O Poder do Pensamento Matemático

Jordan Ellenberg · Capítulo 14 de 30

Páginas do PDF

O Poder do Pensamento Matemático

9. A Revista Internacional de Haruspício

 

EIS UMA PARÁBOLA que aprendi com o estatístico Cosma Shalizi.1

Imagine-se um harúspice, ou seja, sua profissão é fazer predições acerca de eventos futuros sacrificando carneiros e examinando as características de suas entranhas, em especial o fígado. Claro, você não considera suas predições confiáveis apenas porque segue as práticas estabelecidas pelas divindades etruscas. Isso seria ridículo. Você requer evidências. Assim, você e seus colegas submetem todo seu trabalho à revisão dos pares para publicação na Revista Internacional de Haruspício, que exige, sem exceção, que todos os resultados publicados estejam de acordo com os parâmetros da significância estatística.

O haruspício, especialmente o haruspício rigoroso, com base na evidência, não é empreitada fácil, no mínimo porque você passa grande parte de seu tempo salpicado de sangue e bile. Outro motivo é que muitos dos seus experimentos não dão certo. Você tenta usar tripas de carneiro para predizer o preço das ações da Apple e fracassa. Tenta estimar o suprimento global de petróleo e fracassa novamente. Os deuses são muito exigentes, e não é sempre que fica claro qual o arranjo preciso de órgãos internos e que encantações exatas serão confiáveis para desvelar o futuro. Às vezes diferentes harúspices realizam o mesmo experimento, e ele dá certo para uns mas não para outros – quem sabe por quê? É frustrante. Em alguns dias você tem vontade de largar tudo e ir estudar advocacia.

Mas tudo vale a pena naqueles momentos de descoberta, quando as coisas dão certo e você percebe que a textura e as protuberâncias do fígado predizem a gravidade da estação de gripe do próximo ano, e, com um silencioso agradecimento aos deuses, você publica o resultado.

Você veria isso acontecer uma vez em vinte.

Em todo caso, esse fato é o esperável. Porque eu, ao contrário de você, não acredito em haruspício. Acho que as tripas do carneiro não sabem nada sobre os dados da gripe, e que, quando se encaixam, é pura sorte. Em outras palavras, em qualquer assunto referente à predição do futuro por meio de entranhas, sou defensor da hipótese nula. Então, no meu mundo, é bastante improvável que qualquer experimento de haruspício dê certo.

Mas quanto ele é improvável? O limiar-padrão para significância estatística, e portanto para publicação na RevIntha, é fixado por convenção para ter um valor-p de 0,05, ou um em vinte. Lembre-se da definição de valor-p. Este diz precisamente que, se a hipótese nula é verdadeira para algum experimento específico, então a chance de que esse experimento dê como retorno um resultado estatisticamente significativo é de apenas uma em vinte. Se a hipótese nula for sempre verdadeira – ou seja, se o haruspício for um abracadabra não diluído –, então apenas um em vinte experimentos será publicável.

Ainda assim, há centenas de haruspícios, milhares de carneiros com entranhas dilaceradas, e mesmo uma profecia em vinte oferece material de sobra para preencher cada número da revista com novidades em termos de resultados, demonstrando a eficácia dos métodos e a sabedoria dos deuses. Um protocolo que funcionou em determinado caso e é publicado em geral falha quando outro harúspice tenta refazê-lo. Contudo, experimentos sem significância estatística não são publicados, então, ninguém jamais descobre nada sobre o fracasso da repetição. Mesmo que a notícia começasse a se espalhar, há sempre pequenas diferenças que os especialistas indicam para explicar por que o estudo de acompanhamento não deu certo. Afinal, nós sabemos que o protocolo funciona porque o testamos e ele produziu um efeito estatisticamente significativo!

A medicina e a ciência social modernas não são haruspício. Contudo, um círculo cada vez mais ruidoso de cientistas dissidentes vem insistindo, nos últimos anos, numa mensagem desconfortável: provavelmente há muito mais leitura de entranhas nas ciências do que gostaríamos de admitir.

O contestador mais sonoro é John Ioannidis,2 um astro grego da matemática do ensino médio que se tornou pesquisador biomédico e cujo artigo de 2005, “Why most published research findings are false”, detonou um forte surto de autocrítica (e uma segunda onda de autodefesa) nas ciências clínicas. Alguns artigos chamam atenção com um título mais dramático que as alegações apresentadas no corpo do texto, mas não esse aí. Ioannidis leva a sério a ideia de que especialidades inteiras de pesquisa médica são “campos nulos”, como o haruspício, nos quais simplesmente não há efeitos reais a serem encontrados. “Pode-se provar”, escreve ele, “que a maioria dos supostos achados de pesquisas são falsos.”

“Provar” é um pouco mais do que este matemático está disposto a engolir, mas Ioannidis certamente constrói um caso sólido em que sua alegação radical não se torna assim tão implausível. A história é mais ou menos assim. Em medicina, a maioria das intervenções que tentamos fazer não funciona, e a maioria das associações que testamos estará ausente. Pense em testes de associação genética com doenças. Há montes de genes no genoma, e a maior parte deles não causa câncer nem depressão, não deixa você gordo, não tem qualquer efeito direto reconhecível.

Ioannidis nos pede que consideremos o caso da influência genética sobre a esquizofrenia. Essa influência é quase certa, considerando o que sabemos sobre a hereditariedade do distúrbio. Mas onde está ela no genoma? Pesquisadores podem lançar sua rede numa ampla área – afinal, é atrás dos Grandes Conjuntos de Dados que eles estão – em busca de 100 mil genes (mais precisamente, polimorfismos genéticos) para ver quais estão associados à esquizofrenia. Ioannidis sugere que por volta de dez deles na realidade têm algum efeito clinicamente relevante.

E os outros 99.990? Não têm nada a ver com esquizofrenia. Mas um em vinte deles, ou cerca de 5 mil, vai passar no teste de valor-p de significância estatística. Em outras palavras, entre os resultados tipo “Oh, céus, eu achei o gene da esquizofrenia” que poderiam ser publicados, há quinhentas vezes mais falsos que verdadeiros.

E isso admitindo que todos os genes que realmente tenham algum efeito sobre a esquizofrenia passem no teste! Como vimos com Shakespeare e com o basquete, é muito possível que um efeito real seja rejeitado como estatisticamente não significativo se o estudo não tiver potência suficiente para detectá-lo. Se as pesquisas tiverem potência baixa demais, os genes que realmente fazem diferença poderiam passar no teste apenas metade das vezes. No entanto, isso significa que, entre os genes certificados pelo valor-p como causadores de esquizofrenia, apenas cinco realmente o são, contra os 5 mil pretensos candidatos que passaram no teste por mera sorte.

Uma boa maneira de acompanhar as quantidades relevantes é desenhar círculos num quadro:

 

O tamanho de cada círculo representa o número de genes em cada categoria. Na metade esquerda do quadro temos os negativos, os genes que não passaram no teste de significância, e na metade direita temos os positivos. Os dois quadrantes superiores representam a minúscula população de genes que efetivamente afetam a esquizofrenia. Assim, os genes do quadrante superior direito são os verdadeiros positivos (genes que importam, e que o teste diz que importam), enquanto o superior esquerdo representa os falsos negativos (genes que importam, mas que o teste diz que não). Na fila de baixo, temos os genes que não importam; os verdadeiros negativos são o círculo grande na parte inferior esquerda, os falsos positivos, o círculo no quadrante inferior direito.

Você pode ver pela figura que o teste de significância não é o problema. Ele fez exatamente o que foi criado para fazer. Os genes que não afetam a esquizofrenia raramente passam no teste, enquanto os genes nos quais estamos realmente interessados passam na metade das vezes. Mas os genes não ativos são tão maciçamente preponderantes que o círculo de falsos positivos, ainda que pequeno em relação aos verdadeiros negativos, é muito maior que o círculo dos verdadeiros positivos.

 

Doutor, tenho dor no p

 

E a coisa fica ainda pior. Um estudo de baixa potência só vai ser capaz de ver um efeito muito grande. Mas às vezes você sabe que o efeito, se existir, é pequeno. Em outras palavras, um estudo que meça acuradamente o efeito de um gene tem probabilidade de ser rejeitado como estatisticamente não significativo, enquanto qualquer resultado que passe no teste p < 0,05 é um falso positivo ou um verdadeiro positivo que superestima exageradamente o efeito do

gene. A baixa potência é um perigo especial3 em campos onde são comuns estudos pequenos e o tamanho dos efeitos é tipicamente modesto.

Um recente artigo na Psychological Science,4 importantíssima publicação em psicologia, descobriu que mulheres casadas eram significativamente mais propensas a apoiar Mitt Romney, o candidato presidencial republicano, quando estavam no período fértil de seu ciclo ovulatório: das mulheres pesquisadas durante o pico do período fértil, 40,4% manifestaram apoio a Romney, enquanto apenas 23,4% das mulheres casadas pesquisadas em período não

fértil levantavam a bandeira de Mitt.a A amostra é pequena, apenas 228 mulheres, mas a diferença é grande o suficiente para que o resultado passe no teste de valor-p com uma pontuação de 0,03.

Esse é exatamente o problema, a diferença é grande demais. Será realmente plausível que, entre mulheres casadas que preferem Mitt Romney, quase a metade passe grande parte de cada mês apoiando Barack Obama? Será que ninguém notaria isso?

Se há mesmo uma virada política para a direita durante a ovulação, parece provável que ela seja muito menor. Mas o tamanho relativamente pequeno do estudo significa que uma avaliação mais realista da intensidade do efeito teria sido rejeitada, de modo paradoxal, pelo filtro do valor-p. Em outras palavras, podemos ter razoável confiança de que o grande efeito relatado no estudo é principalmente, ou inteiramente, apenas ruído de sinal.

Mas o ruído tem a mesma probabilidade de empurrar você tanto na direção oposta5 do efeito real quanto na direção da verdade. Então acabamos no escuro, por causa de um resultado que fornece muita significância estatística, mas muito pouca confiança.

Os cientistas chamam esse problema de “maldição do vencedor”, e ele é um dos motivos pelos quais resultados impressionantes e ruidosamente alardeados muitas vezes se desfazem em decepcionante lodo quando os experimentos são repetidos. Num caso representativo, uma

equipe de cientistas liderada pelo psicólogo Christopher Chabrisb estudou treze polimorfismos de nucleotídeo único (SNP, de Single-Nucleotide Polymorphism) no genoma que haviam sido observados em estudos anteriores como se tivessem correlações estatisticamente significativas com a pontuação nos testes de QI. Sabemos que a habilidade de se sair bem nesses testes é um tanto hereditária, então, não deixa de ser razoável procurar marcadores

genéticos. Mas quando a equipe de Chabris testou esses SNPs6 com medidas de QI em grandes conjuntos de dados, como o Estudo Longitudinal de Wisconsin, realizado com 10 mil pessoas, cada uma dessas associações esvaneceu-se em insignificância. Se forem de fato reais, as associações são pequenas demais para se detectar até por um experimento de grande porte.

Hoje os geneticistas acreditam que a hereditariedade dos pontos do teste de QI provavelmente não está concentrada em alguns poucos genes metidos a sabidos, e sim em acúmulos provenientes de numerosos traços genéticos, cada um com efeito minúsculo. Isso dizer que se você sair à caça de efeitos grandes de polimorfismos individuais terá êxito na mesma proporção de uma em vinte que os leitores de entranhas.

Nem Ioannidis acha realmente que apenas um artigo em mil publicados esteja correto. A maioria dos estudos científicos não consiste em ficar apalpando o genoma às cegas. Eles testam hipóteses em que os pesquisadores têm alguma razão preexistente para acreditar, de modo que a metade inferior do quadro não predomina tanto assim sobre o topo. Mas a crise de replicabilidade é real. Num estudo de 2012, cientistas da empresa de biotecnologia Amgen, sediada na Califórnia, propuseram-se a replicar alguns dos resultados experimentais mais

famosos na biologia do câncer, 53 estudos ao todo.7 Nas suas tentativas independentes, conseguiram reproduzir apenas seis.

Como isso pode ter acontecido? Não porque os geneticistas e pesquisadores de câncer sejam bobões. Em parte, a crise de replicabilidade é simplesmente reflexo do fato de que a ciência é difícil e de que a maioria das ideias que temos está errada – mesmo a maioria das ideias que sobrevive ao primeiro round de cutucadas.

Mas há práticas no mundo da ciência que tornam a crise pior, e estas podem ser mudadas.

Por algum motivo estamos publicando erros. Considere a profunda tirinha xkcd,c na página seguinte. Suponha que você tenha testado vinte marcadores genéticos para ver se estão associados a alguma desordem de interesse, e descobriu apenas um resultado que atingiu significância p < 0,05. Sendo sofisticado em matemática, você reconheceria que um sucesso em vinte é exatamente o que seria de esperar se nenhum dos marcadores tivesse qualquer efeito, e zombaria da manchete mal-orientada, exatamente como o cartunista pretende fazer.

 

E mais ainda se você testasse o mesmo gene ou a mesma bala de goma vinte vezes e obtivesse um efeito estatisticamente significativo apenas uma vez.

Mas e se as balas de goma verdes fossem testadas vinte vezes por vinte diferentes grupos de pesquisa em vinte laboratórios diferentes? Dezenove dos laboratórios não encontram nenhum efeito estatisticamente significativo. Eles não reportam seus resultados – quem vai publicar o artigo bomba dizendo que “balas de goma verdes são irrelevantes para sua aparência”? Os cientistas no vigésimo laboratório, os sortudos, encontram um efeito estatisticamente significativo porque têm sorte – mas não sabem que tiveram sorte. Tudo que podem saber é que sua teoria de que “balas de goma verdes causam acne” foi testada apenas uma vez e passou.

Se você resolve a cor das balas de goma que vai comer com base apenas nos artigos que são publicados, está cometendo o mesmo erro que o Exército quando contava os buracos de bala nos aviões que voltavam da Alemanha. Como demonstrou Abraham Wald, se você quer uma opinião honesta do que está se passando, também precisa considerar os aviões que não voltaram.

Esse é o chamado problema da gaveta de arquivo – um campo científico tem uma visão drasticamente distorcida da evidência para uma hipótese quando a divulgação pública é cortada por um limiar de significância estatística. Mas nós já demos outro nome a esse problema. É o corretor de ações de Baltimore. O cientista de sorte que prepara empolgado um press release sobre as correlações dermatológicas do corante verde nº 16 é igualzinho ao investidor ingênuo despachando suas economias para um corretor picareta. O investidor, como o cientista, consegue ver o único resultado do experimento que deu certo por acaso, mas é cego para o grupo maior de experimentos que falharam.

No entanto, há uma grande diferença. Em ciência, não há um vigarista escuso nem uma vítima inocente. Quando a comunidade científica arquiva na gaveta os experimentos que falharam, ela desempenha ambos os papéis ao mesmo tempo. Eles próprios estão bancando os vigaristas consigo mesmos.

E tudo isso presumindo que os cientistas em questão estejam jogando honestamente. Mas nem sempre isso acontece. Lembra-se do problema do espaço de manobra que enredava os interessados nos códigos da Bíblia? Os cientistas, sujeitos à mesma pressão intensa de publicar para não perecer, não são imunes às mesmas tentações de manobra. Se você faz sua análise e obtém um valor-p de 0,06, teoricamente deve concluir que seus resultados são estatisticamente insignificantes. Mas é preciso muita força mental para jogar anos de trabalho na gaveta do arquivo. Afinal, será que os números para aquele sujeito experimental específico não parecem um pouco distorcidos? Provavelmente, num caso extremo, quem sabe não é melhor tentar deletar essa linha da planilha? Fizemos o controle por idade? Controlamos levando em consideração o tempo lá fora? Controlamos por idade e considerando o tempo lá fora? Dê a si mesmo licença para torcer e ocultar um pouco os resultados dos testes estatísticos realizados, e com frequência você consegue reduzir 0,06 para 0,04.

Uri Simonsohn, professor na Universidade da Pensilvânia, líder no estudo da

replicabilidade, chama essas práticas de “hackear p”.8 Hackear o p geralmente não é algo tão grosseiro como fiz parecer, e poucas vezes é algo mal-intencionado. Os p-hackers acreditam sinceramente em suas hipóteses, da mesma forma que os adeptos dos códigos da Bíblia, e, quando se é um crédulo, é fácil inventar motivos para que a análise que produz um valor publicável seja aquela que você deveria ter feito em primeiro lugar.

Mas todo mundo sabe que realmente não está certo. Quando pensam que não há ninguém escutando, os cientistas chamam a prática de “torturar os dados até que confessem”. E a confiabilidade dos resultados é aquela que você esperaria de confissões extraídas à força.

Avaliar a escala do problema de hackear p não é fácil – não se podem examinar os artigos escondidos na gaveta ou que simplesmente nunca foram escritos, da mesma forma que não se podem examinar os aviões abatidos na Alemanha para ver onde foram atingidos. Mas é possível, como no caso de Abraham Wald, fazer algumas inferências sobre dados que não se podem medir diretamente.

Pense novamente na Revista Internacional de Haruspício. O que você veria se olhasse cada artigo já publicado ali e registrasse os valores-p que descobriu? Lembre-se, nesse caso a hipótese nula é sempre verdadeira, porque haruspício não funciona; assim, 5% dos experimentos registrarão um valor-p de 0,05 ou inferior; 4% registrarão 0,04 ou menos; 3% registrarão 0,03 ou menos; e assim por diante. Outra maneira de dizer isso é que o número de experimentos que produzem valor-p entre 0,04 e 0,05 deveria ser mais ou menos o mesmo que o número de experimentos produzindo entre 0,03 e 0,04, entre 0,02 e 0,03 etc. Se você pusesse num gráfico os valores-p registrados em todos os artigos veria uma linha reta como essa:

 

Agora, e se você olhasse uma revista de verdade? Espera-se que uma porção de fenômenos que você esteja caçando seja efetivamente real, o que torna mais provável que os seus experimentos obtenham uma boa (significando baixa) contagem de valor-p. Então, o gráfico dos valores-p deveria ter uma inclinação descendente.

 

Só que não é exatamente isso que acontece na vida real. Em campos que variam desde

ciência política e economia até psicologia e sociologia,9 os detetives estatísticos descobriram uma perceptível inclinação ascendente à medida que o valor-p se aproxima do limiar de 0,05:

Essa inclinação é o formato do hackeamento de p. Ela nos conta que muitos resultados de experimentos que pertencem ao lado não publicado da fronteira de p = 0,05 foram alterados, remexidos, torcidos ou simplesmente torturados até que, por fim, acabaram ficando do lado feliz da fronteira. Isso é bom para cientistas que necessitam de publicações, mas é ruim para a ciência.

E se um autor se recusa a torturar os dados, ou a tortura falha em apresentar o resultado desejado, e o valor-p se mantém grudado um pouco acima do importantíssimo 0,05? Há soluções alternativas. Os cientistas se contorcem para elaborar piruetas verbais a fim de justificar a divulgação de um resultado que não atinge a significância estatística: dizem que o resultado é “quase estatisticamente significativo”, ou “tende para a significância”, ou “é

praticamente significativo”, ou “está no limite da significância”.d É fácil zombar dos angustiados pesquisadores que recorrem a essas frases, mas deveríamos odiar o jogo, não os jogadores – não é culpa deles que a publicação esteja condicionada a um limiar de tudo ou nada. Viver ou morrer por 0,05 é cometer um erro básico de categoria, tratando uma variável contínua (quanta evidência temos de que a droga funciona, o gene prediz o QI, mulheres férteis gostam de republicanos?) como se fosse uma variável binária. (Verdadeiro ou falso? Sim ou não?) Os cientistas deveriam ter permissão para informar dados estatisticamente não significativos.

Em alguns contextos, eles podem ser obrigados a isso. Num parecer de 2010, a Suprema

Corte dos Estados Unidos determinou por unanimidade10 que a Matrixx, fabricante do remédio para resfriados Zicam, devia revelar que alguns dos usuários de seu produto haviam sofrido de anosmia, a perda do sentido do olfato. A opinião da corte, redigida por Sonia Sotomayor, sustentava que embora os casos reportados de anosmia não passassem no teste de significância, ainda assim eles contribuíam para a “mescla total” de informações a que os investidores de uma empresa esperam ter acesso. Um resultado com valor-p fraco pode fornecer apenas um pouco de evidência, mas pouco é melhor que nada; um resultado com valor-p forte pode fornecer mais evidência, porém, como vimos, está longe de certificar que o efeito alegado é real.

Não há nada de especial, enfim, em relação ao valor 0,05. Ele é puramente arbitrário, uma convenção escolhida por Fisher. Existe um certo valor na convenção. Um limiar único, que todos aceitam, garante que sabemos do que estamos falando quando usamos a palavra

“significativo”. Certa vez li um artigo de Robert Rector e Kirk Johnson,11 da conservadora Heritage Foundation, reclamando que uma equipe rival de cientistas havia alegado falsamente que declarações de abstinência não faziam diferença, entre adolescentes, nas taxas de doenças sexualmente transmissíveis. Na verdade, os adolescentes do estudo que haviam jurado esperar a noite de núpcias de fato tinham uma taxa ligeiramente mais baixa de DST que o restante da amostra, mas a diferença não era estatisticamente significativa. O pessoal da Heritage tinha razão. A evidência de que as declarações eram verdadeiras mostrava-se fraca, mas não estava inteiramente ausente.

Por outro lado, Rector e Johnson escreveram em outro artigo, referente à relação estatisticamente não significativa entre raça e pobreza que eles desejam desconsiderar: “Se uma variável não é estatisticamente significativa, isso quer dizer que a variável não tem diferença estatisticamente discernível entre o valor do coeficiente e zero, e então não há

efeito.”12 O que é bom para o pateta abstinente também é bom para o gênero racialmente agredido! O valor da convenção é que ela impõe alguma disciplina aos pesquisadores, livrando-os da tentação de deixar que suas próprias preferências determinem quais resultados contam e quais não.

No entanto, uma fronteira convencional, obedecida por bastante tempo, pode facilmente ser tomada por uma coisa do mundo real. Imagine se falássemos sobre o estado da economia dessa maneira! Os economistas têm uma definição formal de “recessão” que depende de um limiar arbitrário exatamente como a “significância estatística”. Ninguém diz: “Não me importo com a taxa de desemprego, com problemas de habitação, com a carga agregada dos empréstimos estudantis ou com o déficit federal. Isso não é recessão, não vamos falar no assunto.” A pessoa seria maluca de dizer isso. Os críticos – e há cada vez maior número deles, cada vez mais estridentes, ano após ano – dizem que uma grande dose de prática científica abriga esse tipo de maluquice.

 

O detetive, não o juiz

 

Claro que está errado usar “p < 0,05” como sinônimo de “verdadeiro” e “p > 0,05” como sinônimo de “falso”. Reductio ad improvável, por mais atraente que seja intuitivamente, não funciona para inferir a verdade científica sob os dados.

Mas qual a alternativa? Se você já realizou algum experimento, sabe que a verdade científica não surge sem mais nem menos, das nuvens, tocando uma trombeta flamejante para você. Dados são confusos e inferência é difícil.

Uma estratégia simples e popular é reportar intervalos de confiança em adição aos valores-p. Isso envolve uma ligeira ampliação do escopo conceitual, pedindo-nos para considerar não só a hipótese nula, porém toda uma gama de alternativas. Talvez você opere uma loja on-line que vende tesouras artesanais para ornamentar jardins. Sendo uma pessoa moderna (exceto pelo fato de fazer tesouras artesanais para decorar jardins), você monta um teste A⁄ B, onde metade dos usuários vê a versão corrente do seu site (A) e outra metade vê uma versão remodelada (B), com uma tesoura animada que canta e faz uma dancinha sobre o botão “Compre agora”. E você descobre que as vendas sobem 10% com a opção B. Ótimo! Agora, se você é do tipo sofisticado, poderia se preocupar se esse aumento é só uma questão de flutuação aleatória – então você calcula um valor-p, descobrindo que a chance de obter um resultado tão bom, se não fosse realmente por causa do novo desenho do site (isto é, se a

hipótese nula estivesse correta), é de apenas 0,03.e

Mas por que parar aqui? Se vou pagar a um garoto de faculdade para sobrepor uma tesourinha dançante em todas as minhas páginas, quero saber não só se funciona, mas quão bem funciona. Será que o efeito que vi é consistente com a hipótese de que a remodelagem do site, a longo prazo, está realmente melhorando as minhas vendas em 5%? Por essa hipótese, você poderia descobrir que a probabilidade de observar um crescimento de 10% é muito mais provável – digamos, 0,2. Em outras palavras, a hipótese de que a remodelagem do site é 5% melhor não é excluída pela reductio ad improvável. Por outro lado, você pode se perguntar de forma otimista se teve algum azar, e a remodelagem estava realmente tornando suas tesouras 25% mais atraentes. Você calcula outro valor-p e obtém 0,01, suficientemente improvável para induzir você a jogar fora a hipótese.

O intervalo de confiança é a faixa de hipóteses que a reductio ad improvável não exige que se jogue no lixo, aquelas razoavelmente consistentes com o resultado que você observou. Nesse caso, o intervalo de confiança poderia variar de +3% a +17%. O fato de zero, a hipótese nula, não estar incluído no intervalo de confiança equivale a dizer que os resultados são estatisticamente significativos no sentido antes descrito neste capítulo.

Mas o intervalo de confiança lhe diz muito mais. Um intervalo de [+3%, +17%] permite-lhe ter confiança de que o efeito é positivo, mas não particularmente grande. Um intervalo de [+9%, +11%], por outro lado, sugere muito mais intensamente que o efeito não só é positivo, como também que ele é bem grande.

O intervalo de confiança é igualmente informativo em casos nos quais você não obtém um resultado estatisticamente significativo – ou seja, onde o intervalo de confiança inclui o zero. Se o intervalo de confiança é [−0,5%, 0,5%], então a razão de você não ter obtido significância estatística é uma boa evidência de que a intervenção não tem efeito algum. Se o intervalo de confiança é [−20%, 20%], você não obtém significância estatística porque não se sabe se a intervenção tem algum efeito, ou em que direção esse efeito se dá. Esses dois resultados parecem iguais do ponto de vista da significância estatística, mas têm implicações bem diferentes para o que você deve fazer em seguida.

O desenvolvimento do intervalo de confiança geralmente é atribuído a Jerzy Neyman, outro gigante dos primórdios da estatística. O polonês Neyman, como Abraham Wald, começou exercendo a matemática pura na Europa Oriental antes de assumir a nova prática então recém-criada da estatística matemática e mudar-se para o Ocidente. No fim da década de 1920, ele começou a colaborar com Egon Pearson, que havia herdado de seu pai, Karl, tanto o posto de professor quanto uma amarga contenda acadêmica com R.A. Fisher. Este era um tipo difícil, sempre pronto para brigar. Uma vez sua filha disse a seu respeito: “Ele cresceu sem

desenvolver uma sensibilidade à humanidade comum de seus semelhantes.”13 Em Neyman e Pearson ele encontrou oponentes afiados o bastante para combatê-lo durante décadas.

As divergências científicas entre eles talvez sejam mais cruamente exibidas na abordagem

que Neyman e Pearson desenvolveram acerca do problema da inferência.f Como determinar a verdade a partir da evidência? A espantosa resposta é: desfazer as perguntas. Para Neyman e Pearson, o propósito da estatística não é nos dizer em que acreditar, mas nos dizer o que fazer. A estatística trata de tomada de decisões, não de responder a perguntas. Um teste de significância não passa de uma regra que diz às pessoas encarregadas se devem aprovar uma droga, realizar uma reforma econômica proposta ou incrementar um website.

À primeira vista parece loucura negar que a meta da ciência é descobrir o que é verdadeiro, mas a filosofia de Neyman-Pearson não está longe do raciocínio que usamos em outras esferas. Qual o propósito de um julgamento criminal? Ingenuamente, poderíamos dizer que é descobrir se o réu cometeu o crime pelo qual está sendo julgado. Mas isso está errado. Há regras para a evidência que proíbem o júri de ouvir testemunhos obtidos de forma inadequada, mesmo que isso pudesse ajudá-lo a determinar com exatidão a inocência ou a culpa do réu. O propósito de um tribunal não é a verdade, mas a justiça. Temos regras, e as regras precisam ser obedecidas. Quando declaramos que o réu é “culpado”, se tivermos cuidado com as nossas palavras, não estamos dizendo que ele cometeu o crime pelo qual é acusado, mas que foi condenado justa e corretamente de acordo com essas regras. Quaisquer que sejam as regras escolhidas, deixaremos alguns criminosos livres e mandaremos para a prisão alguns dos inocentes. Quando menos se fizer o primeiro, mais provavelmente se fará o segundo. Assim, procuramos determinar as regras da maneira que a sociedade julga ser a melhor maneira de lidar com essa opção fundamental.

Para Neyman e Pearson, a ciência é como o tribunal. Quando uma droga fracassa num teste de significância, não dizemos “Estamos bastante certos de que a droga não funcionou”, mas “A droga não demonstrou eficácia”, e a desconsideramos, como faríamos com um réu cuja presença na cena do crime não pôde ser estabelecida dentro de uma dúvida razoável, mesmo que cada homem e mulher na corte ache que ele é culpado.

Fisher não queria nada disso. Para ele, Neyman e Pearson cheiravam a matemática pura, insistindo num racionalismo austero à custa de qualquer coisa que se assemelhasse a uma prática científica. A maioria dos juízes não teria estômago para deixar um réu obviamente inocente rumar em direção ao carrasco, mesmo que o livro de regras o exija. A maioria dos cientistas praticantes não tem interesse em cumprir uma sequência rígida de instruções, negando a si mesmo a satisfação autopoluente de formar uma opinião a respeito de que hipóteses são realmente verdadeiras. Numa carta de 1951 para W.E. Hick, Fisher escreveu:

 

Lamento um pouco que esteja chegando a se preocupar com essa abordagem portentosamente desnecessária dos testes de

significância representada pelas regiões críticas de Neyman e Pearson etc. Na verdade, eu e meus discípulos pelo mundo

jamais pensaríamos em usá-las. Se me pedem para dar uma razão explícita para isso eu diria que eles abordam o problema a

partir da perspectiva inteiramente errada, isto é, não do ponto de vista de um trabalhador em pesquisa, com uma base de

conhecimento bem-fundamentado sobre a qual uma população bastante flutuante de conjecturas e observações incoerentes

está continuamente sob exame. O que ele precisa é de uma resposta confiável para a pergunta: “Devo prestar atenção a

isso?” Esta pergunta pode, claro – e, em nome do requinte de pensamento, deve –, ser formulada como “Essa hipótese

particular é derrubada; se for, com que nível de significância, por este particular corpo de observações?” Ela pode ser

formulada dessa maneira, inequivocamente, apenas porque o experimentador genuíno já tem as respostas para todas as

perguntas que os seguidores de Neyman e Pearson tentam – acho que em vão – responder com considerações puramente

matemáticas.14

 

Mas Fisher decerto entendia que ultrapassar a altura da significância não era a mesma coisa que descobrir a verdade. Ele divisa uma abordagem mais rica, mais iterada, escrevendo em 1926: “Um fato científico deve ser encarado como estabelecido experimentalmente apenas se um experimento projetado da forma adequada poucas vezes falha em produzir esse nível de

significância.”15

Não “tem êxito uma vez em produzir”, mas “poucas vezes falha em produzir”. Um achado estatisticamente significativo fornece uma pista, sugerindo um lugar promissor para se concentrar a energia da pesquisa. O teste de significância é o detetive, não o juiz. Sabe quando você lê um artigo sobre um achado importante, mostrando como essa coisa causa aquela outra coisa, ou aquela coisa impede a outra coisa, e no final sempre há uma citação banal de algum cientista mais velho, não envolvido no estudo, entoando alguma variante menor de “O achado é bastante interessante e sugere que se faz necessária outras pesquisas na mesma direção”? E como você nem lê realmente essa parte porque acha que não passa de uma advertência obrigatória, sem conteúdo?

Aí está: o motivo de os cientistas sempre dizerem isso é porque é importante e é verdade! O achado provocativo e “oh, tão estatisticamente significativo” não são a conclusão do processo científico, mas o início. Se o resultado é novo e importante, outros cientistas em outros laboratórios devem testar e retestar o fenômeno e suas variantes, tentando descobrir se o resultado foi uma casualidade de uma só vez ou se verdadeiramente atende ao padrão de Fisher de “poucas vezes falha”. É isso que os cientistas chamam de replicação. Se um efeito não pode ser replicado, apesar das repetidas tentativas, a ciência se desculpa e retrocede. O processo de replicação é como o sistema imune da ciência, atacando maciçamente os objetos recém-introduzidos e matando aqueles que não deviam estar ali.

De qualquer modo, esse é o ideal. Na prática, a ciência sofre um pouquinho de imunossupressão. Alguns experimentos, claro, são difíceis de repetir. Se o seu estudo mede a capacidade de uma criança de quatro anos de protelar a gratificação e relaciona essas medições a resultados da vida daí a trinta anos, não é possível simplesmente tirar do ar uma replicação.

No entanto, mesmo estudos que poderiam ser replicados muitas vezes não o são. Toda revista científica quer publicar um achado sensacional, mas quem quer publicar o artigo que faz o mesmo experimento um ano depois e obtém o mesmo resultado? Pior ainda, o que acontece com os artigos que relatam o mesmo experimento e não acham um resultado significativo? Para que o sistema funcione, esses experimentos devem ser tornados públicos. Contudo, com muita frequência, eles acabam engavetados.

Mas a cultura está mudando. Reformadores com vozes sonoras, como Ioannidis e Simonsohn, que falam tanto para a comunidade científica quanto para o público mais amplo, têm gerado um novo sentido de urgência acerca do perigo de cair em haruspício em larga escala. Em 2013, a Associação para a Ciência Psicológica anunciou que começaria a publicar um novo gênero de artigo, classificado como “Relatórios de replicações registradas”. Visando a reproduzir os efeitos reportados em estudos largamente citados, eles são tratados de modo diferente dos artigos usuais num aspecto crucial: o experimento proposto é aceito para publicação antes de o estudo ser realizado. Se os resultados respaldam o achado inicial, ótima notícia. Senão, eles são publicados mesmo assim, para que toda a comunidade saiba a plena situação da evidência.

Outro consórcio, o projeto Many Labs, revisita achados importantes em psicologia e tenta replicá-los em grandes amostras multinacionais. Em novembro de 2013, psicólogos foram ovacionados quando o primeiro grupo de resultados do Many Labs retornou, descobrindo que dez entre treze estudos abordados foram replicados com sucesso.

No final, claro, é preciso fazer julgamentos, e linhas devem ser traçadas. O que, afinal, Fisher realmente quer dizer quando usa o termo “poucas vezes” em “poucas vezes falha”? Se atribuímos um limiar numérico arbitrário (“um efeito é real se atinge significância estatística em mais de 90% dos experimentos”), podemos nos ver novamente em apuros.

Fisher, de todo modo, não acreditava numa regra rápida e rígida que nos diga o que fazer. Ele era um desconfiado em relação ao formalismo da matemática pura. Em 1956, perto do fim da vida, escreveu que “na verdade nenhum pesquisador científico tem um nível de significância fixo a partir do qual, de ano a ano, e em todas as circunstâncias, rejeite hipóteses; ele prefere considerar cada caso particular à luz de sua evidência e de suas

ideias”.16

No próximo capítulo, veremos um modo pelo qual “a luz da evidência” pode se tornar mais específica.

 

a Fiquei decepcionado ao descobrir que esse estudo ainda não gerou nenhum vídeo de conspiração alegando que o apoio de Obama ao controle da natalidade destinava-se a suprimir o instinto biológico feminino de votar no republicano durante a ovulação. Liguem-se, produtores de vídeos de conspiração!

b Chabris talvez seja mais famoso por seu vídeo imensamente popular no YouTube demonstrando o princípio cognitivo da atenção seletiva: os espectadores são solicitados a observar um grupo de estudantes passando uma bola de basquete de um lado a outro, e geralmente deixam de notar um ator fantasiado de gorila entrando e saindo de cena.

c xkcd é uma tirinha publicada on-line, criada por Randall Munroe. (N.T.)

d Todos esses exemplos são tirados da imensa coleção do blog do psicólogo de saúde Matthew Hankins, conhecedor de resultados não significativos.

e Todos os números desse exemplo são inventados, em parte porque o cálculo real de intervalos de confiança é mais complicado do que estou revelando neste pequeno espaço.

f Alerta de supersimplificação: Fisher, Neyman e Pearson viveram e escreveram por um longo período, e suas ideias se modificaram no decorrer das décadas; o esboço grosseiro que tracei da diferença filosófica entre eles ignora muitas faixas importantes no pensamento de cada um. Em particular, a perspectiva de que a preocupação básica da estatística é tomar decisões está mais associada a Neyman que a Pearson.