O Poder do Pensamento Matemático
7. Peixe morto não lê mentes
POIS AQUI ESTÁ A COISA: o arranca-rabo sobre os códigos da Bíblia não é o único em que se usou o kit-padrão de ferramentas estatísticas para deduzir um resultado que parece mágica. Um dos temas mais quentes da ciência médica é a neuroimagem funcional, que promete fazer os cientistas verem seus pensamentos e sentimentos faiscarem nas sinapses em tempo real por meio de sensores cada vez mais acurados. Na conferência de 2009 da Organização para Mapeamento do Cérebro Humano, em São Francisco, o neurocientista Craig Bennett, da Universidade da Califórnia, Santa Barbara, apresentou um painel chamado “Correlatos neurais da perspectiva interespécies no exame pós-morte do salmão do Atlântico: um
argumento em favor da correção de comparações múltiplas”.1 Leva alguns segundos para decifrar o jargão do título, mas, quando se consegue, o painel anuncia claramente a natureza inusitada de seus resultados. Mostrou-se a um peixe morto, escaneado por um equipamento de Imagem por Ressonância Magnética Funcional (IRMf), uma série de fotografias de seres humanos, e descobriu-se que ele tinha capacidade surpreendentemente forte de avaliar de modo correto as emoções das pessoas exibidas nas fotos. Já teria sido impressionante com uma pessoa morta ou um peixe vivo. Com um peixe morto, então, isso é material para um Prêmio Nobel!
Mas o artigo, claro, é uma piada em tom sério. E muito bem executada: gosto especialmente da seção “Métodos”, que começa:
Um salmão maduro do Atlântico (Salmo salar) participou do estudo de IRMf. O salmão tinha aproximadamente 45
centímetros, pesava 1,7 quilo e não estava vivo por ocasião do escaneamento. … Uma proteção de espuma foi colocada
dentro do capacete sensor para a cabeça como método de limitar o movimento do salmão durante o escaneamento, mas
mostrou-se totalmente desnecessária, pois o movimento do sujeito foi excepcionalmente baixo.2
A piada, como todas as piadas,3 é um ataque velado. Nesse caso, um ataque à metodologia negligente dos pesquisadores de neuroimagem que cometem o erro de ignorar a verdade fundamental de que coisas improváveis acontecem a toda hora. Os neurocientistas dividem seus escaneamentos de IRMf em dezenas de milhares de pequenos pedaços, chamados voxels, cada qual correspondendo a uma pequena região do cérebro. Quando se escaneia um cérebro, mesmo um cérebro de peixe morto, há certa quantidade de ruído aleatório em cada voxel. É muito improvável que esse ruído venha a ocorrer exatamente no instante em que você mostra ao peixe o instantâneo de uma pessoa em situação emocional extrema. Mas o sistema nervoso é um lugar imenso, com dezenas de milhares de voxels para escolher. As chances de que um desses voxels forneça dados que combinem bem com as fotos são bastante altas.
Foi exatamente o que Bennett e seus colaboradores descobriram. Na verdade, eles localizaram dois grupos de voxels que fizeram um excelente trabalho de empatia com a emoção humana, um na cavidade encefálica medial do salmão e outro na coluna vertebral superior. O objetivo do artigo de Bennett é alertar para o fato de que os métodos probatórios de avaliar resultados, a maneira como estabelecemos os limiares entre um fenômeno real e a estática aleatória, ficam perigosamente pressionados nesta época de massivos conjuntos de dados obtidos sem muito esforço. Precisamos pensar com muito cuidado se nossos padrões para evidências são suficientemente estritos, se o empático salmão passa pelo corte.
Quanto mais oportunidades você dá a si mesmo de ficar surpreso, mais alto deve ser seu limiar para a surpresa. Se, na internet, uma pessoa estranha qualquer que tenha eliminado todos os grãos produzidos nos Estados Unidos de seu consumo alimentar relata que perdeu 7 quilos e que seu eczema sumiu, você não deve tomar isso como uma evidência forte em favor do plano de eliminação do milho. Alguém está vendendo um livro sobre esse plano, milhares de pessoas compraram o livro e tentaram a dieta. Há boas chances de que, simplesmente por acaso, uma delas tenha perda de peso e melhora da pele na semana seguinte. Esse é o sujeito que vai se conectar como “diga adeus ao milho nº 452” e postar seu empolgado testemunho, enquanto as pessoas para as quais a dieta falhou permanecem caladas.
O resultado surpreendente do artigo de Bennett não é que um ou dois voxels num peixe morto passem num teste estatístico, é que uma proporção substancial dos artigos sobre neuroimagem que ele examinou não tenham utilizado salvaguardas estatísticas (conhecidas como “correção de comparações múltiplas”) que levam em conta a onipresença do improvável. Sem essas correções, os cientistas correm o sério risco de fazer a jogada do corretor de Baltimore, e não só com os seus colegas, mas consigo mesmo. Ficar empolgado com voxels de peixe que se encaixam em fotos e ignorar o resto é potencialmente tão perigoso quanto ficar empolgado com uma série bem-sucedida de informativos sobre ações ignorando as inúmeras outras edições com previsões furadas e que foram parar no lixo.
Engenharia reversa, ou por que álgebra é difícil
Há dois momentos no decurso da educação formal em que um monte de alunos cai do trem da matemática. O primeiro vem nas séries do ensino fundamental, quando são introduzidas as frações. Até aquele momento, um número é um número natural, uma das cifras 0, 1, 2, 3 …. É
a resposta para uma pergunta do tipo “quantos”.a Ir dessa noção, tão primitiva que se diz que
muitos animais a compreendem,4 para a ideia radicalmente mais ampla de que um número pode significar “qual parte de” é uma drástica mudança filosófica. (“Deus fez os números naturais”, disse Leopold Kronecker, algebrista do século XIX, “todo o resto é obra do homem.”)
A segunda mudança perigosa nos trilhos é a álgebra. Por que ela é tão difícil? Porque, até a álgebra aparecer, você faz cálculos numéricos de forma diretamente algorítmica. Enfia alguns números na caixa da adição, ou na caixa da multiplicação, ou mesmo, nas escolas de mentalidade mais tradicional, na caixa da divisão longa, gira a manivela e informa o que saiu do outro lado.
Álgebra é diferente. É cálculo de trás para a frente. Quando lhe pedem que resolva
x + 8 = 15,
você sabe o que saiu da caixa de adição (ou seja, 15), e estão lhe pedindo que reverta o mecanismo e descubra o que, junto com o 8, foi colocado dentro da caixa.
Nesse caso, como seu professor de matemática da 7ª série sem dúvida lhe disse, você pode trocar as coisas de lado para deixar de novo tudo certinho do lado direito:
x = 15 – 8,
e nesse ponto basta você enfiar 15 e 8 na caixa de subtração (certificando-se de qual deles colocar primeiro…) e descobrir que x deve ser 7.
Mas nem sempre é tão fácil. Pode ser que você tenha que resolver uma equação de segundo grau, como
x2 − x = 1
É mesmo? (Posso ouvir você chorando.) Você resolveria? Além de ter sido pedido pelo professor, por que você haveria de resolver?
Pense outra vez naquele míssil do Capítulo 2, ainda viajando furiosamente em sua direção:
Talvez você saiba que o míssil foi disparado de uma altura 100 metros acima do nível do solo, com uma velocidade ascendente de 200 metros por segundo. Se não houvesse algo como a gravidade, o míssil simplesmente continuaria a subir em linha reta, de acordo com as leis de Newton, ficando 200 metros mais alto a cada segundo, e sua altura após x segundos seria descrita pela função linear
altura = 100 + 200x.
Mas existe uma coisa chamada gravidade que dobra o arco e força o míssil a fazer uma curva de volta para a Terra. Acontece que o efeito da gravidade é descrito adicionando-se um termo quadrático, ou de segundo grau:
altura = 100 + 200x − 5x2,
onde o termo quadrático é negativo só porque a gravidade empurra o míssil para baixo, e não para cima.
Há um monte de perguntas que você poderia fazer sobre um míssil voando em sua direção, mas uma em particular é de grande importância: quando ele vai chegar ao solo? Para resolvê-la, basta responder à pergunta: quando a altura do míssil será zero? Ou seja, para que valor de x acontece de
100 + 200x − 5x2 = 0?
De maneira nenhuma está claro como você deve “ajeitar” essa equação para achar o valor de x. Mas talvez você não precise. Tentativa e erro são uma arma poderosa. Se você fizer x = 10 na fórmula acima, para ver a que altura o míssil vai estar depois de 10 segundos, obterá 1.600 metros. Faça x = 20, e você obtém 2.100 metros, então parece que o míssil ainda deve estar subindo. Quando x = 30, você obtém 1.600 metros outra vez: promissor; devemos ter passado pelo pico. Em x = 40, o míssil está de novo apenas 100 metros acima do chão. Poderíamos botar mais 10 segundos, mas, quando já estamos tão perto do impacto, isso certamente será exagerado. Se você fizer x = 41, obterá −105 metros, o que não quer dizer que você esteja prevendo que o míssil já começou a escavar a superfície da Terra, e sim que o impacto já ocorreu, de modo que seu belo e claro modelo do movimento do míssil não é mais, como dizemos em balística, operacional.
Então, se 41 segundos é demais, que tal 40,5? Isso dá –1,25 metro, só um pouquinho abaixo de zero. Volte o relógio um pouco para 40,4, e você obtém 19,2 metros, então o impacto ainda não ocorreu. 40,49? Muito perto, só, 0,8 metro acima do solo.
Você pode ver que, brincando de tentativa e erro, girando o botão do tempo cuidadosamente para a frente e para trás, você consegue uma aproximação do tempo de impacto tão próxima quanto quiser.
Mas será que “resolvemos” a equação? Você provavelmente está hesitando em dizer que sim. Embora fique afinando cada vez mais a sintonia de seus palpites até a hora do impacto, para
40,4939015319…
segundos após o lançamento, você não sabe a resposta, mas apenas uma aproximação da resposta. Na prática, porém, isso não ajuda muito você a definir o instante de impacto com a precisão de milionésimo de segundo, não é? Provavelmente dizer “mais ou menos 40 segundos” já é o suficiente. Tente gerar uma resposta mais precisa que essa, e estará perdendo tempo. Além disso, é provável que esteja errado, porque nosso modelo muito simples do progresso do míssil deixa de levar em conta diversos outros fatores, como a resistência do ar, a variação da resistência do ar decorrente do clima, a rotação do próprio míssil, e assim por diante. Esses efeitos podem ser pequenos, mas com certeza são grandes o bastante para impedir que você saiba com precisão de microssegundos quando o projétil irá pintar para comparecer a seu encontro com o solo.
Se você quer uma solução satisfatoriamente exata, não tenha medo, a fórmula da equação do segundo grau está aqui para ajudar. Você pode muito bem ter decorado a fórmula alguma vez na vida, porém, a menos que possua uma memória extraordinariamente privilegiada ou tenha doze anos, você não a lembra de cor neste momento. Então aqui está ela: se x é uma solução para
c + bx + ax2 = 0,
onde a, b e c são números quaisquer, então,
No caso do míssil, c = 100, b = 200 e a = –5. Então, o que a fórmula da equação do segundo grau tem a dizer sobre x é que
A maioria dos símbolos aí são coisas que você pode digitar na sua calculadora, mas existe uma exceção engraçada, o ±. Parece um sinal de mais e um sinal de menos que se amam demais, e não está muito longe disso. O sinal indica que, embora tenhamos começado nossa sentença matemática totalmente confiantes, com
x =,
acabamos num estado de ambivalência. O ±, que corresponde de certo modo à peça em branco, o coringa, do jogo de palavras cruzadas de tabuleiro, pode ser lido como + ou como –, à nossa escolha. Cada escolha que fazemos produz um valor de x que satisfaz a equação 100 + 200x – 5x2 = 0. Não há uma solução única para essa equação. Existem duas.
A existência de dois valores de x que satisfazem a equação pode ser visualizada, mesmo que você tenha esquecido há muito a fórmula da equação de segundo grau. Você pode desenhar um gráfico representativo da equação y = 100 + 200x – 5x2 e obter uma parábola virada para baixo, assim:
A linha horizontal é o eixo x, os pontos do plano cuja coordenada y vale zero. Quando a curva y = 100 + 200x − 5x2 cruza o eixo x, é o caso em que y vale simultaneamente 100 + 200x − 5x2 e y = 0; então, 100 + 200x − 5x2 = 0, precisamente a equação que estamos tentando resolver, agora numa forma geométrica, como uma pergunta acerca da intersecção entre uma curva e a linha horizontal.
A intuição geométrica exige que, se essa parábola tem a ponta acima do eixo x, ela deve cruzar esse eixo exatamente em dois lugares, nem mais nem menos. Em outras palavras, há dois valores de x tais que 100 + 200x − 5x2 = 0.
Então, quais são esses dois valores?
Se escolhemos ler ± como +, obtemos
x = 20 +
que é 40,4939015319…, a mesma resposta a que chegamos pela tentativa e erro. Mas se escolhermos –, obtemos
x = 20 –
que é −0,4939015319…
Como resposta à nossa pergunta inicial, isso fica meio sem sentido. A resposta para “Quando o míssil vai me atingir?” não pode ser “Meio segundo atrás”.
Contudo, esse valor negativo de x é uma solução perfeitamente boa para a equação, e, quando a matemática nos diz algo, devemos no mínimo tentar escutar. O que significa esse número negativo? Eis uma maneira de entendê-lo. Dissemos que o míssil foi lançado 100 metros acima do solo, com uma velocidade de 200 metros por segundo. Mas o que efetivamente usamos no instante zero é que o míssil estava subindo com essa velocidade naquela posição. Mas e se o lançamento não tivesse sido realmente assim? Talvez não tivesse ocorrido no instante zero, de 100 metros acima, mas em algum instante anterior, diretamente do chão. Em que instante anterior?
O cálculo nos diz: há exatamente dois instantes em que o míssil está no chão. Um deles é 0,4939… segundos atrás. Foi aí que o míssil foi lançado. O outro instante é 40,4939… segundos a partir de agora. É aí que o míssil atinge o chão.
Talvez não pareça tão problemático – especialmente se você está acostumado à fórmula da equação de segundo grau – obter duas respostas para a mesma pergunta. Você passou seis longos anos da sua vida descobrindo qual é a resposta, e agora, de repente, não existe algo assim.
Essas são apenas equações quadráticas! E se você tiver que resolver
x3 + 2x2 − 11x = 12?
Essa é uma equação de terceiro grau, ou uma equação cúbica, o que vale dizer que envolve x elevado à terceira potência. Felizmente, existe uma fórmula para a equação cúbica que permite descobrir, por cálculo direto, que valores de x poderiam ter entrado na caixa para fazer sair 12 quando você girar a manivela. Mas você não aprendeu a fórmula cúbica na escola, e a razão disso é que ela é muito confusa, e só foi deduzida no fim do Renascimento, quando algebristas itinerantes perambulavam pela Itália, engalfinhando-se em ferozes batalhas públicas para resolver equações, com dinheiro e status em jogo. As poucas pessoas que conheciam a fórmula da equação cúbica a mantinham em segredo ou as anotavam em crípticos
versos rimados.5
Longa história. A questão é: engenharia reversa é difícil.
O problema da inferência, aquilo com que os decifradores de códigos da Bíblia se debatiam, é difícil por ser exatamente esse tipo de problema. Quando somos cientistas, ou eruditos da Torá, ou crianças pequenas vagando nas nuvens, somos presenteados com observações e solicitados a construir teorias – o que foi colocado na caixa para produzir o mundo que vemos? Inferência é uma coisa difícil, talvez a coisa mais difícil. Pelas formas das nuvens e o modo como se movem, nós lutamos para retroceder, resolver x, o sistema que as formou.
Derrotando o zero
Ficamos dando voltas em torno da questão fundamental: quanto devo me surpreender com aquilo que vejo no mundo? Este é um livro sobre matemática, e você deve desconfiar que existe um meio numérico de chegar a isso. Existe, sim. Mas é cheio de perigos. Precisamos falar de valores-p.
Mas primeiro precisamos falar de improbabilidade, algo sobre o qual até agora fomos inaceitavelmente vagos. Mas existe um motivo para isso. Há partes da matemática, como a geometria e a aritmética, que ensinamos às nossas crianças, e que as crianças, em certa medida, ensinam a si mesmas. São as partes mais próximas da nossa intuição inata. Nascemos praticamente sabendo contar e categorizar objetos pelo seu formato e localização, e a elaboração formal, matemática, desses conceitos não é muito diferente daquela com a qual começamos.
Probabilidade é diferente. Com certeza temos uma intuição embutida em nós para pensar sobre certas coisas. Muito mais difícil é articulá-las. Há uma razão para a teoria matemática da probabilidade ter surgido tão tarde na história da disciplina, e de aparecer também tardiamente no currículo de matemática, se é que aparece. Quando você tenta pensar com cuidado sobre o que a probabilidade significa, fica um pouquinho confuso. Quando dizemos: “A probabilidade de uma moeda lançada dar cara é de ½”, estamos invocando a lei dos grandes números do Capítulo 4, que diz que, se você lançar a moeda muitas, muitas vezes, a proporção de caras quase inevitavelmente se aproximará de ½, como que restringida por um túnel que vai se estreitando. É isso que se chama visão frequentista da probabilidade.
Mas o que estamos querendo dizer quando falamos “A probabilidade de chover amanhã é de 20%”? Amanhã só acontece uma vez, não é um experimento que possamos repetir, como lançar uma moeda vezes e mais vezes. Com algum esforço, podemos inserir o clima no modelo frequentista. Talvez queiramos dizer que, entre alguma grande população de dias com condição similar a este, o dia seguinte foi chuvoso em 20% das vezes. Mas aí você encalha quando lhe perguntam: “Qual a probabilidade de a raça humana ser extinta nos próximos mil anos?” Este é, quase por definição, um experimento que você não pode repetir. Usamos a probabilidade até para falar de acontecimentos que não podem ser pensados como sujeitos ao acaso.
Qual a probabilidade de que o consumo de azeite de oliva previna o câncer? Qual a probabilidade de que Shakespeare seja o autor das peças de Shakespeare? Qual a probabilidade de que Deus tenha escrito a Bíblia e criado a Terra? É difícil falar sobre essas coisas na mesma linguagem que usamos para estimar os resultados de lançamento de moedas e do jogo de dados. Ainda assim, nós nos descobrimos capazes de dizer, sobre perguntas como essas: “Parece improvável” ou “Parece provável”. Uma vez feito isso, como podemos resistir à tentação de perguntar: “Quanto provável?”
Uma coisa é perguntar, outra é responder. Não consigo pensar em nenhum experimento que avalie diretamente a probabilidade de que o “homem lá em cima” esteja realmente “lá em cima” (ou que seja um “homem”, já que tocamos no assunto). Então temos de fazer a segunda melhor coisa, ou pelo menos o que a estatística tradicional afirma ser a segunda melhor coisa. (Como veremos, há controvérsia quanto a isso.)
Dissemos que era improvável que os nomes de rabinos medievais estivessem ocultos nas letras da Torá. Será? Muitos judeus religiosos partem do ponto de vista de que tudo que há para se saber, de uma maneira ou outra, está contido nas palavras da Torá. Se isso é verdade, a presença dos nomes e aniversários dos rabinos não é absolutamente improvável – na realidade, é quase uma exigência.
Pode-se contar história semelhante sobre a loteria da Carolina do Norte. Soa improvável que um conjunto idêntico de números ganhadores saísse duas vezes em uma semana. E é verdade, se você concordar com a hipótese de que os números são tirados de uma gaiola completamente ao acaso. Mas talvez você não concorde. Talvez você pense que o sistema aleatório não funciona direito, e que os números 4, 21, 23, 34, 39 têm mais probabilidade de sair que os outros. Ou talvez você ache que um funcionário corrupto da loteria está escolhendo os números para combinar com determinado bilhete. Em qualquer dessas hipóteses, a impressionante coincidência não é absolutamente improvável. Improbabilidade, tal como descrita aqui, é uma noção relativa, não absoluta. Quando dizemos que um resultado é improvável, estamos sempre dizendo, explicitamente ou não, que ele é improvável segundo determinado conjunto de hipóteses que fizemos sobre o mecanismo subjacente do mundo.
Muitas questões científicas podem ser reduzidas a um simples sim ou não. Alguma coisa está acontecendo, ou não? Uma nova droga consegue atacar a doença que se propõe curar, ou não faz nada? Uma intervenção psicológica faz você mais feliz, vivaz, sexy, ou não faz absolutamente nada? O cenário do “não faz nada” é chamado hipótese nula. Ou seja, a hipótese nula é a de que a intervenção que você está estudando não tem efeito nenhum. Se você é um pesquisador que desenvolveu uma droga nova, a hipótese nula é a coisa que faz você passar a noite acordado. A não ser que consiga excluí-la, não saberá se está no caminho de um grande avanço médico ou simplesmente desmatando a trilha metabólica errada.
Então, como você faz para excluir? O mecanismo-padrão, chamado teste de significância da hipótese nula, foi desenvolvido em sua forma mais comumente usada por R.A. Fisher, o
fundador da moderna prática da estatística,b no começo do século XX.
A coisa funciona assim. Primeiro, você precisa realizar um experimento. Pode começar com uma centena de sujeitos, e então escolhe ao acaso metade deles para tomar sua droga milagrosa, enquanto a outra metade toma um placebo. Sua esperança, obviamente, é de que os pacientes que tomam a droga tenham menos probabilidade de morrer que aqueles que tomam a pílula de açúcar.
A partir daí, o protocolo pode parecer simples: se você observa menos mortes entre os pacientes que tomam a droga do que entre os que tomam o placebo, declare vitória e preencha uma requisição na Administração de Alimentos e Drogas (FDA, na sigla em inglês) para comercializar o produto. Mas isso está errado. Não basta que os dados sejam consistentes com sua teoria. Eles precisam ser inconsistentes com a negação de sua teoria, a temida hipótese nula. Eu posso declarar ter capacidades telecinéticas tão poderosas que sou capaz de arrastar o sol e fazê-lo subir de sob o horizonte – se você quer uma prova, basta sair às 5h da manhã e ver os resultados do meu trabalho! Mas esse tipo de evidência não é evidência nenhuma, porque, segundo a hipótese nula de que eu careço de poderes psíquicos, o sol nascerá de qualquer forma.
Interpretar o resultado de um experimento clínico requer cuidado semelhante. Vamos dar um exemplo numérico. Suponha que estejamos no terreno da hipótese nula, em que a chance de ocorrer uma morte é exatamente a mesma (digamos, 10%) para os cinquenta pacientes que tomaram a droga e os cinquenta pacientes que tomaram o placebo. Mas isso não significa que cinco pacientes que tomam a droga morrem e cinco pacientes que tomam o placebo morrem. Na verdade, a chance de exatamente cinco pacientes da droga morrerem é de cerca de 18,5%. Não muito provável, assim como não é muito provável que uma série de lançamentos de moeda dê exatamente a mesma quantidade de caras e coroas. Do mesmo modo, não é muito provável que exatamente a mesma quantidade de pacientes da droga e de pacientes do placebo expirem no decorrer do experimento. Eu calculei:
13,3% de morrerem quantidades iguais de pacientes da droga e do placebo;
43,3% de morrerem menos pacientes do placebo que da droga;
43,3% de morrerem menos pacientes da droga que do placebo.
Constatar resultados melhores entre pacientes da droga que entre pacientes do placebo diz muito pouco, uma vez que isso não é absolutamente improvável, mesmo pela hipótese nula de que a sua droga não funcione.
Mas as coisas serão diferentes se os pacientes da droga se saírem bem melhor. Suponha que cinco dos pacientes do placebo morram durante o experimento, mas não morra nenhum dos pacientes da droga. Se a hipótese nula estiver correta, ambas as classes de pacientes deveriam ter uma chance de 90% de sobrevivência. Mas, nesse caso, é altamente improvável que todos os cinquenta pacientes da droga sobrevivam. O primeiro dos pacientes da droga tem uma chance de 90%; agora, a chance de que não só primeiro, mas também o segundo paciente sobreviva, é de 90% desses 90%, ou 81% – e se você quer que o terceiro paciente também sobreviva, a chance de isso acontecer é de apenas 90% desses 81%, ou 72,9%. Cada novo paciente cuja sobrevivência você estipula corta um pouquinho das chances, e, no final do processo, quando você estiver indagando sobre a probabilidade de todos os cinquenta pacientes sobreviverem, a fatia que sobra é bem fina:
(0,9) × (0,9) × (0,9) × … cinquenta vezes! … × (0,9) × (0,9) = 0,00515 …
Pela hipótese nula, há apenas uma chance em duzentas de obter resultados tão bons assim. Isso é muito mais convincente. Se eu alego que posso fazer o sol nascer com o poder de minha mente, você não deve se impressionar com meus poderes. Mas se eu alego que posso fazer o sol não nascer, e o sol não nasce, então demonstrei um resultado muito improvável pela hipótese nula, e é bom você ficar atento.
ENTÃO, eis o procedimento para excluir a hipótese nula, em forma de comando de itens:
1. Realize um experimento.
2. Suponha que a hipótese nula seja verdadeira, e seja p a probabilidade (por essa
hipótese) de obter resultados tão extremos quanto os observados.
3. O número p é chamado valor-p. Se ele é muito pequeno, alegre-se; você pode dizer que
seus resultados são estatisticamente significativos. Se é grande, reconheça que a hipótese nula não foi excluída.
Quando dizemos “muito pequeno”, quanto é isso? Não há um princípio que estabeleça uma linha divisória rígida entre o que é significativo e o que não é, mas há uma tradição, que começa com o próprio Fisher, que agora é amplamente adotada, de tomar p = 0,05, ou , como esse limiar.
O teste de significância da hipótese nula é popular porque capta a nossa forma intuitiva de raciocinar acerca da incerteza. Por que achamos os códigos da Bíblia convincentes, pelo menos à primeira vista? Porque códigos como os revelados por Witztum são muito improváveis pela hipótese nula de que a Torá não conhece o futuro. O valor de p – a probabilidade de encontrar tantas sequências de letras equidistantes, tão acuradas em sua descrição demográfica de rabinos notáveis – é muito próximo de zero.
Versões desse argumento em favor da criação divina precedem em muito o desenvolvimento formal de Fisher. O mundo é tão ricamente estruturado e tão perfeitamente ordenado – quão improvável seria haver um mundo como este, pela hipótese nula de que não houve um planejador primordial para construir tudo!
A primeira pessoa que teve a iniciativa de tornar esse argumento matemático foi John Arbuthnot, médico real, satírico, correspondente do poeta Alexander Pope e matemático em
tempo parcial.6 Arbuthnot estudou os registros de crianças nascidas em Londres entre 1629 e 1710, e descobriu que havia uma notável regularidade: em cada um desses 82 anos, nasceram mais meninos que meninas. Quais são as chances, indagou Arbuthnot, de surgir uma coincidência dessas pela hipótese nula de não haver Deus e que tudo era casualidade aleatória? Então, a probabilidade de que, num dado ano, Londres recebesse mais meninos que meninas seria de ½; e o valor-p, a probabilidade de haver mais meninos em 82 anos seguidos é
ou um pouco pior que uma em 4 setilhões. Em outras palavras, mais ou menos zero. Arbuthnot publicou seus achados num artigo chamado “An argument for Divine Providence, taken from the constant regularly observed in the birth of both sexes”.
O argumento de Arbuthnot foi muito elogiado e repetido pelas autoridades clericais, mas outros matemáticos logo apontaram falhas no raciocínio. A principal delas era a não razoável especificidade de sua hipótese nula. Os dados de Arbuthnot certamente se esteiam na hipótese de que o sexo das crianças é determinado ao acaso, e cada qual tem chance igual de nascer homem ou mulher. Mas por que a chance haveria de ser igual? Nicolas Bernoulli propôs hipótese nula diferente: que o sexo de uma criança é determinado pelo acaso, com a chance de
de nascer menino e de nascer menina. A hipótese nula de Bernoulli é tão ateísta quanto
a de Arbuthnot e se ajusta perfeitamente aos dados. Se você lança uma moeda 82 vezes e obtém 82 caras, deve ficar pensando: “Tem alguma coisa viciada nessa moeda”, e não “Deus
adora caras”.c
Embora o argumento de Arbuthnot não tenha sido amplamente aceito, seu princípio teve continuidade. Arbuthnot é o pai intelectual não só dos decifradores de códigos da Bíblia, como também dos “cientistas da criação”, que argumentam, até hoje, que a matemática exige que haja um deus, com base na ideia de que um mundo sem deus muito improvavelmente teria
a aparência do nosso mundo.d 7
Mas o teste da significância não se restringe a apologias teológicas. Em certo sentido, Darwin, o desgrenhado demônio ateu dos cientistas da criação, forneceu argumentos essencialmente do mesmo teor em prol do seu trabalho:
Dificilmente se pode supor que uma teoria falsa explicaria, de maneira tão satisfatória quanto a teoria da seleção natural, as
diversas grandes classes de fatos acima especificados. Recentemente observou-se que este não é um método seguro de
argumentar, mas é o método usado no julgamento de fatos comuns da vida, e tem sido frequentemente empregado pelos
maiores filósofos naturais.8
Em outras palavras, se a seleção natural fosse falsa, pense como seria improvável encontrar um mundo biológico tão meticulosamente consistente com suas predições!
A contribuição de R.A. Fisher foi tornar o teste de significância uma empreitada formal, um sistema pelo qual a significância ou não de um resultado experimental fosse uma questão objetiva. Na forma fisheriana, o teste de significância da hipótese nula tem sido o método-padrão para avaliar resultados de pesquisa científica durante quase um século. Um livro-texto
chama o método de “espinha dorsal da pesquisa psicológica”.9 Ele é o padrão pelo qual separamos experimentos entre bem-sucedidos e fracassados. Toda vez que você encontra os resultados de uma pesquisa médica, psicológica ou econômica, é provável que esteja lendo alguma coisa que foi verificada por um teste de significância.
Mas o desconforto que Darwin registrou sobre esse “método não seguro de argumentar” de fato nunca diminuiu. Por quase tanto tempo quanto o do método como padrão, há gente estigmatizando seu erro colossal. Em 1966, o psicólogo David Bakan escreveu sobre a “crise da psicologia”, que a seu ver era a “crise da teoria estatística”:
O teste de significância não dá a informação referente aos fenômenos psicológicos caracteristicamente atribuídos a ele. …
Grande dose de estragos tem sido associada a seu uso. … Dizer isso “em voz alta” é, por assim dizer, assumir o papel da
criança que aponta que o rei está na verdade vestido apenas com a roupa de baixo.10
E aqui estamos nós, quase cinquenta anos depois, com o rei ainda no poder e ainda exibindo o mesmo traje de aniversário, apesar de o grupo de crianças cada vez maior e mais clamoroso bradar que ele está quase nu.
A insignificância da significância
O que há de errado com a significância? Para começar, a palavra em si. A matemática tem uma relação engraçada com a língua inglesa. Os artigos de pesquisa em matemática, às vezes para surpresa dos não familiarizados, não são predominantemente compostos de números e símbolos. A matemática é feita de palavras. Mas os objetos aos quais nos referimos muitas vezes são entidades não contempladas pelos editores do dicionário de língua inglesa Merriam-Webster. Coisas novas exigem vocabulário novo. Há dois caminhos a seguir. Podem-se pinçar palavras novas de um tecido novo, como fazemos quando falamos de co-homologia, syzygy, monodromia, e assim por diante. Isso tem o efeito de fazer nosso trabalho parecer inatingível e proibitivo.
É mais comum adaptarmos para os nossos propósitos palavras já existentes, com base em uma semelhança percebida entre o objeto matemático a ser descrito e algo do chamado mundo real. Por exemplo, um “grupo”, para um matemático, também é um conjunto de coisas, mas de um tipo de grupo muito especial, como o grupo dos números inteiros ou o grupo de simetrias de uma figura geométrica. Nós não nos referimos a um grupo como uma arbitrária coleção de coisas, como Opep ou Abba, e sim como uma coleção de coisas com a propriedade de que qualquer par delas possa ser combinado numa terceira, como um par de números pode ser
somado, ou um par de simetrias que podem ser executadas uma depois da outra.e O mesmo vale para esquemas, feixes, anéis e pilhas, objetos matemáticos que apresentam apenas a mais tênue relação com as coisas comuns às quais essas palavras se referem. Às vezes a linguagem escolhida tem um sabor pastoral: a moderna geometria algébrica, por exemplo, é amplamente preocupada com campos, feixes, empilhamentos. Outras vezes é mais agressiva – não é incomum falar de um operador matando algo, ou, para impressionar mais, aniquilando algo. Uma vez tive uma experiência desagradável com um colega no aeroporto, quando ele fez o comentário, pouco excepcional no contexto matemático, de que talvez fosse necessário estourar o plano em certo ponto.
Então, passemos à significância. Em linguagem comum, ela quer dizer algo como “importância” ou “significado”. Mas o teste de significância que os cientistas usam não mede a importância. Quando se está testando o efeito de uma nova droga, a hipótese nula é que não haja efeito nenhum. Então, rejeitar a hipótese nula é apenas julgar que o efeito da droga é diferente de zero. Mas o efeito poderia ainda ser muito pequeno – tão pequeno que a droga não é efetiva, num sentido que uma pessoa comum, não matemática, a chamasse de significativo.
Essa duplicidade léxica de “significância” tem consequências que vão muito além de tornar difíceis de ler os artigos científicos. Em 18 de outubro de 1995, o Comitê de Segurança em Medicamentos (CSM, de Committee on Safety of Medicines) do Reino Unido publicou uma carta do tipo “Caro médico” para cerca de 200 mil médicos e profissionais de saúde pública por toda a Grã-Bretanha, com um aviso alarmante sobre certas marcas de contraceptivos orais de “terceira geração”. “Nova evidência tornou-se disponível”, dizia a carta, “indicando que a chance de que ocorra uma trombose numa veia aumenta em torno do dobro das vezes para
alguns tipos de pílula em comparação com outras.”11 Uma trombose na veia não é brincadeira, significa um coágulo impedindo o fluxo de sangue. Se o coágulo se desprende, a corrente sanguínea pode transportá-lo ao longo de todo o caminho até o pulmão, onde, sob sua nova identidade de embolia pulmonar, pode matar.
A carta para o “Caro médico” assegurava os leitores de que a contracepção era segura para a maioria das mulheres, e ninguém deveria parar de tomar a pílula sem recomendação médica. Contudo, detalhes como esse são fáceis de se perder quando a mensagem importante é “Pílulas matam”. A história que a Associated Press (AP) transmitiu em 19 de outubro dizia basicamente:
O governo emitiu um alerta, na quinta-feira, de que um novo tipo de pílula de controle de natalidade usado por 1,5 milhão de
mulheres britânicas pode causar coágulos sanguíneos. … Ele cogitou a retirada das pílulas, mas decidiu não fazê-lo, em parte
porque algumas mulheres não conseguem tolerar outros tipos de pílula.12
O público, compreensivelmente, pirou. Uma médica de clínica geral descobriu que 12%
das usuárias da pílula, entre suas pacientes, pararam de tomar os anticoncepcionais13 assim que ouviram falar no relatório do governo. Presumivelmente, muitas mulheres trocaram para outras versões da pílula não causadoras de trombose, mas qualquer interrupção diminui a eficácia da pílula. Controle de natalidade menos efetivo significa gravidez em maiores quantidades. (O quê, você achou que eu ia dizer que houve uma onda de abstinência?) Após sucessivos anos de declínio, a taxa de concepção no Reino Unido saltou diversos pontos percentuais no ano seguinte. Houve 26 mil bebês a mais concebidos em 1996 na Inglaterra e no País de Gales que no ano anterior. Uma vez que tantas das gravidezes extras não haviam
sido planejadas, isso também levou ao aumento de interrupções da gravidez: 13.600 abortos14
a mais que em 1995.f
Esse pode parecer um preço pequeno a ser pago para evitar um coágulo viajando pelo seu sistema circulatório, alimentando danos potencialmente letais. Pense em todas as mulheres poupadas da morte por embolia em consequência do alerta do CSM!
Mas a quantas mulheres, exatamente, estamos nos referindo? Não podemos saber ao certo. No entanto, um cientista que apoiou a decisão do CSM de emitir o alerta disse que
possivelmente o número total de mortes por embolia prevenidas era “uma”.15 O risco adicional apresentado pelas pílulas anticoncepcionais de terceira geração, ainda que significantes no sentido estatístico de Fisher, eram pouco significativos no sentido da saúde pública.
A maneira como a história foi apresentada só serviu para aumentar a confusão. O CSM reportou uma taxa de risco: pílulas de terceira geração dobravam o risco de trombose para a mulher. Isso é bastante ruim, até você se lembrar de que na verdade a trombose é rara. Entre mulheres em idade de procriar usando contraceptivos orais de primeira e segunda geração, uma em 7 mil podia sofrer uma trombose. As usuárias da nova pílula tinham de fato o dobro do risco, duas em 7 mil. Mas este continua a ser um risco muito pequeno, em razão desse fato matemático certificado: o dobro de um número minúsculo é um número minúsculo. Quanto é bom ou ruim duplicar alguma coisa, isso depende do tamanho inicial dessa coisa! Formar a palavra jazigo ocupando uma casa de “tríplice valor da palavra” num jogo de palavras cruzadas de tabuleiro é uma glória; ocupar a mesma casa com soma é um desperdício.
Taxas de risco são muito mais fáceis para o cérebro captar que diminutos fragmentos de probabilidade, como uma chance em 7 mil. Mas taxas de risco aplicadas a probabilidades pequenas podem enganar você facilmente. Um estudo da Universidade da Cidade de Nova
York (Cuny)16 descobriu que crianças cuidadas em lares privados ou por babás tinham uma
taxa de fatalidade sete vezes maior que crianças matriculadas em creches formais.g No entanto, antes de mandar sua babá embora, considere por um minuto que hoje as crianças pequenas americanas dificilmente morrem, e quando isso acontece quase nunca é porque alguma cuidadora a sacudiu até a morte. A taxa anual de acidentes fatais em lares privados era de 1,6
por 100 mil bebês, bem mais alta, de fato, que a taxa de 0,23 por 100 mil nas creches.h Mas ambos os números são mais ou menos zero.
No estudo da Cuny, apenas uma dúzia de bebês por ano morria por acidentes em lares privados, uma fração mínima das 1.110 crianças americanas que morreram ao todo em 2010 (principalmente estranguladas por roupas de cama), ou as 2.063 que morreram de Síndrome de
Morte Súbita Infantil.17 Mantendo-se todas as outras variáveis iguais, os resultados do estudo da Cuny fornecem um motivo para preferir as creches formais aos lares privados. Mas todas as outras coisas geralmente não são iguais, e algumas desigualdades têm mais importância que outras. E se a encardida creche certificada pela municipalidade fica duas vezes a distância de sua casa ao questionável lar privado? Acidentes de carro mataram 79 crianças de colo nos Estados Unidos em 2010. Se o seu bebê acaba passando 20% mais tempo na estrada por ano por causa da locomoção mais demorada, você pode ter apagado qualquer possível vantagem que obteve escolhendo a creche formal mais especializada.
Um teste de significância é um instrumento científico, e, como qualquer outro, tem certo grau de precisão. Se você aumentar a sensibilidade do teste – aumentando o tamanho da população estudada, por exemplo –, se habilita a ver efeitos cada vez menores. Esse é o poder do método, mas também seu perigo. A verdade é que a hipótese nula, se a tomarmos ao pé da letra, é quase sempre falsa. Quando se injeta uma droga poderosa na corrente sanguínea de um paciente, é difícil acreditar que a intervenção tenha efeito exatamente zero sobre o risco de que o paciente desenvolva câncer no esôfago, ou trombose, ou problemas respiratórios. Cada parte do corpo conversa com a outra, num complexo laço de feedback de influência e controle.
Tudo que você faz lhe dá câncer ou o previne. Em princípio, se você realiza um estudo suficientemente abrangente, pode descobrir qual o efeito. Mas esses efeitos em geral são tão minúsculos que podem ser ignorados com segurança. O simples fato de detectá-los nem sempre quer dizer que eles tenham importância.
Como seria bom se pudéssemos voltar no tempo para os primórdios da nomenclatura estatística e declarar que um resultado que passasse pelo teste de Fisher com valor-p inferior a 0,05 era “estatisticamente perceptível” ou “estatisticamente detectável”, em vez de “estatisticamente significativo”! Isso seria mais verdadeiro com referência ao sentido do método, que apenas nos aconselha acerca da existência de um efeito, porém silencia quanto a
seu tamanho e importância. Mas é tarde demais para isso. Nós temos a linguagem que temos.i
O mito do mito da “mão quente”
Nós conhecemos B.F. Skinner como psicólogo, sob muitos aspectos o psicólogo moderno, o homem que enfrentou os freudianos e liderou uma corrente de psicologia, o behaviorismo (ou comportamentalismo), preocupada apenas com o que era visível e o que podia ser mensurado, sem a necessidade de hipóteses sobre o inconsciente ou as motivações conscientes. Para Skinner, uma teoria da mente era apenas uma teoria do comportamento, e portanto os projetos interessantes para os psicólogos não diziam respeito a pensamentos ou sentimentos, e sim à manipulação do comportamento por meio de reforço.
Menos conhecida é a história de Skinner como romancista frustrado.18 Ele estudou inglês no Hamilton College e passava grande parte de seu tempo com Percy Saunders, esteta e professor de química cuja casa era uma espécie de salão literário. Skinner lia Ezra Pound, escutava Schubert e escrevia acalorados poemas adolescentes (“À noite, ele para,
ofegante/Murmurando para sua consorte terrena/‘o amor me exaure!’”19) para a revista literária da faculdade. Depois de formado, frequentou a conferência de escritores Bread Loaf, escreveu “uma peça em um ato sobre um curandeiro que mudava a personalidade das
pessoas”20 e conseguiu empurrar vários de seus contos para Robert Frost. Este escreveu a Skinner uma carta muito satisfatória elogiando suas histórias e aconselhando: “Tudo que o escritor tem é a habilidade de escrever forte e diretamente a partir de uma ideia pessoal preconcebida inexplicável e quase invencível. … Presumo que todo mundo tem a ideia preconcebida e passa algum tempo com ela até falar e escrever a partir dela. Mas a maioria
das pessoas acaba como começa, externalizando ideias preconcebidas de outras pessoas.”21
Assim incentivado, Skinner mudou para o sótão da casa de seus pais em Scranton, no verão de 1926, e começou a escrever. Mas descobriu que não era tão fácil para ele encontrar sua ideia preconcebida, ou, tendo-a encontrado, colocá-la em forma literária. Sua fase em Scranton não deu em nada. Conseguiu escrever um par de histórias e um soneto sobre o líder trabalhista John Mitchell, mas passava o tempo sobretudo construindo miniaturas de navios e sintonizando sinais distantes de Pittsburgh e Nova York no rádio – na época, um mecanismo de procrastinação novinho em folha.
“Uma reação violenta contra tudo que era literário estava se instalando”,22 escreveu ele sobre esse período. “Fracassei como escritor porque não tinha nada importante a dizer, mas não podia aceitar essa explicação. Era a literatura que devia estar em falta.” Ou, de forma
mais franca: “A literatura deve ser demolida.”23
Skinner era leitor regular da revista literária The Dial; em suas páginas entrou em contato com os escritos literários de Bertrand Russell e, via Russell, foi conduzido a John Watson, o primeiro grande defensor da concepção behaviorista que em breve viria a se tornar praticamente sinônimo de Skinner. Watson sustentava que a atividade dos cientistas era observar os resultados de experimentos, e só. Não havia lugar para hipóteses sobre consciência e almas. “Ninguém jamais tocou uma alma ou viu alguma alma num tubo de
ensaio”,24 dizem que teria escrito, numa forma de menosprezar essa noção. Essas palavras intransigentes devem ter feito Skinner vibrar, pois ele se mudou para Harvard como aluno de pós-graduação em psicologia, preparando-se para banir o eu vago e indisciplinado do estudo científico do comportamento.
Skinner tinha ficado muito impressionado com uma experiência de produção verbal espontânea que vivenciara em seu laboratório. Uma máquina ao fundo emitia um som rítmico, repetitivo, e Skinner viu-se falando junto com ela, acompanhando a batida, repetindo
silenciosamente a frase: “Você nunca vai sair, você nunca vai sair, você nunca vai sair.”25 O que parecia uma fala, ou mesmo, de maneira limitada, poesia, na verdade era resultado de uma espécie de processo verbal autônomo, que não requeria nada parecido com um autor
consciente.j Isso forneceu exatamente a ideia de que Skinner precisava para ficar livre da obrigação com a literatura. E se a linguagem, mesmo a linguagem dos grandes poetas, fosse apenas outro comportamento treinado por exposição a estímulos e manipulável em laboratório?
Na faculdade, Skinner havia escrito imitações dos sonetos de Shakespeare. Ele descreveu retrospectivamente a experiência, na meticulosa maneira behaviorista, como “o estranho
excitamento de emitir linhas inteiras já prontas, com métrica e rimas apropriadas”.26 Agora, como jovem professor de psicologia em Minnesota, ele próprio remodelou Shakespeare, mais emissor que escritor. Essa abordagem não era tão louca quanto parece agora. A forma dominante de crítica literária na época, “a leitura meticulosa”, trazia a marca da filosofia de Watson, exatamente como Skinner, exibindo uma preferência bastante behaviorista pelas
palavras na página, em detrimento das intenções não observáveis do autor.27
Shakespeare é famoso como mestre do verso aliterativo, no qual várias palavras em estreita sucessão começam com o mesmo som (“Full fathom five thy father lies…”). Para Skinner, esse argumento, por exemplo, não era ciência. Shakespeare aliterava? Em caso afirmativo, a matemática podia provar isso. “A comprovação de que existe um processo responsável pelo padrão aliterativo”, escreveu ele, “pode ser obtida apenas mediante uma análise estatística de todos os arranjos de consoantes iniciais numa amostra razoavelmente
grande.”28 E que forma de análise estatística? Nenhuma outra além de uma forma do teste de valor-p de Fisher.
Aqui, a hipótese nula é de que Shakespeare não prestava a menor atenção aos sons iniciais das palavras, de modo que a primeira letra de uma palavra da poesia não tem efeito nenhum sobre as outras palavras do mesmo verso. O protocolo era muito parecido com o de um teste clínico, mas com uma grande diferença: o pesquisador biomédico que testa uma droga espera de todo o coração ver a hipótese nula refutada e a eficácia do remédio demonstrada. Para Skinner, visando a derrubar a crítica literária de seu pedestal, a hipótese nula era a alternativa atraente.
Pela hipótese nula, a frequência com que os sons iniciais apareciam múltiplas vezes no mesmo verso ficaria inalterada se as palavras fossem postas num saco, sacudidas e espalhadas de novo em ordem aleatória. E foi exatamente isso que Skinner encontrou em sua amostra de uma centena de sonetos. Shakespeare fracassou no teste de significância. Skinner escreveu:
Apesar da aparente riqueza de aliteração nos sonetos, não há evidência significativa de um processo de aliteração no
comportamento do poeta ao qual se deva dar séria atenção. No que se refere a esse aspecto da poesia, Shakespeare poderia
muito bem ter tirado as palavras de uma cartola.29
“Aparente riqueza”, que atrevimento! Isso capta à perfeição o espírito da psicologia que Skinner queria criar. Onde Freud havia alegado ver o que estava antes oculto, reprimido ou obscurecido, Skinner queria fazer o contrário, negar a existência do que parecia estar bem diante da nossa vista.
Mas Skinner estava errado. Ele não tinha provado que Shakespeare não aliterava. Um teste de significância é um instrumento, como o telescópio, e alguns instrumentos são mais poderosos que outros. Se você olha Marte com um telescópio com ampliação para pesquisa, você vê luas. Se você olha com um binóculo, não as vê. Mas as luas continuam lá! E a aliteração de Shakespeare continua lá. Conforme documentado por historiadores da
literatura,30 esse era um artifício-padrão na época, conhecido e conscientemente implantado por quase todo mundo que escrevia em inglês.
O que Skinner havia provado é que a aliteração de Shakespeare não produzia um excesso de sons repetidos tão grande a ponto de aparecer em seu teste. Mas por que haveria de ser? O uso da aliteração em poesia é tanto positiva quanto negativa; em certos lugares, alitera-se para criar um efeito; em outros, a aliteração é evitada, para não criar um efeito que você não quer. Pode acontecer que a tendência geral seja aumentar o número de versos aliterativos, mas, mesmo assim, o aumento deve ser pequeno. Encha seus sonetos de uma ou duas aliterações a mais em cada um, e você vira um dos poetas trapalhões ridicularizados pelo colega elisabetano de Shakespeare, George Gascoigne: “Muitos escritores recorrem à repetição de palavras começando com a mesma letra, a qual (sendo modestamente usada) empresta graça a um verso; mas eles o fazem de modo a caçar uma letra até a morte, o que a torna crambe, e
Crambe bis positum mors est.”31
A frase em latim significa: “Repolho servido duas vezes é morte.” A redação de Shakespeare é rica em efeito, mas sempre contida. Ele jamais empacotaria tanto repolho a ponto de o grosseiro teste de Skinner conseguir farejá-lo.
Um estudo estatístico que não seja refinado o suficiente para detectar um fenômeno do tamanho esperado é chamado estudo de baixa potência – o equivalente a olhar os planetas com binóculo. Haja luas ou não, o resultado é o mesmo, então, nem precisava ter se incomodado. Você não manda um binóculo fazer o serviço de um telescópio. O problema da baixa potência é o reverso da medalha do problema gerado com o susto do controle de natalidade britânico. Um estudo de alta potência, como o experimento com os contraceptivos, pode nos levar a estourar uma veia por causa de um efeito pequeno que na verdade não é importante. Um estudo de baixa potência pode nos levar a desconsiderar erroneamente um efeito pequeno que o método simplesmente foi fraco demais para ver.
Consideremos Spike Albrecht, o ala calouro do time masculino de basquete dos Wolverines, da Universidade de Michigan, com apenas 1,80 metro de altura, e que ficou no banco a maior parte da temporada. Ninguém esperava que ele desempenhasse algum papel
importante quando os Wolverines enfrentaram os Cardinals de Louisville na final da NCAAk de 2013. Mas Albrecht converteu cinco arremessos seguidos, quatro deles de três pontos, num intervalo de dez minutos, no primeiro tempo, levando o Michigan a uma vantagem de dez pontos sobre os superfavoritos Cardinals. Ele teve o que os aficionados do basquete chamam de “mão quente” – a aparente incapacidade de errar um arremesso, não importa de que distância ou da marcação feroz da defesa.
Exceto que supostamente não existe tal coisa. Em 1985, num dos artigos acadêmicos
contemporâneos mais famosos em psicologia cognitiva,32 Thomas Gilovich, Robert Vallone e Amos Tversky (doravante GVT) fizeram para os fãs de basquete o que B.F. Skinner fizera para os amantes do Bardo. Conseguiram os registros de cada arremesso da temporada 1980-81 dos Philadelphia 76ers em todos os seus 48 jogos em casa e os analisaram estatisticamente. Se os jogadores tendessem a uma sequência “quente” ou a uma sequência “fria”, seria de esperar que eles tivessem maior propensão a acertar um arremesso após ter convertido uma cesta do que acertá-lo depois de um erro. E quando GVT fizeram um levantamento entre os fãs da NBA, descobriram que essa teoria tinha amplo apoio: nove entre dez fãs concordavam que um jogador tem mais probabilidade de encestar quando acabou de converter duas ou três cestas seguidas.
Mas nada do tipo estava ocorrendo na Filadélfia. Julius Erving, o grande Dr. J, acertava 52% no total. Após três cestas seguidas, situação que poderia indicar que Erving estava com a mão quente, sua porcentagem caía para 48%. E, após três erros consecutivos, sua porcentagem de arremessos de quadra não caía, mas continuava em 52%. Para outros jogadores, como Darryl “Chocolate Thunder” Dawkins, o efeito era ainda mais acentuado. Após uma encestada, sua porcentagem total de 62% caía para 57%; após um arremesso errado, subia para 73%, exatamente o contrário da predição dos fãs. (Uma explicação possível: um arremesso errado sugere que Dawkins estava enfrentando defensores eficientes no perímetro, que o induziam a subir para a cesta e fazer uma daquelas suas enterradas de destruir a tabela, aliás, sua marca registrada, às quais ele dava nomes como “Na sua cara, a desgraça” ou “Turbo sexofônico deleite”.)
Será que isso significa que não existe algo como a “mão quente”? Calma aí. A mão quente em geral não é considerada uma tendência universal de encestadas após encestadas e erros após erros. Ela é uma coisa evanescente, uma breve possessão por um ser superior do basquete que habita o corpo de um jogador por breve e glorioso intervalo na quadra, sem dar aviso de chegada ou partida. Spike Albrecht é Ray Allen por dez minutos, convertendo implacavelmente cestas de três pontos, e aí volta a ser Spike Albrecht. Será que um teste estatístico consegue ver isso? A princípio, por que não? GVT divisaram um meio inteligente de verificar esses breves intervalos de impossibilidade de ser contido. Decompuseram a temporada de cada jogador em sequências de quatro arremessos cada. Assim, se a sequência de cestas (C) e erros (E) de Dr. J era
CECCCECEECCCCEEC,
as sequências seriam
CECC, CECE, ECCC, CEEC …
GVT então contaram quantas sequências eram “boas” (três ou quatro cestas), “moderadas” (duas cestas) ou “ruins” (zero ou uma cesta) para cada um dos nove jogadores do estudo. E então, bons fisherianos que eram, consideraram os resultados da hipótese nula – de que não existe uma coisa do tipo mão quente.
Há dezesseis sequências possíveis de quatro arremessos: o primeiro pode ser c ou e, E para cada uma dessas opções há duas possibilidades para o segundo arremesso, dando-nos ao todo quatro opções para os dois primeiros arremessos (aí vão elas: CC, CE, EC, EE) e para cada uma dessas quatro há duas possibilidades para o terceiro, dando oito sequências possíveis de três arremessos, e duplicando mais uma vez, para considerar o quarto arremesso da sequência, e obtemos dezesseis. Aí estão todas, divididas em sequências boas, moderadas e ruins:
Boas: CCCC, ECCC, CECC, CCEC, CCCE
Moderadas: CCEE, CECE, CEEC, ECCE, ECEC, EECC
Ruins: CEEE, ECEE, EECE, EEEC, EEEE
Para um arremessador de 50%, como Dr. J, todas as dezesseis sequências possíveis deveriam ser igualmente prováveis, porque cada arremesso tem igual probabilidade de ser C ou E. Então, seria de esperar que ou 31,25% das sequências de quatro arremessos de Dr. J
fossem boas, com 37,5% moderadas e 31,25% ruins.
Mas se Dr. J às vezes experimentasse a mão quente, seria de esperar uma proporção mais alta de sequências boas, com a contribuição daqueles jogos em que ele simplesmente parece não errar. Quanto mais propenso a sequências quentes ou frias você está, mais você verá CCCC e EEEE, e menos CECE.
O teste de significância nos pede para formular a seguinte pergunta: se a hipótese nula estivesse correta e não houvesse mão quente, seria improvável que víssemos os resultados efetivamente observados? Acontece que a resposta é não. A proporção de sequências boas, ruins e moderadas nos dados reais é justamente em torno do que o acaso prediria, com qualquer desvio que deixa de ser estatisticamente significativo.
“Se os presentes resultados são surpreendentes”, escrevem GVT, “é por causa da robustez com que a crença errônea na ‘mão quente’ é defendida por observadores experientes e bem-informados.” De fato, enquanto o resultado era considerado sabedoria convencional por psicólogos e economistas, ele demorou para deslanchar no mundo do basquete. Isso não perturbou Tversky, que gostava de uma boa briga, qualquer que fosse o resultado. “Já participei de mil discussões sobre esse tema”, ele dizia. “Ganhei todas e não convenci ninguém.”
Mas GVT, como Skinner, antes, haviam respondido só metade da pergunta. Ou seja, e se a hipótese nula é verdadeira e não existe algo como mão quente? Então, como eles demonstram, os resultados teriam um aspecto muito semelhante aos observados nos dados reais.
No entanto, e se a hipótese nula estiver errada? A mão quente, se existir, é breve, e o efeito, em termos estritamente numéricos, é pequeno. O pior arremessador na liga acerta 40% de seus lances, e o melhor acerta 60%. Essa é uma diferença grande em termos de basquete, mas não tão grande estatisticamente. Como seriam as sequências de arremessos se a mão quente fosse real?
Os cientistas da computação Kevin Korb e Michael Stillwell33 calcularam exatamente isso num artigo escrito em 2003. Eles geraram simulações com a mão quente embutida: a porcentagem de arremessos certos do jogador simulado saltou para até 90%, considerando dois intervalos “quentes” de dez arremessos no decorrer do experimento. Em mais de ¾ dessas simulações, o teste de significância usado por GVT informou que não havia motivo para rejeitar a hipótese nula – mesmo que a hipótese nula fosse completamente falsa. O projeto de GVT era de baixa potência, destinado a informar a inexistência da mão quente mesmo que ela fosse real.
Se você não gosta de simulações, considere a realidade. Nem todos os times são iguais quando se trata de impedir arremessos. Na temporada 2012-13, o mediano time dos Indiana Pacers permitiu aos adversários converter apenas 42% dos arremessos, enquanto 47,6% foram encestados contra os Cleveland Cavaliers. Então os jogadores realmente têm “feitiços quentes” de um tipo bastante previsível: apresentam maior propensão a acertar um arremesso quando jogam contra os Cavs. Mas esse calor morno – talvez devêssemos chamar de “mão morna” – é algo que os testes usados por Gilovich, Vallone e Tversky não são sensíveis o bastante para perceber.
A PERGUNTA CORRETA a fazer não é “Será que jogadores de basquete às vezes melhoram ou pioram temporariamente na conversão de arremessos?” – o tipo de pergunta sim/não abordado por um teste de significância. A pergunta certa é “Quanto sua habilidade varia com o tempo, e em que medida os observadores podem detectar em tempo real se um jogador está quente?”. Aqui, a resposta seguramente é “Não tanto quanto as pessoas pensam, realmente muito pouco.” Um estudo recente descobriu que jogadores que convertem o primeiro de dois lances livres se
tornam ligeiramente mais propensos34 a converter o lance livre seguinte, mas não existe evidência convincente sustentando a mão quente num jogo em tempo real, a não ser que você leve em conta as impressões subjetivas de jogadores e treinadores. A vida curta da mão quente, que a torna tão difícil de refutar, também a torna difícil de detectar de maneira confiável. Gilovich, Vallone e Tversky estão absolutamente corretos em sua alegação central de que os seres humanos são rápidos em perceber padrões onde eles não existem e em superestimar sua força onde existem. Qualquer espectador que fique observando o aro perceberá rotineiramente um ou outro jogador enfiar cinco bolas seguidas. A maior parte do tempo, isso se deve a alguma combinação de defesa indiferente, escolha inteligente de arremessos ou, o mais provável, pura sorte, e não a um surto de transcendência basquetebolística. Isso significa que não há razão para esperar que um sujeito que acabou de fazer cinco cestas seguidas tenha alguma probabilidade especial de fazer a próxima.
Analisar a performance de consultores de investimentos apresenta o mesmo problema. Se existe algo como talento para investir, ou se as diferenças de performance entre diversos fundos devem-se totalmente ao acaso, essa tem sido uma questão controversa, sombria e não
resolvida durante anos.35 Mas se há investidores com mão quente temporária ou permanente, eles são raros, tão raros que fazem pouca ou nenhuma diferença no tipo de estatística contemplada por GVT. Se pegarmos um fundo que venceu o mercado cinco anos seguidos, é bem mais provável que tenha tido sorte do que seja bom. A performance passada não é garantia de retornos futuros. Se os fãs de Michigan estavam contando com Spike Albrecht para carregar o time a fim de ganhar o campeonato, ficaram terrivelmente desapontados. Albrecht errou todos os arremessos que fez no segundo tempo, e os Wolverines acabaram perdendo por seis pontos.
Um estudo de John Huizinga e Sandy Weil,36 realizado em 2009, sugere que poderia ser boa ideia os jogadores não acreditarem na mão quente, mesmo que ela exista! Num conjunto de dados muito maior que o de GVT, eles descobriram um efeito similar. Depois de fazer uma cesta, os jogadores tinham menos probabilidade de acertar o arremesso seguinte. Mas Huizinga e Weil tinham registros não só de arremessos certeiros, mas do local de onde eles foram feitos. Esses dados mostraram uma espantosa explicação em potencial: jogadores que tinham acabado de fazer uma cesta apresentavam maior probabilidade de tentar um arremesso mais difícil na jogada seguinte.
Yigal Attali, em 2013, encontrou resultados ainda mais intrigantes nessa mesma linha.37 Um jogador que tinha acabado de fazer uma bandeja não apresentava maior propensão a fazer um arremesso de longe do que um jogador que acabou de perder uma bandeja. Bandejas são fáceis e não deveriam dar ao jogador uma sensação firme de estar com a mão quente. No entanto, o jogador tem propensão muito maior a tentar um arremesso de longe depois de uma cesta de três pontos do que depois de errar um lance de três. Em outras palavras, a mão quente poderia “se cancelar” – os jogadores, acreditando-se quentes, ganham confiança exagerada e tentam fazer arremessos que não deveriam tentar.
A natureza do fenômeno análogo no investimento em ações fica como exercício para o leitor.
a Há uma controvérsia duradoura e profundamente sem importância sobre se o termo “número natural” deveria ser definido de modo a incluir ou não o zero. Sinta-se livre para fingir que eu não disse “0”, se você for um antizeroísta obstinado.
b Você poderia objetar aqui que os métodos de Fisher são estatística, não matemática. Eu sou filho de dois estatísticos e sei que a fronteira disciplinar entre os dois campos é verdadeira. Contudo, para os nossos propósitos, tratarei o pensamento estatístico como uma espécie de pensamento matemático.
c Arbuthnot via na propensão a um ligeiro excesso de meninos como um argumento em si a favor da Providência: alguém ou Alguém devia ter ajustado o relógio exatamente de modo a criar bebês meninos adicionais para compensar os homens adultos mortos em guerras e acidentes.
d Abordaremos este argumento mais detalhadamente no Capítulo 9.
e A definição matemática verdadeira de “grupo” tem ainda muito mais que isso – no entanto, infelizmente, essa é outra bela história que vai ter de ficar pela metade.
f Cabe lembrar que no Reino Unido o aborto é permitido por lei, sendo portanto realizado pelas vias oficiais e contabilizado nas estatísticas oficiais. (N.T.)
g O autor refere-se aqui a in-home day-care e day-care centers. O primeiro termo refere-se a casas de família com autorização para estabelecer “lares para cuidar das crianças”, sem maiores pretensões educacionais. O segundo termo refere-se às creches formais, públicas ou privadas, que, além dos cuidados, oferecem também propostas educacionais. (N.T.)
h O artigo não aborda a interessante questão de quais são as taxas correspondentes para crianças sob os cuidados dos próprios pais.
i Nem todo mundo tem a linguagem que temos, claro. Os estatísticos chineses usam (xianzhu) para significância, no sentido estatístico, que é mais próximo de “perceptível” – mas meus amigos que falam chinês me dizem que a palavra carrega uma conotação de importância, como significance em inglês [e “significância” em português]. Em russo, o termo estatístico para significância é , mas o modo mais típico de exprimir o sentido em inglês de significant [significativo] seria
.
j Conta-se que David Byrne escreveu a letra de “Burning down the house” de modo muito similar, vociferando sílabas sem sentido, no ritmo da música instrumental, e depois voltando para anotar as palavras que as sílabas absurdas o faziam lembrar.
k NCAA: National College Athletic Association, a entidade que administra o esporte universitário nos Estados Unidos. (N.T.)