O Poder do Pensamento Matemático

Jordan Ellenberg · Capítulo 23 de 30

Páginas do PDF

O Poder do Pensamento Matemático

16. O câncer de pulmão leva você a fumar?

 

E QUANDO DUAS variáveis são correlacionadas? O que isso realmente significa?

Para simplificar, comecemos com o tipo mais simples de variável, uma variável binária, com apenas dois valores possíveis. Frequentemente uma variável binária é a resposta para uma pergunta tipo sim ou não: “Você é casada?” “Você fuma?” “Você é atualmente, ou algum dia foi, membro do Partido Comunista?”

Quando você compara duas variáveis binárias, a correlação assume uma forma particularmente simples. Dizer que a situação conjugal e a situação de fumante são negativamente correlacionadas, por exemplo, é simplesmente dizer que a pessoa casada tem menos probabilidade de fumar que a pessoa média. Ou, falando de outra maneira, que os fumantes têm menos probabilidade que a pessoa média de se casar. Vale a pena reservar um momento para persuadir a si mesmo que essas duas coisas são de fato a mesma! A primeira afirmação pode ser escrita como uma inequação:

 

fumantes casados / todas as pessoas casadas < todos os fumantes / todas as pessoas

 

E a segunda como:

 

fumantes casados / todos os fumantes < todas as pessoas casadas / todas as pessoas

 

Se você multiplicar todos os lados de cada inequação pelo denominador comum (todas as pessoas) × (todos os fumantes), poderá ver que ambos os enunciados são maneiras diferentes de dizer a mesma coisa:

 

(fumantes casados) × (todas as pessoas) < (todos os fumantes) × (todas as pessoas casadas)

 

Da mesma forma, se fumar e casamento fossem positivamente correlacionados, isso significaria que pessoas casadas têm maior probabilidade que a média de fumar e fumantes têm maior probabilidade que a média de se casar.

Um problema se apresenta de imediato. Seguramente é muito pequena a chance de que a proporção de fumantes entre as pessoas casadas seja exatamente igual à proporção de fumantes na população total. Então, exceto uma coincidência maluca, casamento e fumar estarão correlacionados, seja positiva, seja negativamente. Também estarão correlacionados orientação sexual e fumar, cidadania americana e fumar, primeira inicial na última metade do alfabeto e fumar, e assim por diante. Tudo estará correlacionado a fumar, em uma direção ou outra. Esse é o mesmo tema que encontramos no Capítulo 7: a hipótese nula, estritamente falando, quase sempre é falsa.

Botar as mãos na cabeça e dizer “Tudo está correlacionado com tudo!” seria bem pouco informativo. Então, não relatamos todas essas correlações. Quando você lê num relatório que uma coisa está correlacionada a outra, está implicitamente sendo informado de que a correlação é “forte o bastante” para valer a pena ser relatada – geralmente porque passou num teste de significância estatística. Como vimos, o teste de significância estatística traz consigo muitos perigos, mas pelo menos é um sinal que faz o estatístico se aprumar, olhar direito e dizer: “Alguma coisa deve estar acontecendo.”

Mas o quê? Aqui chegamos à parte realmente enrolada. Casamento e fumar estão negativamente correlacionados, isso é fato. Um modo típico de exprimir isso é dizer

 

“Se você é fumante, tem menos probabilidade de ser casado.”

 

Mas uma pequena mudança torna o significado muito diferente:

 

“Se você fosse fumante, teria menos probabilidade de ser casado.”

 

Parece estranho que mudar um verbo do modo indicativo para o subjuntivo possa modificar drasticamente o que diz a sentença. Mas a primeira frase é apenas uma declaração a respeito do caso de que estamos tratando. A segunda se refere a uma questão muito mais delicada: qual seria o caso se mudássemos algo em relação ao mundo? A primeira sentença expressa uma correlação; a segunda sugere uma causalidade. Como já mencionamos, as duas coisas não são iguais. O fato de fumantes serem menos frequentemente casados que os outros não significa que deixar de fumar irá fazer surgir de imediato sua futura esposa. A descrição matemática da correlação tem estado bem fixa no lugar desde o trabalho de Galton e Pearson, um século atrás. Assentar a ideia de causalidade sobre um alicerce matemático firme tem sido algo muito mais fugaz.

Há algo de escorregadio na nossa compreensão de correlação e causalidade. A intuição tende a captá-la com bastante firmeza em algumas circunstâncias, mas deixa escapar em outras. Quando dizemos que o HDL está correlacionado a menor risco de ataque cardíaco, estamos fazendo uma afirmação factual: “Se você tem um nível mais alto de colesterol HDL, menor é sua probabilidade de ter um ataque do coração.” É difícil não pensar que o HDL está fazendo alguma coisa – que as moléculas em questão literalmente provocam uma melhora de sua saúde cardiovascular, digamos, “esfregando e limpando” a crosta lipídica de suas paredes arteriais. Se assim fosse – se a mera presença de muito HDL estivesse funcionando em seu benefício –, seria razoável esperar que qualquer intervenção aumentando o HDL contribuísse para reduzir o risco de ataque cardíaco.

Mas talvez o HDL e os ataques cardíacos estivessem correlacionados por um motivo diferente. Digamos que algum outro fator, que nós não medimos, tende a aumentar o HDL e a reduzir o risco de acidentes cardiovasculares. Se for esse o caso, uma droga que aumente o HDL pode ou não prevenir ataques cardíacos. Se a droga afeta o HDL por meio do misterioso fator, provavelmente ajudará seu coração, porém, se estimula o HDL de algum outro modo, todas as chances caem por terra. Essa é a situação de Tim e Sara. O sucesso financeiro deles está correlacionado, mas não porque o fundo em que Tim investe esteja provocando a decolada de Sara, nem o contrário. Há um fator misterioso, as ações da Honda, que afeta a ambos, Tim e Sara. Pesquisadores clínicos chamam isso de problema do ponto final substituto. É caro e consome tempo verificar se uma droga aumenta a duração média de um tempo de vida porque, para registrar o tempo de vida de uma pessoa, é preciso esperar que ela morra. O nível de HDL é o ponto final substituto, o biomarcador fácil de checar, teoricamente responsável por “vida longa sem ataque cardíaco”. Mas a correlação entre HDL e ausência de ataques cardíacos pode não indicar nenhum vínculo causal.

Fazer a separação entre correlações provenientes de relações causais e aquelas que não são causais é um problema enlouquecedor e difícil, mesmo em casos que podem parecer

óbvios, como a relação entre fumar e câncer de pulmão.1 Na virada do século XX, o câncer de pulmão era uma doença extremamente rara. Mas, por volta de 1947, ele era responsável por quase das mortes por câncer entre os homens britânicos, matando cerca de quinze vezes mais pessoas do que matara em décadas anteriores. No começo, muitos pesquisadores achavam que o câncer de pulmão estava sendo mais bem diagnosticado que antes, mas logo ficou claro que o aumento de casos era grande e rápido demais para ser atribuído a um efeito desse tipo. O câncer de pulmão realmente estava em alta. No entanto, ninguém tinha certeza de quem era o culpado. Talvez fosse a fumaça das fábricas, talvez o aumento dos níveis de escape de veículos, ou talvez alguma substância nem sequer imaginada como poluente. Ou talvez fossem os cigarros, cuja popularidade eclodiu durante o mesmo período.

Por volta de 1950, grandes estudos na Inglaterra e nos Estados Unidos mostraram uma poderosa associação entre fumar e câncer de pulmão. Entre os não fumantes, o câncer de pulmão ainda era uma doença rara, todavia, para os fumantes, o risco era espetacularmente

mais alto. Um famoso artigo de Doll e Hill,2 de 1950, descobriu que, entre 649 homens com câncer de pulmão, em vinte hospitais londrinos, apenas dois eram não fumantes. Isso não soa tão impressionante segundo os padrões modernos. Em Londres, em meados do século, fumar era um hábito extremamente popular, e os não fumantes eram muito mais raros que hoje. Mesmo assim, numa população de 649 pacientes do sexo masculino hospitalizados por queixas outras que não o câncer de pulmão, 27 eram não fumantes, bem mais que dois. Além disso, a associação ficava mais forte à medida que o hábito de fumar era mais pesado. Dos pacientes com câncer de pulmão, 168 fumavam mais de 25 cigarros por dia, enquanto apenas 84 hospitalizados por outros motivos fumavam tanto assim.

Os dados de Doll e Hill mostravam que câncer de pulmão e fumo estavam correlacionados; sua relação não era de determinação estrita (alguns fumantes pesados não têm câncer de pulmão, enquanto alguns não fumantes têm), mas tampouco os dois fenômenos eram independentes. Sua relação ficava na nebulosa área intermediária que Galton e Pearson haviam sido os primeiros a mapear.

A mera declaração de correlação é muito diferente de uma explicação. O estudo de Doll e Hill não mostra que fumar causa câncer. Eles escrevem: “A associação ocorreria se o carcinoma do pulmão fizesse as pessoas fumarem, ou se ambos os atributos fossem efeitos finais de uma causa comum.” Pensar que o câncer de pulmão leva a fumar, como eles ressaltam, não é muito razoável. Um tumor não pode voltar atrás no tempo e dar a alguém o hábito de fumar um maço por dia. Mas o problema da causa comum é mais trabalhoso.

Nosso velho amigo R.A. Fisher, herói fundador da estatística moderna, era um vigoroso cético da ligação entre tabaco e câncer exatamente com os mesmos fundamentos. Fisher era o herdeiro intelectual natural de Galton e Pearson. Na verdade, sucedeu Pearson em 1933 na Cátedra Galton de Eugenia no University College, em Londres. (Em deferência às sensibilidades modernas, a posição é agora chamada de Cátedra Galton de Genética.)

Fisher sentia que era prematuro excluir até a teoria de que “câncer leva a fumar”:

 

Será possível, então, que o câncer de pulmão – vale dizer, a condição pré-cancerosa que deve viger e cuja existência é

conhecida durante anos naqueles que exibirão o câncer de pulmão – seja uma das causas de fumar? Não acho que isso

possa ser excluído. Não julgo que saibamos o suficiente para dizer que há essa causa. Mas a condição pré-cancerosa

envolve certa quantidade de inflamação crônica leve. As causas de fumar podem ser estudadas entre seus amigos, em

alguma medida, e creio que se concordará que uma ligeira causa de irritação – uma ligeira decepção, um atraso inesperado,

algum tipo de crítica branda, uma frustração – é comumente acompanhada pela tentativa de fumar, e dessa maneira obter

um pouquinho de compensação pelos infortúnios menores da vida. Assim, não é improvável, para qualquer um que sofra de

uma inflamação crônica em alguma parte do corpo (algo que não dê margem a dor consciente), que esse sofrimento esteja

associado ao ato de fumar com mais frequência, ou simplesmente de fumar, em vez de não fumar. Esse é o tipo de conforto

que poderia ser um verdadeiro consolo para qualquer um que esteja numa faixa de quinze anos próxima do câncer de

pulmão. Tirar o cigarro do pobre coitado seria como tirar a bengala de um cego. Isso faria mais infeliz a pessoa já infeliz.3

 

É possível ver aqui a exigência de um estatístico brilhante e rigoroso, de que todas as possibilidades recebam justa consideração, até o apego de um fumante inveterado pelo seu hábito. (Alguns também viram a influência do trabalho de Fisher como consultor do comitê permanente da Tobacco Manufacturer, grupo industrial britânico. A meu ver, a relutância de Fisher em afirmar uma relação causal era consistente com sua abordagem estatística geral.) A sugestão de Fisher, de que os homens na amostra de Doll e Hill pudessem ter sido levados a fumar por uma inflamação pré-cancerosa, jamais vingou, porém, seu argumento em favor de uma causa comum ganhou mais força. Fisher, fiel a seu título acadêmico, era um dedicado eugenista, acreditando que diferenças genéticas determinavam uma porção saudável do nosso destino, e que as melhores espécies estavam, naqueles indulgentes tempos evolutivos, em grave risco de serem batidas pelos seus inferiores naturais.

Do ponto de vista de Fisher, era perfeitamente normal imaginar que um fator genético comum, ainda não mensurado, estivesse por trás tanto do câncer de pulmão quanto da propensão a fumar. Isso pode parecer bastante especulativo, mas lembre-se de que, na época, a geração do câncer de pulmão provocado pelo fumo assentava-se sobre alicerces igualmente misteriosos. Nenhum componente químico do tabaco havia se mostrado capaz de produzir tumores em laboratório.

Há uma forma elegante de testar a influência genética do fumo estudando gêmeos. Digamos que dois gêmeos “combinam” se ambos forem fumantes ou se ambos não forem fumantes. É esperável que a combinação seja bastante comum, pois em geral os gêmeos crescem na mesma casa, com os mesmos pais e sob as mesmas condições culturais, e é isso de fato o que se vê. Mas gêmeos idênticos e gêmeos fraternos estão sujeitos a esses fatores comuns exatamente no mesmo grau. Então, se gêmeos idênticos têm mais probabilidade de combinar que gêmeos fraternos, isso é evidência de que fatores hereditários exercem alguma influência sobre o hábito de fumar. Fisher apresentou alguns resultados em pequena escala a esse respeito, a

partir de estudos não publicados, e trabalhos mais recentes têm confirmado sua intuição.4 O ato de fumar parece estar sujeito a pelo menos alguns fatores hereditários.

Isso, obviamente, não quer dizer que esses mesmos genes são o que provoca câncer de pulmão mais adiante na estrada. Sabemos um bocado mais sobre câncer e como o tabaco o provoca. O fato de que fumar dá câncer já não está sujeito a dúvida. Todavia, é difícil não ter um pouquinho de simpatia pela abordagem “não vamos nos apressar” de Fisher. É bom ser desconfiado diante das correlações. O epidemiologista Jan Vandenbroucke escreveu a respeito dos artigos de Fisher sobre o tabaco: “Para minha surpresa, encontrei artigos extremamente bem escritos e convincentes que poderiam ter se tornado livros-texto clássicos pela sua impecável lógica e clara exposição de dados e argumentos, se os autores estivessem do lado

certo.”5

No decorrer dos anos 1950, a opinião científica sobre a correlação entre fumo e câncer de pulmão convergiu uniformemente para um consenso. É verdade, ainda não havia nenhum mecanismo biológico claro para a geração de tumores pela fumaça de tabaco, e ainda não havia argumento para a associação entre fumar e câncer que não se baseasse nas correlações observadas. No entanto, em 1959, tantas dessas correlações haviam sido vistas, e tantos possíveis fatores de confusão descartados, que o Diretor Nacional de Saúde do governo americano, Leroy E. Burney, declarou: “O peso da evidência no presente implica o ato de fumar como principal fator na crescente incidência de câncer de pulmão.” Mesmo então, essa postura não era incontroversa. John Talbott, editor do Journal of the American Medical Association, revidou o fogo apenas três semanas depois num editorial do periódico:

 

Numerosas autoridades que examinaram a mesma evidência citada pelo dr. Burney não concordam com suas conclusões.

Nem os proponentes nem os oponentes da teoria do fumo possuem evidência suficiente para garantir a premissa de uma

posição de autoridade do tipo tudo ou nada. Até que sejam realizados estudos definitivos, o médico pode cumprir com sua

responsabilidade observando a situação de perto, mantendo-se a par dos fatos e aconselhando seus pacientes com base em

sua avaliação.6

 

Talbott, assim como Fisher antes dele, acusava Burney e aqueles que concordavam com ele de estarem, cientificamente falando, colocando a carroça na frente dos bois.

Quanto essa disputa se manteve feroz, mesmo dentro do establishment científico, fica claro

pelo extraordinário trabalho do historiador da medicina Jon Harkness.7 Sua exaustiva pesquisa de arquivos mostrou que a declaração assinada pelo Diretor Nacional foi na verdade escrita por um grande grupo de cientistas do Serviço Público de Saúde, e que o próprio Burney tivera pouco envolvimento direto. Quanto à resposta de Talbott, essa também teve ghostwriters, um grupo rival de pesquisadores do Serviço Público de Saúde! O que parecia uma rixa entre funcionários do governo e establishment médico era, na verdade, uma briga científica interna projetada em tela pública.

Sabemos como a história termina. O sucessor de Burney no cargo de Diretor Nacional de Saúde, Luther Terry, convocou um comitê independente, formado por figuras ilustres, para debater a relação entre fumo e saúde no começo da década de 1960. Em janeiro de 1964, com a cobertura nacional da imprensa, o comitê anunciou seus achados em termos que faziam Burney parecer tímido:

 

Em vista da continuada e acumulada evidência vinda de muitas fontes, julga o comitê que fumar contribui substancialmente

para a mortalidade de certas doenças específicas e para a taxa de mortalidade geral. … Fumar cigarro é um risco à saúde

de importância suficiente nos Estados Unidos para exigir ação corretiva apropriada. (Grifos do relatório original.)

 

O que havia mudado? Em 1964, a associação entre fumo e câncer tinha aparecido de modo consistente em estudo após estudo. Fumantes pesados sofriam mais de câncer que fumantes leves, e o câncer estava provavelmente no ponto de contato entre o tabaco e o tecido humano; fumantes de cigarros tinham mais câncer de pulmão, fumantes de cachimbo, mais câncer de boca. Ex-fumantes estavam menos propensos ao câncer que fumantes ativos. Todos esses fatores se combinaram para levar o comitê à conclusão de que fumar não estava apenas correlacionado ao câncer de pulmão, mas causava o câncer de pulmão, e que esforços para reduzir o consumo de tabaco provavelmente contribuiriam para prolongar as vidas americanas.

 

Nem sempre é errado estar errado

 

Num universo alternativo, em que a mais recente pesquisa sobre tabaco tivesse resultado diferente, poderíamos ter descoberto que a estranha teoria de Fisher afinal estava correta, e que fumar era consequência do câncer, e não o contrário. E essa não teria sido, de longe, a maior inversão nas ciências médicas. E aí? O Diretor Nacional de Saúde teria emitido um press release dizendo: “Lamento, todo mundo agora pode voltar a fumar.” Nesse ínterim, os fabricantes de cigarro teriam perdido um monte de dinheiro, milhões de fumantes teriam abdicado de bilhões de prazerosos cigarros. Tudo porque o diretor nacional havia declarado como fato aquilo que era apenas uma hipótese fortemente respaldada.

Mas qual era a alternativa? Imagine o que você teria de fazer para saber realmente, com algum tipo de certeza absoluta, que fumar causa câncer de pulmão. Você teria de reunir uma grande população de adolescentes, selecionar metade deles aleatoriamente e forçar essa metade a passar os cinquenta anos seguintes fumando cigarros de modo regular, enquanto a outra metade teria de se abster dessa prática. Jerry Cornfield, pioneiro da pesquisa sobre

fumo, declarou que tal experimento era “possível de conceber, mas impossível de realizar”.8 Mesmo que o experimento fosse logisticamente possível, ele violaria toda norma ética existente acerca de pesquisa com sujeitos humanos.

Os responsáveis por políticas públicas não têm o luxo da incerteza de que os cientistas dispõem. Precisam elaborar seus melhores palpites e tomar decisões com base neles. Quando o sistema funciona – como inquestionavelmente funcionou, no caso do tabaco –, o cientista e o responsável pela política pública trabalham em uníssono, o cientista avaliando o grau de incerteza que devemos ter e o responsável pela política decidindo como agir com base na incerteza especificada.

Às vezes isso leva a erros. Já deparamos com o caso da terapia de reposição hormonal, que durante muito tempo julgou-se proteger mulheres em idade pós-menopausa contra doenças cardíacas, com base em correlações observadas. As recomendações correntes, balizadas em experimentos aleatórios realizados posteriormente, são mais ou menos o contrário.

Em 1976 e novamente em 2009, o governo dos Estados Unidos embarcou numa maciça e cara campanha de vacinação contra a gripe suína, tendo recebido advertências de epidemiologistas cada vez que a cepa predominante corria o risco de se tornar catastroficamente pandêmica. Na verdade, os dois surtos de gripe, embora graves, estavam

bem longe de ser desastrosos.9

É fácil criticar os responsáveis pela política nesses cenários, por deixar que a tomada de decisões assuma a dianteira da ciência. Mas não é tão simples assim. Nem sempre é errado estar errado.

Como pode ser? Um rápido cálculo de valor esperado, como os feitos na Parte III, ajuda a desvendar esse dito aparentemente paradoxal. Suponha que estejamos considerando fazer uma recomendação na área de saúde – digamos, que as pessoas devam parar de comer berinjela porque ela representa um pequeno risco de súbita e catastrófica parada cardíaca. Essa conclusão baseia-se numa série de estudos que descobriram que os comedores de berinjela têm probabilidade ligeiramente maior que os não comedores de berinjela de cair mortos de repente. Mas não há perspectiva de se fazer um teste controlado aleatório em larga escala, pelo qual forcemos algumas pessoas a comer berinjela e obriguemos outras a se abster. Precisamos nos contentar com a informação que temos, e que representa apenas uma correlação. Pelo que sabemos, há uma base genética comum para berinjelofilia e parada cardíaca. Mas não há como ter certeza.

Talvez estejamos 75% seguros de que nossa conclusão está correta, e que uma campanha contra a berinjela salvaria mil vidas americanas por ano. Mas há também 25% de chance de que nossa conclusão esteja errada. Se for assim, induzimos muita gente a abandonar aquele que poderia ser seu legume predileto, levando-as a uma dieta geral menos saudável e

causando, digamos, duzentas mortes a mais por ano.a

Como sempre, obtemos o valor esperado multiplicando o valor de cada resultado possível pela probabilidade correspondente, e então somando tudo. Nesse caso, descobrimos que

 

75% × 1.000 + 25% × (−200) = 750 − 50 = 700

 

Nossa recomendação tem um valor esperado de setecentas vidas salvas por ano. Apesar das estridentes e bem-financiadas reclamações do Conselho da Berinjela, e a despeito da nossa incerteza bastante real, vamos a público.

Lembre-se de que o valor esperado não representa o que literalmente esperamos que aconteça, mas o que poderíamos esperar que aconteça em média caso a mesma decisão fosse repetida vezes e vezes seguidas. Uma decisão de saúde pública não é como tirar cara ou coroa; é algo que se pode fazer apenas uma vez. Por outro lado, berinjelas não são o único perigo ambiental que podemos ser chamados a avaliar. Talvez a seguir tenhamos nossa atenção voltada para o fato de a couve-flor estar associada à artrite, ou que escovas de dentes vibratórias estão associadas a autismo. Se, em cada caso, cada intervenção tiver um valor esperado de setecentas vidas por ano, deveríamos executar todas, e em média esperaremos salvar setecentas vidas a cada vez. Em qualquer caso individual, poderíamos acabar fazendo mais mal que bem, porém, de forma geral, salvaremos um monte de vidas. Como os jogadores de loteria num dia de rolagem, arriscamo-nos a perder num dado instante, mas temos quase certeza de nos sairmos bem a longo prazo.

E se nos ativermos a um padrão de evidência mais estrito, declinando de implantar qualquer uma dessas recomendações porque não temos certeza de que estamos certos? Então as vidas que seriam salvas teriam se perdido.

Seria ótimo se pudéssemos atribuir probabilidades precisas, objetivas, a questões difíceis de saúde na vida real, mas é claro que não podemos. Essa é outra diferença entre a interação de uma droga com o corpo humano e um cara ou coroa ou um bilhete de loteria. Estamos encalhados com as confusas e vagas probabilidades que refletem nosso grau de crença em várias hipóteses, as probabilidades que R.A. Fisher negou veementemente que fossem probabilidades. Não sabemos e não podemos saber o valor esperado exato de se lançar uma campanha contra a berinjela, escovas de dentes vibratórias ou o tabaco. No entanto, com frequência podemos dizer com confiança que o valor esperado é positivo. Mais uma vez, isso não significa que a campanha terá bons efeitos, mas apenas que a soma total de todas as campanhas similares, ao longo do tempo, provavelmente fará mais bem que mal. A própria natureza da incerteza é que nós não sabemos qual das nossas escolhas será proveitosa, como atacar o tabaco, e qual nos prejudicará, como recomendar terapia de reposição hormonal. Mas uma coisa é certa: eximir-se de fazer qualquer recomendação, baseado no fato de que pode estar errada, é uma estratégia perdedora. É como o conselho de George Stigler sobre perder voos de avião. Se você nunca dá um conselho enquanto não tem certeza de ter razão, então não está aconselhando o suficiente.

 

A falácia de Berkson, ou por que homens bonitões são tão idiotas?

 

As correlações podem surgir de causas comuns não vistas, e isso em si já causa bastante confusão. Mas a história não termina aí. Correlações também podem vir de efeitos comuns. Esse fenômeno é conhecido como falácia de Berkson, em referência ao estatístico e médico Joseph Berkson, que lá atrás, no Capítulo 8, explicou como uma confiança cega nos valores poderia nos levar a concluir que um pequeno grupo de pessoas incluindo um albino consiste em seres não humanos.

O próprio Berkson, como Fisher, era um cético vigoroso da ligação entre tabaco e câncer. Com doutorado em medicina, ele representava a velha escola de epidemiologia, profundamente desconfiada de qualquer argumento cujo respaldo fosse mais estatístico que médico. Esses argumentos, pressentia ele, representavam uma invasão por parte de teóricos ingênuos num terreno que pertencia de direito à profissão médica. “Câncer é um problema

biológico, não estatístico”,10 escreveu em 1958. “A estatística pode perfeitamente desempenhar um papel auxiliar em sua elucidação. Mas se os biólogos permitirem que os estatísticos se tornem árbitros de questões biológicas, o desastre científico é inevitável.”

Berkson se sentia profundamente desconfortável com o fato de se ter descoberto que o tabaco tinha correlação não só com o câncer de pulmão, mas com dezenas de outras doenças, afligindo cada sistema do corpo humano. Para Berkson, a ideia de que o tabaco podia ser completamente venenoso era implausível em si mesma. “É como se, ao investigar uma droga que antes fora indicada para alívio de um resfriado comum, se descobrisse que ela não só serve para melhorar a coriza, mas também para curar pneumonia, câncer e diversas outras enfermidades. Um cientista diria: ‘Deve haver algo de errado nesse método de

investigação.’”11

Berkson, como Fisher, estava mais inclinado a acreditar na “hipótese constitucional”, de que alguma diferença preexistente entre não fumantes e fumantes era responsável pelo estado relativamente saudável do segundo grupo.

 

Se 85% a 95% de uma população é fumante, então a pequena minoria de não fumantes deveria ter, diante disso, algum tipo

especial de constituição. Não é implausível que fossem, em média, relativamente longevos, e isso implica que as taxas de

mortalidade gerais nesse segmento da população sejam relativamente baixas. Afinal, o pequeno grupo de pessoas que têm

sucesso em resistir às lisonjas incessantemente aplicadas e ao condicionamento de reflexos dos anunciantes de cigarros

forma uma turma intrépida; e, se são capazes de enfrentar esses assaltos, deveriam ter relativamente pouca dificuldade em

rechaçar a tuberculose e até o câncer!12

Berkson também teceu objeções ao estudo original de Doll e Hill, realizado entre pacientes de hospitais britânicos. Ele observara, em 1938, que selecionar pacientes dessa forma pode produzir o surgimento de associações onde efetivamente não há.

Suponha, por exemplo, que você queira saber se pressão sanguínea elevada é um fator de risco para diabetes. Você poderia fazer um levantamento dos pacientes em seu hospital com o objetivo de descobrir se pressão sanguínea elevada é mais comum entre não diabéticos ou diabéticos. E você descobre, para sua surpresa, que a pressão sanguínea elevada é menos comum entre pacientes com diabetes. Você poderia concluir que a pressão alta protege contra a diabetes, ou pelo menos contra sintomas de diabetes sérios o bastante para exigir a hospitalização. Mas antes de começar a aconselhar os pacientes diabéticos a aumentar seu consumo de besteirinhas salgadas, considere a seguinte tabela:

 

1.000 é a população total

300 pessoas com pressão alta

400 pessoas com diabetes

120 pessoas com pressão alta e diabetes

 

Vamos supor que haja mil pessoas na nossa cidadezinha, das quais 30% têm pressão alta e 40% têm diabetes. (Nós gostamos de besteirinhas salgadas e de besteirinhas doces na nossa cidade.) Vamos supor, além disso, que não haja relação entre as duas condições; então, 30% dos 400 diabéticos, ou 120 pessoas, também sofrem de pressão alta.

 

Se todas as pessoas doentes na cidade acabarem no hospital, então a população do hospital irá consistir em

 

180 pessoas com pressão alta, mas sem diabetes

280 pessoas com diabetes, mas sem pressão alta

120 pessoas com pressão alta e diabetes

 

Dos quatrocentos diabéticos no total que estão no hospital, 120, ou 30%, têm pressão alta. Mas dos 180 não diabéticos no hospital, 100% têm pressão alta! Seria loucura concluir daí que a pressão sanguínea elevada impede você de contrair diabetes. As duas condições estão negativamente correlacionadas, mas não porque uma cause a ausência da outra. E também não porque haja algum fator oculto que simultaneamente aumente a pressão sanguínea e ajude a regular a insulina. Isso acontece porque as duas condições têm um efeito em comum: levar a pessoa para o hospital.

 

Em outras palavras, se você está no hospital, está ali por algum motivo. Se não é diabético, aumenta a probabilidade de ser por causa de pressão alta. Então, o que à primeira vista parece uma relação causal entre pressão alta e diabetes na verdade é apenas uma ilusão estatística.

O efeito também pode funcionar no sentido oposto. Na vida real, ter duas doenças traz uma probabilidade maior de ir parar no hospital que ter uma só. Talvez os 120 diabéticos hipertensos da cidade terminem todos no hospital, mas 90% das pessoas relativamente saudáveis com uma doença só ficam em casa. Também há outras razões para estar no hospital, por exemplo, no primeiro dia de neve do ano, muita gente tenta polir o limpador de neve com a mão e acaba cortando o dedo. Então, a população do hospital poderia ser assim:

 

10 pessoas sem diabetes nem pressão alta, mas com um corte profundo no dedo

18 pessoas com pressão alta, mas sem diabetes

28 pessoas com diabetes, mas sem pressão alta

120 pessoas com pressão alta e diabetes

 

Agora, quando você faz seu estudo no hospital, descobre que 120 em 148 diabéticos, ou 81%, têm pressão alta. Mas só dezoito dos 28 não diabéticos, ou 64%, têm pressão alta. Isso faz parecer que a pressão alta aumenta a probabilidade de ter diabetes. Mais uma vez, contudo, isso é uma ilusão. Tudo que estamos medindo é o fato de que um conjunto de pessoas que estão hospitalizadas é qualquer coisa, menos uma amostra aleatória da população.

 

A falácia de Berkson faz sentido fora dos domínios da medicina. Na verdade, ela faz sentido mesmo fora do domínio das características que podem ser precisamente quantificadas.

Você deve ter notado que, entre os homensb na sua lista de possíveis encontros, os bonitões tendem a não ser simpáticos e os simpáticos tendem a não ser bonitões. Será que é porque ter uma face simétrica torna o cara cruel? Ou porque ser simpático com as pessoas torna o cara feio? Bem, talvez. Mas não necessariamente. Apresento a seguir o Grande Quadrado de Homens,

 

e tomo como hipótese de trabalho que os homens sejam de fato equidistribuídos por todo o quadrado. Em particular, há bonitões simpáticos, feios simpáticos, bonitões médios e feios médios em proporções aproximadamente iguais.

Mas simpatia e beleza têm um efeito em comum: colocam esses homens no grupo dos que são notados. Seja honesta, os feios médios são aqueles que você nem chega a levar em conta. Então, dentro do Grande Quadrado, há um Triângulo Menor de Homens Aceitáveis:

Agora a fonte do fenômeno está clara. Os homens mais bonitões no triângulo percorrem toda a gama de personalidades, desde os mais gentis até os mais antipáticos. Em média, eles são tão simpáticos quanto a pessoa média na população inteira, que, vamos falar a verdade, não é tão simpática assim. Da mesma forma, os homens mais simpáticos são apenas medianamente bonitos. Os feios de que você gosta, porém – eles ocupam um minúsculo canto no triângulo e são supersimpáticos –, precisam ser visíveis para você, ou nem sequer estariam ali. A correlação negativa entre aparência e personalidade na sua lista de homens possíveis é absolutamente verdadeira. No entanto, se você tenta melhorar o aspecto do seu namorado treinando-o a agir na média, está sendo vítima da falácia de Berkson.

O esnobismo literário funciona da mesma maneira. Você sabe como são terríveis os romances populares? Não porque as massas não apreciem qualidade, mas porque existe um Grande Quadrado dos Romances, e os únicos dos quais você ouve falar são aqueles no Triângulo Aceitável, que são populares ou bons. Se você se força a ler romances impopulares escolhidos essencialmente ao acaso – eu já participei de um júri de prêmio literário, então realmente tive de fazer isso –, descobre que a maioria deles, assim como os populares, é bastante ruim.

O Grande Quadrado é simples demais, claro. Há muitas dimensões, não só duas, ao longo das quais você pode classificar seus interesses amorosos ou sua leitura semanal. O Grande Quadrado é mais bem descrito como uma espécie de Grande Hipercubo. E isso só para suas preferências pessoais! Se você tentar entender o que acontece na população inteira, vai ter de lidar com o fato de que pessoas diferentes definem atração de forma diferente, podem diferir quanto aos pesos que atribuem aos vários critérios ou podem simplesmente ter preferências incompatíveis. O processo de agregar opiniões, preferências e desejos de muitas pessoas diferentes apresenta ainda outro conjunto de dificuldades. Isso quer dizer oportunidade para fazer mais matemática. Vamos agora nos voltar para isso.

 

a Todos os números nesse exemplo foram inventados sem consideração de plausibilidade.

b Ou “pessoas do seu gênero preferido, se houver”, obviamente.