Rápido e devagar: Duas formas de pensar

Daniel Kahneman · Capítulo 18 de 42

Páginas do PDF

Rápido e devagar: Duas formas de pensar

17 - Regressão à Média

FALANDO DE CAUSAS E ESTATÍSTICAS

“Não podemos presumir que eles vão aprender alguma coisa de fato a partir de meras estatísticas. Vamos lhes mostrar um ou dois casos representativos individuais para influenciar seu Sistema 1.”

“Não precisamos nos preocupar com que essa informação estatística seja ignorada. Pelo contrário, ela vai ser utilizada imediatamente para alimentar um estereótipo.”

17

REGRESSÃO À MÉDIA

Tive uma das experiências ao estilo “heureca!” mais gratificantes de minha carreira quando ensinava a instrutores de voo da Força Aérea Israelense sobre a psicologia do treinamento eficaz. Eu lhes falava sobre um importante princípio de treinamento de habilidade: recompensas por desempenho aperfeiçoado funcionam melhor do que punição por erros. Essa proposição é apoiada por grande evidência de pesquisa com pombos, ratos, humanos e outros animais.

Quando terminei minha entusiasmada exposição, um dos instrutores mais experientes do grupo ergueu a mão e foi sua vez de fazer a própria exposição. Ele começou por concordar que de fato recompensar a melhoria de desempenho podia ser bom para pássaros, mas negou que fosse a melhor coisa para cadetes da Força Aérea. O que ele disse foi o seguinte: “Em várias ocasiões elogiei os cadetes por alguma execução perfeita numa manobra acrobática.

Quando eles voltam a executar essa mesma manobra, em geral se saem pior. Por outro lado, muitas vezes berrei no fone de ouvido de um cadete por causa de uma manobra malfeita, e em geral eles a executam melhor da vez seguinte. Então por favor não venha nos dizer que recompensa funciona e punição não, porque o que acontece é o oposto.”

Esse foi um alegre momento de insight, quando vi sob nova luz um princípio estatístico que eu vinha ensinando havia anos. O instrutor tinha razão — mas também estava redondamente enganado! Sua observação foi perspicaz e correta: ocasiões em que ele elogiava o desempenho provavelmente se fariam seguir de um desempenho decepcionante, e punições eram tipicamente acompanhadas de melhoria. Mas a inferência que ele extraíra sobre a eficácia da recompensa e punição errara o alvo completamente. O que ele havia observado é conhecido como regressão à média, que nesse caso se devia a flutuações aleatórias na qualidade do desempenho. Naturalmente, ele só elogiava um cadete cujo desempenho estava muito acima da média. Mas esse cadete provavelmente apenas tivera sorte naquela tentativa particular e desse modo era provável que piorasse, independentemente de ter ou não sido elogiado. De modo similar, o instrutor gritava na comunicação por rádio com um cadete apenas quando o desempenho deste era singularmente ruim e desse modo com probabilidade de melhorar independentemente do que o instrutor fizesse. O instrutor vinculara uma interpretação causal às flutuações inevitáveis de um processo aleatório.

O desafio não podia ficar sem resposta, mas uma aula de álgebra de previsão não seria recebida com muito entusiasmo. Em vez disso, peguei um giz e desenhei um alvo no chão. Pedi a cada oficial na sala para ficar de costas para o alvo e jogar duas moedas ali em imediata sucessão, sem olhar. Medimos as distâncias do alvo e escrevi os dois resultados de cada arremessador na lousa. Depois reescrevemos os resultados em ordem, do melhor para o pior desempenho na primeira tentativa. Ficou óbvio que a maioria (mas nem todos) dos que haviam se saído bem na primeira vez pioraram na segunda tentativa, e os que se saíram mal na

primeira tentativa de um modo geral melhoraram. Comentei com os instrutores que o que eles haviam presenciado na lousa coincidia com o que havíamos escutado a respeito do desempenho em sucessivas execuções de manobras aéreas: um desempenho ruim era tipicamente seguido de melhoria e um desempenho bom de piora, sem qualquer ajuda de elogios ou punição.

A descoberta que fiz nesse dia foi de que os instrutores de voo estavam aprisionados numa desafortunada contingência: como eles puniam os cadetes quando o desempenho era ruim, eram na maior parte dos casos recompensados com uma melhoria subsequente, mesmo que a punição fosse na verdade ineficaz. Além do mais, os instrutores não estavam sozinhos nesse dilema. Eu estava presenciando um fato significativo da condição humana: o feedback ao qual a vida nos expõe é perverso. Como tendemos a ser bons com os outros quando nos agradam e ruins quando não o fazem, somos estatisticamente punidos por sermos bons e estatisticamente recompensados por sermos ruins.

TALENTO E SORTE

Alguns anos atrás, John Brockman, que edita a revista online Edge, pediu a um certo número de cientistas que apresentassem sua “equação favorita”. Essas foram minhas contribuições: sucesso = talento + sorte

grande sucesso = um pouco mais de talento + muita sorte

A ideia nada surpreendente de que a sorte muitas vezes contribui para o sucesso tem consequências surpreendentes quando a aplicamos aos primeiros dois dias de um torneio de golfe de alto nível. Para manter as coisas simples, suponha que em ambos os dias a pontuação média dos competidores foi no par 72. Nós nos concentramos em um jogador que se saiu muito bem no primeiro dia, encerrando com uma pontuação de 66. O que podemos apreender dessa pontuação excelente? Uma inferência imediata é de que o golfista é mais talentoso do que a média de participantes do torneio. A fórmula para o sucesso sugere que outra inferência é igualmente justificada: o golfista que se saiu tão bem no dia 1 provavelmente desfrutou de sorte maior do que a média nesse dia. Se você aceita que tanto talento como sorte contribuem para o sucesso, a conclusão de que o golfista bem-sucedido foi sortudo é tão justificada quanto a conclusão de que ele é talentoso.

Igualmente, se você olha para um jogador que pontuou 5 acima do par nesse dia, tem motivo para inferir que ele é um pouco fraco e teve um dia ruim. Claro, você sabe que nenhuma dessas inferências é segura. É inteiramente possível que o jogador que marcou 77

seja na verdade muito talentoso, mas teve um dia excepcionalmente horrível. Por mais incertas que sejam, as seguintes inferências a partir da pontuação no dia 1 são plausíveis e estarão corretas com mais frequência do que estão erradas.

pontuação acima da média no dia 1 = talento acima da média +

sorte no dia 1

e

pontuação abaixo da média no dia 1 = talento abaixo da média +

falta de sorte no dia 1

Agora presuma que você sabe a pontuação de um golfista no dia 1 e lhe pedem para predizer sua pontuação no dia 2. Você espera que o golfista conserve o mesmo nível de talento no segundo dia, então suas melhores estimativas serão “acima da média” para o primeiro jogador e “abaixo da média” para o segundo jogador. Com sorte, é claro, são outros quinhentos. Já que você não tem como prever a sorte dos golfistas no segundo (ou em qualquer outro) dia, sua melhor suposição deve ser que ela será mediana, nem boa, nem má. Isso significa que na ausência de qualquer outra informação, sua melhor estimativa sobre a pontuação dos jogadores no dia 2 não deve ser uma repetição do desempenho deles no dia 1.

Isto é o máximo que você pode dizer:

• O golfista que se saiu bem no dia 1 tem maior probabilidade de ser bem-sucedido também no dia 2, mas menos do que no primeiro dia, pois a sorte incomum que ele provavelmente teve no dia 1 tem pouca probabilidade de continuar.

• O golfista que se saiu mal no dia 1 provavelmente ficará abaixo da média no dia 2, mas vai melhorar, pois há pouca probabilidade de que sua provável onda de azar continue.

Também esperamos que a diferença entre os dois golfistas diminua no segundo dia, embora nossa melhor estimativa seja de que o primeiro jogador ainda se sairá melhor do que o segundo.

Meus alunos sempre ficaram surpresos em saber que o melhor desempenho previsto para o dia 2 é mais moderado, mais próximo da média do que a evidência na qual está baseado (a contagem no dia 1). Eis por que o padrão é chamado regressão à média. Quanto mais extrema a pontuação original, mais regressão é esperada, pois uma pontuação extremamente boa sugere um dia de muita sorte. A previsão regressiva é razoável, mas sua precisão não é garantida.

Alguns dos golfistas que marcaram 66 no dia 1 irão se sair ainda melhor no segundo dia, se sua sorte melhorar. A maioria vai se sair pior, porque sua sorte não estará mais acima da média.

Agora vamos andar contra a seta do tempo. Organize os jogadores por seu desempenho no dia 2 e olhe para o desempenho deles no dia 1. Você vai encontrar precisamente o mesmo padrão de regressão à média. Os golfistas que se saíram melhor no dia 2 provavelmente tiveram sorte nesse dia, e a melhor estimativa é de que haviam tido menos sorte e se saído pior no dia 1. O fato de que você observa regressão quando prediz um evento anterior a partir

de um evento posterior deve convencê-lo de que a regressão não possui uma explicação causal.

Os efeitos da regressão são ubíquos, e desse modo induzem a erro as histórias causais feitas para explicá-los. Um exemplo bem conhecido é “a maldição da Sports Illustrated”, a alegação de que um atleta cuja foto aparece na capa da revista está fadado a ir muito mal na temporada seguinte. Superconfiança e pressão de atender as altas expectativas são em geral oferecidos como explicações. Mas há uma explicação mais simples para a “maldição”: um atleta que consegue ganhar a capa da Sports Illustrated deve ter se saído excepcionalmente bem na temporada anterior, provavelmente contando com um pequeno empurrão da sorte — e a sorte é volúvel.

Por acaso assisti ao evento de salto com esquis masculino nas Olimpíadas de Inverno quando Amos e eu escrevíamos um artigo sobre previsão intuitiva. Cada atleta tem dois saltos no evento, e os resultados são combinados para a pontuação final. Fiquei chocado de ouvir os comentários do locutor enquanto os atletas se preparavam para seu segundo salto: “A Noruega deu um ótimo primeiro salto; ele vai ficar tenso, esperando proteger sua vantagem, e provavelmente vai se sair pior” ou “A Suécia teve um primeiro salto ruim e agora ele sabe que não tem nada a perder e ficará relaxado, o que deve ajudá-lo a se sair melhor”. O

comentarista obviamente detectara a regressão à média e inventara uma história causal para a qual não havia evidência alguma. A história em si podia até ser verdadeira. Talvez se ele tivesse medido o batimento dos atletas antes de cada salto pudéssemos descobrir que de fato eles ficam mais relaxados após um primeiro salto ruim. E talvez não. O ponto a lembrar é que a mudança do primeiro para o segundo salto não necessita de uma explicação causal. É uma consequência matemática inevitável para o fato de que a sorte desempenhou um papel no resultado do primeiro salto. Uma história não muito satisfatória — todos preferiríamos um relato causal —, mas isso é tudo que há.

COMPREENDENDO A REGRESSÃO

Seja não detectado, seja explicado erradamente, o fenômeno da regressão é estranho para a mente humana. Tão estranho, na verdade, que foi identificado e compreendido pela primeira vez duzentos anos após a teoria da gravitação e o cálculo diferencial. Além do mais, exigiu que uma das maiores mentes da Inglaterra no século XIX elucidasse o problema, e isso com grande dificuldade.

A regressão à média foi descoberta e batizada no fim do século XIX por sir Francis Galton, primo de Charles Darwin e um renomado polímata. Podemos perceber a empolgação da descoberta em um artigo que ele publicou em 1886 sob o título de “Regression towards

Mediocrity in Hereditary Stature” (Regressão à mediocridade19 na estatura hereditária), que registra medições de tamanho em sucessivas gerações de sementes e em comparações da altura de crianças com a altura de seus pais. Ele escreve sobre os estudos com sementes:

Eles forneceram resultados que pareceram deveras notáveis e eu os utilizei como base de uma conferência perante a Royal Institution em 9 de fevereiro de 1877. Tudo indica, segundo esses experimentos, que a prole não tende a parecer com as sementes de seus pais em tamanho, mas a ser sempre mais medíocre do que eles — a ser menor do que os pais, se os pais eram grandes; a ser maior do que os pais, se os pais eram muito pequenos. […] Os experimentos revelaram ainda que a regressão filial média na direção da mediocridade era diretamente proporcional ao desvio parental dela.

Galton obviamente esperava que seu público culto na Royal Institution — a mais antiga sociedade de pesquisa independente do mundo — ficasse tão surpreso quanto ele por sua observação “notável”. O que é verdadeiramente notável é o fato de ele ter se mostrado surpreso com uma regularidade estatística que é tão comum quanto o ar que respiramos.

Efeitos de regressão podem ser encontrados para onde quer que olhemos, mas não os reconhecemos pelo que são. Eles se escondem bem debaixo de nosso nariz. Galton levou vários anos para elaborar seu trabalho desde a descoberta da regressão filial no tamanho até o conceito mais amplo de que a regressão inevitavelmente ocorre quando a correlação entre duas medidas é menos do que perfeita, e ele precisou da ajuda dos estatísticos mais

brilhantes de sua época para chegar a essa conclusão1.

Um dos obstáculos que Galton teve de superar foi o problema de medir a regressão entre variáveis que são medidas em escalas diferentes, como peso corporal e habilidade de tocar piano. Isso é feito utilizando-se a população como padrão de referência. Imagine que o peso e a habilidade ao piano foram medidos para cem crianças em todas as séries de uma escola primária, e que foram classificados entre elevado e baixo em cada medição. Se Jane ficou em terceiro como pianista e em 27º no peso, é apropriado dizer que ela é uma pianista melhor do que é grande. Vamos fazer algumas suposições que simplificarão as coisas:

Em qualquer idade,

• O sucesso no piano depende apenas das horas de prática semanais.

• Peso depende apenas do consumo de sorvete.

• Consumo de sorvete e horas semanais ao piano não estão relacionados.

Agora, usando categorizações (ou escores-Z2, como preferem os estatísticos), podemos escrever algumas equações:

peso = idade + consumo de sorvete

habilidade ao piano = idade + horas de prática semanais

Você pode perceber que haverá regressão à média quando previrmos habilidade ao piano a partir do peso, ou vice-versa. Se tudo que você sabe sobre Tom é que ele ocupa o vigésimo lugar em peso (muito acima da média), você pode inferir (estatisticamente) que ele provavelmente é mais velho do que a média e também que provavelmente consome mais sorvete que as outras crianças. Se tudo que você sabe sobre Barbara é que ela ocupa a 85ª posição em piano (muito abaixo da média do grupo), pode inferir que é provável que seja

mais nova e que é provável que pratique menos do que a maioria das outras crianças.

O coeficiente de correlação entre as duas medidas, que varia entre 0 e 1, é uma medida do peso relativo dos fatores que eles compartilham. Por exemplo, todos compartilhamos nossos genes com cada um de nossos pais, e para características nas quais os fatores ambientais exercem relativamente pouca influência, como

altura, a correlação entre pai e filho3 não está longe de 0,50. Para apreciar o significado da medida de correlação, a seguir alguns exemplos de coeficientes:

• A correlação entre o tamanho de objetos medidos com precisão em inglês ou em unidades métricas é 1. Qualquer fator que influencie uma medição também influencia a outra; 100% dos determinantes são compartilhados.

• A correlação entre altura e peso4 declarados pela própria pessoa entre norte-americanos adultos do sexo masculino é 0,41. Se se incluíssem mulheres e crianças, a correlação seria muito mais elevada, pois sexo e idade dos indivíduos influenciam tanto sua altura como seu peso, impulsionando o peso relativo de fatores compartilhados.

• A correlação entre pontuações de SAT e GPA universitário20 é de aproximadamente 0,60. Porém, a correlação entre testes de aptidão e sucesso nas pós-graduações é muito mais baixa, em grande parte porque a aptidão medida varia pouco nesse grupo seleto. Se todos apresentam aptidões similares, as diferenças nessa mensuração apresentam pouca probabilidade de desempenhar um papel importante na medida do sucesso.

• A correlação entre renda e nível educacional5 nos Estados Unidos é de aproximadamente 0,40.

• A correlação entre renda familiar e os quatro últimos dígitos de seu número de telefone é 0.

Francis Galton precisou de vários anos para perceber que

correlação e regressão6 não são dois conceitos — são perspectivas diferentes do mesmo conceito. A regra geral é inequívoca, mas apresenta consequências surpreendentes: sempre que a correlação entre duas pontuações é imperfeita, haverá regressão à média. Para ilustrar o insight de Galton, pegue uma proposição que a maioria das pessoas acha interessante:

Mulheres muito inteligentes tendem a se casar com homens que são menos inteligentes do que elas.

Você pode dar início a uma boa conversa numa festa perguntando qual a explicação para isso, e seus amigos o atenderão prontamente. Mesmo pessoas que já tiveram algum contato com estatística interpretarão espontaneamente a afirmação em termos causais. Alguns podem pensar em mulheres muito inteligentes querendo evitar a competição de homens igualmente

inteligentes, ou sendo forçadas a baixar seu padrão de escolha conjugal porque homens inteligentes não querem competir com mulheres inteligentes. Explicações mais dissolvidas virão à tona numa boa festa. Agora considere esta afirmação:

A correlação entre pontuações de inteligência de cônjuges é menos do que perfeita.

Essa afirmação é obviamente verdadeira e nem um pouco interessante. Quem esperaria que a correlação fosse perfeita? Não há nada que explicar. Mas a afirmação que você achou interessante e a afirmação que achou trivial são algebricamente equivalentes. Se a correlação entre a inteligência de cônjuges é menos do que perfeita (e se homens e mulheres em média não diferem em inteligência), então é uma inevitabilidade matemática que mulheres altamente inteligentes serão casadas com maridos que são em média menos inteligentes do que elas são (e vice-versa, é claro). A regressão à média observada não pode ser mais interessante ou mais explicável do que a correlação imperfeita.

Você provavelmente simpatiza com a luta de Galton com o conceito de regressão. De fato, o estatístico David Freedman costumava dizer que se o tema da regressão viesse à tona num julgamento civil ou criminal, o lado obrigado a explicar a regressão para o júri perderia o caso. Por que é tão difícil? O principal motivo para a dificuldade é um tema recorrente deste livro: nossa mente é fortemente propensa a explicações causais e não lida bem com “meras estatísticas”. Quando nossa atenção é exigida por algum evento, a memória associativa procura sua causa — mais precisamente, a ativação vai se propagar automaticamente para qualquer causa que já esteja armazenada na memória. Explicações causais serão evocadas quando a regressão é detectada, mas estarão erradas, pois a verdade é que a regressão à média possui uma explicação mas não possui uma causa. O evento que atrai nossa atenção no torneio de golfe é a deterioração frequente do desempenho dos golfistas que se saíram bem no dia 1.

A melhor explicação para isso é que esses golfistas foram extraordinariamente sortudos nesse dia, mas essa explicação carece da força causal que nossas mentes preferem. De fato, pagamos muito bem a algumas pessoas para fornecer explicações interessantes dos efeitos de regressão. Um consultor empresarial que anuncia corretamente que “os negócios foram melhores este ano porque foram mal no ano passado” muito provavelmente está com os dias contados.

Nossas dificuldades com o conceito de regressão origina-se tanto no Sistema 1 como no Sistema 2. Sem instrução especial, e, em pouquíssimos casos, mesmo após alguma instrução estatística, o relacionamento entre correlação e regressão permanece obscuro. O Sistema 2

acha difícil compreender e aprender. Isso se deve em parte à demanda insistente por interpretações causais, que é uma característica do Sistema 1.

Crianças deprimidas tratadas com uma bebida energética melhoram significativamente em um período de três meses.

Eu inventei essa manchete de jornal, mas o fato que ele noticia é verdadeiro: se você tratasse um grupo de crianças deprimidas por algum tempo com uma bebida energética, elas mostrariam uma melhoria clinicamente significativa. E também acontece de crianças deprimidas que passam algum tempo plantando bananeira ou acariciando um gato por vinte minutos diários também apresentarem melhora. A maioria dos leitores dessas manchetes vai inferir automaticamente que a bebida energética ou as carícias no gato causam melhoria, mas essa conclusão é completamente injustificada. Crianças deprimidas são um grupo extremo, elas são mais deprimidas do que a maioria das outras crianças — e grupos extremos regressam à média com o tempo. A correlação entre pontuações de depressão em ocasiões sucessivas de testes é menos do que perfeita, de modo que haverá regressão à média: crianças deprimidas melhorarão com o tempo mesmo que não segurem gato algum nem bebam Red Bull. A fim de concluir que uma bebida energética — ou qualquer outro tratamento — é eficaz, você deve comparar um grupo de pacientes que recebe esse tratamento com um “grupo de controle” que não recebe tratamento (ou, melhor ainda, que recebe um placebo). Espera-se que o grupo de controle melhore apenas por regressão, e o objetivo do experimento é determinar se os pacientes tratados melhoram mais do que a regressão pode explicar.

Interpretações causais incorretas dos efeitos de regressão não estão restritos aos leitores dos jornais populares. O estatístico Howard Wainer coligiu uma longa lista de pesquisadores eminentes que cometeram o mesmo engano — confundindo mera correlação

com causação7.

Efeitos de regressão são uma fonte comum de dificuldade em pesquisa, e cientistas experientes desenvolvem um medo saudável da armadilha da inferência causal injustificada.

Um de meus exemplos favoritos dos erros de previsão intuitiva é adaptado do excelente texto de Max Bazerman, Judgment in Managerial Decision Making [O julgamento na tomada de decisão empresarial]:

Você é o responsável pelas previsões de vendas de uma cadeia de loja de departamentos. Todas as lojas são semelhantes em tamanho e seleção das mercadorias, mas suas vendas diferem devido à localização, à competição e a fatores aleatórios. Você recebe os resultados para 2011 e pedem-lhe um prognóstico das vendas para 2012. Você foi instruído a admitir a previsão global dos economistas de que as vendas vão aumentar globalmente em 10%. Como você completaria a seguinte tabela?

Loja

2011

2012

1

$11.000.000

______

2

$23.000.000

______

3

$18.000.000

______

4

$29.000.000

______

Total $81.000.000 $89.100.000

Tabe la 2

Tendo lido este capítulo, você sabe que a solução óbvia de acrescentar 10% às vendas de cada loja está errada. Você quer que suas previsões sejam regressivas, o que exige adicionar mais do que 10% às filiais de desempenho fraco e acrescentar menos (ou mesmo subtrair) em outras. Mas se você perguntar para outras pessoas, provavelmente vai se deparar com a perplexidade: Por que os está importunando com uma pergunta óbvia? Como Galton dolorosamente descobriu, o conceito de regressão está longe de óbvio.

FALANDO DE REGRESSÃO À MEDIOCRIDADE

“Ela diz que a experiência lhe ensinou que a crítica é mais eficaz do que o elogio. O que ela não compreende é que tudo se deve à regressão à média.”

“Talvez sua segunda entrevista tenha impressionado menos do que a primeira porque ele estava com medo de nos decepcionar, mas mais provavelmente a primeira é que foi extraordinariamente boa.”

“Nosso procedimento de triagem é bom, mas não é perfeito, então devemos esperar por regressão. Não deve nos causar surpresa que os melhores candidatos muitas vezes deixem de atender nossas expectativas.”

19 Atenção para o sentido de “mediocridade”, não de “abaixo de mediano”, no uso comum. (N. do T.)

20 SAT ( Scholastic Aptitude Test): teste padronizado para admissão nas faculdades americanas; GPA ( Grade Point Average): índice do ensino superior que fornece a pontuação média do aluno, obtido com a divisão das notas num determinado período pelo total de créditos cursados. (N. do T.)