Rápido e devagar: Duas formas de pensar

Daniel Kahneman · Capítulo 22 de 42

Páginas do PDF

Rápido e devagar: Duas formas de pensar

21 - Intuições Versus Fórmulas

FALANDO DE HABILIDADE ILUSÓRIA

“Ele sabe que o histórico indica que o desenvolvimento dessa enfermidade é em grande parte imprevisível. Como pode ficar tão confiante neste caso? Parece uma ilusão de validade.”

“Ela tem uma história coerente que explica tudo que sabe, e a coerência faz com que se sinta bem.”

“O que leva ele a crer que é mais esperto que o mercado? Será uma ilusão de habilidade?”

“Ela é um porco-espinho. Tem uma teoria que explica tudo, e isso lhe dá a ilusão de compreender o mundo.”

“A questão não é se esses especialistas são bem treinados. É se o mundo deles é previsível.”

22 A máxima de origem grega diz algo como: “A raposa sabe muitas coisas; o porco-espinho, apenas uma, mas muito importante.” (N. do T.)

21

INTUIÇÕES VERSUS FÓRMULAS

Paul Meehl foi um personagem estranho e maravilhoso, e um dos psicólogos mais versáteis do século XX. Entre os departamentos em que lecionou na Universidade de Minnesota estavam os de psicologia, direito, psiquiatria, neurologia e filosofia. Ele também escreveu sobre religião, ciência política e aprendizado em ratos. Um pesquisador estatisticamente sofisticado e crítico feroz de alegações fúteis em psicologia clínica, Meehl era também um psicanalista praticante.

Escreveu ensaios cuidadosos sobre os fundamentos filosóficos da pesquisa psicológica que cheguei quase a decorar quando era aluno de graduação. Nunca o conheci, mas ele se tornou um dos meus heróis a partir do momento em que li seu Clinical vs. Statistical Prediction: A Theoretical Analysis and a Review of the Evidence (Prognóstico clínico versus estatística: uma análise teórica e uma revisão da evidência).

No fino volume que ele mais tarde chamou de “meu livrinho perturbador”, Meehl revisou os resultados de vinte estudos que haviam analisado se previsões clínicas baseadas nas impressões subjetivas de profissionais treinados eram mais precisas do que previsões estatísticas feitas com a combinação de algumas pontuações ou classificações segundo uma regra. Em um estudo típico, orientadores treinados fizeram previsões sobre as notas dos calouros ao final do ano letivo. Esses psicólogos entrevistaram cada aluno por 45 minutos.

Também tiveram acesso às notas do ensino médio, diversos testes de aptidão e uma declaração pessoal de quatro páginas. O algoritmo estatístico utilizava apenas uma fração dessa informação: notas do ensino médio e um teste de aptidão. Mesmo assim, a fórmula foi mais precisa do que 11 dentre os 14 orientadores. Meehl registrou conclusões de um modo geral semelhantes em uma variedade de outros resultados de prognósticos, incluindo violações de condicional, sucesso em treinamento de pilotos e reincidência criminal.

Não é de surpreender que o livro de Meehl tenha provocado choque e descrença entre psicólogos clínicos, e a controvérsia que ele iniciou gerou uma torrente de pesquisa que continua fluindo até hoje, mais de cinquenta anos após sua publicação. O número de estudos informando comparações de previsões clínicas e estatísticas aumentou para aproximadamente duzentos, mas o placar na disputa entre algoritmos e humanos não mudou. Cerca de 60% dos estudos mostraram precisão significativamente maior em relação aos algoritmos. As outras comparações registraram um empate na precisão, mas um empate é o equivalente a uma vitória para as regras estatísticas, que são normalmente muito menos caras que o julgamento de um especialista. Nenhuma exceção foi documentada de forma convincente.

O alcance de resultados previstos expandiu-se para cobrir variáveis médicas como a longevidade de pacientes com câncer, a duração de estadia em hospitais, o diagnóstico de doença cardíaca e a suscetibilidade de bebês à síndrome de morte súbita infantil; medidas econômicas como as perspectivas de sucesso para novos negócios, a avaliação de riscos de crédito pelos bancos e a futura satisfação profissional entre trabalhadores; questões de

interesse para agências do governo, incluindo avaliações da adequabilidade de pais adotivos, chances de reincidência entre delinquentes juvenis e a probabilidade de outras formas de comportamento violento; e resultados variados como a avaliação de apresentações científicas, vencedores de partidas de futebol americano e preços futuros do vinho de Bordeaux. Cada um desses domínios envolve um significativo grau de incerteza e imprevisibilidade. Nós os descrevemos como “ambientes de baixa validade”. Em todos os casos, a precisão dos especialistas foi equiparada ou superada por um simples algoritmo.

Como Meehl observou com justificado orgulho trinta anos após a publicação de seu livro:

“Não existe outra controvérsia1 na ciência social que exibe um corpus tão grande de estudos qualitativamente diversos sendo apresentados de modo tão uniforme e na mesma direção quanto esta.”

O economista de Princeton e enólogo Orley Ashenfelter forneceu uma demonstração convincente do poder das simples estatísticas em superar especialistas de renome mundial.

Ashenfelter queria prever o valor futuro de bons vinhos de Bordeaux com base na informação disponível no ano em que foram feitos. A questão é importante porque vinhos finos levam anos para atingir seu pico de qualidade, e os preços de vinhos maduros de uma mesma vinícola variam dramaticamente pelas mesmas vindimas; vinhos engarrafados com intervalos de apenas 12 meses podem

diferir em valor por um fator de dez ou mais20. Uma capacidade de predizer os preços futuros é algo de valor substancial, pois investidores compram vinho, como arte, antecipando que seus preços subirão.

É consenso mais ou menos geral que o efeito da vindima talvez se deva apenas a variações do clima durante a temporada de cultivo das vinhas. Os melhores vinhos são produzidos quando o verão está quente e seco, o que torna a indústria do vinho em Bordeaux uma beneficiária provável do aquecimento global. A indústria é auxiliada também por primaveras úmidas, que aumentam a quantidade sem afetar muito a qualidade. Ashenfelter converteu esse conhecimento convencional em uma fórmula estatística que prevê o preço de um vinho — para uma propriedade qualquer e uma idade qualquer — segundo três características do clima: a temperatura média durante a temporada de crescimento do verão, o índice pluviométrico na época da colheita e o total de chuvas durante o inverno precedente. Sua fórmula fornece prognósticos de preço precisos, para anos e até décadas no futuro. De fato, sua fórmula prevê os preços futuros de forma muito mais precisa do que os atuais preços dos vinhos jovens. Esse novo exemplo de um “padrão Meehl” desafia as capacidades dos especialistas cujas opiniões ajudam a moldar o preço inicial. Isso também é um desafio para a teoria econômica, segundo a qual os preços devem refletir toda a informação disponível, incluindo o clima. A fórmula de Ashenfelter é extremamente precisa — a correlação entre suas previsões e os preços reais é de mais de 0,90.

Por que especialistas são inferiores aos algoritmos? Um dos motivos, assim suspeitou Meehl, é que os especialistas tentam ser inteligentes, pensar fora da caixa e consideram combinações complexas de características ao fazer suas previsões. A complexidade pode funcionar em um ou outro caso, mas na maioria das vezes reduz a validade. Combinações simples de características são melhores. Diversos estudos têm mostrado que os tomadores de decisão humanos são inferiores a uma fórmula de previsão mesmo quando informados sobre a pontuação sugerida pela fórmula! Eles acham que são capazes de levar a melhor sobre a fórmula porque contam com informação adicional sobre o caso, mas na maior parte das vezes estão errados. Segundo Meehl, há poucas circunstâncias sob as quais é boa ideia substituir uma fórmula pelo julgamento. Em um famoso experimento mental, ele descrevia uma fórmula que prediz se uma pessoa em particular vai ao cinema nessa noite e notava que está correto desconsiderar a fórmula se surgisse a informação de que o indivíduo quebrou a perna nesse dia. O nome “regra da perna quebrada” pegou. A ideia central, é claro, é a de que pernas quebradas são muito raras — bem como determinantes.

Outro motivo para a inferioridade do julgamento dos especialistas é que humanos são incorrigivelmente inconsistentes em fazer julgamentos sumários de informação complexa.

Quando alguém lhes pede para avaliar a mesma informação duas vezes, eles frequentemente dão respostas diferentes. A extensão da inconsistência é muitas vezes um motivo de real preocupação.

Radiologistas experimentados3 que avaliam raios X do peito como “normal” ou

“anormal” se contradizem em 20% das vezes quando veem a mesma imagem em ocasiões separadas. Um estudo de 101 auditores independentes a quem se pediu para avaliar a

confiabilidade de auditorias corporativas internas4 revelaram grau similar de inconsistência.

Uma revisão de 41 estudos separados de confiabilidade de

julgamentos5 feitos por auditores, patologistas, psicólogos, gerentes de organizações e outros profissionais sugere que esse nível de inconsistência é típico, mesmo quando um caso é reavaliado no período de poucos minutos.

Julgamentos pouco confiáveis não podem ser prognosticadores válidos de coisa alguma.

A inconsistência disseminada deve-se provavelmente à extrema dependência de contexto do Sistema 1. Sabemos a partir de estudos de priming que estímulos despercebidos em nosso ambiente têm substancial influência em nossos pensamentos e ações. Essas influências flutuam de um momento a outro. O breve prazer de uma brisa fresca em um dia quente deixa você ligeiramente mais positivo e otimista sobre seja lá o que estiver avaliando no momento. As perspectivas de um condenado receber condicional podem mudar significativamente durante o tempo

transcorrido entre os sucessivos intervalos para refeições6 na agenda de um juiz. Como você possui pouco conhecimento direto do que acontece em sua mente, nunca vai saber que poderia ter feito um julgamento diferente ou chegado a uma decisão diferente sob circunstâncias muito ligeiramente diferentes. Fórmulas não sofrem com tais problemas. Dado um mesmo input, elas sempre fornecem a mesma resposta. Quando a previsibilidade é fraca

— o que é o caso na maioria dos estudos revistos por Meehl e seus seguidores —, a inconsistência é destrutiva para qualquer validade prognosticadora.

A pesquisa sugere uma conclusão surpreendente: para maximizar a precisão de prognóstico, decisões finais devem ser deixadas para fórmulas, especialmente em ambientes de baixa validade. Em decisões de admissão para faculdades de medicina, por exemplo, a

determinação final é em geral feita pelos membros da instituição que entrevistam o candidato.

A evidência é fragmentária, mas há bases sólidas para uma conjectura: conduzir uma entrevista provavelmente diminuirá a precisão de um procedimento de seleção caso os entrevistadores também tomem as decisões de admissão finais. Como os entrevistadores são superconfiantes em suas intuições, darão peso de mais a suas impressões pessoais e peso de menos a outras

fontes de informação, diminuindo a validade7. De modo semelhante, os especialistas que avaliam a qualidade de um vinho imaturo para predizer seu futuro têm uma fonte de informação que quase certamente torna as coisas piores, não melhores: eles podem provar o vinho. Além do mais, é claro, mesmo que tenham uma boa compreensão dos efeitos do clima na qualidade do vinho, eles não serão capazes de manter a consistência de uma fórmula.

O mais importante acontecimento na área desde o trabalho original

de Meehl é o famoso artigo de Robyn Dawes8, “The Robust Beauty of Improper Linear Models in Decision Making” (A robusta beleza dos modelos lineares impróprios em tomada de decisões). A prática estatística dominante nas ciências sociais é designar pesos para diferentes prognosticadores seguindo um algoritmo, chamado de regressão múltipla, que hoje está compilado em um software convencional. A lógica da regressão múltipla é incontestável: ela encontra a melhor fórmula montando uma combinação ponderada dos prognosticadores. Porém, Dawes observou que o algoritmo estatístico complexo agrega pouco ou nenhum valor. A pessoa pode se sair igualmente bem selecionando uma série de contagens que tenham alguma validade na predição do resultado e ajustando os valores para torná-los comparáveis (usando escores-Z ou categorizações). Uma fórmula que combine esses prognosticadores com pesos iguais será provavelmente tão precisa em prever novos casos quanto a fórmula de regressão múltipla que foi ideal na amostra original. Uma pesquisa mais recente foi além: fórmulas que atribuem pesos iguais a todos os prognosticadores são muitas vezes superiores, pois não são afetadas por acidentes de

amostragem. 9

O surpreendente sucesso de estratégias de ponderação equivalente tem uma importante implicação prática: é possível desenvolver algoritmos úteis sem qualquer pesquisa estatística prévia. Fórmulas simples de ponderação equivalente baseadas em estatísticas existentes ou no bom-senso são com frequência muito boas prognosticadoras de resultados significativos. Em um exemplo memorável, Dawes mostrou que a estabilidade conjugal é bem prevista por uma fórmula:

frequência de atividade sexual menos frequência de brigas

Você não vai querer que seu resultado seja um número negativo.

A conclusão importante dessa pesquisa é que um algoritmo que está construído no verso de

um envelope é com frequência bom o bastante para competir com uma fórmula idealmente ponderada, e decerto bom o bastante para superar o julgamento do especialista. Essa lógica pode ser aplicada a muitos domínios, indo da seleção de estoques de ações por gerentes de portfólio às escolhas de tratamento médico feitas por médicos ou pacientes.

Uma aplicação clássica dessa abordagem é um algoritmo simples que salvou as vidas de centenas de milhares de crianças. Os obstetras sempre souberam que uma criança que não está respirando normalmente alguns minutos após o parto corre sério risco de dano cerebral ou morte. Até a anestesiologista Virginia Apgar intervir em 1953, médicos e parteiras valiam-se de sua avaliação clínica para determinar se um bebê estava sofrendo. Profissionais diferentes concentravam-se em indícios diferentes. Alguns observavam problemas de respiração, enquanto outros monitoravam quanto tempo o bebê levava para chorar. Sem um procedimento padronizado, sinais perigosos muitas vezes passavam despercebidos, e muitos recém-nascidos morriam.

Certo dia, durante o café da manhã, um residente perguntou à dra.

Apgar10 como ela faria uma avaliação sistemática de um recém-nascido. “Isso é fácil”, respondeu ela. “Da seguinte maneira.” Apgar rabiscou rapidamente cinco variáveis (batimento cardíaco, respiração, reflexo, tônus muscular e cor) e três notas (0, 1 ou 2, dependendo da robustez de cada sinal).

Percebendo ter feito talvez uma descoberta que qualquer maternidade poderia implementar, Apgar começou a classificar os bebês de acordo com essa regra um minuto depois de nascerem. Um bebê com uma pontuação total de 8 ou acima disso provavelmente apresentaria as seguintes características: rosado, contorcendo-se, chorando, fazendo caretas, com um batimento de 100 ou mais — em boa forma. Um bebê com uma pontuação de 4 ou abaixo era provavelmente arroxeado, flácido, passivo, com batimento lento ou fraco — necessitando de intervenção imediata. Aplicando a escala de Apgar, a equipe das maternidades finalmente passou a contar com padrões consistentes para determinar quais bebês estavam com problemas, e a fórmula recebeu o devido crédito como uma importante contribuição para reduzir a mortalidade infantil. O teste de Apgar ainda é usado diariamente em todas as maternidades. O recente Checklist de Atul Gawande fornece inúmeros outros exemplos das virtudes da checagem de

itens e regras simples11.

A HOSTILIDADE AOS ALGORITMOS

Desde o início, psicólogos clínicos reagiram às ideias de Meehl com hostilidade e descrença.

Claramente, estavam possuídos de uma ilusão de habilidade quanto à sua própria capacidade de fazer prognósticos de longo prazo. Pensando bem, é fácil perceber como a ilusão se formou e é fácil se solidarizar com a rejeição dos clínicos à pesquisa de Meehl.

A evidência estatística de inferioridade clínica contradiz a experiência diária dos clínicos quanto à qualidade de suas avaliações. Psicólogos que trabalham com pacientes têm muitos

pressentimentos durante cada sessão de terapia, antecipando como o paciente vai reagir a uma intervenção, conjecturando sobre o que ocorrerá a seguir. Muitos desses pressentimentos são confirmados, ilustrando a realidade da habilidade clínica.

O problema é que os julgamentos corretos envolvem previsões de curto prazo no contexto da entrevista terapêutica, habilidade em que os profissionais têm muitos anos de prática. As tarefas em que eles tipicamente falham exigem previsões de longo prazo sobre o futuro do paciente. Essas são bem mais difíceis, mesmo as melhores fórmulas saem-se apenas modestamente bem, e são ainda tarefas que os clínicos nunca tiveram oportunidade de aprender adequadamente — eles teriam de esperar anos pelo feedback, em vez de receber o feedback instantâneo da sessão clínica. Porém, a linha entre o que os clínicos podem fazer bem e o que não podem fazer bem de modo algum não é óbvia, e certamente não é óbvia para eles. Eles sabem que são habilidosos, mas não necessariamente sabem os limites de suas habilidades. Não surpreende, assim, que a ideia de uma combinação mecânica de algumas variáveis sobrepujar a sutil complexidade do julgamento humano pareça a clínicos experientes obviamente errada.

O debate sobre as virtudes dos prognósticos clínica e estatística sempre tiveram uma dimensão moral. O método estatístico, escreveu Meehl, foi criticado por clínicos tarimbados como “mecânico, atomístico, cumulativo, ordinário, artificial, absurdo, arbitrário, incompleto, obtuso, pedante, fragmentário, trivial, forçado, estático, superficial, rígido, estéril, acadêmico, pseudocientífico e cego”. O método clínico, por outro lado, já foi enaltecido por seus propositores como “dinâmico, global, significativo, holístico, sutil, solidário, padronizado, organizado, rico, profundo, genuíno, sensível, sofisticado, real, vivo, concreto, natural, realista e compreensivo”.

Essa é uma atitude que podemos todos reconhecer. Quando um humano compete com uma máquina, seja o lendário gigante John Henry abrindo túneis ferroviários na montanha com seu martelo, seja o gênio enxadrista Garry Kasparov enfrentando o computador Deep Blue, nossas simpatias são dirigidas ao nosso semelhante humano. A aversão a algoritmos tomando decisões que afetam humanos está enraizada na forte preferência que muitas pessoas têm pelo natural sobre o sintético ou artificial. Pergunte a qualquer pessoa se ela preferiria comer uma maçã cultivada de modo orgânico ou industrial, e a maioria vai responder que prefere a fruta

“100% natural”. Mesmo depois de serem informadas que as duas maçãs têm o mesmo gosto, idêntico valor nutricional e são igualmente saudáveis, ainda assim a maioria vai preferir a fruta

orgânica12. Até os produtores de cerveja já descobriram que podem aumentar as vendas escrevendo “100% natural” ou “sem conservantes” no rótulo.

A profunda resistência à desmistificação da expertise é ilustrada pela reação da comunidade enóloga europeia à fórmula de Ashenfelter para predizer o preço dos vinhos de Bordeaux. A fórmula de Ashenfelter atendia uma prece: seria de se esperar que os amantes de vinho do mundo todo ficariam agradecidos a ele por melhorar de modo demonstrável sua capacidade de identificar os vinhos que mais tarde seriam bons. Nada disso. A reação nos

círculos de enólogos franceses, escreveu o New York Times, variou “em algum ponto entre violenta e histérica”. Ashenfelter relata que um deles chamou sua descoberta de “ridícula e absurda”. Outro zombou: “É como julgar filmes sem vê-los de verdade.”

O preconceito contra algoritmos é intensificado quando as decisões são significativas.

Meehl observou: “Não sei muito bem como aliviar o horror que alguns médicos parecem sentir quando imaginam um caso tratável tendo seu tratamento negado porque uma equação

‘cega, mecânica’ o classificou erroneamente.” Por outro lado, Meehl e outros proponentes de algoritmos têm defendido fortemente que é antiético apoiar-se em julgamentos intuitivos para decisões importantes se um algoritmo que cometerá poucos erros está disponível. O argumento racional deles é convincente, mas depõe contra uma realidade psicológica persistente: para a maioria das pessoas, a causa do erro faz diferença. A história de uma criança morrendo porque um algoritmo cometeu um erro é mais pungente do que a história da mesma tragédia ocorrendo como resultado de erro humano, e a diferença na intensidade emocional é prontamente traduzida em uma preferência moral.

Felizmente, a hostilidade a algoritmos provavelmente irá abrandar à medida que seu papel na vida cotidiana continuar a se expandir. Procurando livros ou música de que podemos gostar, apreciamos as recomendações geradas por um software. Não nos surpreendemos nem um pouco que decisões sobre limites de crédito sejam tomadas sem qualquer intervenção direta de algum julgamento humano. Estamos cada vez mais expostos a diretrizes que possuem a forma de simples algoritmos, como a proporção entre os níveis de colesterol bom e ruim que devemos atingir a qualquer custo. Atualmente o público está bastante ciente de que fórmulas podem se sair melhor do que humanos em algumas decisões críticas no mundo dos esportes: quanto dinheiro uma equipe profissional deve gastar com determinados jogadores novatos ou quando tentar o chute no quarto down. A lista cada vez maior de tarefas atribuídas a algoritmos deve acabar por reduzir o desconforto que a maioria das pessoas sente quando encontra pela primeira vez o padrão de resultados que Meehl descreveu em seu perturbador livrinho.

APRENDENDO COM MEEHL

Em 1955, então um jovem tenente de 21 anos nas Forças de Defesa de Israel, fui incumbido de criar um sistema de entrevista para todo o Exército. Se você está imaginando por que tal responsabilidade deveria ser imposta sobre alguém tão jovem, tenha em mente que o próprio Estado de Israel tinha apenas 7 anos de idade na época; todas as suas instituições estavam em construção, e alguém precisava construí-las. Por mais esquisito que pareça hoje, minha graduação em psicologia provavelmente me qualificava como o psicólogo mais bem treinado do Exército. Meu supervisor direto, um pesquisador brilhante, era formado em química.

Uma entrevista de rotina já era utilizada quando recebi minha missão. Todo soldado convocado para o Exército completava uma bateria de testes psicométricos, e cada homem considerado para servir em combate era entrevistado para uma avaliação de personalidade. O

objetivo era atribuir ao recruta uma pontuação de aptidão geral para o combate e encontrar a melhor combinação para sua personalidade entre as várias divisões: infantaria, artilharia, tanques e assim por diante. Os próprios entrevistadores por sua vez eram jovens recrutados, selecionados para a incumbência em virtude de sua elevada inteligência e interesse em lidar com pessoas. A maioria era de mulheres, que na época estavam dispensadas de servir em combate. Treinadas durante algumas semanas em como conduzir uma entrevista de 15 a vinte minutos, elas eram encorajadas a cobrir uma gama de tópicos e a formar uma impressão geral de como o recruta ia se sair no exército.

Infelizmente, avaliações de acompanhamento já haviam indicado que esse procedimento de entrevista era quase inútil em predizer o sucesso futuro de recrutas. Fui instruído a desenvolver uma entrevista que fosse mais útil, mas que não tomasse mais tempo. Também fui orientado a experimentar a nova entrevista e avaliar sua precisão. Da perspectiva de um profissional sério, eu era tão qualificado para a tarefa quanto seria para construir uma ponte sobre o rio Amazonas.

Felizmente, eu já havia lido o “livrinho” de Paul Meehl, que fora publicado apenas um ano antes. Fiquei convencido pelo seu argumento que regras simples estatísticas são superiores a julgamentos “clínicos” intuitivos. Concluí que a entrevista até então utilizada falhara ao menos em parte porque permitia aos entrevistadores fazer o que achavam mais interessante, ou seja, aprender sobre a dinâmica da vida mental do entrevistado. Em vez disso, deveríamos utilizar o tempo limitado de que dispúnhamos para obter o máximo de informação específica possível sobre a vida do entrevistado em seu ambiente normal. Outra lição que aprendi com Meehl era de que deveríamos abandonar o procedimento em que as avaliações globais do recruta feitas pelos entrevistadores determinavam a decisão final. O livro de Meehl sugeria que tais avaliações não eram confiáveis e que resumos estatísticos de atributos avaliados separadamente atingiriam validade maior.

Decidi por um procedimento em que os entrevistadores avaliariam diversos traços de personalidade relevantes e dariam notas separadamente para cada um. A contagem final de adequação para servir em combate seria calculada segundo uma fórmula padronizada, sem nenhum input adicional dos entrevistadores. Elaborei uma lista de seis características que pareciam relevantes para o desempenho numa unidade de combate, incluindo

“responsabilidade”, “sociabilidade” e “orgulho masculino”. Depois escrevi, para cada característica, uma série de questões factuais sobre a vida do indivíduo antes de seu alistamento, incluindo o número de diferentes trabalhos que ele tivera, quão assíduo e pontual fora em seu trabalho ou estudos, a frequência de suas interações com amigos e seu interesse e participação em esportes, entre outras coisas. A ideia era avaliar tão objetivamente quanto possível até que ponto o recruta se saíra bem em cada dimensão.

Concentrando-me em questões padronizadas, factuais, eu esperava combater o efeito halo, em que primeiras impressões favoráveis influenciam julgamentos posteriores. Como precaução extra contra halos, instruí os entrevistadores a percorrer as seis características

numa sequência fixa, classificando cada traço numa escala de cinco pontos antes de passar à seguinte. E foi isso. Informei os entrevistadores que não precisavam se preocupar com o futuro ajuste dos recrutas à vida militar. Sua única tarefa era extrair fatos relevantes sobre o passado deles e usar essa informação para pontuar a dimensão de cada personalidade. “Sua função é fornecer medidas confiáveis”, disse a eles. “Deixem a validade preditiva para mim”, com o que eu queria dizer a fórmula que eu ia projetar para combinar suas classificações específicas.

Os entrevistadores chegaram perto de um motim. Aquelas pessoas jovens e brilhantes não gostaram nem um pouco de receber ordens, de alguém muito pouco mais velho do que eles próprios, para mudar sua intuição e foco inteiramente para entediantes perguntas factuais. Um deles se queixou: “Você está nos transformando em robôs!” Então fiz uma concessão. “Façam a entrevista exatamente como instruí”, disse-lhes, “e quando terminarem, façam como quiserem: fechem os olhos, tentem imaginar o recruta como um soldado, e atribuam a ele uma pontuação numa escala de 1 a 5”.

Centenas de entrevistas foram conduzidas por esse novo método e alguns meses depois recebemos as avaliações do desempenho dos soldados das mãos dos oficiais comandantes das unidades para as quais eles haviam sido destacados. Os resultados nos deixaram satisfeitos.

Como sugeria o livro de Meehl, o novo procedimento de entrevista teve uma melhora substancial sobre o antigo. A soma de nossas seis classificações previa o desempenho dos soldados muito mais precisamente do que as avaliações globais do método de entrevista precedente, embora fosse longe de perfeito. Havíamos progredido do “completamente inútil”

ao “moderadamente útil”.

A grande surpresa para mim foi que o julgamento intuitivo elaborado pelos entrevistadores no exercício de “fechar os olhos” também se saiu muito bem, na verdade, tão bem quanto a soma das seis classificações específicas. Aprendi com a descoberta uma lição que nunca esqueci: intuição agrega valor até à justamente ridicularizada entrevista de seleção, mas somente após uma coleta disciplinada de informação objetiva e uma pontuação disciplinada de características isoladas. Estabeleci uma fórmula que dava à avaliação “feche os olhos” o mesmo peso da soma das classificações de seis características. Uma lição mais geral que aprendi com esse episódio foi de não confiar simplesmente no julgamento intuitivo — seja o seu, seja o de outros —, mas também de não desprezá-lo.

Cerca de 45 anos depois, após ganhar o Prêmio Nobel em economia, tornei-me por um breve período uma celebridade em Israel. Em uma de minhas visitas, alguém teve a ideia de me levar para dar uma volta por minha velha base do exército, que ainda abrigava a unidade que entrevista novos recrutas. Fui apresentado à oficial comandante da Unidade de Psicologia, e ela descreveu para mim sua prática corrente de entrevistas, que não mudara muito do sistema que eu havia elaborado; havia, como vimos, uma considerável quantidade de pesquisa indicando que as entrevistas ainda funcionavam bem. Quando terminou de descrever como as entrevistas eram conduzidas, a oficial acrescentou: “Depois a gente diz para eles: ‘Fechem os olhos.’”

FAÇA VOCÊ MESMO

A mensagem deste capítulo é prontamente aplicável a outras tarefas que não tomar decisões sobre a capacidade humana para um exército. Implementar procedimentos de entrevista no espírito de Meehl e Dawes exige relativamente pouco esforço, mas substancial disciplina.

Suponha que você necessite contratar um representante de vendas para sua empresa. Se você leva a sério a tarefa de contratar a melhor pessoa possível para o cargo, eis o que deve fazer.

Primeiro, selecione algumas características que sejam pré-requisitos para o sucesso nessa posição (proficiência técnica, personalidade cativante, confiabilidade e assim por diante).

Não exagere — seis dimensões é um bom número. As características que você escolheu devem ser o mais independentes possíveis umas das outras, e você deve sentir que é capaz de aferi-las de modo confiável fazendo algumas questões factuais. Em seguida, faça uma lista dessas questões para cada característica e pense em como vai atribuir pontuações, digamos, numa escala de 1-5. Você deve fazer uma ideia do que vai chamar de “muito fraco” ou “muito forte”.

Esses preparativos não devem lhe tomar mais do que meia hora ou algo assim, um pequeno investimento que pode fazer uma diferença significativa na qualidade das pessoas que você contrata. Para evitar efeitos halo, você deve coligir a informação sobre uma característica de cada vez, pontuando cada uma antes de passar à seguinte. Não pule nenhuma. Para avaliar cada candidato, some as seis contagens. Como você é o encarregado da decisão final, você não deve “fechar os olhos”. Tome a firme decisão de que irá contratar o candidato cuja pontuação final seja a mais alta, mesmo que haja outro de quem gostou mais — tente resistir ao seu desejo de inventar pernas quebradas para mudar a classificação. Uma vasta quantidade de pesquisa oferece uma promessa: há uma probabilidade muito maior de você encontrar o melhor candidato usando esse procedimento do que fazendo o que normalmente as pessoas fazem nessas situações, ou seja, ir para a entrevista despreparado e fazer a escolha com base num julgamento intuitivo global, como “Olhei em seus olhos e gostei do que vi”.