Système 1, système 2 : les deux vitesses de la pensée

21 - Les intuitions contre les formules

21

 

Les intuitions contre les formules

 

Paul Meehl est un personnage étrange et merveilleux, et un des

psychologues les plus polyvalents du XXe siècle. À l'université du

Minnesota, il enseignait dans plusieurs départements – en

psychologie, en droit, en psychiatrie, en neurologie et en

philosophie. Il a aussi écrit sur la religion, les sciences politiques et

l'apprentissage chez les rats. Passionné de statistiques, il a

vigoureusement dénoncé certaines théories infondées de

psychologie clinique. Il était également psychanalyste. Il a rédigé

des essais profonds sur les fondements philosophiques de la

recherche en psychologie, que j'ai presque appris par cœur quand

j'étais étudiant. Je ne l'ai jamais rencontré, mais il était un de mes

héros depuis que j'avais lu son essai Prédiction clinique et

prédiction statistique : analyse théorique et étude des preuves.

Dans cet opuscule qu'il décrivit plus tard comme « [s]on petit

livre qui dérange », il compilait vingt études ayant analysé si les

prédictions cliniques basées sur les impressions subjectives de

professionnels entraînés étaient plus exactes que des prédictions

statistiques obtenues en appliquant une formule précise. Dans une

étude classique, des consultants spécialisés devaient prédire les

notes d'étudiants de première année. Ils avaient interviewé chacun

d'entre eux pendant quarante-cinq minutes. Ils avaient en outre accès

à leurs notes de lycée, à plusieurs tests d'aptitude, et à une déclaration personnelle de quatre pages. L'algorithme statistique

n'utilisait qu'une partie de ces informations : les notes de lycée et un

test d'aptitude. Ce qui n'empêcha pas la formule d'être plus exacte

que onze des quatorze consultants. Selon Meehl, des résultats

similaires avaient été obtenus dans d'autres domaines de prévisions,

comme le risque de violation de la liberté conditionnelle, la réussite

à l'entraînement de pilotes et le récidivisme chez les délinquants.

Le livre de Meehl n'a pas manqué de provoquer la stupeur et

l'incrédulité parmi les psychologues cliniciens, et la controverse qu'il

déclencha est à l'origine d'une vague de recherches qui se

poursuivent encore aujourd'hui, plus de cinquante ans après sa

publication. Le nombre d'études comparant des prédictions cliniques

et statistiques a aujourd'hui dépassé la barre des deux cents, mais le

résultat du match opposant les algorithmes aux prédictions humaines

reste inchangé. Environ 60 % des études ont montré que les

algorithmes étaient beaucoup plus précis. Les autres donnent un

résultat nul, ce qui revient à une victoire des règles statistiques, qui

coûtent d'ordinaire beaucoup moins cher que le recours au jugement

des experts. Aucune exception n'a pu être étayée de façon

satisfaisante.

Au fil des études, l'éventail des résultats prédits s'est élargi pour

couvrir des variables médicales (la longévité des patients atteints de

cancer, la longueur des séjours à l'hôpital, le diagnostic de maladies

cardiaques, la susceptibilité que des bébés succombent au syndrome

de mort subite du nourrisson), des mesures économiques (les

perspectives de réussite de nouvelles entreprises, l'évaluation du

risque de crédit pour les banques et la future satisfaction

professionnelle des salariés), des questions institutionnelles ou

politiques (l'évaluation des aptitudes de parents d'adoption, les

risques de récidive chez les délinquants juvéniles, la probabilité

d'autres formes de comportement violent) ; ou encore l'évaluation de

présentations scientifiques, l'issue de matchs de football et le prix

futur des vins de Bordeaux. Chacun de ces domaines comporte un

degré significatif d'incertitude et d'imprévisibilité. Nous les

décrivons comme des « environnements à faible validité ». Dans chaque cas, un simple algorithme a fait aussi bien ou mieux que les

experts.

Comme l'a souligné Meehl avec une fierté justifiée trente ans

après la publication de son livre, « aucune autre controverse dans les

sciences sociales n'a abouti à une telle quantité d'études variées

allant toutes uniformément dans le même sens194 ».

L'économiste de Princeton Orley Ashenfelter, également

œnologue, a proposé à son tour une démonstration convaincante de

la capacité de simples statistiques à surclasser des experts de

renommée mondiale. Ashenfelter voulait prédire la valeur future de

grands vins de Bordeaux à partir d'informations glanées dans l'année

où le raisin avait été récolté. La question est importante, parce qu'il

faut des années pour qu'un grand vin atteigne le pic de sa qualité, et

les prix des vins arrivés à maturité dans un même vignoble divergent

considérablement d'un millésime à l'autre. Des bouteilles remplies à

seulement douze mois d'écart peuvent afficher des prix variant d'un

facteur de dix ou plus195 . La capacité à prédire les prix est précieuse,

parce que les investisseurs achètent du vin, comme des œuvres d'art,

en anticipant leur appréciation future.

Il est généralement admis que la qualité d'un millésime peut n'être

due qu'à des variations du climat durant la saison de la culture du

raisin. Les meilleurs vins sont produits quand l'été est chaud et sec,

ce qui fait que le secteur des bordeaux profite sans aucun doute du

réchauffement climatique. Ils aiment aussi les printemps humides,

qui accroissent la quantité sans grand effet sur la qualité. Ashenfelter

a converti ces idées reçues en une formule statistique qui prédit le

prix d'un vin – pour un domaine particulier et à un âge précis – à

partir de trois caractéristiques météorologiques : la température

moyenne pendant l'été de la culture du raisin, la quantité de pluie au

moment des vendanges et le total des précipitations durant l'hiver

précédent. Sa formule permet d'obtenir des prix avec des années et

même des décennies d'avance. En fait, elle prédit les prix futurs avec

beaucoup plus d'exactitude que ne le fait le prix actuel des vins

jeunes. Ce nouvel exemple d'un « schéma Meehl » remet en cause le

talent des experts dont les opinions contribuent à déterminer le prix

de départ. Il contredit également la théorie économique qui veut que les prix reflètent les informations disponibles, dont le climat. La

formule d'Ashenfelter est extrêmement précise – la corrélation entre

ses prédictions et les véritables prix est supérieure à 0,90.

Pourquoi les spécialistes sont-ils inférieurs à des algorithmes ?

Une raison, que Meehl a évoquée, est que les experts s'efforcent

d'être malins, de sortir des sentiers battus, et qu'ils prennent en

compte des combinaisons complexes de caractéristiques dans leurs

prédictions. Il arrive que la complexité fonctionne de temps à autre,

mais le plus souvent, elle limite la validité. Il vaut mieux avoir

recours à des combinaisons simples. Plusieurs études ont montré que

les décideurs humains sont inférieurs à une formule de prédiction

même quand on leur donne le résultat obtenu par la formule ! Ils se

disent qu'ils peuvent passer outre parce qu'ils disposent

d'informations supplémentaires, mais là encore, le plus souvent, ils

ont tort. Selon Meehl, rares sont les situations où il est recommandé

de substituer le jugement à une formule. Dans une célèbre

expérience, il a décrit une formule qui prédit si une personne va aller

au cinéma le soir, et a précisé que l'on pouvait effectivement faire fi

de la formule si l'on apprend que la personne en question s'est cassé

la jambe le jour même. Depuis, on l'appelle la « règle de la jambe

cassée ». L'idée étant, bien sûr, que les jambes cassées sont très rares

– et décisives.

Une autre raison expliquant l'infériorité des experts est que les

humains font preuve d'une inconstance incorrigible quand ils

analysent des informations complexes. Quand on leur demande

d'évaluer la même information deux fois de suite, ils donnent

souvent des réponses différentes, ce qui est évidemment assez

inquiétant. Les radiologues expérimentés qui évaluent des

radiographies du thorax comme « normales » ou « anormales » se

contredisent dans 20 % des cas quand ils voient la même radio à

deux occasions différentes 196 . Une étude menée auprès de

101 auditeurs indépendants à qui l'on avait demandé d'évaluer la

fiabilité d'audits internes a montré le même degré d'inconstance 197 .

D'après l'analyse de 41 études distinctes sur la fiabilité des

jugements d'auditeurs, de pathologistes, de psychologues, de

spécialistes de la gestion et d'autres professionnels, il semblerait que ce niveau d'incohérence soit caractéristique, même quand un cas fait

l'objet d'une réévaluation dans un intervalle de quelques minutes198 .

Des jugements qui ne sont pas fiables ne peuvent pas être des

instruments de prédiction valides de quoi que ce soit.

Cette inconstance généralisée est probablement due à la

dépendance extrême du Système 1 vis-à-vis du contexte. Nous

savons, pour avoir étudié l'amorçage, que des stimuli qui passent

inaperçus dans notre environnement ont une influence substantielle

sur nos pensées et sur nos actes. Ces influences fluctuent d'un

moment à l'autre. Le bref plaisir d'une brise fraîche par un jour de

forte chaleur vous rend légèrement plus positif et optimiste sur ce

que vous êtes en train d'évaluer à cet instant-là. Les perspectives

qu'un détenu se voie accorder une remise en liberté conditionnelle

peuvent changer de manière significative selon le temps écoulé

depuis la dernière pause des juges chargés des dossiers 199 . Comme

vous n'avez que peu de connaissance directe de ce qui se passe dans

votre esprit, vous ne saurez jamais que vous êtes parvenu à un

jugement différent ou avez pris une décision différente du fait d'un

infime changement dans les conditions de votre environnement. Les

formules ne souffrent pas de tels problèmes. Avec les mêmes

données de départ, elles aboutissent toujours à la même réponse.

Quand la prévisibilité est faible – comme dans la plupart des études

analysées par Meehl et ses collaborateurs –, l'inconstance détruit

toute validité prédictive.

Nous voici donc arrivés à une conclusion surprenante : pour

maximiser l'exactitude des prédictions, il faudrait en laisser la

charge à des formules, surtout dans des environnements à faible

validité. Les admissions en faculté de médecine, par exemple, sont

souvent décidées par les membres de la fac qui interviewent le

candidat. Les preuves restent fragmentaires, mais on peut se livrer à

une conjecture : le fait d'interroger le candidat diminuera

probablement l'exactitude du processus de sélection, si ce sont les

membres du jury qui prennent aussi la décision finale. Étant trop

sûrs de leurs intuitions, ils accorderont trop de poids à leurs

impressions personnelles et pas assez à d'autres sources

d'information, ce qui amoindrit la validité 200 . De même, les experts qui évaluent la qualité de vins encore jeunes pour prédire leur avenir

disposent d'une source d'information qui risque presque

certainement d'aggraver les choses plutôt que de les améliorer : ils

peuvent goûter le vin. Même si, bien entendu, ils se font par ailleurs

une idée juste des effets de la météorologie sur la qualité du vin, ils

ne pourront pas se montrer aussi constants qu'une formule.

 

Depuis les travaux originaux de Meehl, le développement le plus

important dans ce domaine est lié au célèbre article de Robyn

Dawes, « The Robust Beauty of Improper Linear Models in

Decision Making » (La robuste beauté des modèles linéaires

incorrects dans la prise de décision) 201. Dans les sciences sociales, la

pratique statistique dominante consiste à pondérer les différents

indices en fonction d'un algorithme, dit de régression multiple, qui

existe aujourd'hui sous forme de logiciel conventionnel. La logique

de la régression multiple est imparable : elle trouve la formule

optimale pour associer une combinaison pondérée d'indices.

Toutefois, Dawes a observé que cet algorithme statistique complexe

n'apportait pas grand-chose. On s'en tire aussi bien en choisissant

une série de chiffres ayant une certaine validité pour prédire le

résultat et en ajustant les valeurs pour les rendre comparables (en

utilisant des chiffres ou des classements standards). Une formule qui

combine ces indices en les pondérant sera sans doute aussi précise

dans la prédiction de nouveaux cas que la formule de la régression

multiple qui avait été optimale pour l'échantillon d'origine. D'autres

recherches récentes sont allées plus loin : des formules qui

pondèrent équitablement tous les indices sont souvent supérieures

parce qu'elles ne sont pas affectées par des erreurs

d'échantillonnage202 .

Le succès étonnant des systèmes de pondération équitable a une

implication pratique importante : il est possible de développer des

algorithmes utiles sans avoir auparavant effectué de recherches

statistiques. Des formules pondérées simples fondées sur des

statistiques existantes ou sur le sens commun sont souvent

d'excellents indicateurs. Dans un exemple mémorable, Dawes a montré que la stabilité conjugale pouvait être efficacement prédite

par une formule :

 

fréquence des rapports sexuels moins fréquence des disputes

 

Mieux vaut que le résultat ne soit pas négatif.

Cette recherche nous mène à une conclusion importante : un

algorithme griffonné au dos d'une enveloppe est souvent assez

efficace pour concurrencer une formule optimale pondérée, et en

tout cas assez bonne pour surclasser l'avis des experts. On peut

appliquer cette logique à de nombreux domaines, allant de la

sélection des valeurs par les gérants de portefeuilles au choix des

traitements médicaux par les médecins et leurs patients.

Un simple algorithme, qui a sauvé la vie de centaines de milliers

d'enfants, est un exemple désormais classique de cette approche. Les

obstétriciens ont toujours su qu'un nourrisson qui ne respire pas

normalement dans les quelques minutes qui suivent la naissance

courait le risque de subir de graves dommages cérébraux, ou de

mourir. Jusqu'à l'intervention de l'anesthésiste Virginia Apgar en

1953, les médecins et les sages-femmes s'appuyaient sur leur

jugement clinique pour déterminer si un bébé était en danger,

chacun se référant à des indices différents : certains étaient à l'affût

de difficultés respiratoires, d'autres guettaient les premiers cris de

l'enfant, etc. En l'absence d'une procédure standardisée, des signes

indicateurs d'un risque étaient souvent négligés, et beaucoup de

nouveau-nés mouraient.

Un matin, au petit déjeuner, un interne demanda au docteur Apgar

comment elle systématiserait l'évaluation de l'état d'un nouveau-né.

« C'est facile, répondit-elle, il faut faire comme ça. » Elle coucha par

écrit cinq variables (le rythme cardiaque, la respiration, les réflexes,

la tonicité musculaire et la couleur) et trois chiffres (0, 1 ou 2, selon

l'importance de chaque variable). Comprenant que sa liste

constituait peut-être un outil utile pour toutes les salles de travail,

Apgar commença à classer les nourrissons en fonction de cette règle

une minute après leur naissance 203 . Un bébé ayant un score total de

8 avait toutes les chances d'être rose, de se tortiller, de pleurer, de

grimacer, avec un rythme cardiaque de 100 ou plus – bref, d'être en

bonne forme. Un bébé avec un résultat de 4 ou moins serait

probablement bleuâtre, mou, passif, avec un rythme cardiaque lent

ou faible – et nécessiterait donc une intervention immédiate. En

appliquant la règle d'Apgar, le personnel des salles de travail

disposait enfin de normes constantes permettant de déterminer quels

bébés étaient en danger, et on considère que cette formule a

grandement contribué à réduire la mortalité infantile. Le test d'Apgar

est encore aujourd'hui utilisé tous les jours dans toutes les

maternités. Dans A Checklist Manifesto (Le Manifeste des listes de

contrôles), Atul Gawande fournit bien d'autres exemples des vertus

des listes de contrôle et des règles simples 204 .

 

L'hostilité aux algorithmes

 

Dès le début, les psychologues cliniciens ont réagi avec hostilité

et incrédulité aux idées de Meehl. Ils étaient manifestement en proie

à une illusion de talent quant à leur propre capacité à effectuer des

prédictions à long terme. À la réflexion, on voit facilement comment

cette illusion a pu se développer et on ne peut s'empêcher de

comprendre les cliniciens.

La preuve statistique de l'infériorité du diagnostic clinique

contredit l'expérience qu'ont quotidiennement les cliniciens de la

qualité de leur jugement. Les psychologues, par exemple, ont de

nombreuses intuitions concernant leurs patients au fil des séances de

thérapie ; ils anticipent la réaction de ces derniers à telle intervention

de leur part, devinent ce qui va se passer ensuite. Nombre de ces

intuitions se vérifient, confortant la réalité de leur compétence

clinique.

Le problème, c'est que les jugements corrects impliquent des

prédictions à court terme dans le contexte d'entretiens

thérapeutiques, une compétence dans laquelle les thérapeutes

peuvent avoir des années de pratique. Quand ils échouent, c'est

généralement sur des prédictions à long terme concernant l'avenir du patient. C'est de fait une tâche beaucoup plus difficile, et même les

meilleures formules n'y réussissent que modérément. En outre, les

cliniciens n'ont jamais eu l'occasion d'apprendre correctement à

pratiquer ce type de prédictions – il leur faudrait attendre des années

pour bénéficier d'un retour, au lieu des retours immédiats qu'ils

connaissent lors des séances cliniques. Cependant, la ligne qui

sépare ce que les cliniciens peuvent bien faire de ce qu'ils ne

peuvent pas faire du tout n'est pas évidente, en tout cas, pas pour

eux. Ils savent qu'ils sont compétents, mais ne connaissent pas

forcément les limites de leurs talents. Pas étonnant, donc, que les

cliniciens expérimentés considèrent comme fondamentalement

erronée l'idée qu'une combinaison mécanique de quelques variables

puisse faire mieux que la subtile complexité du jugement humain.

Le débat sur les vertus des prédictions cliniques et statistiques a

toujours eu une dimension morale. La méthode statistique, écrivait

Meehl, a été dénoncée par les cliniciens expérimentés comme étant

« mécanique, atomiste, additive, figée, artificielle, irréelle, arbitraire,

incomplète, morte, pédante, fractionnée, futile, contrainte, statique,

superficielle, rigide, stérile, académique, pseudo-scientifique et

aveugle ». Au contraire, elle a été saluée par ses défenseurs comme

étant « dynamique, globale, constructive, holistique, subtile,

compatissante, ordonnée, organisée, riche, profonde, authentique,

sensible, raffinée, réelle, vivante, concrète, naturelle, réaliste et

bienveillante ».

Nous connaissons tous des exemples d'une telle attitude. Quand

l'homme affronte la machine, comme le génie des échecs

Garry Kasparov jouant contre l'ordinateur Deep Blue, nous

penchons en faveur de notre congénère. L'aversion pour les

algorithmes, quand ils décident à la place des humains, s'enracine

dans le fait que beaucoup de gens préfèrent le naturel au synthétique

ou à l'artificiel. Quand on leur demande s'ils préféreraient manger

une pomme bio ou produite industriellement, les gens disent qu'ils

choisiraient la pomme « entièrement naturelle ». Même quand on

leur explique que les deux fruits ont le même goût, la même valeur

nutritive et qu'ils sont tout aussi sains, une majorité continue de

préférer le fruit bio 205 . Même les producteurs de bière se sont aperçus qu'ils pouvaient augmenter les ventes en ajoutant la mention

« entièrement naturelle » ou « sans conservateur » sur l'étiquette.

Un autre exemple de résistance acharnée contre la démystification

de l'expertise est celui de la communauté européenne des amoureux

du vin, confrontée à la formule d'Ashenfelter pour prédire le prix

des bordeaux. On aurait pu s'attendre à ce que, partout dans le

monde, les œnologues lui soient reconnaissants d'avoir contribué par

sa formule à améliorer leur capacité à identifier les vins qui

prendraient de la valeur. Que nenni ! Dans les cercles œnologiques

français, écrivit le New York Times, la réaction alla « de la violence à

l'hystérie ». Un œnophile, raconte Ashenfelter, avait même traité ses

découvertes de « grotesques et absurdes ». Un autre s'était moqué :

« C'est comme de critiquer des films sans les avoir vus. »

Le préjugé contre les algorithmes s'accroît quand les décisions

qu'ils influent portent à conséquence. Meehl a noté : « Je ne sais pas

trop comment atténuer l'horreur que semblent éprouver les cliniciens

quand ils apprennent qu'un malade se voit refuser un traitement

parce qu'il aurait été mal classé par une équation “aveugle,

mécanique”. » Pour leur part, Meehl et d'autres partisans des

algorithmes ont fermement soutenu qu'il était contraire à l'éthique de

s'appuyer sur des jugements intuitifs pour prendre des décisions

importantes s'il existe un algorithme susceptible de commettre

moins d'erreurs. Leur argument est rationnel et convaincant, mais il

va à l'encontre d'une réalité psychologique obstinée : pour la plupart

des gens, la cause d'une erreur a de l'importance. L'histoire d'un

enfant qui meurt parce qu'un algorithme a fait une erreur est plus

poignante que la même tragédie due à une erreur humaine, et la

différence d'intensité émotionnelle peut facilement se traduire en

termes de préférence morale.

Heureusement, l'hostilité suscitée par les algorithmes ira

probablement en s'atténuant au fur et à mesure que leur rôle

continuera à progresser dans la vie quotidienne. Quand nous

cherchons des livres ou de la musique susceptibles de nous plaire,

nous apprécions les recommandations des logiciels. Nous

considérons comme acquis le fait que les décisions sur les plafonds

de crédit soient prises sans l'intervention directe d'un jugement humain. Nous sommes de plus en plus exposés à des directives qui

prennent la forme de simples algorithmes, comme le taux de bon et

de mauvais cholestérol que nous devrions nous efforcer d'atteindre.

Le public est désormais parfaitement conscient que les formules

peuvent faire mieux que l'homme dans certaines décisions critiques

liées au monde du sport : combien une équipe professionnelle

devrait-elle payer pour aider des joueurs débutants, par exemple. La

liste croissante de tâches confiées aux algorithmes devrait finir par

réduire le malaise qu'éprouvent la plupart des gens quand ils

croisent pour la première fois les résultats décrits par Meehl dans

son petit livre qui dérange.

 

Les leçons de Meehl

 

En 1955, alors qu'âgé de vingt et un ans, j'étais lieutenant dans

l'armée israélienne, on m'a demandé de mettre au point un système

d'entretiens de recrutement valables pour l'ensemble des forces

armées. Si vous vous demandez pourquoi une telle responsabilité a

pu être imposée à quelqu'un de si jeune, n'oubliez pas qu'alors l'État

d'Israël lui-même n'avait que sept ans. Toutes ses institutions étaient

en chantier, et il fallait bien que quelqu'un les bâtisse. Aussi bizarre

que cela puisse paraître aujourd'hui, l'option psychologie que j'avais

choisie faisait probablement de moi le psychologue le mieux formé

de l'armée. Quant à mon chef direct, un chercheur brillant, il était

diplômé de chimie.

Il existait déjà une procédure de routine pour les entretiens quand

on m'a confié cette mission. Chaque soldat appelé dans l'armée

passait une batterie de tests psychométriques, et chaque homme

considéré comme apte au combat était interrogé pour que l'on juge

de sa personnalité. Le but était d'attribuer à chacun une note

d'aptitude générale au combat et de trouver quel corps lui

correspondait le mieux : l'infanterie, l'artillerie, les blindés, etc. Les

interrogateurs étaient eux-mêmes de jeunes appelés, choisis en

fonction de leur grande intelligence et de leur intérêt pour le

relationnel. La plupart étaient des femmes qui, à l'époque, étaient

exemptées de missions de combat. Formées en quelques semaines aux façons de mener un entretien de quinze à vingt minutes, elles

étaient encouragées à couvrir un éventail de sujets pour se faire une

idée générale des futures prestations de la recrue.

Malheureusement, des évaluations de contrôle avaient déjà

montré que cette procédure était presque inutile lorsqu'il s'agissait de

prédire la réussite future des recrues. Je reçus l'ordre de mettre au

point un système d'entretiens plus fiable, mais qui ne prendrait pas

plus de temps. On me demanda également de le tester et d'évaluer

son efficacité. D'un point de vue purement professionnel, j'étais à

peu près aussi qualifié pour cette mission que pour construire un

pont sur l'Amazone.

Par chance, j'avais lu le « petit livre » de Paul Meehl, paru un an

plus tôt. Sa thèse, à savoir que des règles statistiques simples sont

plus fiables que des jugements « cliniques » intuitifs, m'avait

convaincu. J'en conclus que le système d'entretiens jusqu'alors

utilisé avait échoué au moins en partie parce qu'il laissait les

interrogateurs faire ce qui les intéressait le plus, soit découvrir les

rouages de la vie mentale du candidat. Au lieu de cela, il fallait

profiter du temps limité dont nous disposions pour récolter autant

d'informations que possible sur la vie de la recrue dans son

environnement habituel. J'avais tiré une autre leçon de Meehl : il

fallait abandonner la procédure selon laquelle l'évaluation de

l'interrogateur déterminait seule la décision finale. D'après Meehl,

on ne pouvait pas faire confiance à des évaluations de ce genre, et le

bilan statistique d'éléments évalués séparément serait plus fiable.

Je m'orientais donc vers une procédure où les interrogateurs

évalueraient plusieurs traits de la personnalité du candidat et les

noteraient séparément. La note finale de l'aptitude au combat serait

calculée à l'aide d'une formule standard, sans aucune intervention

supplémentaire des interrogateurs. J'établis une liste de six

caractéristiques qui paraissaient liées à la performance au sein d'une

unité de combat, dont la « responsabilité », la « sociabilité » et « la

fierté masculine ». Puis je composai, pour chaque caractéristique,

une série de questions factuelles relatives à la vie de l'individu avant

son entrée dans l'armée, par exemple le nombre d'emplois différents

qu'il avait occupés, de quelle régularité et de quelle ponctualité il avait fait preuve dans son travail ou ses études, la fréquence de ses

interactions avec ses amis, sa pratique du sport… L'idée était

d'évaluer aussi objectivement que possible comment la recrue s'était

comportée dans chacune de ces situations.

En mettant l'accent sur des questions factuelles standardisées,

j'espérais lutter contre l'effet de halo, où les premières impressions

favorables ont une influence sur les jugements ultérieurs. En guise

de précaution supplémentaire contre les halos, j'ai suggéré aux

interrogateurs d'aborder chacun des six traits à la suite, et de les

noter sur une échelle de 1 à 5 avant de passer au suivant. Et c'était

tout. Je leur ai également dit qu'ils n'avaient pas à se soucier de la

manière dont la recrue s'adapterait à l'armée à l'avenir. Leur seule

mission était de trouver des faits utiles dans son passé et d'utiliser

ces informations pour noter la recrue dans chacun des six domaines

définis. « Votre fonction est de fournir des mesures fiables, leur ai-je

dit. Je me charge de la validité prédictive », leur dis-je, comptant

pour ce faire sur la formule que j'allais mettre au point pour

combiner les résultats de leurs différents classements.

Je faillis déclencher une mutinerie. Ces jeunes gens intelligents

n'appréciaient guère qu'un type à peine plus âgé qu'eux leur donne

des ordres, leur explique qu'il ne fallait plus s'appuyer sur leur

intuition mais uniquement désormais sur d'ennuyeuses questions

factuelles. L'un d'entre eux se plaignit : « Vous nous transformez en

robots ! » Je leur proposai alors un compromis. « Procédez à

l'entretien en suivant exactement les instructions, et quand vous en

aurez fini, faites comme vous le souhaitez : fermez les yeux, essayez

d'imaginer la recrue en soldat, et donnez-lui une note de 1 à 5. »

Plusieurs centaines d'entretiens furent menés à l'aide de cette

nouvelle méthode, et quelques mois plus tard, nous reçûmes

l'évaluation des soldats par les commandants des unités auxquelles

ils avaient été affectés. Les résultats nous emplirent de joie. Comme

l'avait suggéré le livre de Meehl, la nouvelle procédure d'entretien

représentait une nette amélioration par rapport à l'ancienne. La

combinaison de nos six classements prédisait la performance des

soldats avec beaucoup plus d'exactitude que les évaluations globales

de la méthode précédente, même si elle était loin d'être parfaite. Nous avions progressé et étions passés d'une mission

« complètement inutile » à une mission « modérément utile ».

La grande surprise, pour moi, fut que le jugement intuitif final des

interrogateurs (la phase du « fermez les yeux ») fonctionnait

également très bien, en fait – tout aussi bien que la somme des six

classements spécifiques. C'est là une leçon que je n'ai jamais

oubliée : l'intuition est une valeur ajoutée même dans le cadre d'un

entretien de sélection, mais seulement si l'on a au préalable

rassemblé rigoureusement et soigneusement classé des informations

objectives. J'avais en effet établi une formule qui conférait à

l'évaluation intuitive finale le même poids que la somme des six

classements de caractéristiques. Il ne fallait certes pas se fier au

jugement intuitif – le sien ou celui des autres –, mais il ne fallait pas

non plus le rejeter.

Près de quarante-cinq ans plus tard, après avoir obtenu un prix

Nobel d'économie, j'ai, pendant un temps, été vaguement célèbre en

Israël. À l'occasion d'un déplacement, quelqu'un a eu l'idée de

m'emmener jusqu'à mon ancienne base militaire, qui abritait encore

l'unité d'évaluation des nouvelles recrues. Le commandant m'a décrit

leurs pratiques, qui n'avaient pas tellement changé par rapport au

système que j'avais conçu ; un grand nombre d'études, semblait-il,

confirmaient que les entretiens fonctionnaient encore très bien. À la

fin de sa présentation, elle a ajouté : « Et ensuite, on leur dit :

“Fermez les yeux”… »

 

À faire chez soi

 

Ce qu'il y a à retenir dans ce chapitre ne sert pas seulement au

recrutement de candidats pour l'armée. La mise en œuvre de

procédures d'entretien dans l'esprit de Meehl et Dawes n'est pas très

compliquée, mais nécessite de la discipline. Supposons qu'il vous

faille engager un commercial pour votre entreprise. Si vous tenez

sérieusement à recruter le meilleur candidat possible pour ce poste,

voici ce qu'il faut faire. Pour commencer, sélectionnez quelques

caractéristiques préalables à la réussite à ce poste (compétences

techniques, personnalité engageante, fiabilité, etc.). N'en faites pas trop – six est un bon chiffre. Ces caractéristiques doivent, autant que

possible, être indépendantes les unes des autres, et vous devez avoir

le sentiment que vous pouvez les évaluer de façon fiable en posant

simplement quelques questions factuelles. Ensuite, dressez la liste

de ces questions pour chaque caractéristique et imaginez comment

vous allez les noter, disons sur une échelle de 1 à 5. Ayez une idée

de ce qui, pour vous, sera « très faible » ou « très fort ».

Ces préparatifs devraient vous prendre à peu près une demi-heure,

soit un investissement modeste pour faire la différence en termes de

qualité de recrutement. Pour éviter les effets de halo, vous devez

rassembler les informations pour une caractéristique après l'autre, et

consigner vos notes avant de passer à la suivante. Ne vous éparpillez

pas. Pour évaluer chaque candidat, additionnez les six notes. Étant

responsable de la décision finale, vous ne devriez pas « fermer les

yeux ». Décidez fermement d'embaucher le candidat dont le score

final sera le plus élevé, même si votre préférence va à un autre –

 résistez à votre envie d'inventer des jambes cassées pour modifier le

classement. À en juger par les nombreuses recherches entreprises

dans ce domaine, vous avez plus de chances de trouver le meilleur

candidat en ayant recours à cette procédure qu'à la procédure

habituelle dans ce genre de situation, c'est-à-dire se lancer dans

l'entretien sans préparation et faire son choix d'après un jugement

intuitif d'ensemble, type : « J'ai regardé dans ses yeux et ce que j'y ai

vu m'a plu. »

 

*

 

Les jugements et les formules en bref

 

« Chaque fois qu'il est possible de remplacer le jugement humain

par une formule, nous devrions au moins l'envisager. »

« Il pense que ses jugements sont complexes et subtils, mais une

simple combinaison de notes fonctionnerait sans doute mieux. »

« Décidons par avance quel poids accorder aux données dont nous

disposons sur les performances passées des candidats. Sinon, nous donnerons trop d'importance à l'impression que nous laisseront les

entretiens. »

 

OceanofPDF.com