Système 1, système 2 : les deux vitesses de la pensée
21 - Les intuitions contre les formules
21
Les intuitions contre les formules
Paul Meehl est un personnage étrange et merveilleux, et un des
psychologues les plus polyvalents du XXe siècle. À l'université du
Minnesota, il enseignait dans plusieurs départements – en
psychologie, en droit, en psychiatrie, en neurologie et en
philosophie. Il a aussi écrit sur la religion, les sciences politiques et
l'apprentissage chez les rats. Passionné de statistiques, il a
vigoureusement dénoncé certaines théories infondées de
psychologie clinique. Il était également psychanalyste. Il a rédigé
des essais profonds sur les fondements philosophiques de la
recherche en psychologie, que j'ai presque appris par cœur quand
j'étais étudiant. Je ne l'ai jamais rencontré, mais il était un de mes
héros depuis que j'avais lu son essai Prédiction clinique et
prédiction statistique : analyse théorique et étude des preuves.
Dans cet opuscule qu'il décrivit plus tard comme « [s]on petit
livre qui dérange », il compilait vingt études ayant analysé si les
prédictions cliniques basées sur les impressions subjectives de
professionnels entraînés étaient plus exactes que des prédictions
statistiques obtenues en appliquant une formule précise. Dans une
étude classique, des consultants spécialisés devaient prédire les
notes d'étudiants de première année. Ils avaient interviewé chacun
d'entre eux pendant quarante-cinq minutes. Ils avaient en outre accès
à leurs notes de lycée, à plusieurs tests d'aptitude, et à une déclaration personnelle de quatre pages. L'algorithme statistique
n'utilisait qu'une partie de ces informations : les notes de lycée et un
test d'aptitude. Ce qui n'empêcha pas la formule d'être plus exacte
que onze des quatorze consultants. Selon Meehl, des résultats
similaires avaient été obtenus dans d'autres domaines de prévisions,
comme le risque de violation de la liberté conditionnelle, la réussite
à l'entraînement de pilotes et le récidivisme chez les délinquants.
Le livre de Meehl n'a pas manqué de provoquer la stupeur et
l'incrédulité parmi les psychologues cliniciens, et la controverse qu'il
déclencha est à l'origine d'une vague de recherches qui se
poursuivent encore aujourd'hui, plus de cinquante ans après sa
publication. Le nombre d'études comparant des prédictions cliniques
et statistiques a aujourd'hui dépassé la barre des deux cents, mais le
résultat du match opposant les algorithmes aux prédictions humaines
reste inchangé. Environ 60 % des études ont montré que les
algorithmes étaient beaucoup plus précis. Les autres donnent un
résultat nul, ce qui revient à une victoire des règles statistiques, qui
coûtent d'ordinaire beaucoup moins cher que le recours au jugement
des experts. Aucune exception n'a pu être étayée de façon
satisfaisante.
Au fil des études, l'éventail des résultats prédits s'est élargi pour
couvrir des variables médicales (la longévité des patients atteints de
cancer, la longueur des séjours à l'hôpital, le diagnostic de maladies
cardiaques, la susceptibilité que des bébés succombent au syndrome
de mort subite du nourrisson), des mesures économiques (les
perspectives de réussite de nouvelles entreprises, l'évaluation du
risque de crédit pour les banques et la future satisfaction
professionnelle des salariés), des questions institutionnelles ou
politiques (l'évaluation des aptitudes de parents d'adoption, les
risques de récidive chez les délinquants juvéniles, la probabilité
d'autres formes de comportement violent) ; ou encore l'évaluation de
présentations scientifiques, l'issue de matchs de football et le prix
futur des vins de Bordeaux. Chacun de ces domaines comporte un
degré significatif d'incertitude et d'imprévisibilité. Nous les
décrivons comme des « environnements à faible validité ». Dans chaque cas, un simple algorithme a fait aussi bien ou mieux que les
experts.
Comme l'a souligné Meehl avec une fierté justifiée trente ans
après la publication de son livre, « aucune autre controverse dans les
sciences sociales n'a abouti à une telle quantité d'études variées
allant toutes uniformément dans le même sens194 ».
L'économiste de Princeton Orley Ashenfelter, également
œnologue, a proposé à son tour une démonstration convaincante de
la capacité de simples statistiques à surclasser des experts de
renommée mondiale. Ashenfelter voulait prédire la valeur future de
grands vins de Bordeaux à partir d'informations glanées dans l'année
où le raisin avait été récolté. La question est importante, parce qu'il
faut des années pour qu'un grand vin atteigne le pic de sa qualité, et
les prix des vins arrivés à maturité dans un même vignoble divergent
considérablement d'un millésime à l'autre. Des bouteilles remplies à
seulement douze mois d'écart peuvent afficher des prix variant d'un
facteur de dix ou plus195 . La capacité à prédire les prix est précieuse,
parce que les investisseurs achètent du vin, comme des œuvres d'art,
en anticipant leur appréciation future.
Il est généralement admis que la qualité d'un millésime peut n'être
due qu'à des variations du climat durant la saison de la culture du
raisin. Les meilleurs vins sont produits quand l'été est chaud et sec,
ce qui fait que le secteur des bordeaux profite sans aucun doute du
réchauffement climatique. Ils aiment aussi les printemps humides,
qui accroissent la quantité sans grand effet sur la qualité. Ashenfelter
a converti ces idées reçues en une formule statistique qui prédit le
prix d'un vin – pour un domaine particulier et à un âge précis – à
partir de trois caractéristiques météorologiques : la température
moyenne pendant l'été de la culture du raisin, la quantité de pluie au
moment des vendanges et le total des précipitations durant l'hiver
précédent. Sa formule permet d'obtenir des prix avec des années et
même des décennies d'avance. En fait, elle prédit les prix futurs avec
beaucoup plus d'exactitude que ne le fait le prix actuel des vins
jeunes. Ce nouvel exemple d'un « schéma Meehl » remet en cause le
talent des experts dont les opinions contribuent à déterminer le prix
de départ. Il contredit également la théorie économique qui veut que les prix reflètent les informations disponibles, dont le climat. La
formule d'Ashenfelter est extrêmement précise – la corrélation entre
ses prédictions et les véritables prix est supérieure à 0,90.
Pourquoi les spécialistes sont-ils inférieurs à des algorithmes ?
Une raison, que Meehl a évoquée, est que les experts s'efforcent
d'être malins, de sortir des sentiers battus, et qu'ils prennent en
compte des combinaisons complexes de caractéristiques dans leurs
prédictions. Il arrive que la complexité fonctionne de temps à autre,
mais le plus souvent, elle limite la validité. Il vaut mieux avoir
recours à des combinaisons simples. Plusieurs études ont montré que
les décideurs humains sont inférieurs à une formule de prédiction
même quand on leur donne le résultat obtenu par la formule ! Ils se
disent qu'ils peuvent passer outre parce qu'ils disposent
d'informations supplémentaires, mais là encore, le plus souvent, ils
ont tort. Selon Meehl, rares sont les situations où il est recommandé
de substituer le jugement à une formule. Dans une célèbre
expérience, il a décrit une formule qui prédit si une personne va aller
au cinéma le soir, et a précisé que l'on pouvait effectivement faire fi
de la formule si l'on apprend que la personne en question s'est cassé
la jambe le jour même. Depuis, on l'appelle la « règle de la jambe
cassée ». L'idée étant, bien sûr, que les jambes cassées sont très rares
– et décisives.
Une autre raison expliquant l'infériorité des experts est que les
humains font preuve d'une inconstance incorrigible quand ils
analysent des informations complexes. Quand on leur demande
d'évaluer la même information deux fois de suite, ils donnent
souvent des réponses différentes, ce qui est évidemment assez
inquiétant. Les radiologues expérimentés qui évaluent des
radiographies du thorax comme « normales » ou « anormales » se
contredisent dans 20 % des cas quand ils voient la même radio à
deux occasions différentes 196 . Une étude menée auprès de
101 auditeurs indépendants à qui l'on avait demandé d'évaluer la
fiabilité d'audits internes a montré le même degré d'inconstance 197 .
D'après l'analyse de 41 études distinctes sur la fiabilité des
jugements d'auditeurs, de pathologistes, de psychologues, de
spécialistes de la gestion et d'autres professionnels, il semblerait que ce niveau d'incohérence soit caractéristique, même quand un cas fait
l'objet d'une réévaluation dans un intervalle de quelques minutes198 .
Des jugements qui ne sont pas fiables ne peuvent pas être des
instruments de prédiction valides de quoi que ce soit.
Cette inconstance généralisée est probablement due à la
dépendance extrême du Système 1 vis-à-vis du contexte. Nous
savons, pour avoir étudié l'amorçage, que des stimuli qui passent
inaperçus dans notre environnement ont une influence substantielle
sur nos pensées et sur nos actes. Ces influences fluctuent d'un
moment à l'autre. Le bref plaisir d'une brise fraîche par un jour de
forte chaleur vous rend légèrement plus positif et optimiste sur ce
que vous êtes en train d'évaluer à cet instant-là. Les perspectives
qu'un détenu se voie accorder une remise en liberté conditionnelle
peuvent changer de manière significative selon le temps écoulé
depuis la dernière pause des juges chargés des dossiers 199 . Comme
vous n'avez que peu de connaissance directe de ce qui se passe dans
votre esprit, vous ne saurez jamais que vous êtes parvenu à un
jugement différent ou avez pris une décision différente du fait d'un
infime changement dans les conditions de votre environnement. Les
formules ne souffrent pas de tels problèmes. Avec les mêmes
données de départ, elles aboutissent toujours à la même réponse.
Quand la prévisibilité est faible – comme dans la plupart des études
analysées par Meehl et ses collaborateurs –, l'inconstance détruit
toute validité prédictive.
Nous voici donc arrivés à une conclusion surprenante : pour
maximiser l'exactitude des prédictions, il faudrait en laisser la
charge à des formules, surtout dans des environnements à faible
validité. Les admissions en faculté de médecine, par exemple, sont
souvent décidées par les membres de la fac qui interviewent le
candidat. Les preuves restent fragmentaires, mais on peut se livrer à
une conjecture : le fait d'interroger le candidat diminuera
probablement l'exactitude du processus de sélection, si ce sont les
membres du jury qui prennent aussi la décision finale. Étant trop
sûrs de leurs intuitions, ils accorderont trop de poids à leurs
impressions personnelles et pas assez à d'autres sources
d'information, ce qui amoindrit la validité 200 . De même, les experts qui évaluent la qualité de vins encore jeunes pour prédire leur avenir
disposent d'une source d'information qui risque presque
certainement d'aggraver les choses plutôt que de les améliorer : ils
peuvent goûter le vin. Même si, bien entendu, ils se font par ailleurs
une idée juste des effets de la météorologie sur la qualité du vin, ils
ne pourront pas se montrer aussi constants qu'une formule.
Depuis les travaux originaux de Meehl, le développement le plus
important dans ce domaine est lié au célèbre article de Robyn
Dawes, « The Robust Beauty of Improper Linear Models in
Decision Making » (La robuste beauté des modèles linéaires
incorrects dans la prise de décision) 201. Dans les sciences sociales, la
pratique statistique dominante consiste à pondérer les différents
indices en fonction d'un algorithme, dit de régression multiple, qui
existe aujourd'hui sous forme de logiciel conventionnel. La logique
de la régression multiple est imparable : elle trouve la formule
optimale pour associer une combinaison pondérée d'indices.
Toutefois, Dawes a observé que cet algorithme statistique complexe
n'apportait pas grand-chose. On s'en tire aussi bien en choisissant
une série de chiffres ayant une certaine validité pour prédire le
résultat et en ajustant les valeurs pour les rendre comparables (en
utilisant des chiffres ou des classements standards). Une formule qui
combine ces indices en les pondérant sera sans doute aussi précise
dans la prédiction de nouveaux cas que la formule de la régression
multiple qui avait été optimale pour l'échantillon d'origine. D'autres
recherches récentes sont allées plus loin : des formules qui
pondèrent équitablement tous les indices sont souvent supérieures
parce qu'elles ne sont pas affectées par des erreurs
d'échantillonnage202 .
Le succès étonnant des systèmes de pondération équitable a une
implication pratique importante : il est possible de développer des
algorithmes utiles sans avoir auparavant effectué de recherches
statistiques. Des formules pondérées simples fondées sur des
statistiques existantes ou sur le sens commun sont souvent
d'excellents indicateurs. Dans un exemple mémorable, Dawes a montré que la stabilité conjugale pouvait être efficacement prédite
par une formule :
fréquence des rapports sexuels moins fréquence des disputes
Mieux vaut que le résultat ne soit pas négatif.
Cette recherche nous mène à une conclusion importante : un
algorithme griffonné au dos d'une enveloppe est souvent assez
efficace pour concurrencer une formule optimale pondérée, et en
tout cas assez bonne pour surclasser l'avis des experts. On peut
appliquer cette logique à de nombreux domaines, allant de la
sélection des valeurs par les gérants de portefeuilles au choix des
traitements médicaux par les médecins et leurs patients.
Un simple algorithme, qui a sauvé la vie de centaines de milliers
d'enfants, est un exemple désormais classique de cette approche. Les
obstétriciens ont toujours su qu'un nourrisson qui ne respire pas
normalement dans les quelques minutes qui suivent la naissance
courait le risque de subir de graves dommages cérébraux, ou de
mourir. Jusqu'à l'intervention de l'anesthésiste Virginia Apgar en
1953, les médecins et les sages-femmes s'appuyaient sur leur
jugement clinique pour déterminer si un bébé était en danger,
chacun se référant à des indices différents : certains étaient à l'affût
de difficultés respiratoires, d'autres guettaient les premiers cris de
l'enfant, etc. En l'absence d'une procédure standardisée, des signes
indicateurs d'un risque étaient souvent négligés, et beaucoup de
nouveau-nés mouraient.
Un matin, au petit déjeuner, un interne demanda au docteur Apgar
comment elle systématiserait l'évaluation de l'état d'un nouveau-né.
« C'est facile, répondit-elle, il faut faire comme ça. » Elle coucha par
écrit cinq variables (le rythme cardiaque, la respiration, les réflexes,
la tonicité musculaire et la couleur) et trois chiffres (0, 1 ou 2, selon
l'importance de chaque variable). Comprenant que sa liste
constituait peut-être un outil utile pour toutes les salles de travail,
Apgar commença à classer les nourrissons en fonction de cette règle
une minute après leur naissance 203 . Un bébé ayant un score total de
8 avait toutes les chances d'être rose, de se tortiller, de pleurer, de
grimacer, avec un rythme cardiaque de 100 ou plus – bref, d'être en
bonne forme. Un bébé avec un résultat de 4 ou moins serait
probablement bleuâtre, mou, passif, avec un rythme cardiaque lent
ou faible – et nécessiterait donc une intervention immédiate. En
appliquant la règle d'Apgar, le personnel des salles de travail
disposait enfin de normes constantes permettant de déterminer quels
bébés étaient en danger, et on considère que cette formule a
grandement contribué à réduire la mortalité infantile. Le test d'Apgar
est encore aujourd'hui utilisé tous les jours dans toutes les
maternités. Dans A Checklist Manifesto (Le Manifeste des listes de
contrôles), Atul Gawande fournit bien d'autres exemples des vertus
des listes de contrôle et des règles simples 204 .
L'hostilité aux algorithmes
Dès le début, les psychologues cliniciens ont réagi avec hostilité
et incrédulité aux idées de Meehl. Ils étaient manifestement en proie
à une illusion de talent quant à leur propre capacité à effectuer des
prédictions à long terme. À la réflexion, on voit facilement comment
cette illusion a pu se développer et on ne peut s'empêcher de
comprendre les cliniciens.
La preuve statistique de l'infériorité du diagnostic clinique
contredit l'expérience qu'ont quotidiennement les cliniciens de la
qualité de leur jugement. Les psychologues, par exemple, ont de
nombreuses intuitions concernant leurs patients au fil des séances de
thérapie ; ils anticipent la réaction de ces derniers à telle intervention
de leur part, devinent ce qui va se passer ensuite. Nombre de ces
intuitions se vérifient, confortant la réalité de leur compétence
clinique.
Le problème, c'est que les jugements corrects impliquent des
prédictions à court terme dans le contexte d'entretiens
thérapeutiques, une compétence dans laquelle les thérapeutes
peuvent avoir des années de pratique. Quand ils échouent, c'est
généralement sur des prédictions à long terme concernant l'avenir du patient. C'est de fait une tâche beaucoup plus difficile, et même les
meilleures formules n'y réussissent que modérément. En outre, les
cliniciens n'ont jamais eu l'occasion d'apprendre correctement à
pratiquer ce type de prédictions – il leur faudrait attendre des années
pour bénéficier d'un retour, au lieu des retours immédiats qu'ils
connaissent lors des séances cliniques. Cependant, la ligne qui
sépare ce que les cliniciens peuvent bien faire de ce qu'ils ne
peuvent pas faire du tout n'est pas évidente, en tout cas, pas pour
eux. Ils savent qu'ils sont compétents, mais ne connaissent pas
forcément les limites de leurs talents. Pas étonnant, donc, que les
cliniciens expérimentés considèrent comme fondamentalement
erronée l'idée qu'une combinaison mécanique de quelques variables
puisse faire mieux que la subtile complexité du jugement humain.
Le débat sur les vertus des prédictions cliniques et statistiques a
toujours eu une dimension morale. La méthode statistique, écrivait
Meehl, a été dénoncée par les cliniciens expérimentés comme étant
« mécanique, atomiste, additive, figée, artificielle, irréelle, arbitraire,
incomplète, morte, pédante, fractionnée, futile, contrainte, statique,
superficielle, rigide, stérile, académique, pseudo-scientifique et
aveugle ». Au contraire, elle a été saluée par ses défenseurs comme
étant « dynamique, globale, constructive, holistique, subtile,
compatissante, ordonnée, organisée, riche, profonde, authentique,
sensible, raffinée, réelle, vivante, concrète, naturelle, réaliste et
bienveillante ».
Nous connaissons tous des exemples d'une telle attitude. Quand
l'homme affronte la machine, comme le génie des échecs
Garry Kasparov jouant contre l'ordinateur Deep Blue, nous
penchons en faveur de notre congénère. L'aversion pour les
algorithmes, quand ils décident à la place des humains, s'enracine
dans le fait que beaucoup de gens préfèrent le naturel au synthétique
ou à l'artificiel. Quand on leur demande s'ils préféreraient manger
une pomme bio ou produite industriellement, les gens disent qu'ils
choisiraient la pomme « entièrement naturelle ». Même quand on
leur explique que les deux fruits ont le même goût, la même valeur
nutritive et qu'ils sont tout aussi sains, une majorité continue de
préférer le fruit bio 205 . Même les producteurs de bière se sont aperçus qu'ils pouvaient augmenter les ventes en ajoutant la mention
« entièrement naturelle » ou « sans conservateur » sur l'étiquette.
Un autre exemple de résistance acharnée contre la démystification
de l'expertise est celui de la communauté européenne des amoureux
du vin, confrontée à la formule d'Ashenfelter pour prédire le prix
des bordeaux. On aurait pu s'attendre à ce que, partout dans le
monde, les œnologues lui soient reconnaissants d'avoir contribué par
sa formule à améliorer leur capacité à identifier les vins qui
prendraient de la valeur. Que nenni ! Dans les cercles œnologiques
français, écrivit le New York Times, la réaction alla « de la violence à
l'hystérie ». Un œnophile, raconte Ashenfelter, avait même traité ses
découvertes de « grotesques et absurdes ». Un autre s'était moqué :
« C'est comme de critiquer des films sans les avoir vus. »
Le préjugé contre les algorithmes s'accroît quand les décisions
qu'ils influent portent à conséquence. Meehl a noté : « Je ne sais pas
trop comment atténuer l'horreur que semblent éprouver les cliniciens
quand ils apprennent qu'un malade se voit refuser un traitement
parce qu'il aurait été mal classé par une équation “aveugle,
mécanique”. » Pour leur part, Meehl et d'autres partisans des
algorithmes ont fermement soutenu qu'il était contraire à l'éthique de
s'appuyer sur des jugements intuitifs pour prendre des décisions
importantes s'il existe un algorithme susceptible de commettre
moins d'erreurs. Leur argument est rationnel et convaincant, mais il
va à l'encontre d'une réalité psychologique obstinée : pour la plupart
des gens, la cause d'une erreur a de l'importance. L'histoire d'un
enfant qui meurt parce qu'un algorithme a fait une erreur est plus
poignante que la même tragédie due à une erreur humaine, et la
différence d'intensité émotionnelle peut facilement se traduire en
termes de préférence morale.
Heureusement, l'hostilité suscitée par les algorithmes ira
probablement en s'atténuant au fur et à mesure que leur rôle
continuera à progresser dans la vie quotidienne. Quand nous
cherchons des livres ou de la musique susceptibles de nous plaire,
nous apprécions les recommandations des logiciels. Nous
considérons comme acquis le fait que les décisions sur les plafonds
de crédit soient prises sans l'intervention directe d'un jugement humain. Nous sommes de plus en plus exposés à des directives qui
prennent la forme de simples algorithmes, comme le taux de bon et
de mauvais cholestérol que nous devrions nous efforcer d'atteindre.
Le public est désormais parfaitement conscient que les formules
peuvent faire mieux que l'homme dans certaines décisions critiques
liées au monde du sport : combien une équipe professionnelle
devrait-elle payer pour aider des joueurs débutants, par exemple. La
liste croissante de tâches confiées aux algorithmes devrait finir par
réduire le malaise qu'éprouvent la plupart des gens quand ils
croisent pour la première fois les résultats décrits par Meehl dans
son petit livre qui dérange.
Les leçons de Meehl
En 1955, alors qu'âgé de vingt et un ans, j'étais lieutenant dans
l'armée israélienne, on m'a demandé de mettre au point un système
d'entretiens de recrutement valables pour l'ensemble des forces
armées. Si vous vous demandez pourquoi une telle responsabilité a
pu être imposée à quelqu'un de si jeune, n'oubliez pas qu'alors l'État
d'Israël lui-même n'avait que sept ans. Toutes ses institutions étaient
en chantier, et il fallait bien que quelqu'un les bâtisse. Aussi bizarre
que cela puisse paraître aujourd'hui, l'option psychologie que j'avais
choisie faisait probablement de moi le psychologue le mieux formé
de l'armée. Quant à mon chef direct, un chercheur brillant, il était
diplômé de chimie.
Il existait déjà une procédure de routine pour les entretiens quand
on m'a confié cette mission. Chaque soldat appelé dans l'armée
passait une batterie de tests psychométriques, et chaque homme
considéré comme apte au combat était interrogé pour que l'on juge
de sa personnalité. Le but était d'attribuer à chacun une note
d'aptitude générale au combat et de trouver quel corps lui
correspondait le mieux : l'infanterie, l'artillerie, les blindés, etc. Les
interrogateurs étaient eux-mêmes de jeunes appelés, choisis en
fonction de leur grande intelligence et de leur intérêt pour le
relationnel. La plupart étaient des femmes qui, à l'époque, étaient
exemptées de missions de combat. Formées en quelques semaines aux façons de mener un entretien de quinze à vingt minutes, elles
étaient encouragées à couvrir un éventail de sujets pour se faire une
idée générale des futures prestations de la recrue.
Malheureusement, des évaluations de contrôle avaient déjà
montré que cette procédure était presque inutile lorsqu'il s'agissait de
prédire la réussite future des recrues. Je reçus l'ordre de mettre au
point un système d'entretiens plus fiable, mais qui ne prendrait pas
plus de temps. On me demanda également de le tester et d'évaluer
son efficacité. D'un point de vue purement professionnel, j'étais à
peu près aussi qualifié pour cette mission que pour construire un
pont sur l'Amazone.
Par chance, j'avais lu le « petit livre » de Paul Meehl, paru un an
plus tôt. Sa thèse, à savoir que des règles statistiques simples sont
plus fiables que des jugements « cliniques » intuitifs, m'avait
convaincu. J'en conclus que le système d'entretiens jusqu'alors
utilisé avait échoué au moins en partie parce qu'il laissait les
interrogateurs faire ce qui les intéressait le plus, soit découvrir les
rouages de la vie mentale du candidat. Au lieu de cela, il fallait
profiter du temps limité dont nous disposions pour récolter autant
d'informations que possible sur la vie de la recrue dans son
environnement habituel. J'avais tiré une autre leçon de Meehl : il
fallait abandonner la procédure selon laquelle l'évaluation de
l'interrogateur déterminait seule la décision finale. D'après Meehl,
on ne pouvait pas faire confiance à des évaluations de ce genre, et le
bilan statistique d'éléments évalués séparément serait plus fiable.
Je m'orientais donc vers une procédure où les interrogateurs
évalueraient plusieurs traits de la personnalité du candidat et les
noteraient séparément. La note finale de l'aptitude au combat serait
calculée à l'aide d'une formule standard, sans aucune intervention
supplémentaire des interrogateurs. J'établis une liste de six
caractéristiques qui paraissaient liées à la performance au sein d'une
unité de combat, dont la « responsabilité », la « sociabilité » et « la
fierté masculine ». Puis je composai, pour chaque caractéristique,
une série de questions factuelles relatives à la vie de l'individu avant
son entrée dans l'armée, par exemple le nombre d'emplois différents
qu'il avait occupés, de quelle régularité et de quelle ponctualité il avait fait preuve dans son travail ou ses études, la fréquence de ses
interactions avec ses amis, sa pratique du sport… L'idée était
d'évaluer aussi objectivement que possible comment la recrue s'était
comportée dans chacune de ces situations.
En mettant l'accent sur des questions factuelles standardisées,
j'espérais lutter contre l'effet de halo, où les premières impressions
favorables ont une influence sur les jugements ultérieurs. En guise
de précaution supplémentaire contre les halos, j'ai suggéré aux
interrogateurs d'aborder chacun des six traits à la suite, et de les
noter sur une échelle de 1 à 5 avant de passer au suivant. Et c'était
tout. Je leur ai également dit qu'ils n'avaient pas à se soucier de la
manière dont la recrue s'adapterait à l'armée à l'avenir. Leur seule
mission était de trouver des faits utiles dans son passé et d'utiliser
ces informations pour noter la recrue dans chacun des six domaines
définis. « Votre fonction est de fournir des mesures fiables, leur ai-je
dit. Je me charge de la validité prédictive », leur dis-je, comptant
pour ce faire sur la formule que j'allais mettre au point pour
combiner les résultats de leurs différents classements.
Je faillis déclencher une mutinerie. Ces jeunes gens intelligents
n'appréciaient guère qu'un type à peine plus âgé qu'eux leur donne
des ordres, leur explique qu'il ne fallait plus s'appuyer sur leur
intuition mais uniquement désormais sur d'ennuyeuses questions
factuelles. L'un d'entre eux se plaignit : « Vous nous transformez en
robots ! » Je leur proposai alors un compromis. « Procédez à
l'entretien en suivant exactement les instructions, et quand vous en
aurez fini, faites comme vous le souhaitez : fermez les yeux, essayez
d'imaginer la recrue en soldat, et donnez-lui une note de 1 à 5. »
Plusieurs centaines d'entretiens furent menés à l'aide de cette
nouvelle méthode, et quelques mois plus tard, nous reçûmes
l'évaluation des soldats par les commandants des unités auxquelles
ils avaient été affectés. Les résultats nous emplirent de joie. Comme
l'avait suggéré le livre de Meehl, la nouvelle procédure d'entretien
représentait une nette amélioration par rapport à l'ancienne. La
combinaison de nos six classements prédisait la performance des
soldats avec beaucoup plus d'exactitude que les évaluations globales
de la méthode précédente, même si elle était loin d'être parfaite. Nous avions progressé et étions passés d'une mission
« complètement inutile » à une mission « modérément utile ».
La grande surprise, pour moi, fut que le jugement intuitif final des
interrogateurs (la phase du « fermez les yeux ») fonctionnait
également très bien, en fait – tout aussi bien que la somme des six
classements spécifiques. C'est là une leçon que je n'ai jamais
oubliée : l'intuition est une valeur ajoutée même dans le cadre d'un
entretien de sélection, mais seulement si l'on a au préalable
rassemblé rigoureusement et soigneusement classé des informations
objectives. J'avais en effet établi une formule qui conférait à
l'évaluation intuitive finale le même poids que la somme des six
classements de caractéristiques. Il ne fallait certes pas se fier au
jugement intuitif – le sien ou celui des autres –, mais il ne fallait pas
non plus le rejeter.
Près de quarante-cinq ans plus tard, après avoir obtenu un prix
Nobel d'économie, j'ai, pendant un temps, été vaguement célèbre en
Israël. À l'occasion d'un déplacement, quelqu'un a eu l'idée de
m'emmener jusqu'à mon ancienne base militaire, qui abritait encore
l'unité d'évaluation des nouvelles recrues. Le commandant m'a décrit
leurs pratiques, qui n'avaient pas tellement changé par rapport au
système que j'avais conçu ; un grand nombre d'études, semblait-il,
confirmaient que les entretiens fonctionnaient encore très bien. À la
fin de sa présentation, elle a ajouté : « Et ensuite, on leur dit :
“Fermez les yeux”… »
À faire chez soi
Ce qu'il y a à retenir dans ce chapitre ne sert pas seulement au
recrutement de candidats pour l'armée. La mise en œuvre de
procédures d'entretien dans l'esprit de Meehl et Dawes n'est pas très
compliquée, mais nécessite de la discipline. Supposons qu'il vous
faille engager un commercial pour votre entreprise. Si vous tenez
sérieusement à recruter le meilleur candidat possible pour ce poste,
voici ce qu'il faut faire. Pour commencer, sélectionnez quelques
caractéristiques préalables à la réussite à ce poste (compétences
techniques, personnalité engageante, fiabilité, etc.). N'en faites pas trop – six est un bon chiffre. Ces caractéristiques doivent, autant que
possible, être indépendantes les unes des autres, et vous devez avoir
le sentiment que vous pouvez les évaluer de façon fiable en posant
simplement quelques questions factuelles. Ensuite, dressez la liste
de ces questions pour chaque caractéristique et imaginez comment
vous allez les noter, disons sur une échelle de 1 à 5. Ayez une idée
de ce qui, pour vous, sera « très faible » ou « très fort ».
Ces préparatifs devraient vous prendre à peu près une demi-heure,
soit un investissement modeste pour faire la différence en termes de
qualité de recrutement. Pour éviter les effets de halo, vous devez
rassembler les informations pour une caractéristique après l'autre, et
consigner vos notes avant de passer à la suivante. Ne vous éparpillez
pas. Pour évaluer chaque candidat, additionnez les six notes. Étant
responsable de la décision finale, vous ne devriez pas « fermer les
yeux ». Décidez fermement d'embaucher le candidat dont le score
final sera le plus élevé, même si votre préférence va à un autre –
résistez à votre envie d'inventer des jambes cassées pour modifier le
classement. À en juger par les nombreuses recherches entreprises
dans ce domaine, vous avez plus de chances de trouver le meilleur
candidat en ayant recours à cette procédure qu'à la procédure
habituelle dans ce genre de situation, c'est-à-dire se lancer dans
l'entretien sans préparation et faire son choix d'après un jugement
intuitif d'ensemble, type : « J'ai regardé dans ses yeux et ce que j'y ai
vu m'a plu. »
*
Les jugements et les formules en bref
« Chaque fois qu'il est possible de remplacer le jugement humain
par une formule, nous devrions au moins l'envisager. »
« Il pense que ses jugements sont complexes et subtils, mais une
simple combinaison de notes fonctionnerait sans doute mieux. »
« Décidons par avance quel poids accorder aux données dont nous
disposons sur les performances passées des candidats. Sinon, nous donnerons trop d'importance à l'impression que nous laisseront les
entretiens. »
OceanofPDF.com