Système 1, système 2 : les deux vitesses de la pensée
17 - Régression vers la moyenne
17
Régression vers la moyenne
C'est quand j'enseignais la psychologie d'un entraînement efficace
à des instructeurs de l'Armée de l'air israélienne que je connus l'une
des expériences les plus satisfaisantes de ma carrière. Je leur parlais
d'un principe important de la formation spécialisée : il est plus
efficace de récompenser une amélioration que de punir une erreur.
Cette proposition s'appuie sur les nombreuses preuves fournies par
des recherches effectuées sur des pigeons, des rats, des hommes et
d'autres animaux.
Quand j'eus terminé mon discours enthousiaste, un des
instructeurs les plus aguerris leva la main et prit la parole. Il
commença par reconnaître que le fait de récompenser la
performance était sans doute bon pour les oiseaux, mais il niait que
cela soit la meilleure solution pour les élèves pilotes. Voici ce qu'il
dit : « J'ai bien souvent félicité des élèves pour l'exécution parfaite
d'une manœuvre acrobatique. En général, quand ils la retentent
ensuite, ils s'en tirent moins bien. Alors que j'ai souvent hurlé dans
les écouteurs d'un élève qui a raté sa manœuvre, et en général, il s'en
tire beaucoup mieux la fois suivante. Donc, je vous en prie, ne venez
pas nous dire que la récompense fonctionne, mais pas la punition,
parce que c'est le contraire qui est vrai. »
Ce fut pour moi une superbe prise de conscience, car je vis sous
un jour nouveau un principe de statistiques que j'enseignais depuis des années. L'instructeur avait raison, mais en même temps, il avait
complètement tort ! Sa remarque était astucieuse et juste : quand il
récompensait une performance, il était probable que la prochaine
prestation de l'élève serait décevante, et les punitions étaient
généralement suivies d'une amélioration. Mais la déduction qu'il en
avait tirée sur l'efficacité de la récompense et de la punition était tout
à fait à côté de la plaque. Ce qu'il avait observé s'appelle la
régression vers la moyenne, qui, dans ce cas, était due aux
fluctuations aléatoires dans la qualité de la performance.
Naturellement, il ne félicitait que les élèves dont les performances
étaient nettement supérieures à la moyenne. Mais l'élève n'avait sans
doute eu que de la chance lors de cette tentative, et il était probable
que sa prestation se détériorât ensuite, qu'il ait ou non été félicité.
De même, il ne devait hurler dans les écouteurs d'un élève que
quand la performance de ce dernier était particulièrement mauvaise,
et donc vouée à s'améliorer quoi que fasse l'instructeur. L'instructeur
avait rattaché une interprétation causale aux fluctuations inévitables
d'un processus aléatoire.
C'était un défi digne d'être relevé, mais je doutais qu'une leçon
d'algèbre de la prédiction soit pleinement appréciée. Au lieu de cela,
je pris une craie pour dessiner une cible au sol. Je demandai à tous
les officiers présents de tourner le dos à la cible et de lancer
rapidement dessus deux pièces, sans regarder. Nous avons mesuré la
distance des pièces par rapport à la cible et écrit au tableau les deux
résultats de chaque concurrent. Puis nous les avons ordonnés, de la
meilleure à la pire au premier essai. Il était évident que la plupart de
ceux qui avaient bien visé la première fois (mais pas tous) avaient
fait moins bien au second lancer, et que ceux qui avaient obtenu un
piètre résultat la première fois s'étaient ensuite améliorés. Je fis
remarquer aux instructeurs que ce qu'ils voyaient au tableau
coïncidait avec ce que nous avions entendu sur les résultats des
manœuvres acrobatiques : une mauvaise performance était suivie
d'une amélioration, et une bonne d'une détérioration, sans
intervention ni de félicitations, ni de réprimandes.
Ce jour-là, j'avais découvert que les instructeurs de vol étaient
pris au piège d'une contingence malheureuse : comme ils punissaient les élèves quand leurs performances étaient mauvaises, ils étaient le
plus souvent récompensés par une amélioration consécutive, même
si, en réalité, la punition n'avait aucun effet. De plus, les instructeurs
n'étaient pas les seuls à devoir faire face à cet embarras. Je venais de
tomber sur un phénomène significatif de la condition humaine : la
vie nous expose à des informations perverses. Comme nous avons
tendance à être gentils avec les autres quand ils nous font plaisir et
agressifs quand ils nous déplaisent, nous sommes statistiquement
punis pour notre gentillesse et récompensés pour notre méchanceté.
Le talent et la chance
Il y a quelques années, John Brockman, aujourd'hui rédacteur en
chef du magazine en ligne Edge, a demandé à plusieurs scientifiques
de citer leur « équation préférée ». Voici ce que j'ai proposé :
Succès = talent + chance
Grand succès = un peu plus de talent + beaucoup de chance
L'idée, qui n'a rien de surprenant, que la chance contribue souvent
au succès a des conséquences étonnantes quand on l'applique aux
deux premiers jours d'un tournoi de golf de haut niveau. Pour faire
simple, partons du principe que sur les deux jours, le score moyen
des concurrents était un par de 72. Concentrons-nous sur un joueur
qui a eu une excellente journée, puisqu'il a fini sur un score de 66.
Que nous apprend ce score remarquable ? On peut immédiatement
en déduire que ce golfeur est plus talentueux que la moyenne des
participants au tournoi. La formule du succès suggère que l'on
pourrait également parvenir à une autre déduction : le golfeur qui
s'en est si bien tiré le premier jour a sans doute eu en moyenne plus
de chance que d'habitude. Si vous admettez que le talent et la chance
contribuent l'un et l'autre au succès, il est tout aussi légitime de
conclure que le golfeur a eu de la chance que de dire qu'il a du
talent.
Selon le même principe, si vous vous intéressez à un joueur qui a
fini avec un score de 5 au-dessus du par ce jour-là, vous avez des
raisons de déduire à la fois qu'il est plutôt mauvais, et qu'il n'était
pas dans un bon jour. Bien sûr, vous savez qu'aucune de ces
déductions n'est sûre. Il est tout à fait possible que le golfeur avec 77
est en réalité très talentueux, mais qu'il a connu une journée
particulièrement catastrophique. Malgré cette incertitude, les
déductions suivantes à partir des résultats de la première journée
sont plausibles et seront plus souvent correctes qu'erronées.
Score au-dessus de la moyenne le premier jour = talent au-
dessus de la moyenne + chance le premier jour
et
score en dessous de la moyenne le premier jour = talent en
dessous de la moyenne + malchance le premier jour
Maintenant, supposons que vous connaissiez le score d'un golfeur
pour le premier jour et que l'on vous demande de prédire son score
pour le lendemain. Vous vous attendez à ce qu'il conserve le même
niveau de talent le jour suivant, donc, vous estimerez que le talent
du premier joueur sera « au-dessus de la moyenne » et celui du
deuxième « en dessous de la moyenne ». Il en va bien sûr tout à fait
autrement de la chance. Puisque vous n'avez aucun moyen de
prédire la chance des sportifs le deuxième jour (ou quelque jour que
ce soit), vos estimations doivent partir du principe qu'elle sera
moyenne – ni bonne, ni mauvaise. Cela veut dire qu'en l'absence de
toute autre information, votre meilleure estimation du score des
deux joueurs le deuxième jour ne devrait pas être calquée sur leur
performance de la veille. Voici tout ce que vous pouvez dire :
Le golfeur qui a bien joué le premier jour réussira aussi sans
doute le deuxième jour, mais moins que la veille, parce que la
chance inhabituelle dont il a probablement bénéficié ne va
manifestement pas durer.
Le golfeur qui a mal joué le premier jour sera probablement
en dessous de la moyenne le lendemain, mais il s'améliorera,
parce que sa malchance ne durera sans doute pas.
Nous nous attendons également à ce que l'écart entre les deux
golfeurs se réduise, même si, selon nos meilleures estimations, le
premier continuera à faire mieux que le second.
Mes étudiants ont toujours été étonnés d'apprendre que la
meilleure performance annoncée pour le deuxième jour est plus
modérée, plus près de la moyenne que les indices sur lesquels elle
est fondée (le score du premier jour). C'est pourquoi cette logique
s'appelle la régression vers la moyenne. Plus le premier score sera
extrême, plus il faut s'attendre à une régression, car un score
particulièrement excellent laisse entrevoir l'intervention d'une
chance tout aussi exceptionnelle. La prédiction régressive est
raisonnable, mais sa précision n'est pas garantie. Certains des
golfeurs qui ont marqué 66 le premier jour feront encore mieux le
lendemain, si leur chance augmente. La plupart feront moins bien,
parce que leur chance ne se situera plus au-dessus de la moyenne.
Maintenant, inversons le temps. Classez les joueurs par leurs
résultats du deuxième jour et considérez leur résultat du premier
jour. Vous retrouverez avec précision la même logique de régression
vers la moyenne. Les golfeurs qui ont fait mieux le deuxième jour
ont probablement eu de la chance ce jour-là, et votre meilleure
estimation, c'est qu'ils ont eu moins de chance la veille et ont donc
obtenu un moins bon score. Le fait que vous observiez une
régression quand vous prédisez un événement antérieur à partir d'un
événement ultérieur devrait vous convaincre que la régression n'a
pas d'explication causale.
Les effets de régression sont partout, de même que les histoires
causales erronées que l'on raconte pour les expliquer. Un exemple
bien connu est la « malédiction de Sports Illustrated », qui veut
qu'un sportif ayant fait la couverture du magazine soit condamné à
de piètres performances à la saison suivante. En guise d'explication,
on évoque souvent l'excès de confiance et la pression face aux
grands espoirs suscités. Mais cette malédiction peut s'expliquer plus
simplement : un sportif qui se retrouve en couverture de Sports
Illustrated doit avoir connu une saison précédente exceptionnelle,
sans doute avec un petit coup de pouce de la chance – or, cette
dernière est capricieuse.
Il se trouve que je suivais la compétition de saut à ski hommes
lors des Jeux olympiques d'hiver quand Amos et moi travaillions à
la rédaction d'un article sur la prédiction intuitive. Chaque skieur a
droit à deux sauts, et les résultats sont additionnés pour obtenir le
score final. Je fus surpris d'entendre le commentateur déclarer : « Le
Norvégien a réalisé un très bon premier saut ; il va être tendu, il doit
vouloir conserver son avance, et il va sans doute faire moins bien »
ou encore : « Le Suédois a raté son premier saut, maintenant, il sait
qu'il n'a plus rien à perdre, il va être détendu, ce qui devrait l'aider à
faire mieux. » Le commentateur avait clairement détecté la
régression vers la moyenne et inventé une histoire causale sans
aucune preuve. L'histoire elle-même pouvait d'ailleurs être vraie.
Peut-être que si nous mesurions le rythme cardiaque des skieurs
avant chaque saut, nous nous apercevrions qu'ils sont effectivement
plus détendus après un premier saut raté. Mais peut-être pas. Ce qu'il
ne faut pas oublier, c'est que le passage du premier au second saut
n'a pas besoin d'une explication causale. C'est une conséquence
mathématiquement inévitable du fait que la chance a joué un rôle
dans le résultat du premier saut. Ce n'est peut-être pas très
satisfaisant – nous préférerions tous une histoire causale –, mais il
ne faut pas chercher plus loin.
Comprendre la régression vers la moyenne
Qu'il n'ait pas été détecté ou qu'il ait été mal expliqué, le
phénomène de la régression paraît étrange à l'esprit humain. Si
étrange, d'ailleurs, qu'il n'a été identifié et compris pour la première
fois que deux cents ans après la théorie de la gravitation et le calcul
différentiel. De plus, il a fallu un des meilleurs esprits de la Grande-
Bretagne du XIXe siècle pour en trouver le sens, et encore, non sans
peine.
La régression vers la moyenne a été découverte et nommée à la
fin du XIXe siècle par sir Francis Galton, cousin éloigné de Charles
Darwin et polymathe réputé. On perçoit encore la passion de la
découverte dans un article qu'il publia en 1886 sous le titre
« Régression vers la médiocrité dans la stature héréditaire », qui fait
état de mesures de la taille chez des générations successives et
compare la taille des enfants à celle des parents. À propos de ses
études sur les semences, il écrivait :
Elles donnèrent des résultats qui semblaient dignes d'intérêt, et je m'en servis pour étayer une conférence
devant la Royal Institution le 9 février 1877. À la lueur de ces expériences, il apparaissait que les rejetons
n'avaient pas tendance à ressembler à leurs parents par la taille, mais semblaient toujours être plus médiocres
qu'eux – plus petits qu'eux si les parents étaient grands ; plus grands si les parents étaient très petits […]. Les
expériences montrèrent en outre que la régression filiale moyenne vers la médiocrité était directement
proportionnelle à la déviation parentale par rapport à ladite moyenne.
Galton s'attendait manifestement à ce que son docte public de la
Royal Institution – la plus ancienne société de recherche
indépendante du monde – soit aussi surpris que lui par son
observation « digne d'intérêt ». Ce qui est vraiment digne d'intérêt,
c'est qu'il a été surpris par une régularité statistique aussi courante
que l'air que nous respirons. Partout où nous portons notre regard,
les effets de la régression sont là, au vu et au su de tous, mais nous
ne les reconnaissons pas pour ce qu'ils sont. Il a fallu des années à
Galton pour parcourir le chemin séparant sa découverte de la
régression filiale en taille de la notion, plus générale, qu'une
régression se produit inévitablement quand la corrélation entre deux
mesures est imparfaite, et il ne parvint à cette conclusion qu'avec
l'aide des statisticiens les plus brillants de son temps 159 .
Un des obstacles que Galton dut surmonter était le problème de la
mesure de la régression entre des variables calculées sur des échelles différentes, comme le poids et le fait de jouer du piano. On y
parvient en se servant de la population comme d'un étalon de
référence. Imaginez que le poids et le fait de jouer du piano aient été
mesurés chez cent enfants dans toutes les classes d'une école
primaire, et qu'ils aient été classés du plus fort au plus faible dans
chaque domaine. Si Jane est troisième en piano et vingt-septième en
poids, on peut dire qu'elle joue mieux du piano qu'elle n'est mince.
Autorisons-nous quelques suppositions qui nous simplifieront les
choses :
Quel que soit l'âge,
◆ le succès au piano ne dépend que de quelques heures d'exercices par semaine ;
◆ le poids ne dépend que de la consommation de glace ;
◆ la consommation de glace et les heures d'exercices hebdomadaires ne sont pas liées.
Maintenant, à l'aide de classements (ou des variables centrées
réduites 160 que préfèrent les statisticiens), nous pouvons écrire
quelques équations :
poids = âge + consommation de glace
piano = âge + heures d'exercices hebdomadaires
Nous assisterons ainsi à une régression vers la moyenne quand
nous prédirons la compétence au piano à partir du poids, et vice
versa. Si tout ce que vous savez de Tom, c'est qu'il est douzième en
poids (nettement au-dessus de la moyenne), vous pouvez en déduire
(statistiquement) qu'il est probablement plus vieux que la moyenne
et aussi qu'il consomme probablement plus de glaces que d'autres
enfants. Si tout ce que vous savez de Barbara, c'est qu'elle est
quatre-vingt-cinquième en piano (très en dessous de la moyenne du
groupe), vous pouvez en déduire qu'elle est sans doute jeune et
qu'elle répète moins que la plupart des autres enfants.
Le coefficient de corrélation entre deux mesures, qui varie entre
0 et 1, est une mesure du poids relatif des facteurs qu'ils ont en commun. Par exemple, nous partageons tous la moitié de nos gènes
avec chacun de nos parents, et pour des caractéristiques sur
lesquelles les facteurs environnementaux ont relativement peu
d'influence, comme la taille, la corrélation entre parent et enfant
n'est pas loin de 0,5 161 . Pour apprécier le sens de la mesure de
corrélation, voici quelques exemples de coefficients :
◆ La corrélation entre la taille de différents objets mesurés avec précision est de 1. Tout facteur qui influence une
mesure influence aussi l'autre ; 100 % de déterminants sont partagés.
◆ 162 La corrélation entre la taille et le poids des hommes adultes américains est de 0,41 . Si vous incluiez les femmes
et les enfants, la corrélation serait beaucoup plus importante, parce que le genre et l'âge des individus influencent à la fois leur taille et leur poids, renforçant l'importance relative des facteurs partagés.
◆ 163 La corrélation entre le revenu et le niveau d'éducation aux États-Unis est approximativement de 0,40 .
◆ La corrélation entre le revenu d'une famille et les quatre derniers chiffres de son numéro de téléphone est de 0.
Il fallut des années à Francis Galton pour comprendre que la
corrélation et la régression ne sont pas deux concepts, mais bien
deux perspectives différentes du même concept164 . La règle
générale est simple, mais elle a des conséquences étonnantes :
chaque fois que la corrélation entre deux scores est imparfaite, il y
aura régression vers la moyenne. Pour illustrer la découverte de
Galton, prenons cette proposition que la plupart des gens trouvent
fort intéressante :
Les femmes très intelligentes ont tendance à épouser des
hommes moins intelligents qu'elles.
Si vous voulez lancer une conversation à une soirée, demandez
donc à vos amis de vous l'expliquer, et ils ne demanderont pas
mieux. Même les gens qui ont des notions de statistiques
interpréteront spontanément cette déclaration en termes causaux.
Certains peuvent se dire que les femmes très intelligentes cherchent
à éviter la concurrence d'hommes aussi intelligents qu'elles, ou
qu'elles sont contraintes à des compromis dans le choix de leur
partenaire parce que les hommes intelligents ne veulent pas être en
concurrence avec des femmes intelligentes. Si la soirée est animée, vous aurez droit à des explications encore plus tirées par les
cheveux. Considérez maintenant la déclaration suivante :
La corrélation entre le niveau d'intelligence de deux conjoints
est loin d'être parfaite.
Une déclaration manifestement vraie, mais pas intéressante du
tout. Qui s'attendrait à ce que cette corrélation soit parfaite ? Il n'y a
rien à expliquer. Mais la déclaration que vous avez trouvée
intéressante et celle que vous avez jugée banale sont équivalentes
sur le plan algébrique. Si la corrélation entre l'intelligence des
conjoints n'est pas parfaite (et si hommes et femmes, en moyenne,
ne diffèrent pas en intelligence), alors il est mathématiquement
inévitable que des femmes très intelligentes soient mariées à des
hommes en moyenne moins intelligents qu'elles (et vice versa, bien
sûr). La régression vers la moyenne que l'on observe ne peut pas être
plus intéressante ou plus explicable que l'imperfection de la
corrélation.
Vous éprouvez sans doute de la sympathie pour les difficultés que
rencontra Galton avec le concept de régression. Vous n'êtes pas le
seul : le statisticien David Freedman avait coutume de dire que,
quand la question de la régression est évoquée dans un procès pénal
ou civil, la partie qui doit l'expliquer au jury est sûre de perdre.
Pourquoi est-ce si difficile ? La principale raison de cette difficulté
est un thème récurrent de ce livre : notre esprit est profondément
biaisé en faveur d'explications causales et gère mal les « simples
statistiques ». Quand on attire notre attention sur un événement, la
mémoire associative va en rechercher la cause – plus précisément,
l'activation s'étendra automatiquement à toute cause déjà stockée
dans la mémoire. Des explications causales seront évoquées quand
une régression est détectée, mais elles seront fausses parce que la
vérité, c'est que la régression vers la moyenne a une explication,
mais elle n'a pas de cause. L'événement qui attire notre attention
dans le tournoi de golf est la détérioration fréquente des performances des golfeurs qui ont réussi le premier jour. La
meilleure explication en est que ces golfeurs ont eu une chance
inhabituelle ce jour-là, mais il manque à cette explication la force
causale que préfèrent nos esprits. Du reste, nous payons fort bien
des gens pour qu'ils nous expliquent les effets de régression de façon
intéressante. Un commentateur économique qui annoncerait
correctement que « les marchés se sont mieux portés cette année
parce qu'ils ont souffert l'an dernier » ne resterait sans doute pas
longtemps sur nos écrans. Nos difficultés avec le concept de la
régression trouvent leur origine autant dans le Système 1 que dans le
Système 2. Sans instruction spécialisée, et dans bien des cas, même
après avoir reçu une formation en statistiques, la relation entre la
corrélation et la régression reste obscure. Le Système 2 peine à la
comprendre et à l'apprendre. Cela est dû en partie au besoin insistant
d'interprétations causales, une caractéristique du Système 1.
La condition des enfants dépressifs traités avec une boisson
énergisante s'améliore nettement au bout de trois mois.
Ce gros titre est de mon cru, mais le fait, lui, est vrai : si vous
traitez un groupe d'enfants dépressifs pendant un certain temps avec
des boissons énergisantes, ils montrent une amélioration
significative en termes cliniques. C'est aussi le cas des enfants
dépressifs qui passent du temps la tête en bas ou qui tiennent un chat
dans leurs bras vingt minutes par jour. La plupart des lecteurs de ce
gros titre en déduiront automatiquement que l'amélioration est liée à
la boisson énergisante ou au fait de tenir un chat, mais cette
conclusion ne se justifie absolument pas. Les enfants dépressifs
constituent un groupe extrême, ils sont plus déprimés que les autres
enfants – et les groupes extrêmes régressent vers la moyenne avec le
temps. La corrélation entre les résultats des tests de dépression
réalisés à plusieurs reprises est imparfaite, et il y aura donc
régression vers la moyenne : les enfants dépressifs finiront par aller
mieux au bout d'un moment, même s'ils ne tiennent pas de chat dans leurs bras ou ne boivent pas de Red Bull. Pour pouvoir conclure
qu'une boisson énergisante – ou n'importe quel autre traitement – est
efficace, vous devez comparer un groupe de patients qui reçoit ce
traitement à un « groupe de contrôle » qui n'en reçoit aucun (ou,
mieux encore, qui reçoit un placebo). Le groupe de contrôle devrait,
lui, s'améliorer uniquement par l'effet de la régression, et le but de
l'expérience est de déterminer si les patients traités présentent une
amélioration supérieure à ce que pourrait expliquer la régression.
Les interprétations causales incorrectes des effets de la régression
ne concernent pas que les lecteurs de la presse populaire. Le
statisticien Howard Wainer a dressé une longue liste de chercheurs
éminents qui ont commis la même erreur – ils ont confondu une 165 simple corrélation avec la relation causale . Les effets de
régression sont une source courante de problèmes dans la recherche,
et les scientifiques chevronnés nourrissent une saine méfiance face
au piège de la déduction causale infondée.
Un de mes exemples favoris d'erreur de la prédiction intuitive est
tiré de l'excellent texte de Max Bazerman, Le Jugement dans les
prises de décision managériales :
Vous êtes le prévisionniste des ventes d'une chaîne de
supermarchés. Toutes les boutiques sont de même taille et
proposent les mêmes articles, mais leurs ventes diffèrent pour
des questions d'emplacement, de concurrence et de facteurs
aléatoires. On vous transmet les résultats pour 2011 et on vous
demande de prédire les ventes pour 2012. On vous a
recommandé d'accepter la prédiction d'ensemble des
économistes, qui assurent que les ventes vont globalement
augmenter de 10 %. Comment compléteriez-vous le tableau
suivant ?
Après avoir lu ce chapitre, vous savez que la solution évidente,
qui consiste à ajouter 10 % aux ventes de chaque magasin, est
erronée. Il faut que vos prévisions soient régressives, ce qui signifie
ajouter plus de 10 % aux succursales dont les performances sont
plus faibles, et moins (voire retrancher un certain montant) aux
autres. Mais si vous posez la question à d'autres personnes, vous
allez sans doute vous heurter à leur perplexité : pourquoi venir les
ennuyer avec une question évidente ? Comme Galton l'avait
découvert à ses dépens, le concept de la régression est loin d'être
évident.
*
La régression vers la moyenne en bref
« La critique est plus efficace que les félicitations, a-t-elle appris
d'expérience. Mais ce qu'elle ne comprend pas, c'est que tout est dû
à la régression vers la moyenne. »
« Peut-être son deuxième entretien a-t-il été moins impressionnant
que le premier parce qu'il avait peur de nous décevoir, mais il est
plus probable que son premier entretien était inhabituellement bon. »
« Notre procédure de sélection est bonne, mais elle n'est pas
parfaite, donc, nous devrions anticiper la régression. Nous ne
devrions pas être surpris que les meilleurs candidats ne répondent
souvent pas à nos attentes. »
OceanofPDF.com