Système 1, système 2 : les deux vitesses de la pensée

17 - Régression vers la moyenne

17

 

Régression vers la moyenne

 

C'est quand j'enseignais la psychologie d'un entraînement efficace

à des instructeurs de l'Armée de l'air israélienne que je connus l'une

des expériences les plus satisfaisantes de ma carrière. Je leur parlais

d'un principe important de la formation spécialisée : il est plus

efficace de récompenser une amélioration que de punir une erreur.

Cette proposition s'appuie sur les nombreuses preuves fournies par

des recherches effectuées sur des pigeons, des rats, des hommes et

d'autres animaux.

Quand j'eus terminé mon discours enthousiaste, un des

instructeurs les plus aguerris leva la main et prit la parole. Il

commença par reconnaître que le fait de récompenser la

performance était sans doute bon pour les oiseaux, mais il niait que

cela soit la meilleure solution pour les élèves pilotes. Voici ce qu'il

dit : « J'ai bien souvent félicité des élèves pour l'exécution parfaite

d'une manœuvre acrobatique. En général, quand ils la retentent

ensuite, ils s'en tirent moins bien. Alors que j'ai souvent hurlé dans

les écouteurs d'un élève qui a raté sa manœuvre, et en général, il s'en

tire beaucoup mieux la fois suivante. Donc, je vous en prie, ne venez

pas nous dire que la récompense fonctionne, mais pas la punition,

parce que c'est le contraire qui est vrai. »

Ce fut pour moi une superbe prise de conscience, car je vis sous

un jour nouveau un principe de statistiques que j'enseignais depuis des années. L'instructeur avait raison, mais en même temps, il avait

complètement tort ! Sa remarque était astucieuse et juste : quand il

récompensait une performance, il était probable que la prochaine

prestation de l'élève serait décevante, et les punitions étaient

généralement suivies d'une amélioration. Mais la déduction qu'il en

avait tirée sur l'efficacité de la récompense et de la punition était tout

à fait à côté de la plaque. Ce qu'il avait observé s'appelle la

régression vers la moyenne, qui, dans ce cas, était due aux

fluctuations aléatoires dans la qualité de la performance.

Naturellement, il ne félicitait que les élèves dont les performances

étaient nettement supérieures à la moyenne. Mais l'élève n'avait sans

doute eu que de la chance lors de cette tentative, et il était probable

que sa prestation se détériorât ensuite, qu'il ait ou non été félicité.

De même, il ne devait hurler dans les écouteurs d'un élève que

quand la performance de ce dernier était particulièrement mauvaise,

et donc vouée à s'améliorer quoi que fasse l'instructeur. L'instructeur

avait rattaché une interprétation causale aux fluctuations inévitables

d'un processus aléatoire.

C'était un défi digne d'être relevé, mais je doutais qu'une leçon

d'algèbre de la prédiction soit pleinement appréciée. Au lieu de cela,

je pris une craie pour dessiner une cible au sol. Je demandai à tous

les officiers présents de tourner le dos à la cible et de lancer

rapidement dessus deux pièces, sans regarder. Nous avons mesuré la

distance des pièces par rapport à la cible et écrit au tableau les deux

résultats de chaque concurrent. Puis nous les avons ordonnés, de la

meilleure à la pire au premier essai. Il était évident que la plupart de

ceux qui avaient bien visé la première fois (mais pas tous) avaient

fait moins bien au second lancer, et que ceux qui avaient obtenu un

piètre résultat la première fois s'étaient ensuite améliorés. Je fis

remarquer aux instructeurs que ce qu'ils voyaient au tableau

coïncidait avec ce que nous avions entendu sur les résultats des

manœuvres acrobatiques : une mauvaise performance était suivie

d'une amélioration, et une bonne d'une détérioration, sans

intervention ni de félicitations, ni de réprimandes.

Ce jour-là, j'avais découvert que les instructeurs de vol étaient

pris au piège d'une contingence malheureuse : comme ils punissaient les élèves quand leurs performances étaient mauvaises, ils étaient le

plus souvent récompensés par une amélioration consécutive, même

si, en réalité, la punition n'avait aucun effet. De plus, les instructeurs

n'étaient pas les seuls à devoir faire face à cet embarras. Je venais de

tomber sur un phénomène significatif de la condition humaine : la

vie nous expose à des informations perverses. Comme nous avons

tendance à être gentils avec les autres quand ils nous font plaisir et

agressifs quand ils nous déplaisent, nous sommes statistiquement

punis pour notre gentillesse et récompensés pour notre méchanceté.

 

Le talent et la chance

 

Il y a quelques années, John Brockman, aujourd'hui rédacteur en

chef du magazine en ligne Edge, a demandé à plusieurs scientifiques

de citer leur « équation préférée ». Voici ce que j'ai proposé :

 

Succès = talent + chance

Grand succès = un peu plus de talent + beaucoup de chance

 

L'idée, qui n'a rien de surprenant, que la chance contribue souvent

au succès a des conséquences étonnantes quand on l'applique aux

deux premiers jours d'un tournoi de golf de haut niveau. Pour faire

simple, partons du principe que sur les deux jours, le score moyen

des concurrents était un par de 72. Concentrons-nous sur un joueur

qui a eu une excellente journée, puisqu'il a fini sur un score de 66.

Que nous apprend ce score remarquable ? On peut immédiatement

en déduire que ce golfeur est plus talentueux que la moyenne des

participants au tournoi. La formule du succès suggère que l'on

pourrait également parvenir à une autre déduction : le golfeur qui

s'en est si bien tiré le premier jour a sans doute eu en moyenne plus

de chance que d'habitude. Si vous admettez que le talent et la chance

contribuent l'un et l'autre au succès, il est tout aussi légitime de

conclure que le golfeur a eu de la chance que de dire qu'il a du

talent.

Selon le même principe, si vous vous intéressez à un joueur qui a

fini avec un score de 5 au-dessus du par ce jour-là, vous avez des

raisons de déduire à la fois qu'il est plutôt mauvais, et qu'il n'était

pas dans un bon jour. Bien sûr, vous savez qu'aucune de ces

déductions n'est sûre. Il est tout à fait possible que le golfeur avec 77

est en réalité très talentueux, mais qu'il a connu une journée

particulièrement catastrophique. Malgré cette incertitude, les

déductions suivantes à partir des résultats de la première journée

sont plausibles et seront plus souvent correctes qu'erronées.

 

Score au-dessus de la moyenne le premier jour = talent au-

dessus de la moyenne + chance le premier jour

 

et

 

score en dessous de la moyenne le premier jour = talent en

dessous de la moyenne + malchance le premier jour

 

Maintenant, supposons que vous connaissiez le score d'un golfeur

pour le premier jour et que l'on vous demande de prédire son score

pour le lendemain. Vous vous attendez à ce qu'il conserve le même

niveau de talent le jour suivant, donc, vous estimerez que le talent

du premier joueur sera « au-dessus de la moyenne » et celui du

deuxième « en dessous de la moyenne ». Il en va bien sûr tout à fait

autrement de la chance. Puisque vous n'avez aucun moyen de

prédire la chance des sportifs le deuxième jour (ou quelque jour que

ce soit), vos estimations doivent partir du principe qu'elle sera

moyenne – ni bonne, ni mauvaise. Cela veut dire qu'en l'absence de

toute autre information, votre meilleure estimation du score des

deux joueurs le deuxième jour ne devrait pas être calquée sur leur

performance de la veille. Voici tout ce que vous pouvez dire :

Le golfeur qui a bien joué le premier jour réussira aussi sans

doute le deuxième jour, mais moins que la veille, parce que la

chance inhabituelle dont il a probablement bénéficié ne va

manifestement pas durer.

Le golfeur qui a mal joué le premier jour sera probablement

en dessous de la moyenne le lendemain, mais il s'améliorera,

parce que sa malchance ne durera sans doute pas.

 

Nous nous attendons également à ce que l'écart entre les deux

golfeurs se réduise, même si, selon nos meilleures estimations, le

premier continuera à faire mieux que le second.

Mes étudiants ont toujours été étonnés d'apprendre que la

meilleure performance annoncée pour le deuxième jour est plus

modérée, plus près de la moyenne que les indices sur lesquels elle

est fondée (le score du premier jour). C'est pourquoi cette logique

s'appelle la régression vers la moyenne. Plus le premier score sera

extrême, plus il faut s'attendre à une régression, car un score

particulièrement excellent laisse entrevoir l'intervention d'une

chance tout aussi exceptionnelle. La prédiction régressive est

raisonnable, mais sa précision n'est pas garantie. Certains des

golfeurs qui ont marqué 66 le premier jour feront encore mieux le

lendemain, si leur chance augmente. La plupart feront moins bien,

parce que leur chance ne se situera plus au-dessus de la moyenne.

Maintenant, inversons le temps. Classez les joueurs par leurs

résultats du deuxième jour et considérez leur résultat du premier

jour. Vous retrouverez avec précision la même logique de régression

vers la moyenne. Les golfeurs qui ont fait mieux le deuxième jour

ont probablement eu de la chance ce jour-là, et votre meilleure

estimation, c'est qu'ils ont eu moins de chance la veille et ont donc

obtenu un moins bon score. Le fait que vous observiez une

régression quand vous prédisez un événement antérieur à partir d'un

événement ultérieur devrait vous convaincre que la régression n'a

pas d'explication causale.

Les effets de régression sont partout, de même que les histoires

causales erronées que l'on raconte pour les expliquer. Un exemple

bien connu est la « malédiction de Sports Illustrated », qui veut

qu'un sportif ayant fait la couverture du magazine soit condamné à

de piètres performances à la saison suivante. En guise d'explication,

on évoque souvent l'excès de confiance et la pression face aux

grands espoirs suscités. Mais cette malédiction peut s'expliquer plus

simplement : un sportif qui se retrouve en couverture de Sports

Illustrated doit avoir connu une saison précédente exceptionnelle,

sans doute avec un petit coup de pouce de la chance – or, cette

dernière est capricieuse.

Il se trouve que je suivais la compétition de saut à ski hommes

lors des Jeux olympiques d'hiver quand Amos et moi travaillions à

la rédaction d'un article sur la prédiction intuitive. Chaque skieur a

droit à deux sauts, et les résultats sont additionnés pour obtenir le

score final. Je fus surpris d'entendre le commentateur déclarer : « Le

Norvégien a réalisé un très bon premier saut ; il va être tendu, il doit

vouloir conserver son avance, et il va sans doute faire moins bien »

ou encore : « Le Suédois a raté son premier saut, maintenant, il sait

qu'il n'a plus rien à perdre, il va être détendu, ce qui devrait l'aider à

faire mieux. » Le commentateur avait clairement détecté la

régression vers la moyenne et inventé une histoire causale sans

aucune preuve. L'histoire elle-même pouvait d'ailleurs être vraie.

Peut-être que si nous mesurions le rythme cardiaque des skieurs

avant chaque saut, nous nous apercevrions qu'ils sont effectivement

plus détendus après un premier saut raté. Mais peut-être pas. Ce qu'il

ne faut pas oublier, c'est que le passage du premier au second saut

n'a pas besoin d'une explication causale. C'est une conséquence

mathématiquement inévitable du fait que la chance a joué un rôle

dans le résultat du premier saut. Ce n'est peut-être pas très

satisfaisant – nous préférerions tous une histoire causale –, mais il

ne faut pas chercher plus loin.

 

Comprendre la régression vers la moyenne

Qu'il n'ait pas été détecté ou qu'il ait été mal expliqué, le

phénomène de la régression paraît étrange à l'esprit humain. Si

étrange, d'ailleurs, qu'il n'a été identifié et compris pour la première

fois que deux cents ans après la théorie de la gravitation et le calcul

différentiel. De plus, il a fallu un des meilleurs esprits de la Grande-

Bretagne du XIXe siècle pour en trouver le sens, et encore, non sans

peine.

La régression vers la moyenne a été découverte et nommée à la

fin du XIXe siècle par sir Francis Galton, cousin éloigné de Charles

Darwin et polymathe réputé. On perçoit encore la passion de la

découverte dans un article qu'il publia en 1886 sous le titre

« Régression vers la médiocrité dans la stature héréditaire », qui fait

état de mesures de la taille chez des générations successives et

compare la taille des enfants à celle des parents. À propos de ses

études sur les semences, il écrivait :

 

Elles donnèrent des résultats qui semblaient dignes d'intérêt, et je m'en servis pour étayer une conférence

devant la Royal Institution le 9 février 1877. À la lueur de ces expériences, il apparaissait que les rejetons

n'avaient pas tendance à ressembler à leurs parents par la taille, mais semblaient toujours être plus médiocres

qu'eux – plus petits qu'eux si les parents étaient grands ; plus grands si les parents étaient très petits […]. Les

expériences montrèrent en outre que la régression filiale moyenne vers la médiocrité était directement

proportionnelle à la déviation parentale par rapport à ladite moyenne.

 

Galton s'attendait manifestement à ce que son docte public de la

Royal Institution – la plus ancienne société de recherche

indépendante du monde – soit aussi surpris que lui par son

observation « digne d'intérêt ». Ce qui est vraiment digne d'intérêt,

c'est qu'il a été surpris par une régularité statistique aussi courante

que l'air que nous respirons. Partout où nous portons notre regard,

les effets de la régression sont là, au vu et au su de tous, mais nous

ne les reconnaissons pas pour ce qu'ils sont. Il a fallu des années à

Galton pour parcourir le chemin séparant sa découverte de la

régression filiale en taille de la notion, plus générale, qu'une

régression se produit inévitablement quand la corrélation entre deux

mesures est imparfaite, et il ne parvint à cette conclusion qu'avec

l'aide des statisticiens les plus brillants de son temps 159 .

Un des obstacles que Galton dut surmonter était le problème de la

mesure de la régression entre des variables calculées sur des échelles différentes, comme le poids et le fait de jouer du piano. On y

parvient en se servant de la population comme d'un étalon de

référence. Imaginez que le poids et le fait de jouer du piano aient été

mesurés chez cent enfants dans toutes les classes d'une école

primaire, et qu'ils aient été classés du plus fort au plus faible dans

chaque domaine. Si Jane est troisième en piano et vingt-septième en

poids, on peut dire qu'elle joue mieux du piano qu'elle n'est mince.

Autorisons-nous quelques suppositions qui nous simplifieront les

choses :

Quel que soit l'âge,

 

◆ le succès au piano ne dépend que de quelques heures d'exercices par semaine ;

◆ le poids ne dépend que de la consommation de glace ;

◆ la consommation de glace et les heures d'exercices hebdomadaires ne sont pas liées.

 

Maintenant, à l'aide de classements (ou des variables centrées

réduites 160 que préfèrent les statisticiens), nous pouvons écrire

quelques équations :

 

poids = âge + consommation de glace

piano = âge + heures d'exercices hebdomadaires

 

Nous assisterons ainsi à une régression vers la moyenne quand

nous prédirons la compétence au piano à partir du poids, et vice

versa. Si tout ce que vous savez de Tom, c'est qu'il est douzième en

poids (nettement au-dessus de la moyenne), vous pouvez en déduire

(statistiquement) qu'il est probablement plus vieux que la moyenne

et aussi qu'il consomme probablement plus de glaces que d'autres

enfants. Si tout ce que vous savez de Barbara, c'est qu'elle est

quatre-vingt-cinquième en piano (très en dessous de la moyenne du

groupe), vous pouvez en déduire qu'elle est sans doute jeune et

qu'elle répète moins que la plupart des autres enfants.

Le coefficient de corrélation entre deux mesures, qui varie entre

0 et 1, est une mesure du poids relatif des facteurs qu'ils ont en commun. Par exemple, nous partageons tous la moitié de nos gènes

avec chacun de nos parents, et pour des caractéristiques sur

lesquelles les facteurs environnementaux ont relativement peu

d'influence, comme la taille, la corrélation entre parent et enfant

n'est pas loin de 0,5 161 . Pour apprécier le sens de la mesure de

corrélation, voici quelques exemples de coefficients :

 

◆ La corrélation entre la taille de différents objets mesurés avec précision est de 1. Tout facteur qui influence une

mesure influence aussi l'autre ; 100 % de déterminants sont partagés.

◆ 162 La corrélation entre la taille et le poids des hommes adultes américains est de 0,41 . Si vous incluiez les femmes

et les enfants, la corrélation serait beaucoup plus importante, parce que le genre et l'âge des individus influencent à la fois leur taille et leur poids, renforçant l'importance relative des facteurs partagés.

◆ 163 La corrélation entre le revenu et le niveau d'éducation aux États-Unis est approximativement de 0,40 .

◆ La corrélation entre le revenu d'une famille et les quatre derniers chiffres de son numéro de téléphone est de 0.

 

Il fallut des années à Francis Galton pour comprendre que la

corrélation et la régression ne sont pas deux concepts, mais bien

deux perspectives différentes du même concept164 . La règle

générale est simple, mais elle a des conséquences étonnantes :

chaque fois que la corrélation entre deux scores est imparfaite, il y

aura régression vers la moyenne. Pour illustrer la découverte de

Galton, prenons cette proposition que la plupart des gens trouvent

fort intéressante :

 

Les femmes très intelligentes ont tendance à épouser des

hommes moins intelligents qu'elles.

 

Si vous voulez lancer une conversation à une soirée, demandez

donc à vos amis de vous l'expliquer, et ils ne demanderont pas

mieux. Même les gens qui ont des notions de statistiques

interpréteront spontanément cette déclaration en termes causaux.

Certains peuvent se dire que les femmes très intelligentes cherchent

à éviter la concurrence d'hommes aussi intelligents qu'elles, ou

qu'elles sont contraintes à des compromis dans le choix de leur

partenaire parce que les hommes intelligents ne veulent pas être en

concurrence avec des femmes intelligentes. Si la soirée est animée, vous aurez droit à des explications encore plus tirées par les

cheveux. Considérez maintenant la déclaration suivante :

 

La corrélation entre le niveau d'intelligence de deux conjoints

est loin d'être parfaite.

 

Une déclaration manifestement vraie, mais pas intéressante du

tout. Qui s'attendrait à ce que cette corrélation soit parfaite ? Il n'y a

rien à expliquer. Mais la déclaration que vous avez trouvée

intéressante et celle que vous avez jugée banale sont équivalentes

sur le plan algébrique. Si la corrélation entre l'intelligence des

conjoints n'est pas parfaite (et si hommes et femmes, en moyenne,

ne diffèrent pas en intelligence), alors il est mathématiquement

inévitable que des femmes très intelligentes soient mariées à des

hommes en moyenne moins intelligents qu'elles (et vice versa, bien

sûr). La régression vers la moyenne que l'on observe ne peut pas être

plus intéressante ou plus explicable que l'imperfection de la

corrélation.

Vous éprouvez sans doute de la sympathie pour les difficultés que

rencontra Galton avec le concept de régression. Vous n'êtes pas le

seul : le statisticien David Freedman avait coutume de dire que,

quand la question de la régression est évoquée dans un procès pénal

ou civil, la partie qui doit l'expliquer au jury est sûre de perdre.

Pourquoi est-ce si difficile ? La principale raison de cette difficulté

est un thème récurrent de ce livre : notre esprit est profondément

biaisé en faveur d'explications causales et gère mal les « simples

statistiques ». Quand on attire notre attention sur un événement, la

mémoire associative va en rechercher la cause – plus précisément,

l'activation s'étendra automatiquement à toute cause déjà stockée

dans la mémoire. Des explications causales seront évoquées quand

une régression est détectée, mais elles seront fausses parce que la

vérité, c'est que la régression vers la moyenne a une explication,

mais elle n'a pas de cause. L'événement qui attire notre attention

dans le tournoi de golf est la détérioration fréquente des performances des golfeurs qui ont réussi le premier jour. La

meilleure explication en est que ces golfeurs ont eu une chance

inhabituelle ce jour-là, mais il manque à cette explication la force

causale que préfèrent nos esprits. Du reste, nous payons fort bien

des gens pour qu'ils nous expliquent les effets de régression de façon

intéressante. Un commentateur économique qui annoncerait

correctement que « les marchés se sont mieux portés cette année

parce qu'ils ont souffert l'an dernier » ne resterait sans doute pas

longtemps sur nos écrans. Nos difficultés avec le concept de la

régression trouvent leur origine autant dans le Système 1 que dans le

Système 2. Sans instruction spécialisée, et dans bien des cas, même

après avoir reçu une formation en statistiques, la relation entre la

corrélation et la régression reste obscure. Le Système 2 peine à la

comprendre et à l'apprendre. Cela est dû en partie au besoin insistant

d'interprétations causales, une caractéristique du Système 1.

 

La condition des enfants dépressifs traités avec une boisson

énergisante s'améliore nettement au bout de trois mois.

 

Ce gros titre est de mon cru, mais le fait, lui, est vrai : si vous

traitez un groupe d'enfants dépressifs pendant un certain temps avec

des boissons énergisantes, ils montrent une amélioration

significative en termes cliniques. C'est aussi le cas des enfants

dépressifs qui passent du temps la tête en bas ou qui tiennent un chat

dans leurs bras vingt minutes par jour. La plupart des lecteurs de ce

gros titre en déduiront automatiquement que l'amélioration est liée à

la boisson énergisante ou au fait de tenir un chat, mais cette

conclusion ne se justifie absolument pas. Les enfants dépressifs

constituent un groupe extrême, ils sont plus déprimés que les autres

enfants – et les groupes extrêmes régressent vers la moyenne avec le

temps. La corrélation entre les résultats des tests de dépression

réalisés à plusieurs reprises est imparfaite, et il y aura donc

régression vers la moyenne : les enfants dépressifs finiront par aller

mieux au bout d'un moment, même s'ils ne tiennent pas de chat dans leurs bras ou ne boivent pas de Red Bull. Pour pouvoir conclure

qu'une boisson énergisante – ou n'importe quel autre traitement – est

efficace, vous devez comparer un groupe de patients qui reçoit ce

traitement à un « groupe de contrôle » qui n'en reçoit aucun (ou,

mieux encore, qui reçoit un placebo). Le groupe de contrôle devrait,

lui, s'améliorer uniquement par l'effet de la régression, et le but de

l'expérience est de déterminer si les patients traités présentent une

amélioration supérieure à ce que pourrait expliquer la régression.

Les interprétations causales incorrectes des effets de la régression

ne concernent pas que les lecteurs de la presse populaire. Le

statisticien Howard Wainer a dressé une longue liste de chercheurs

 

éminents qui ont commis la même erreur – ils ont confondu une 165 simple corrélation avec la relation causale . Les effets de

régression sont une source courante de problèmes dans la recherche,

et les scientifiques chevronnés nourrissent une saine méfiance face

au piège de la déduction causale infondée.

Un de mes exemples favoris d'erreur de la prédiction intuitive est

tiré de l'excellent texte de Max Bazerman, Le Jugement dans les

prises de décision managériales :

 

Vous êtes le prévisionniste des ventes d'une chaîne de

supermarchés. Toutes les boutiques sont de même taille et

proposent les mêmes articles, mais leurs ventes diffèrent pour

des questions d'emplacement, de concurrence et de facteurs

aléatoires. On vous transmet les résultats pour 2011 et on vous

demande de prédire les ventes pour 2012. On vous a

recommandé d'accepter la prédiction d'ensemble des

économistes, qui assurent que les ventes vont globalement

augmenter de 10 %. Comment compléteriez-vous le tableau

suivant ?

Après avoir lu ce chapitre, vous savez que la solution évidente,

qui consiste à ajouter 10 % aux ventes de chaque magasin, est

erronée. Il faut que vos prévisions soient régressives, ce qui signifie

ajouter plus de 10 % aux succursales dont les performances sont

plus faibles, et moins (voire retrancher un certain montant) aux

autres. Mais si vous posez la question à d'autres personnes, vous

allez sans doute vous heurter à leur perplexité : pourquoi venir les

ennuyer avec une question évidente ? Comme Galton l'avait

découvert à ses dépens, le concept de la régression est loin d'être

évident.

 

*

 

La régression vers la moyenne en bref

 

« La critique est plus efficace que les félicitations, a-t-elle appris

d'expérience. Mais ce qu'elle ne comprend pas, c'est que tout est dû

à la régression vers la moyenne. »

« Peut-être son deuxième entretien a-t-il été moins impressionnant

que le premier parce qu'il avait peur de nous décevoir, mais il est

plus probable que son premier entretien était inhabituellement bon. »

« Notre procédure de sélection est bonne, mais elle n'est pas

parfaite, donc, nous devrions anticiper la régression. Nous ne

devrions pas être surpris que les meilleurs candidats ne répondent

souvent pas à nos attentes. »

 

OceanofPDF.com