Une moyenne dit où se trouvent les données. Elle ne dit rien de leur étalement, ni de la façon dont deux mesures varient ensemble. Ces deux questions se règlent avec une seule idée : multiplier des écarts à la moyenne.
Multiplier l'écart d'une donnée par lui-même donne un carré, dont l'aire moyenne est la variance. Multiplier l'écart de x par l'écart de y donne un rectangle signé, dont l'aire moyenne est la covariance. Tout le reste — écart-type, corrélation, régression, ellipse des données, risque d'un portefeuille — n'est que la mise en forme de ces deux aires.
Chaque donnée est à une certaine distance de la moyenne. Élevons cette distance au carré : nous obtenons un carré véritable, dessiné ci-dessous. La variance est l'aire moyenne de ces carrés. Le curseur m déplace le point de référence : l'aire moyenne est minimale exactement à la moyenne, et c'est là sa définition la plus solide.
La somme des écarts à la moyenne est nulle — c'est pourquoi on ne peut pas mesurer l'étalement avec les écarts eux-mêmes : ils se compensent exactement. Les élever au carré supprime les signes, et la parabole du bas montre que le minimum de l'aire moyenne tombe précisément sur x̄ : la moyenne n'est pas seulement le centre de gravité, c'est le point qui minimise la distance quadratique.
Le minimum est cherché à l'aveugle, par section dorée, sans utiliser la moyenne : il retombe sur x̄, mais à 10−8 près seulement, alors que la valeur du minimum est exacte au dernier chiffre. C'est la signature d'un minimum plat : au voisinage du sommet d'une parabole, une erreur h sur la position ne coûte qu'une erreur en h² sur l'aire.
La formule de König–Huygens, V = moyenne des x² − (moyenne des x)², donne la même valeur par un tout autre chemin ; l'écart entre les deux calculs est du bruit d'arrondi. Enfin, si l'on change d'unité, Var(aX + b) = a²·Var(X) : le décalage b ne change rien, le facteur a agit au carré. L'écart-type σ, racine de la variance, revient à l'unité des données.
Deux mesures cette fois. Pour chaque point du nuage, on trace le rectangle qui joint le point au centre du nuage : sa largeur est xi − x̄, sa hauteur yi − ȳ. Il est compté positivement si le point est en haut à droite ou en bas à gauche, négativement sinon. La covariance est l'aire moyenne de ces rectangles signés.
Le signe de la covariance est celui de la tendance : positif si les deux mesures s'écartent de leur moyenne dans le même sens, négatif si elles s'opposent. Poussez le curseur de liaison vers zéro : les rectangles bleus et rouges se compensent et la somme cumulée du bas s'aplatit.
Trois vérifications tombent au bruit d'arrondi près. La covariance d'une variable avec elle-même est sa variance : la variance n'est qu'un cas particulier de covariance. La formule moyenne des xy − x̄·ȳ redonne la même valeur. Et Var(X + Y) = Var(X) + Var(Y) + 2·Cov(X, Y) : c'est le terme de covariance qui explique pourquoi les variances ne s'additionnent que si les variables sont décorrélées.
Reste un défaut sérieux : la covariance se mesure en produit des unités — des centimètres-kilogrammes — et sa valeur change si l'on change d'unité. Elle ne se compare pas d'un tableau à l'autre. D'où la planche suivante.
Divisons la covariance par le produit des deux écarts-types. Le résultat, noté r, n'a plus d'unité, reste entre −1 et 1, et ne bouge pas quand on change d'unité — vérifiez-le avec le curseur. Son carré est la part de la variance de Y que la droite de régression explique.
Quatre jeux de onze points construits par Francis Anscombe en 1973. Mêmes moyennes, mêmes variances, même coefficient de corrélation, même droite de régression — les valeurs ci-dessous coïncident toutes à deux décimales, Anscombe ayant arrondi ses données — et quatre situations qui n'ont rien à voir. Aucun résumé chiffré ne remplace le tracé du nuage.
L'inégalité de Cauchy–Schwarz garantit |Cov(X, Y)| ≤ σx·σy, donc |r| ≤ 1, avec égalité seulement si les points sont alignés. Le coefficient r mesure donc l'alignement, pas la pente : multipliez l'unité de X par huit, la covariance et la pente sont multipliées ou divisées d'autant, r ne bouge pas d'un chiffre.
La barre du bas décompose la variance de Y en deux morceaux qui s'additionnent exactement : ce que la droite reproduit et ce qu'elle laisse. Le premier morceau rapporté au total vaut r² — c'est tout le sens de l'expression « variance expliquée ».
Les deux variances et la covariance se rangent dans une matrice symétrique 2×2. Elle contient toute la dispersion du nuage : l'ellipse tracée est son portrait, ses axes propres sont les directions où la variance est maximale et minimale. Tournez l'axe de projection et regardez la variance projetée décrire sa courbe.
La variance dans une direction u = (cos θ, sin θ) vaut uTΣu = cos²θ·Vx + 2·cosθ·sinθ·C + sin²θ·Vy. La courbe du bas est cette fonction ; ses deux extrema sont les valeurs propres de la matrice, et la recherche numérique du maximum par section dorée retombe sur λ₁ à quelques chiffres décimaux près, sans jamais avoir écrit le polynôme caractéristique.
Deux quantités ne dépendent pas de la direction choisie. La trace, somme des deux variances, égale λ₁ + λ₂ : c'est l'inertie totale du nuage, et la courbe « variance en θ plus variance en θ+90° » est parfaitement plate. Le déterminant, λ₁λ₂, vaut VxVy(1 − r²) : il s'effondre quand le nuage s'aplatit sur une droite. Chercher l'axe de plus grande variance, c'est exactement ce que fait le premier axe d'une analyse en composantes principales.
La covariance ne mesure qu'une chose : la tendance linéaire commune. Trois expériences montrent ce qu'elle manque, ce qu'elle inverse, et ce qu'elle commande.
Premier volet. Sur la parabole, Y est une fonction exacte de X : connaître x, c'est connaître y sans la moindre incertitude. Pourtant la covariance est nulle au dernier chiffre, parce que la dépendance est symétrique et qu'aucune droite ne la capte. Le rapport de corrélation η², qui compare la variance des moyennes par tranche à la variance totale, voit lui la dépendance et monte au voisinage de 1. Décorrélation n'est donc pas indépendance ; la réciproque, elle, reste vraie.
Passez à l'anneau ou à la croix, et η² s'effondre à son tour : dans chaque tranche verticale, la moyenne de y est nulle, et un indicateur qui ne regarde que des moyennes ne peut rien y voir. Ce qui change d'une tranche à l'autre, c'est la dispersion de y — d'où la troisième barre, le même η² appliqué à y², qui remonte aussitôt près de 1. Chaque indicateur ne détecte que ce qu'il regarde ; le tracé du nuage, lui, montre tout.
Deuxième volet. Trois groupes, à l'intérieur desquels la liaison est franchement négative. En les écartant le long d'une diagonale montante, la covariance globale change de signe sans qu'aucun point n'ait changé de forme dans son groupe. La décomposition affichée l'explique exactement : la covariance totale est la somme d'une part intra-groupe, restée négative, et d'une part inter-groupe, née du seul écartement des centres. C'est le paradoxe de Simpson, et il suffit d'oublier une variable de groupe pour lire une liaison de signe contraire à la vérité.
Troisième volet. Répartir un capital sur n titres de même risque σ et de corrélation commune ρ donne une variance σ²(1 + (n−1)ρ)/n, mesurée ici par simulation. Elle ne tend pas vers zéro mais vers ρσ² : la part de risque que la diversification supprime est celle qui vient des variances, la part qui reste est celle qui vient des covariances. Tout le sens de la théorie du portefeuille tient dans ce plancher.