Interroger mille personnes pour connaître l’avis de cinquante millions : comment tirer l’échantillon, combien il en faut, ce que coûtent les raccourcis, et pourquoi une énorme enquête mal tirée peut valoir moins qu’une poignée de personnes tirées au sort.
Un sondage consiste à observer une partie seulement d’une population (les électeurs, les ménages, les entreprises…) pour en déduire une grandeur qui la décrit tout entière : une proportion, une moyenne, un total. La partie observée s’appelle l’échantillon, sa taille est notée n, celle de la population N, et le rapport f = n/N est le taux de sondage.
Toute la théorie repose sur une idée simple : si l’on choisit l’échantillon par un tirage au sort dont on connaît les règles, le hasard n’est plus un ennemi, c’est un instrument de mesure. On sait alors calculer, avant même d’interroger qui que ce soit, de combien l’estimation risque de s’écarter de la vérité. Les différentes techniques ne sont que des façons plus habiles d’organiser ce tirage.
| Technique | Principe | Outil mathématique | Planche |
|---|---|---|---|
| Sondage aléatoire simple | tous les échantillons de taille n ont la même chance | loi hypergéométrique, variance (1 − f)S²/n, intervalle de confiance | 1 |
| Stratification | on découpe la population en groupes et l’on tire dans chacun | variance ΣWh²(1 − fh)Sh²/nh, allocation de Neyman | 2 |
| Sondage en grappes | on tire des groupes entiers (immeubles, villages) | corrélation intra-grappe ρ, effet de plan 1 + (m − 1)ρ | 3 |
| Tirage systématique | un individu tous les k dans une liste | variance exacte par énumération des k départs | 3 |
| Méthode des quotas | on remplit des cases (sexe, âge…) sans tirage au sort | biais de sélection | 4 |
| Redressement (calage) | on repondère l’échantillon pour retrouver les marges connues | algorithme de Deming-Stephan, effet de pondération 1 + CV² | 4 |
| Enquête non probabiliste massive | ceux qui veulent bien répondre | identité de Meng : erreur = ρ × √((1 − f)/f) × σ | 5 |
Toutes les populations de cette page sont fabriquées par la page elle-même : on connaît donc la vraie réponse, et chaque formule peut être confrontée à des milliers de sondages simulés.
L’idée : si chaque personne a la même chance d’être tirée, la proportion observée dans l’échantillon, notée p̂, tombe « en moyenne » sur la vraie proportion p, et ses écarts obéissent à une loi que l’on sait calculer exactement.
Dans une urne de N personnes dont K répondent « oui », le nombre de « oui » dans un échantillon de n tirées sans remise suit la loi hypergéométrique : P(k) = C(K,k)·C(N−K,n−k) / C(N,n). Son écart-type donne la précision du sondage :
Le premier facteur, proche de 1 − f, est la correction de population finie : tirer sans remise dans une petite population apporte un peu plus d’information. L’intervalle de confiance [p̂ − 1,96 σ̂ ; p̂ + 1,96 σ̂], où σ̂ est calculé avec p̂ faute de connaître p, doit contenir la vraie valeur dans environ 95 % des sondages. Cette promesse repose sur l’approximation normale : essayez p = 5 % avec n = 10, la loi exacte devient très dissymétrique et la couverture s’effondre.
Relisons la formule : N n’apparaît que dans le facteur (N − n)/(N − 1), qui tend vers 1 dès que la population est grande devant l’échantillon. Une cuillère de soupe renseigne sur le goût de la marmite, que la marmite fasse deux litres ou deux cents, pourvu qu’on ait bien remué.
L’idée : si la population se compose de groupes très différents, on tire séparément dans chaque groupe. Le hasard ne peut plus alors donner un échantillon « trop riche » en un groupe ; il ne joue plus qu’à l’intérieur des groupes.
Exemple typique des enquêtes auprès des entreprises : on veut le chiffre d’affaires moyen de 4 560 entreprises, des micro-entreprises aux grands groupes. Les groupes, appelés strates, sont repérés par l’indice h ; chacun a son effectif Nh, son poids Wh = Nh/N, sa dispersion Sh, et l’on y tire nh entreprises au hasard. L’estimateur et sa variance exacte sont :
Reste à répartir les n questionnaires entre strates : c’est l’allocation. Égale (autant par strate), proportionnelle (nh ∝ Nh, l’échantillon est une maquette de la population), ou optimale de Neyman (1934) : nh ∝ Nh Sh, on interroge davantage là où les valeurs sont dispersées. Si le calcul demande plus d’entreprises qu’une strate n’en contient, on la prend en entier : c’est une strate exhaustive, et l’on répartit le reste entre les autres.
L’idée : sur le terrain, on ne dispose pas toujours d’une liste de toute la population, et l’enquêteur ne peut pas traverser le pays pour une seule adresse. On tire alors des groupes entiers, ou un individu sur k dans une liste. C’est moins cher ; reste à savoir ce que l’on perd, ou parfois ce que l’on gagne.
On tire au hasard a immeubles parmi 100, et l’on interroge les 20 ménages de chacun. Mais des voisins se ressemblent : même quartier, même milieu, mêmes conversations. Cette ressemblance se mesure par la corrélation intra-grappe ρ, corrélation moyenne entre deux ménages d’un même immeuble. Interroger 20 voisins apporte alors moins d’information que 20 personnes dispersées. La perte se chiffre par l’effet de plan (Kish, 1965), rapport de la variance obtenue à celle d’un tirage aléatoire simple de même taille :
La relation est exacte avec le petit facteur de gauche, qui vaut ici (2 000 − 1)/(2 000 − 20) : elle découle d’une identité algébrique sur les sommes de carrés, vérifiée ci-dessous.
On dispose d’une liste de 1 260 logements rangés immeuble par immeuble, étage par étage, et l’on veut leur consommation d’eau moyenne. Le tirage systématique choisit un point de départ r au hasard entre 0 et k − 1, puis prend un logement tous les k. Il n’y a que k échantillons possibles, tous équiprobables : on peut donc calculer la variance exactement, en les énumérant tous.
Chaque étage compte dix logements, dont un grand appartement d’angle qui consomme beaucoup plus : la liste a une périodicité de 10. Elle a aussi une tendance : les immeubles récents, en fin de liste, sont plus économes.
L’idée : les instituts français n’utilisent presque jamais le tirage au sort pour les sondages d’opinion, mais la méthode des quotas. On fixe à l’avance combien d’hommes et de femmes de chaque âge il faut interroger, conformément au recensement, et l’on interroge les premiers volontaires jusqu’à remplir chaque case. Puis on redresse l’échantillon par une pondération.
Le danger : dans chaque case, ceux qui acceptent de répondre ne sont pas tirés au hasard. Ici, sur un panel en ligne, les diplômés du supérieur et les personnes intéressées par la politique répondent plus volontiers. Or l’intérêt pour la politique influence aussi l’opinion étudiée, et il n’est dans aucun fichier officiel : c’est une variable cachée.
Le calage sur marges (Deming et Stephan, 1940) cherche des poids wi tels que l’échantillon pondéré retrouve exactement les effectifs connus de la population pour chaque variable. L’algorithme est d’une simplicité désarmante : on multiplie les poids pour caler la première variable, puis la deuxième, et ainsi de suite, et l’on recommence jusqu’à ce que plus rien ne bouge. Les instituts calent aussi sur le vote à l’élection précédente, dont on connaît le résultat officiel : c’est un moyen détourné d’atteindre la variable cachée.
L’idée : dès que la participation n’est plus décidée par un tirage au sort mais par les personnes elles-mêmes, l’erreur ne dépend plus seulement de la taille. Xiao-Li Meng (2018) l’a résumé en une identité exacte, valable pour n’importe quel échantillon, tiré au sort ou non.
Notons Ri = 1 si la personne i a répondu, 0 sinon, et Yi sa réponse. L’erreur de la proportion observée se factorise en trois termes :
Qualité des données : la corrélation, dans la population entière, entre « avoir répondu » et « ce que l’on pense ». Quantité : un terme qui ne dépend que du taux de réponse f. Difficulté du problème : la dispersion σY = √(p(1 − p)). Un tirage au sort rend ρ minuscule, de l’ordre de 1/√N ; une participation volontaire le laisse à une valeur fixe, qui ne diminue pas quand l’échantillon grossit.
Un pays d’un million d’électeurs, dont 52 % voteront « A ». Chacun décide de répondre à une consultation en ligne ; les électeurs de A y sont un peu plus enclins, d’un facteur eβ. On tire une réalisation, on calcule les trois facteurs sur la population entière, et l’on compare leur produit à l’erreur constatée.
Deux enquêtes grossissent côte à côte dans le même million d’électeurs. La première est un tirage de Poisson : chacun est retenu avec la même probabilité f, par un vrai tirage au sort (β = 0). La seconde est la consultation volontaire, avec la propension β réglée ci-dessous. Pour chaque taille, 300 réalisations ; on trace l’erreur quadratique moyenne.
En 1936, la revue américaine Literary Digest envoie dix millions de bulletins-questionnaires, tirés des annuaires téléphoniques et des fichiers de propriétaires d’automobiles. Elle en reçoit plus de deux millions en retour et publie, le 31 octobre : Landon 1 293 669, Roosevelt 972 897. Le 3 novembre, Roosevelt l’emporte avec 60,80 % des voix contre 36,54 %. Au même moment, George Gallup, avec un échantillon bien plus petit construit selon des quotas, annonce la victoire de Roosevelt. Appliquons l’identité de Meng à ces chiffres, en nous limitant aux deux candidats.
Un tirage au sort de règles connues permet de calculer la précision avant l’enquête. Elle dépend de la taille n de l’échantillon et décroît en 1/√n, presque pas de la taille de la population.
Stratifier la réduit, d’autant plus que les strates diffèrent ; tirer des grappes l’augmente d’un facteur 1 + (m − 1)ρ ; le tirage systématique peut être excellent ou désastreux selon l’ordre de la liste.
Quotas et redressement corrigent ce qui est lié aux variables de calage, rien d’autre. Quand la participation dépend de l’opinion, l’erreur cesse de diminuer avec n : ρ compte plus que le nombre de réponses.
L’estimateur de Horvitz-Thompson. Si l’individu i a la probabilité πi d’être tiré, le total t = Σ yi est estimé sans biais par t̂ = Σéchantillon yi/πi : chaque répondant « représente » 1/πi personnes. Le sondage aléatoire simple (πi = n/N) et le sondage stratifié (πi = nh/Nh) en sont des cas particuliers ; les poids de calage de la planche 4 en sont une version corrigée.
Estimer la variance. Les formules des planches supposent connues les dispersions S² ou Sh² de la population ; en pratique, on les remplace par celles de l’échantillon, s² = Σ(yi − ȳ)²/(n − 1), qui en sont des estimateurs sans biais sous tirage aléatoire simple. Pour les plans complexes, on recourt à la linéarisation ou aux méthodes de rééchantillonnage (demi-échantillons, jackknife, bootstrap).
Quelle marge d’erreur pour un sondage par quotas ? Aucune formule ne s’applique en toute rigueur, puisqu’il n’y a pas de probabilités de sélection. Les instituts utilisent par convention celle du tirage aléatoire simple, qui ne mesure que la fluctuation d’échantillonnage et ignore le biais de sélection. En France, la publication d’un sondage électoral doit mentionner ses marges d’erreur, et sa notice complète est déposée auprès de la Commission des sondages.
La non-réponse. Même un tirage au sort parfait devient une enquête volontaire dès que certains refusent de répondre. La planche 5 s’applique alors : c’est la corrélation entre refus et réponse qui fixe l’erreur, et le redressement ne la corrige que dans la mesure où les variables de calage l’expliquent.
Lectures. W. G. Cochran, Sampling Techniques (1977) ; L. Kish, Survey Sampling (1965) ; Y. Tillé, Théorie des sondages (Dunod, 2001) ; P. Ardilly, Les Techniques de sondage (Technip, 2006) ; X.-L. Meng, « Statistical paradises and paradoxes in big data », Annals of Applied Statistics, 2018.