francebalade.fr       Cours de Mathématiques       Table des matières       Votre avis sur ce site
Statistique · théorie des sondages

Les sondages et leurs techniques

Interroger mille personnes pour connaître l’avis de cinquante millions : comment tirer l’échantillon, combien il en faut, ce que coûtent les raccourcis, et pourquoi une énorme enquête mal tirée peut valoir moins qu’une poignée de personnes tirées au sort.

Le vocabulaire en une page

Un sondage consiste à observer une partie seulement d’une population (les électeurs, les ménages, les entreprises…) pour en déduire une grandeur qui la décrit tout entière : une proportion, une moyenne, un total. La partie observée s’appelle l’échantillon, sa taille est notée n, celle de la population N, et le rapport f = n/N est le taux de sondage.

Toute la théorie repose sur une idée simple : si l’on choisit l’échantillon par un tirage au sort dont on connaît les règles, le hasard n’est plus un ennemi, c’est un instrument de mesure. On sait alors calculer, avant même d’interroger qui que ce soit, de combien l’estimation risque de s’écarter de la vérité. Les différentes techniques ne sont que des façons plus habiles d’organiser ce tirage.

TechniquePrincipeOutil mathématiquePlanche
Sondage aléatoire simpletous les échantillons de taille n ont la même chanceloi hypergéométrique, variance (1 − f)S²/n, intervalle de confiance1
Stratificationon découpe la population en groupes et l’on tire dans chacunvariance ΣWh²(1 − fh)Sh²/nh, allocation de Neyman2
Sondage en grappeson tire des groupes entiers (immeubles, villages)corrélation intra-grappe ρ, effet de plan 1 + (m − 1)ρ3
Tirage systématiqueun individu tous les k dans une listevariance exacte par énumération des k départs3
Méthode des quotason remplit des cases (sexe, âge…) sans tirage au sortbiais de sélection4
Redressement (calage)on repondère l’échantillon pour retrouver les marges connuesalgorithme de Deming-Stephan, effet de pondération 1 + CV²4
Enquête non probabiliste massiveceux qui veulent bien répondreidentité de Meng : erreur = ρ × √((1 − f)/f) × σ5

Toutes les populations de cette page sont fabriquées par la page elle-même : on connaît donc la vraie réponse, et chaque formule peut être confrontée à des milliers de sondages simulés.

1

Le tirage au sort, et pourquoi mille personnes suffisent

L’idée : si chaque personne a la même chance d’être tirée, la proportion observée dans l’échantillon, notée p̂, tombe « en moyenne » sur la vraie proportion p, et ses écarts obéissent à une loi que l’on sait calculer exactement.

Dans une urne de N personnes dont K répondent « oui », le nombre de « oui » dans un échantillon de n tirées sans remise suit la loi hypergéométrique : P(k) = C(K,k)·C(N−K,n−k) / C(N,n). Son écart-type donne la précision du sondage :

σ(p̂) = √[ (N − n)/(N − 1) · p(1 − p)/n ]   et   marge d’erreur à 95 % ≈ 1,96 σ

Le premier facteur, proche de 1 − f, est la correction de population finie : tirer sans remise dans une petite population apporte un peu plus d’information. L’intervalle de confiance [p̂ − 1,96 σ̂ ; p̂ + 1,96 σ̂], où σ̂ est calculé avec p̂ faute de connaître p, doit contenir la vraie valeur dans environ 95 % des sondages. Cette promesse repose sur l’approximation normale : essayez p = 5 % avec n = 10, la loi exacte devient très dissymétrique et la couverture s’effondre.

Une ville de 2 500 habitants (un carré par personne). Clair : personne non tirée ; foncé : personne interrogée. Bleu : « oui » ; gris : « non ».
Histogramme des p̂ obtenus sur tous les sondages simulés (barres bleues), loi hypergéométrique exacte (points rouges), approximation normale (tirets gris), vraie proportion (vert). En haut : l’intervalle de confiance du dernier sondage.
dernier sondage : p̂ et intervalle à 95 %
—
écart-type exact σ (formule)
—
écart-type mesuré sur les sondages simulés
—
marge d’erreur ± 1,96 σ
—
intervalles contenant p : mesuré / exact
—
contrôle de la loi exacte : moyenne − np ; variance − formule
—

La taille de la population ne compte presque pas

Relisons la formule : N n’apparaît que dans le facteur (N − n)/(N − 1), qui tend vers 1 dès que la population est grande devant l’échantillon. Une cuillère de soupe renseigne sur le goût de la marmite, que la marmite fasse deux litres ou deux cents, pourvu qu’on ait bien remué.

Marge d’erreur à 95 % pour la taille n et la proportion p choisies, en fonction de la taille N de la population (échelle logarithmique).
marge pour N = 2 500
—
marge pour N = 20 000 (une petite ville)
—
marge pour N = 50 millions (ordre de grandeur du corps électoral français)
—
n nécessaire pour ± 1 point (N = 50 millions)
—
Ce qui fixe la précision, c’est n, presque pas N. Pour p = 50 %, mille personnes tirées au sort donnent ± 3,1 points dans une population de cinquante millions, et encore ± 3,0 points dans une ville de vingt mille habitants ; pour diviser cette marge par deux, il faut quatre fois plus de monde, car σ décroît comme 1/√n.
2

La stratification : découper avant de tirer

L’idée : si la population se compose de groupes très différents, on tire séparément dans chaque groupe. Le hasard ne peut plus alors donner un échantillon « trop riche » en un groupe ; il ne joue plus qu’à l’intérieur des groupes.

Exemple typique des enquêtes auprès des entreprises : on veut le chiffre d’affaires moyen de 4 560 entreprises, des micro-entreprises aux grands groupes. Les groupes, appelés strates, sont repérés par l’indice h ; chacun a son effectif Nh, son poids Wh = Nh/N, sa dispersion Sh, et l’on y tire nh entreprises au hasard. L’estimateur et sa variance exacte sont :

ȳst = Σ Wh ȳh     V(ȳst) = Σ Wh² (1 − nh/Nh) Sh² / nh

Reste à répartir les n questionnaires entre strates : c’est l’allocation. Égale (autant par strate), proportionnelle (nh ∝ Nh, l’échantillon est une maquette de la population), ou optimale de Neyman (1934) : nh ∝ Nh Sh, on interroge davantage là où les valeurs sont dispersées. Si le calcul demande plus d’entreprises qu’une strate n’en contient, on la prend en entier : c’est une strate exhaustive, et l’on répartit le reste entre les autres.

Les 4 560 entreprises, une ligne par strate, placées selon leur chiffre d’affaires (échelle logarithmique). Points pleins : entreprises tirées dans le dernier échantillon.
Estimations du chiffre d’affaires moyen sur 1 500 échantillons : sondage aléatoire simple (contour gris) contre sondage stratifié avec l’allocation choisie (bleu). Vert : vraie moyenne.
allocation
vraie moyenne (M€)
—
écart-type exact : aléatoire simple / stratifié
—
écart-type mesuré : aléatoire simple / stratifié
—
effet de plan (variance stratifiée / aléatoire simple)
—
Neyman continu : formule (ΣWhSh)²/n − ΣWhSh²/N contre variance
—
2 000 allocations au hasard : la meilleure rapportée à Neyman
—
—
3

Grappes et tirage systématique : les raccourcis et leur prix

L’idée : sur le terrain, on ne dispose pas toujours d’une liste de toute la population, et l’enquêteur ne peut pas traverser le pays pour une seule adresse. On tire alors des groupes entiers, ou un individu sur k dans une liste. C’est moins cher ; reste à savoir ce que l’on perd, ou parfois ce que l’on gagne.

On tire au hasard a immeubles parmi 100, et l’on interroge les 20 ménages de chacun. Mais des voisins se ressemblent : même quartier, même milieu, mêmes conversations. Cette ressemblance se mesure par la corrélation intra-grappe ρ, corrélation moyenne entre deux ménages d’un même immeuble. Interroger 20 voisins apporte alors moins d’information que 20 personnes dispersées. La perte se chiffre par l’effet de plan (Kish, 1965), rapport de la variance obtenue à celle d’un tirage aléatoire simple de même taille :

deff = (N − 1)/(N − m) · [1 + (m − 1) ρ] ≈ 1 + (m − 1) ρ     neffectif = n / deff

La relation est exacte avec le petit facteur de gauche, qui vaut ici (2 000 − 1)/(2 000 − 20) : elle découle d’une identité algébrique sur les sommes de carrés, vérifiée ci-dessous.

Cent immeubles de 20 ménages. Bleu : « oui » ; clair : « non ». Cadres rouges : immeubles tirés.
Proportions estimées sur 4 000 sondages : en grappes (bleu) et aléatoire simple de même taille (contour gris). Vert : vraie proportion.
ρ mesuré dans la ville tirée (fluctue autour du réglage)
—
effet de plan exact (rapport des variances)
—
Kish 1 + (m − 1)ρ
—
contrôle de l’identité exacte
—
effet de plan mesuré sur les sondages simulés
—
n interrogés → n effectif
—
—

On dispose d’une liste de 1 260 logements rangés immeuble par immeuble, étage par étage, et l’on veut leur consommation d’eau moyenne. Le tirage systématique choisit un point de départ r au hasard entre 0 et k − 1, puis prend un logement tous les k. Il n’y a que k échantillons possibles, tous équiprobables : on peut donc calculer la variance exactement, en les énumérant tous.

Vsyst = (1/k) Σr (ȳr − Ȳ)²    à comparer à    Vsimple = (1 − n/N) S²/n

Chaque étage compte dix logements, dont un grand appartement d’angle qui consomme beaucoup plus : la liste a une périodicité de 10. Elle a aussi une tendance : les immeubles récents, en fin de liste, sont plus économes.

Consommation des 1 260 logements dans l’ordre de la liste (gris) ; en rouge, les logements retenus avec le départ r choisi.
Les k moyennes possibles, écart à la vraie moyenne (barres) ; la barre rouge est celle du départ r. Tirets orange : ± 1,96 σ d’un tirage aléatoire simple de même taille.
taille n = N/k
—
écart-type exact du tirage systématique
—
écart-type d’un tirage aléatoire simple
—
rapport des variances systématique / simple
—
contrôle : moyenne des k moyennes − Ȳ
—
—
4

Quotas et redressement : ce que la pondération corrige, et ce qu’elle ne voit pas

L’idée : les instituts français n’utilisent presque jamais le tirage au sort pour les sondages d’opinion, mais la méthode des quotas. On fixe à l’avance combien d’hommes et de femmes de chaque âge il faut interroger, conformément au recensement, et l’on interroge les premiers volontaires jusqu’à remplir chaque case. Puis on redresse l’échantillon par une pondération.

Le danger : dans chaque case, ceux qui acceptent de répondre ne sont pas tirés au hasard. Ici, sur un panel en ligne, les diplômés du supérieur et les personnes intéressées par la politique répondent plus volontiers. Or l’intérêt pour la politique influence aussi l’opinion étudiée, et il n’est dans aucun fichier officiel : c’est une variable cachée.

Le calage sur marges (Deming et Stephan, 1940) cherche des poids wi tels que l’échantillon pondéré retrouve exactement les effectifs connus de la population pour chaque variable. L’algorithme est d’une simplicité désarmante : on multiplie les poids pour caler la première variable, puis la deuxième, et ainsi de suite, et l’on recommence jusqu’à ce que plus rien ne bouge. Les instituts calent aussi sur le vote à l’élection précédente, dont on connaît le résultat officiel : c’est un moyen détourné d’atteindre la variable cachée.

à chaque passage : wi ← wi × Nc / Σj∈c wj     coût en précision : deff ≈ 1 + CV²(w)
Remplissage des six cases de quotas (sexe × âge) au fil des contacts. Gris : personnes contactées refusées parce que leur case est pleine.
Convergence du calage : plus grand écart relatif entre marges pondérées et marges de la population, à chaque passage (échelle logarithmique).
Chaque point est un sondage simulé de taille n. Ligne verte : vraie proportion de « oui ». Barre noire : moyenne des sondages ; son écart au vert est le biais.
vraie proportion de « oui »
—
diplômés du supérieur : population / échantillon brut
—
biais moyen : quotas bruts / calé socio-démo / + vote passé
—
écart-type : aléatoire simple / quotas calés
—
calage : passages pour 10⁻¹² ; taux de convergence mesuré
—
effet de pondération 1 + CV² → n effectif
—
—
5

Le paradoxe des grands nombres : quand un million de réponses valent une poignée de personnes

L’idée : dès que la participation n’est plus décidée par un tirage au sort mais par les personnes elles-mêmes, l’erreur ne dépend plus seulement de la taille. Xiao-Li Meng (2018) l’a résumé en une identité exacte, valable pour n’importe quel échantillon, tiré au sort ou non.

Notons Ri = 1 si la personne i a répondu, 0 sinon, et Yi sa réponse. L’erreur de la proportion observée se factorise en trois termes :

p̂ − p =  ρ(R, Y)  ×  √[(1 − f)/f]  ×  σY

Qualité des données : la corrélation, dans la population entière, entre « avoir répondu » et « ce que l’on pense ». Quantité : un terme qui ne dépend que du taux de réponse f. Difficulté du problème : la dispersion σY = √(p(1 − p)). Un tirage au sort rend ρ minuscule, de l’ordre de 1/√N ; une participation volontaire le laisse à une valeur fixe, qui ne diminue pas quand l’échantillon grossit.

Un pays d’un million d’électeurs, dont 52 % voteront « A ». Chacun décide de répondre à une consultation en ligne ; les électeurs de A y sont un peu plus enclins, d’un facteur eβ. On tire une réalisation, on calcule les trois facteurs sur la population entière, et l’on compare leur produit à l’erreur constatée.

Une multiplication lue sur une règle logarithmique : on part de 1 (tirets), chaque facteur déplace le trait de son logarithme — bleu la qualité |ρ|, violet la quantité, orange la difficulté. La barre rouge, l’erreur |p̂ − p| mesurée directement, part aussi de 1 et arrive au même point (pointillé).
réponses n et proportion observée p̂
—
erreur p̂ − p mesurée
—
ρ(R, Y) calculé sur le million d’électeurs
—
produit des trois facteurs − erreur mesurée
—
marge d’un tirage au sort de même taille
—
taille effective : tirage au sort de même erreur neff = f/((1 − f)ρ²)
—
—

Deux enquêtes grossissent côte à côte dans le même million d’électeurs. La première est un tirage de Poisson : chacun est retenu avec la même probabilité f, par un vrai tirage au sort (β = 0). La seconde est la consultation volontaire, avec la propension β réglée ci-dessous. Pour chaque taille, 300 réalisations ; on trace l’erreur quadratique moyenne.

Erreur quadratique moyenne en fonction de la taille de l’échantillon (échelles logarithmiques). Bleu : tirage au sort ; rouge : participation volontaire ; tirets : biais théorique de la participation volontaire.
pente mesurée, tirage au sort (théorie : −0,5)
—
pente mesurée, volontaires, cinq plus grandes tailles
—
biais théorique / erreur mesurée au plus grand n
—
taille au-delà de laquelle le biais domine
—
—

En 1936, la revue américaine Literary Digest envoie dix millions de bulletins-questionnaires, tirés des annuaires téléphoniques et des fichiers de propriétaires d’automobiles. Elle en reçoit plus de deux millions en retour et publie, le 31 octobre : Landon 1 293 669, Roosevelt 972 897. Le 3 novembre, Roosevelt l’emporte avec 60,80 % des voix contre 36,54 %. Au même moment, George Gallup, avec un échantillon bien plus petit construit selon des quotas, annonce la victoire de Roosevelt. Appliquons l’identité de Meng à ces chiffres, en nous limitant aux deux candidats.

Taille effective neff en fonction de |ρ| pour le taux de réponse du Digest (échelles logarithmiques). Point rouge : le Digest de 1936 ; point bleu : la valeur choisie avec le curseur.
Deux millions de réponses contre leur équivalent en tirage au sort : chaque carré représente une personne tirée au sort ; la barre grise, à la même échelle d’un carré par personne, déborderait de plusieurs kilomètres.
électeurs des deux candidats N / réponses n / taux f
—
part de Roosevelt : Digest / urnes / erreur
—
corrélation ρ(R, Y) déduite de l’identité
—
taille effective du Digest
—
avec |ρ| choisi : erreur et taille effective
—
—

De Laplace aux enquêtes en ligne

1802Laplace estime la population de la France sans recensement : il compte habitants et naissances dans un ensemble de communes, en tire leur rapport, qu’il applique au total des naissances du pays, et évalue le risque d’erreur de son estimation (environ 28 millions d’habitants).
1895Le Norvégien Anders Kiær défend devant l’Institut international de statistique la « méthode représentative » : observer une partie de la population plutôt que tout recenser. L’idée suscite d’abord de vives réserves.
1912Arthur Bowley tire au hasard des ménages ouvriers de Reading et accompagne ses résultats d’un calcul de précision : le tirage au sort devient un instrument de mesure.
1934Jerzy Neyman fonde la théorie moderne : stratification, allocation optimale, intervalles de confiance, et démonstration que le choix raisonné d’unités « représentatives » peut tromper gravement.
1936Le naufrage du Literary Digest face à Gallup : la taille ne protège pas d’un échantillon mal constitué.
1938Jean Stoetzel fonde en France l’Institut français d’opinion publique (Ifop).
1940Deming et Stephan publient l’algorithme de calage sur marges par ajustements proportionnels successifs.
1952Horvitz et Thompson donnent l’estimateur universel des tirages à probabilités inégales : pondérer chaque réponse par l’inverse de sa probabilité d’être tirée.
1965Leslie Kish, Survey Sampling : l’effet de plan devient l’unité de compte de la précision des enquêtes complexes.
1977La loi du 19 juillet 1977 encadre en France la publication des sondages électoraux et crée la Commission des sondages.
1992Jean-Claude Deville et Carl-Erik Särndal unifient les méthodes de redressement dans la théorie du calage, aussitôt mise en œuvre à l’Insee.
2018Xiao-Li Meng publie la factorisation qualité × quantité × difficulté et montre qu’un très grand échantillon non aléatoire peut valoir quelques centaines de personnes tirées au sort.

Ce qu’il faut retenir

Le hasard est l’instrument

Un tirage au sort de règles connues permet de calculer la précision avant l’enquête. Elle dépend de la taille n de l’échantillon et décroît en 1/√n, presque pas de la taille de la population.

Les techniques déplacent la variance

Stratifier la réduit, d’autant plus que les strates diffèrent ; tirer des grappes l’augmente d’un facteur 1 + (m − 1)ρ ; le tirage systématique peut être excellent ou désastreux selon l’ordre de la liste.

Le biais ne se dilue pas

Quotas et redressement corrigent ce qui est lié aux variables de calage, rien d’autre. Quand la participation dépend de l’opinion, l’erreur cesse de diminuer avec n : ρ compte plus que le nombre de réponses.

Pour aller plus loin

L’estimateur de Horvitz-Thompson. Si l’individu i a la probabilité πi d’être tiré, le total t = Σ yi est estimé sans biais par t̂ = Σéchantillon yi/πi : chaque répondant « représente » 1/πi personnes. Le sondage aléatoire simple (πi = n/N) et le sondage stratifié (πi = nh/Nh) en sont des cas particuliers ; les poids de calage de la planche 4 en sont une version corrigée.

Estimer la variance. Les formules des planches supposent connues les dispersions S² ou Sh² de la population ; en pratique, on les remplace par celles de l’échantillon, s² = Σ(yi − ȳ)²/(n − 1), qui en sont des estimateurs sans biais sous tirage aléatoire simple. Pour les plans complexes, on recourt à la linéarisation ou aux méthodes de rééchantillonnage (demi-échantillons, jackknife, bootstrap).

Quelle marge d’erreur pour un sondage par quotas ? Aucune formule ne s’applique en toute rigueur, puisqu’il n’y a pas de probabilités de sélection. Les instituts utilisent par convention celle du tirage aléatoire simple, qui ne mesure que la fluctuation d’échantillonnage et ignore le biais de sélection. En France, la publication d’un sondage électoral doit mentionner ses marges d’erreur, et sa notice complète est déposée auprès de la Commission des sondages.

La non-réponse. Même un tirage au sort parfait devient une enquête volontaire dès que certains refusent de répondre. La planche 5 s’applique alors : c’est la corrélation entre refus et réponse qui fixe l’erreur, et le redressement ne la corrige que dans la mesure où les variables de calage l’expliquent.

Lectures. W. G. Cochran, Sampling Techniques (1977) ; L. Kish, Survey Sampling (1965) ; Y. Tillé, Théorie des sondages (Dunod, 2001) ; P. Ardilly, Les Techniques de sondage (Technip, 2006) ; X.-L. Meng, « Statistical paradises and paradoxes in big data », Annals of Applied Statistics, 2018.