francebalade.fr       Cours de Mathématiques       Table des matières       Votre avis sur ce site
Théorie des sondages

Les sondages : l'estimation

Une fois l’échantillon tiré, tout n’est pas joué. Tirer les grandes unités plus souvent, se servir de ce que l’on sait déjà, organiser le terrain en deux temps, mesurer sa propre précision : quatre outils de l’estimation, et un cirque de cinquante éléphants pour montrer qu’un estimateur sans biais peut être absurde.

Où l’on reprend

Le premier volet (Les sondages et leurs techniques) montrait comment tirer un échantillon : au hasard simple, par strates, par grappes, par quotas. Il supposait toujours que chaque personne de l’échantillon « compte » autant que les autres. Ce second volet s’occupe de l’autre moitié du métier : transformer les réponses en estimation, et chiffrer la confiance qu’on peut lui accorder.

Le fil conducteur est un seul principe, dû à Horvitz et Thompson (1952) : si l’unité i avait la probabilité πi d’être tirée, elle représente 1/πi unités de la population. Son poids est di = 1/πi, et le total t = Σ yi s’estime sans biais par

t̂HT = Σi ∈ échantillon yi / πi
PlancheQuestionOutil
1faut-il donner la même chance à une commune de 2 000 et de 30 000 habitants ?tirage proportionnel à la taille, Horvitz-Thompson, loi exacte par énumération
2comment profiter du dernier recensement ?estimateurs par le quotient et par la régression, linéarisation
3combien de communes, et combien de ménages par commune ?sondage à deux degrés, fonction de coût, optimum de Cochran
4comment connaître sa précision sans connaître la population ?linéarisation, jackknife, bootstrap, couverture
5un estimateur sans biais est-il forcément bon ?les éléphants de Basu (1971), estimateur de Hájek
1

Probabilités inégales : tirer les grands plus souvent

L’idée : pour estimer les dépenses totales de douze communes en n’en visitant que trois, il serait dommage de risquer de ne tirer que des villages. On donne à chaque commune une chance d’être tirée proportionnelle à sa taille xi, connue par le recensement, puis on corrige par le poids 1/πi.

πi = n · xi / Σ xj     t̂HT = Σ yi/πi = (Σxj/n) · Σ (yi/xi)

La seconde écriture dit tout : l’estimateur ne dépend plus que des rapports yi/xi. Si les dépenses sont à peu près proportionnelles à la taille, ces rapports se ressemblent tous, et l’estimation varie très peu d’un échantillon à l’autre. On tire ici par la méthode systématique de Madow (1949) : les communes sont mises bout à bout sur une règle de longueur n, chacune occupant la longueur πi, et l’on lance n pointeurs espacés d’une unité à partir d’un départ u tiré au hasard entre 0 et 1.

La règle de Madow : chaque commune occupe une longueur πi ; les pointeurs rouges, espacés d’une unité, désignent les communes tirées. Déplacez le départ u.
Lois exactes des deux estimateurs, obtenues en énumérant tous les échantillons possibles : tirage proportionnel à la taille avec Horvitz-Thompson (bleu), tirage aléatoire simple avec N · ȳ (gris). Vert : vrai total ; rouge : estimation du départ u choisi.
vrai total des dépenses (M€)
—
communes tirées et estimation t̂HT
—
contrôles exacts : E(t̂HT) − t ; max |fréquence d’inclusion − πi|
—
nombre d’échantillons possibles : proportionnel / simple
—
écart-type exact : proportionnel / simple
—
rapport des variances ; contrôle du tirage simple (énumération / formule − 1)
—
—
2

L’information auxiliaire : se servir de ce que l’on sait déjà

L’idée : on veut le nombre total de chômeurs de 400 communes, en n’en enquêtant que n. Mais on connaît, pour toutes les communes, le nombre de chômeurs du dernier recensement, noté x, et son total X. Si l’échantillon est tombé par hasard sur des communes « riches en chômeurs », ce sera visible sur x aussi, et l’on peut corriger.

t̂simple = N ȳ    t̂quotient = X · ȳ/x̄    t̂régression = N [ȳ + b (X̄ − x̄)]

L’estimateur par le quotient suppose y à peu près proportionnel à x ; celui par la régression, avec la pente b calculée sur l’échantillon, suppose seulement une relation linéaire. Ils ont un léger biais, de l’ordre de 1/n, mais une variance bien plus faible. Leur variance ne se calcule pas exactement ; on l’approche par linéarisation (développement de Taylor au premier ordre) :

V(t̂quotient) ≈ N² (1 − f) Se²/n,   ei = yi − R xi     V(t̂régression) ≈ N² (1 − f) Sy² (1 − ρ²)/n
Les 400 communes : chômeurs au recensement (x) et aujourd’hui (y). Points bleus : dernier échantillon ; rouge : droite du quotient passant par l’origine ; orange : droite de régression de l’échantillon.
Estimations du total sur 3 000 échantillons pour chacun des trois estimateurs. Vert : vrai total ; barre noire : moyenne des estimations.
vrai total t ; corrélation ρ(x, y)
—
écart-type simple : formule / mesuré
—
écart-type quotient : linéarisé / mesuré
—
écart-type régression : linéarisé / mesuré
—
biais du quotient mesuré, rapporté à son écart-type
—
gain : variance simple / variance quotient
—
—
3

Le sondage à deux degrés : combien de communes, combien de ménages ?

L’idée : la plupart des grandes enquêtes tirent d’abord des unités primaires (des communes), puis, dans chacune, des unités secondaires (des ménages). Chaque commune visitée coûte un déplacement ; chaque ménage coûte un entretien. À budget fixé, il faut choisir entre beaucoup de communes peu enquêtées et peu de communes très enquêtées.

On tire n communes parmi 200, puis m ménages parmi les 50 de chaque commune. Avec S1² la dispersion des moyennes communales et S2² la dispersion moyenne à l’intérieur des communes, la variance exacte de la moyenne estimée est (Cochran) :

V = (1 − n/200) S1²/n + (1 − m/50) S2²/(n m)     coût C = c1 n + c2 n m

Pour un budget C donné, on remplace n par C/(c1 + c2m) et l’on minimise en m. Le calcul donne une formule très parlante, avec Su² = S1² − S2²/50 :

mopt = √( c1/c2 ) · S2 / Su

Plus un déplacement coûte cher par rapport à un entretien, plus on interroge de ménages par commune ; plus les communes diffèrent entre elles, moins on en interroge.

Les 200 communes, teintées selon leur revenu moyen ; les communes tirées sont encadrées de rouge, avec le nombre de ménages interrogés.
Écart-type de la moyenne estimée en fonction de m, le budget étant entièrement dépensé. Vert : minimum trouvé par section dorée ; rouge : le plan choisi.
plan choisi : communes n × ménages m (budget 600 entretiens-équivalents)
—
m optimal : formule de Cochran / section dorée
—
écart-type : formule exacte / 3 000 enquêtes simulées
—
variance du plan choisi / variance à l’optimum
—
S1² ; S2² mesurés dans la population
—
—
4

Estimer sa propre précision

L’idée : les formules de variance font intervenir la population entière, que l’on ne connaît pas. Il faut donc estimer la précision à partir du seul échantillon, et vérifier que l’intervalle de confiance qui en découle tient sa promesse de 95 %.

On reprend l’estimateur par le quotient de la planche 2 (dispersion 0,20), dont la variance n’a pas de formule exacte. Trois méthodes rivales :

Linéarisation : on remplace dans la formule approchée Se² par sa version d’échantillon, avec les résidus yi − R̂ xi. Jackknife (Quenouille 1949, Tukey 1958) : on recalcule l’estimation en retirant chaque unité à tour de rôle, et la dispersion de ces n estimations, multipliée par (n − 1), mesure la variance. Bootstrap (Efron 1979) : on retire n unités avec remise dans l’échantillon lui-même, 200 fois, comme si l’échantillon était la population, avec la correction (1 − f)·n/(n − 1).

Chaque point est un échantillon : variance estimée par chaque méthode, divisée par la vraie variance (mesurée sur 20 000 échantillons), en échelle logarithmique. Barre noire : moyenne ; ligne verte : 1.
Proportion des intervalles « estimation ± 1,96 √(variance estimée) » qui contiennent le vrai total. Tirets : la promesse de 95 % et la marge de fluctuation de la simulation.
vraie variance (écart-type) du quotient, 20 000 échantillons
—
linéarisation : moyenne v̂/V ; couverture
—
jackknife : moyenne v̂/V ; couverture
—
bootstrap : moyenne v̂/V ; couverture
—
contrôle : jackknife = linéarisation quand n grandit (rapport moyen)
—
—
5

Les éléphants de Basu : sans biais, et pourtant absurde

L’idée : en 1971, le statisticien indien Debabrata Basu raconte une fable pour montrer qu’un estimateur sans biais n’est pas forcément raisonnable. Un directeur de cirque doit estimer le poids total de ses 50 éléphants avant de les embarquer, et ne veut en peser qu’un seul.

Il connaît leurs poids d’il y a trois ans. Il propose de peser Sambo, l’éléphant qui était alors de poids moyen, et de multiplier par 50. Le statisticien du cirque, horrifié par ce choix « non aléatoire », impose un tirage au sort : Sambo aura la probabilité 99/100 d’être choisi, et chacun des 49 autres la probabilité 1/4 900. Sambo est tiré, comme prévu. Quelle estimation donne Horvitz-Thompson ? Le poids de Sambo divisé par 0,99, soit à peu près le poids d’un seul éléphant. Et si Jumbo, le plus lourd, avait été tiré : son poids multiplié par 4 900.

E(t̂HT) = Σ πi · yi/πi = Σ yi = t    pour n’importe quelles probabilités
Les 50 éléphants, dessinés selon leur poids d’il y a trois ans. Sambo est entouré de vert, Jumbo d’orange ; le projecteur rouge désigne l’éléphant tiré.
vrai poids total aujourd’hui
—
éléphant tiré
—
estimation Horvitz-Thompson
—
estimation du directeur (50 × poids de Sambo)
—
tirages effectués : moyenne des estimations HT / vrai total
—
—

Il n’y a que 50 issues possibles : on peut les énumérer toutes et calculer exactement l’espérance et la variance.

Chaque tige est une issue : estimation obtenue (échelle logarithmique en abscisse) et probabilité (échelle logarithmique en ordonnée). Vert : vrai total. L’espérance tombe pile sur le vert, alors qu’aucune issue n’en approche.
E(t̂HT) − t, calcul exact
—
écart-type exact de t̂HT, rapporté à t
—
probabilité d’une erreur de moins de 50 %
—
si Sambo est tiré : t̂HT/t ; si Jumbo : t̂HT/t
—
—

Le tort n’est pas le tirage au sort, mais le choix des probabilités : πi n’a aucun rapport avec le poids. Deux remèdes. Hájek (1971), dans la discussion même de Basu, propose de diviser par la somme des poids plutôt que par N, ce qui donne ici 50 × yi quel que soit πi. Ou bien l’on tire proportionnellement aux anciens poids (planche 1) : Horvitz-Thompson devient alors l’estimateur par le quotient de la planche 2, X · yi/xi. Le curseur passe continûment du plan de Basu (α = 0) au plan proportionnel (α = 1).

Erreur quadratique moyenne exacte, rapportée au vrai total (échelle logarithmique), en fonction du mélange α : Horvitz-Thompson (rouge), Hájek (orange), quotient sur les anciens poids (bleu). Point : valeur de α choisie.
Horvitz-Thompson : biais ; erreur relative
—
Hájek (50 × yi) : biais ; erreur relative
—
quotient X yi/xi : biais ; erreur relative
—
à α = 1 : écart maximal entre Horvitz-Thompson et quotient
—
—

Repères

1943Hansen et Hurwitz, au Bureau du recensement des États-Unis, formalisent le tirage à probabilités proportionnelles à la taille et le sondage à plusieurs degrés.
1949William Madow étudie le tirage systématique à probabilités inégales, la « règle » de la planche 1. Maurice Quenouille propose la méthode qui deviendra le jackknife.
1952Horvitz et Thompson publient l’estimateur 1/πi, sans biais pour tout plan de sondage.
1953William Cochran, Sampling Techniques : estimateurs par le quotient et la régression, optimum des sondages à deux degrés.
1958John Tukey donne son nom au jackknife, « couteau suisse » de l’estimation de variance.
1971Basu publie la fable des éléphants ; Jaroslav Hájek, dans la discussion, propose l’estimateur normalisé qui porte son nom.
1979Bradley Efron invente le bootstrap, que Rao et Wu adapteront aux sondages en 1988.
1992Särndal, Swensson et Wretman, Model Assisted Survey Sampling : le modèle guide l’estimateur, le plan de sondage garantit sa validité. Deville et Särndal unifient les estimateurs de la planche 2 dans le calage.

Ce qu’il faut retenir

Le poids 1/π

Toute unité tirée représente l’inverse de sa probabilité d’être tirée. Ce principe unique rend sans biais n’importe quel plan de sondage probabiliste.

Ce que l’on sait déjà

Une variable connue sur toute la population, liée à celle qu’on étudie, sert deux fois : pour fixer les probabilités de tirage, et pour corriger l’estimation. Le gain se mesure par 1 − ρ².

Sans biais ne suffit pas

L’absence de biais est une moyenne sur des échantillons qu’on n’a pas tirés. Ce qui compte est l’erreur sur celui qu’on a : il faut des probabilités proches de la proportionnalité à y, et un estimateur qui s’appuie sur l’information disponible.

Pour aller plus loin

La variance de Horvitz-Thompson fait intervenir les probabilités d’inclusion doubles πij, probabilité que i et j soient tirés ensemble : V = ΣΣ (πij − πiπj) (yi/πi)(yj/πj). Le tirage systématique de la planche 1 a certains πij nuls (deux communes qui ne peuvent jamais être tirées ensemble) : sa variance est alors impossible à estimer sans biais à partir de l’échantillon, d’où les méthodes approchées de la planche 4.

Le biais du quotient est d’ordre 1/n alors que son écart-type est d’ordre 1/√n : le biais relatif s’efface quand l’échantillon grandit. Pour de très petits échantillons, on lui préfère parfois l’estimateur sans biais de Hartley et Ross.

Le plan et le modèle. Deux écoles s’affrontent depuis Basu : l’inférence « par le plan », où seul le tirage au sort justifie les calculs, et l’inférence « par le modèle », qui traite la population comme une réalisation d’un modèle statistique. L’approche « assistée par un modèle » de Särndal, Swensson et Wretman les réconcilie : les estimateurs par régression et par calage restent presque sans biais même si le modèle est faux, et deviennent très précis s’il est juste.

Lectures. W. G. Cochran, Sampling Techniques ; C.-E. Särndal, B. Swensson, J. Wretman, Model Assisted Survey Sampling (1992) ; Y. Tillé, Théorie des sondages (Dunod) ; D. Basu, « An essay on the logical foundations of survey sampling », 1971.