Une fois l’échantillon tiré, tout n’est pas joué. Tirer les grandes unités plus souvent, se servir de ce que l’on sait déjà, organiser le terrain en deux temps, mesurer sa propre précision : quatre outils de l’estimation, et un cirque de cinquante éléphants pour montrer qu’un estimateur sans biais peut être absurde.
Le premier volet (Les sondages et leurs techniques) montrait comment tirer un échantillon : au hasard simple, par strates, par grappes, par quotas. Il supposait toujours que chaque personne de l’échantillon « compte » autant que les autres. Ce second volet s’occupe de l’autre moitié du métier : transformer les réponses en estimation, et chiffrer la confiance qu’on peut lui accorder.
Le fil conducteur est un seul principe, dû à Horvitz et Thompson (1952) : si l’unité i avait la probabilité πi d’être tirée, elle représente 1/πi unités de la population. Son poids est di = 1/πi, et le total t = Σ yi s’estime sans biais par
| Planche | Question | Outil |
|---|---|---|
| 1 | faut-il donner la même chance à une commune de 2 000 et de 30 000 habitants ? | tirage proportionnel à la taille, Horvitz-Thompson, loi exacte par énumération |
| 2 | comment profiter du dernier recensement ? | estimateurs par le quotient et par la régression, linéarisation |
| 3 | combien de communes, et combien de ménages par commune ? | sondage à deux degrés, fonction de coût, optimum de Cochran |
| 4 | comment connaître sa précision sans connaître la population ? | linéarisation, jackknife, bootstrap, couverture |
| 5 | un estimateur sans biais est-il forcément bon ? | les éléphants de Basu (1971), estimateur de Hájek |
L’idée : pour estimer les dépenses totales de douze communes en n’en visitant que trois, il serait dommage de risquer de ne tirer que des villages. On donne à chaque commune une chance d’être tirée proportionnelle à sa taille xi, connue par le recensement, puis on corrige par le poids 1/πi.
La seconde écriture dit tout : l’estimateur ne dépend plus que des rapports yi/xi. Si les dépenses sont à peu près proportionnelles à la taille, ces rapports se ressemblent tous, et l’estimation varie très peu d’un échantillon à l’autre. On tire ici par la méthode systématique de Madow (1949) : les communes sont mises bout à bout sur une règle de longueur n, chacune occupant la longueur πi, et l’on lance n pointeurs espacés d’une unité à partir d’un départ u tiré au hasard entre 0 et 1.
L’idée : on veut le nombre total de chômeurs de 400 communes, en n’en enquêtant que n. Mais on connaît, pour toutes les communes, le nombre de chômeurs du dernier recensement, noté x, et son total X. Si l’échantillon est tombé par hasard sur des communes « riches en chômeurs », ce sera visible sur x aussi, et l’on peut corriger.
L’estimateur par le quotient suppose y à peu près proportionnel à x ; celui par la régression, avec la pente b calculée sur l’échantillon, suppose seulement une relation linéaire. Ils ont un léger biais, de l’ordre de 1/n, mais une variance bien plus faible. Leur variance ne se calcule pas exactement ; on l’approche par linéarisation (développement de Taylor au premier ordre) :
L’idée : la plupart des grandes enquêtes tirent d’abord des unités primaires (des communes), puis, dans chacune, des unités secondaires (des ménages). Chaque commune visitée coûte un déplacement ; chaque ménage coûte un entretien. À budget fixé, il faut choisir entre beaucoup de communes peu enquêtées et peu de communes très enquêtées.
On tire n communes parmi 200, puis m ménages parmi les 50 de chaque commune. Avec S1² la dispersion des moyennes communales et S2² la dispersion moyenne à l’intérieur des communes, la variance exacte de la moyenne estimée est (Cochran) :
Pour un budget C donné, on remplace n par C/(c1 + c2m) et l’on minimise en m. Le calcul donne une formule très parlante, avec Su² = S1² − S2²/50 :
Plus un déplacement coûte cher par rapport à un entretien, plus on interroge de ménages par commune ; plus les communes diffèrent entre elles, moins on en interroge.
L’idée : les formules de variance font intervenir la population entière, que l’on ne connaît pas. Il faut donc estimer la précision à partir du seul échantillon, et vérifier que l’intervalle de confiance qui en découle tient sa promesse de 95 %.
On reprend l’estimateur par le quotient de la planche 2 (dispersion 0,20), dont la variance n’a pas de formule exacte. Trois méthodes rivales :
Linéarisation : on remplace dans la formule approchée Se² par sa version d’échantillon, avec les résidus yi − R̂ xi. Jackknife (Quenouille 1949, Tukey 1958) : on recalcule l’estimation en retirant chaque unité à tour de rôle, et la dispersion de ces n estimations, multipliée par (n − 1), mesure la variance. Bootstrap (Efron 1979) : on retire n unités avec remise dans l’échantillon lui-même, 200 fois, comme si l’échantillon était la population, avec la correction (1 − f)·n/(n − 1).
L’idée : en 1971, le statisticien indien Debabrata Basu raconte une fable pour montrer qu’un estimateur sans biais n’est pas forcément raisonnable. Un directeur de cirque doit estimer le poids total de ses 50 éléphants avant de les embarquer, et ne veut en peser qu’un seul.
Il connaît leurs poids d’il y a trois ans. Il propose de peser Sambo, l’éléphant qui était alors de poids moyen, et de multiplier par 50. Le statisticien du cirque, horrifié par ce choix « non aléatoire », impose un tirage au sort : Sambo aura la probabilité 99/100 d’être choisi, et chacun des 49 autres la probabilité 1/4 900. Sambo est tiré, comme prévu. Quelle estimation donne Horvitz-Thompson ? Le poids de Sambo divisé par 0,99, soit à peu près le poids d’un seul éléphant. Et si Jumbo, le plus lourd, avait été tiré : son poids multiplié par 4 900.
Il n’y a que 50 issues possibles : on peut les énumérer toutes et calculer exactement l’espérance et la variance.
Le tort n’est pas le tirage au sort, mais le choix des probabilités : πi n’a aucun rapport avec le poids. Deux remèdes. Hájek (1971), dans la discussion même de Basu, propose de diviser par la somme des poids plutôt que par N, ce qui donne ici 50 × yi quel que soit πi. Ou bien l’on tire proportionnellement aux anciens poids (planche 1) : Horvitz-Thompson devient alors l’estimateur par le quotient de la planche 2, X · yi/xi. Le curseur passe continûment du plan de Basu (α = 0) au plan proportionnel (α = 1).
Toute unité tirée représente l’inverse de sa probabilité d’être tirée. Ce principe unique rend sans biais n’importe quel plan de sondage probabiliste.
Une variable connue sur toute la population, liée à celle qu’on étudie, sert deux fois : pour fixer les probabilités de tirage, et pour corriger l’estimation. Le gain se mesure par 1 − ρ².
L’absence de biais est une moyenne sur des échantillons qu’on n’a pas tirés. Ce qui compte est l’erreur sur celui qu’on a : il faut des probabilités proches de la proportionnalité à y, et un estimateur qui s’appuie sur l’information disponible.
La variance de Horvitz-Thompson fait intervenir les probabilités d’inclusion doubles πij, probabilité que i et j soient tirés ensemble : V = ΣΣ (πij − πiπj) (yi/πi)(yj/πj). Le tirage systématique de la planche 1 a certains πij nuls (deux communes qui ne peuvent jamais être tirées ensemble) : sa variance est alors impossible à estimer sans biais à partir de l’échantillon, d’où les méthodes approchées de la planche 4.
Le biais du quotient est d’ordre 1/n alors que son écart-type est d’ordre 1/√n : le biais relatif s’efface quand l’échantillon grandit. Pour de très petits échantillons, on lui préfère parfois l’estimateur sans biais de Hartley et Ross.
Le plan et le modèle. Deux écoles s’affrontent depuis Basu : l’inférence « par le plan », où seul le tirage au sort justifie les calculs, et l’inférence « par le modèle », qui traite la population comme une réalisation d’un modèle statistique. L’approche « assistée par un modèle » de Särndal, Swensson et Wretman les réconcilie : les estimateurs par régression et par calage restent presque sans biais même si le modèle est faux, et deviennent très précis s’il est juste.
Lectures. W. G. Cochran, Sampling Techniques ; C.-E. Särndal, B. Swensson, J. Wretman, Model Assisted Survey Sampling (1992) ; Y. Tillé, Théorie des sondages (Dunod) ; D. Basu, « An essay on the logical foundations of survey sampling », 1971.