La formule utilisée
Le calculateur applique la formule de Cochran pour l'estimation d'une proportion, assortie de la correction pour population finie. C'est la référence en enquête par sondage, et c'est le calcul que font, sous le capot, la plupart des calculateurs du marché.
Le résultat est ensuite arrondi à l'entier supérieur : on n'interroge pas une demi-personne.
D'où vient cette formule
Sous échantillonnage aléatoire simple sans remise, la variance de la proportion estimée vaut
Var(p̂) = p(1 − p)/n × (N − n)/(N − 1). Le second facteur est la correction pour
population finie : plus on interroge une part importante de la population, plus l'incertitude diminue.
La marge d'erreur est le demi-intervalle de confiance, soit e = z × √Var(p̂).
On isole n dans cette égalité, et on obtient exactement la formule ci-dessus.
n₀ = z² · p(1 − p) / e². C'est ce que calcule
l'outil si vous laissez le champ population vide. À 95 % de confiance et 5 % de marge, cela donne
385, un chiffre que l'on retrouve dans quantité de rapports d'enquête.
Les deux écritures courantes sont d'ailleurs équivalentes : calculer n₀ puis appliquer
n = n₀ / (1 + (n₀ − 1)/N) donne rigoureusement le même résultat que la formule
en une ligne présentée plus haut.
Un exemple pas à pas
Une distribution a touché 5 000 ménages. Vous voulez mesurer leur taux de satisfaction à 5 % près, avec un niveau de confiance de 95 %.
- Niveau de confiance de 95 % :
z = 1,96(valeur exacte 1,959964, l'arrondi usuel ne change pas le résultat final), doncz² = 3,8416. - Aucune hypothèse sur le taux de satisfaction : on prend
p = 0,5, doncp(1 − p) = 0,25. - Numérateur commun :
z² × p(1 − p) = 0,9604. - Marge d'erreur de 5 % :
e = 0,05, donce² = 0,0025. - Dénominateur :
(5 000 − 1) × 0,0025 + 0,9604 = 13,4579. - Numérateur :
5 000 × 0,9604 = 4 802. - Résultat :
4 802 / 13,4579 = 356,8, arrondi à 357 ménages.
Si vous anticipez que 15 % des ménages seront absents ou refuseront de répondre, le taux de réponse
attendu est de 85 % : il faut alors planifier 357 / 0,85 = 420 visites pour
récolter les 357 questionnaires exploitables.
Les trois paramètres expliqués
La taille de la population
C'est le nombre total d'individus sur lesquels vous voulez conclure : tous les bénéficiaires d'un projet, tous les ménages d'une zone, tous les élèves d'un district. Point important et souvent contre-intuitif : son influence s'épuise vite. Passer de 100 000 à 10 millions d'individus ne change pratiquement rien à la taille d'échantillon requise. Ce qui compte, ce n'est pas la part de la population interrogée, c'est le nombre absolu de réponses.
La marge d'erreur
Elle s'exprime en points de pourcentage, pas en pourcentage relatif. Une marge de 5 % sur un résultat mesuré à 60 % signifie que la vraie valeur se situe entre 55 % et 65 %, pas entre 57 % et 63 %. C'est le paramètre le plus coûteux : diviser la marge par deux multiplie l'échantillon par quatre, puisque e apparaît au carré au dénominateur.
Le niveau de confiance
Il décrit la fiabilité de la procédure, pas d'un résultat particulier : à 95 %, si l'enquête était répétée cent fois dans les mêmes conditions, l'intervalle calculé contiendrait la vraie valeur dans environ 95 cas. Monter de 95 % à 99 % paraît anodin mais coûte cher : à population et marge identiques, l'échantillon augmente d'environ 73 %, puisque z passe de 1,960 à 2,576 et qu'il intervient lui aussi au carré.
D'où vient le z
Le coefficient z est le quantile bilatéral de la loi normale centrée réduite : la valeur telle
que la probabilité de tomber entre −z et +z égale le niveau de confiance choisi.
Formellement, pour un niveau de confiance C, on prend z = Φ⁻¹((1 + C)/2),
où Φ⁻¹ est la fonction quantile de la loi normale.
Ce calculateur ne lit pas z dans une table figée : il l'obtient par une approximation
numérique de Φ⁻¹ précise à environ 10⁻⁹, ce qui permet d'accepter n'importe quel
niveau de confiance, y compris 92,5 % ou 98 %.
| Niveau de confiance | Valeur de z | z² |
|---|---|---|
| 80 % | 1,2816 | 1,6424 |
| 85 % | 1,4395 | 2,0723 |
| 90 % | 1,6449 | 2,7055 |
| 95 % | 1,9600 | 3,8415 |
| 97 % | 2,1701 | 4,7093 |
| 99 % | 2,5758 | 6,6349 |
Table de référence
Tailles d'échantillon pour un niveau de confiance de 95 % et une proportion attendue de 50 %, selon la taille de la population et la marge d'erreur visée.
| Population | ± 10 % | ± 5 % | ± 3 % | ± 1 % |
|---|---|---|---|---|
| 100 | 50 | 80 | 92 | 99 |
| 250 | 70 | 152 | 203 | 244 |
| 500 | 81 | 218 | 341 | 476 |
| 1 000 | 88 | 278 | 517 | 906 |
| 2 500 | 93 | 334 | 749 | 1 984 |
| 5 000 | 95 | 357 | 880 | 3 289 |
| 10 000 | 96 | 370 | 965 | 4 900 |
| 50 000 | 96 | 382 | 1 045 | 8 057 |
| 100 000 | 96 | 383 | 1 056 | 8 763 |
| 1 000 000 | 97 | 384 | 1 066 | 9 513 |
| Très grande | 97 | 385 | 1 068 | 9 604 |
On y lit clairement le phénomène de saturation : entre 100 000 et 1 000 000 d'individus, la colonne « ± 5 % » ne bouge que d'une seule unité.
Les limites à connaître
Cette formule est exacte dans son cadre, et ce cadre a des frontières. Les ignorer est la source d'erreur la plus fréquente dans les rapports d'enquête.
Elle suppose un échantillonnage aléatoire simple
Chaque individu doit avoir la même probabilité d'être tiré, indépendamment des autres. Dès que vous
procédez par grappes, villages, camps, écoles, cette hypothèse tombe : les personnes
d'une même grappe se ressemblent, chaque réponse apporte donc moins d'information. Il faut alors
multiplier le résultat par l'effet de plan DEFF = 1 + (m − 1) × ρ, où m
est le nombre moyen d'individus par grappe et ρ le coefficient de corrélation intra-grappe.
En enquête ménage humanitaire, un DEFF de 1,5 à 2 est courant, ce qui suffit à doubler l'échantillon.
La taille calculée n'est pas le nombre de personnes à contacter
C'est le nombre de réponses valides à obtenir. Absences, refus, questionnaires incomplets ou aberrants font mécaniquement chuter le rendement. Divisez la taille par le taux de réponse attendu pour obtenir la charge de terrain réelle, ce que fait l'option « taux de réponse » du calculateur.
Elle vaut pour la population entière, pas pour chaque sous-groupe
Si vous devez conclure séparément sur les femmes et les hommes, sur trois districts ou sur deux tranches d'âge, chaque strate doit atteindre sa propre taille d'échantillon. Un échantillon global de 400 personnes réparti en quatre groupes de 100 donne, pour chaque groupe, une marge d'erreur proche de 10 %, pas de 5 %. C'est l'erreur qui fait le plus souvent dérailler une PDM désagrégée.
Elle porte sur une proportion, pas sur une moyenne
Pour estimer une moyenne (un revenu, un nombre de repas, une distance), la formule devient
n₀ = (z × σ / e)², où σ est l'écart-type de la variable et e
la marge d'erreur dans l'unité de la variable. La correction pour population finie s'applique de la
même manière.
L'approximation normale a besoin d'un minimum d'effectifs
L'intervalle repose sur l'approximation de la loi binomiale par une loi normale, valable tant que
n × p et n × (1 − p) dépassent environ 5. Pour un
événement rare (une prévalence de 2 %, par exemple), passez par un intervalle exact de type
Clopper-Pearson ou Wilson, sensiblement plus large.
Glossaire
- Population (N)
- L'ensemble complet des individus sur lesquels on veut conclure, aussi appelé population cible ou base de sondage lorsqu'elle est listée.
- Échantillon (n)
- Le sous-ensemble effectivement interrogé, censé représenter la population.
- Marge d'erreur
- Le demi-intervalle de confiance autour du résultat mesuré, exprimé en points de pourcentage.
- Niveau de confiance
- La probabilité que l'intervalle calculé contienne la vraie valeur, sur un grand nombre de répétitions de l'enquête.
- Correction pour population finie
- Le facteur qui réduit l'échantillon nécessaire lorsqu'on interroge une part non négligeable d'une population de taille limitée.
- Effet de plan (DEFF)
- Le rapport entre la variance obtenue avec le plan de sondage réel et celle d'un tirage aléatoire simple de même taille.
- Taux de sondage
- La part de la population effectivement interrogée, soit n divisé par N.
- Strate
- Un sous-groupe de la population traité comme une population à part entière pour le tirage et pour l'analyse.
Tous les termes du suivi-évaluation sont réunis dans le glossaire MEAL complet.
Questions fréquentes
Comment calcule-t-on la taille d'un échantillon ?
On applique la formule de Cochran corrigée pour population finie : n = N·z²·p(1−p) / ((N−1)·e² + z²·p(1−p)), où N est la taille de la population, e la marge d'erreur souhaitée, p la proportion attendue (0,5 par défaut, le cas le plus exigeant) et z le quantile de la loi normale associé au niveau de confiance (1,960 pour 95 %). Le résultat est arrondi à l'entier supérieur.
Quelle taille d'échantillon pour une population de 1 000 personnes ?
Pour une population de 1 000 personnes, avec une marge d'erreur de 5 % et un niveau de confiance de 95 %, il faut interroger 278 personnes. Avec une marge d'erreur de 3 %, il en faut 517 ; avec 10 %, 88 suffisent.
Qu'est-ce que la marge d'erreur d'une enquête ?
C'est l'écart maximal, en points de pourcentage, entre le résultat mesuré sur l'échantillon et la valeur réelle dans la population. Si 60 % des personnes interrogées se déclarent satisfaites avec une marge d'erreur de 5 %, la vraie proportion se situe très probablement entre 55 % et 65 %.
Qu'est-ce que le niveau de confiance ?
C'est la probabilité que l'intervalle calculé contienne la vraie valeur, si l'enquête était répétée un grand nombre de fois. À 95 %, environ 95 échantillons sur 100 tirés dans les mêmes conditions donneraient un intervalle contenant la valeur réelle. Plus il est élevé, plus l'échantillon nécessaire est grand.
Pourquoi le chiffre 385 revient-il si souvent ?
385 est la taille d'échantillon requise pour une population infinie ou très grande, à 95 % de confiance et 5 % de marge d'erreur. Au-delà d'environ 100 000 individus, la taille de la population n'influence plus le calcul : interroger 385 personnes suffit, que la population compte 500 000 ou 50 millions d'individus.
Ce calcul est-il valable pour un sondage en grappes ?
Non, pas directement. La formule suppose un échantillonnage aléatoire simple. Pour un sondage en grappes (villages, ménages, écoles), il faut multiplier le résultat par l'effet de grappe DEFF = 1 + (m−1)·ρ, où m est la taille moyenne d'une grappe et ρ le coefficient de corrélation intra-grappe. Un DEFF de 2, courant en enquête humanitaire ménage, double la taille d'échantillon nécessaire.
Faut-il prévoir plus de personnes que la taille d'échantillon calculée ?
Oui. La taille calculée est le nombre de réponses valides à obtenir, pas le nombre de personnes à contacter. Si vous anticipez 80 % de réponses exploitables, il faut contacter n / 0,80 personnes. Le calculateur intègre ce taux de réponse dans ses options avancées.
Puis-je utiliser une proportion attendue autre que 50 % ?
Oui, et c'est même préférable quand vous disposez d'une estimation solide, par exemple issue d'une enquête de référence. Une proportion de 10 % ou de 90 % réduit nettement l'échantillon nécessaire, puisque p(1−p) passe de 0,25 à 0,09. Mais si votre estimation est fausse, la marge d'erreur réelle sera plus large qu'annoncé : en l'absence de repère fiable, gardez 50 %.
Passer de l'échantillon au questionnaire
Une fois la taille d'échantillon fixée, le vrai travail commence : concevoir le questionnaire, le déployer sur le terrain, analyser les réponses et rédiger le rapport. C'est exactement ce que couvre Opti'. Décrivez votre enquête en une phrase, et Opti Gemba génère un questionnaire XLSForm complet, prêt à importer dans KoboToolbox ou ODK, avec sauts logiques, contraintes et désagrégation humanitaire. La collecte, l'analyse désagrégée et le rapport narratif suivent dans le même outil.
OptiBot
Conseil méthodologique : plan d'échantillonnage, stratification, effet de grappe, indicateurs.
En savoir plus →
Opti Gemba
Questionnaire généré par IA, collecte hors ligne, analyse et rapport final.
En savoir plus →
Opti Academy
Formez-vous à l'échantillonnage et aux statistiques d'enquête, à votre rythme.
En savoir plus →