Passer au contenu principal
Tangente

problème de Behrens-Fisher

Le problème de Behrens-Fisher consiste à comparer les moyennes de deux populations normales à partir d’échantillons indépendants lorsque leurs variances sont inconnues et ne sont pas supposées égales. Il faut alors tenir compte séparément de l’incertitude propre à chaque groupe, sans estimer de variance commune, pour déterminer si l’écart observé est compatible avec l’égalité des moyennes des deux populations.
Décomposition de l'erreur standard Les contributions arrondies de 1,333 et 3,556 points carrés totalisent environ 4,889 ; leur racine carrée vaut environ 2,211 points. Deux contributions, une erreur standard Groupe 1 Groupe 2 4²/12 ≈ 1,333 8²/18 ≈ 3,556 Somme 4,889 points² environ Racine carrée : SE ≈ 2,211 points
Chaque groupe contribue séparément aux quelque 4,889 points carrés ; la racine carrée donne une erreur standard d'environ 2,211 points.
Sommaire

Ce que vous allez apprendre

  • Identifier les hypothèses qui définissent le problème de Behrens-Fisher.
  • Recalculer une statistique de Welch et ses degrés de liberté approchés.
  • Interpréter le test et l'intervalle de confiance sur un même exemple.
  • Distinguer ce cadre du test de Student à variance commune et des données appariées.

En clair

Deux méthodes donnent des scores moyens de 52 et 45 points. La première a été essayée 12 fois, la seconde 18 fois. Surtout, les scores de la seconde sont beaucoup plus dispersés. Comparer seulement 52 et 45 ferait oublier cette différence de variabilité.
Le problème de Behrens-Fisher demande si l'écart observé entre les moyennes traduit une différence entre les populations ou peut venir des fluctuations d'échantillonnage. Chaque groupe contribue à l'incertitude selon sa propre dispersion et son propre effectif.

Définition

Le problème de Behrens-Fisher concerne deux échantillons aléatoires indépendants issus de populations normales. Les moyennes des populations sont notées μ1 et μ2. Leurs variances, notées σ12 et σ22, sont inconnues et ne sont pas supposées égales. On cherche notamment à tester l'hypothèse H0:μ1=μ2H_0:\mu_1=\mu_2 ou à construire un intervalle pour la différence μ1 − μ2.
Dans le premier groupe, la moyenne observée est xˉ1\bar{x}_1, la variance d'échantillon est s12 et l'effectif est n1. Les indices 2 désignent les mêmes quantités dans le second groupe. L'erreur standard estimée de la différence et la statistique usuelle sont :
SE=s12n1+s22n2,t=xˉ1xˉ2SESE=\sqrt{\frac{s_1^2}{n_1}+\frac{s_2^2}{n_2}},\qquad t=\frac{\bar{x}_1-\bar{x}_2}{SE}
Chaque variance est donc pondérée par l'effectif de son propre groupe ; elles ne sont pas fusionnées.
Le test de Welch apporte une réponse approchée très utilisée : il compare cette statistique à une loi de Student dont le nombre de degrés de liberté est estimé par la formule de Welch-Satterthwaite. Le problème de Behrens-Fisher est plus général que cette procédure. Sans hypothèse d'égalité des variances, le rapport inconnu entre celles-ci empêche d'obtenir le test de Student classique à variance commune ; différentes solutions exactes, approchées ou bayésiennes répondent à des critères différents.

Un exemple, pas à pas

Deux méthodes sont comparées sur des scores indépendants, supposés issus de populations normales. Pour la méthode 1 : n1 = 12, moyenne 52 points et écart-type 4 points. Pour la méthode 2 : n2 = 18, moyenne 45 points et écart-type 8 points. On applique l'approximation de Welch pour un test bilatéral au seuil de 5 %.
1. La différence observée des moyennes vaut 52 − 45 = 7 points.
2. Chaque groupe apporte sa propre contribution à la variance de la différence : 42 / 12 ≈ 1,333 et 82 / 18 ≈ 3,556 points carrés. Ainsi :
SE=4212+82182,211 pointsSE=\sqrt{\frac{4^2}{12}+\frac{8^2}{18}}\approx 2{,}211\ \text{points}
Le schéma décompose cette somme avant la racine carrée.
3. La statistique de test vaut t=7/2,2113,166t=7/2{,}211\approx 3{,}166.
4. Le nombre approché de degrés de liberté est :
ν=(42/12+82/18)2(42/12)2/11+(82/18)2/1726,40\nu=\frac{(4^2/12+8^2/18)^2}{(4^2/12)^2/11+(8^2/18)^2/17}\approx 26{,}40
Pour ce nombre de degrés de liberté, la valeur critique bilatérale à 5 % est environ 2,0555. Comme 3,166 est supérieur à 2,0555, l'égalité des moyennes est rejetée dans ce cadre.
5. L'intervalle de confiance approché à 95 % pour la différence vaut 7±2,0555×2,2111[2,46;11,54]7\pm 2{,}0555\times 2{,}2111\approx[2{,}46\,;\,11{,}54] points. Il ne contient pas 0, ce qui confirme le verdict. Pour contrôler le calcul, on retrouve 4,889 points carrés avant la racine, puis une marge d'environ 4,54 points.

En pratique

Quand deux groupes indépendants ont des dispersions visiblement différentes, la procédure de Welch conserve une contribution d'incertitude propre à chacun. Un test de Student à variance commune ne se justifie que si cette hypothèse est défendable par le protocole et le modèle.
Le résultat se lit mieux avec la différence estimée et son intervalle de confiance qu'avec le seul verdict significatif ou non. Dans l'exemple, l'intervalle de 2,46 à 11,54 points montre aussi l'ordre de grandeur compatible avec les données.
Si les observations sont appariées, par exemple avant et après sur les mêmes sujets, il faut analyser les différences au sein des paires. Le critère observable est l'existence d'une correspondance individuelle entre les deux mesures.

À ne pas confondre

Test de Welch et test de Student à variance commune. Le premier garde deux estimations de variance séparées ; le second les regroupe. Avec des variances inconnues non supposées égales, comme 42 et 82 dans l'exemple, la version à variance commune ne traite pas le même modèle.
Échantillons indépendants et données appariées. Deux groupes de personnes distinctes peuvent relever du premier cadre si l’indépendance des observations est aussi défendable. Deux mesures prises sur chaque même personne forment des paires et demandent une analyse des différences individuelles.
Behrens-Fisher et Fisher-Snedecor. Le premier problème compare deux moyennes sous variances inconnues et inégales. Le test de Fisher-Snedecor porte sur un rapport de variances ; le nom de Fisher ne suffit donc pas à identifier le test.

Limites et pièges

La normalité fait partie du cadre. Avec de petits effectifs, une forte asymétrie ou des valeurs extrêmes peut rendre l'approximation trompeuse. Il faut examiner les distributions et, si le modèle normal est inadéquat, employer une méthode robuste ou adaptée à la grandeur observée.
L'indépendance ne se lit pas dans les moyennes. Des mesures répétées sur les mêmes sujets ou des observations regroupées peuvent être corrélées. Il faut alors modéliser cet appariement ou cette structure plutôt que traiter toutes les valeurs comme indépendantes.
Welch n'est pas l'unique solution du problème. Ses 26,40 degrés de liberté dans l'exemple sont estimés, non observés. Si une garantie exacte de niveau est exigée pour le modèle de Behrens-Fisher, il faut annoncer la procédure exacte choisie et son critère.
Un effectif inférieur à 2 bloque l'estimation usuelle. La variance d'échantillon du groupe concerné n'est alors pas estimable. Si les deux variances observées valent 0, l'erreur standard est nulle et la statistique devient indéfinie ; il faut revenir aux données et au modèle, pas forcer un verdict.

Pour aller plus loin

intervalle de confiance — Relier estimation, marge d'incertitude et valeurs compatibles avec les données.
variance d'une variable aléatoire — Approfondir la grandeur qui mesure la dispersion propre à chaque population.
Continuez avec Tangente

Explorez les mathématiques autrement

Retrouvez nos magazines, podcasts et jeux pour explorer les mathématiques autrement.

Découvrir les offres