Sheppard's formula
Formule utilisée en statistiques pour transformer la concordance médiane entre deux variables. Elle est définie par : R = cos(π(100 − L) / 100), où L désigne le pourcentage des écarts concordants, c'est-à-dire des paires d'observations présentant des écarts de même signe par rapport à la médiane. R peut être interprété comme une estimation de la corrélation lorsque des hypothèses distributionnelles, telles qu'un modèle bivarié normal justifiant la relation entre concordance par quadrants et corrélation, sont admises. Hors de ce cadre, R reste un score transformé de concordance médiane et non une estimation générale du coefficient de Pearson.
Contents
What you will learn
- Classer des couples selon le signe de leurs écarts aux médianes.
- Calculer L puis appliquer la formule trigonométrique de Sheppard.
- Refaire un exemple à dix couples donnant R ≈ 0,809.
- Distinguer le pourcentage de concordance, l'estimation obtenue et le coefficient de Pearson.
- Repérer les égalités aux médianes et les limites d'interprétation.
In plain terms
Imaginez dix couples de mesures, par exemple une valeur x et une valeur y relevées ensemble. Pour chaque variable, on trace mentalement sa médiane. Un couple est concordant lorsque ses deux valeurs sont du même côté de leurs médianes : toutes deux au-dessus ou toutes deux au-dessous.
La formule de Sheppard transforme la proportion de ces accords en un nombre entre −1 et 1. Beaucoup d'accords donnent un score positif ; autant d'accords que de désaccords conduisent à 0 ; beaucoup de désaccords donnent un score négatif. Ce score ne s'interprète comme une corrélation que sous des hypothèses statistiques appropriées.
Definition
La formule de Sheppard transforme la concordance médiane calculée à partir de couples d'observations. Pour chaque couple (x, y), on compare x à la médiane des valeurs de x et y à la médiane des valeurs de y. Les écarts sont concordants s'ils ont le même signe, donc si le point se trouve au-dessus des deux médianes ou au-dessous des deux. Sous des hypothèses distributionnelles justifiant la relation entre concordance par quadrants et corrélation, notamment dans un modèle bivarié normal, le résultat peut servir à estimer la corrélation.
On note L le pourcentage de couples concordants et R le coefficient estimé. La relation est :
Le calcul ne retient que le côté des médianes, pas l'amplitude des écarts. Ainsi, L = 0 donne R = −1, L = 50 donne R = 0 et L = 100 donne R = 1. La non-normalité ne suffit pas à justifier l'interprétation de R comme une corrélation : celle-ci exige un modèle ou des hypothèses supplémentaires reliant la concordance par quadrants à la corrélation. Sans ces hypothèses, R est seulement un score transformé de concordance médiane.
The principle
Pour une série de couples, calculez la médiane de chaque variable, puis comptez les couples dont les deux écarts aux médianes ont le même signe. Si L est leur pourcentage, le score transformé de concordance médiane R est donné par :
Un résultat proche de 1 traduit une concordance médiane dominante, un résultat proche de −1 une discordance médiane dominante, et un résultat proche de 0 un partage voisin de 50 %. L'interprétation de R comme corrélation exige en plus un modèle justifiant la relation entre ce comptage par quadrants et la corrélation.
When to use it
Les données doivent être appariées : chaque valeur de la première variable accompagne une valeur de la seconde. Les deux médianes doivent être calculées sur ces mêmes couples, et L doit être exprimé sur une échelle de 0 à 100 avant l'application de la formule.
Il faut aussi fixer le traitement des observations exactement égales à une médiane, car leur écart est nul et n'a pas de signe positif ou négatif. Sans convention explicite pour ces égalités, le pourcentage L est ambigu. Enfin, la formule seule ne garantit pas une estimation pertinente pour toute distribution non normale : le modèle statistique et l'objectif de l'étude doivent justifier son emploi. À défaut, on choisit une mesure de dépendance adaptée et on en annonce les hypothèses.
A step-by-step example
Considérons dix couples dont les premières valeurs sont x = 1, 2, …, 10 et les secondes y = 1, 2, 3, 8, 4, 5, 9, 6, 7, 10. Les deux médianes valent 5,5. Un nuage partagé par ces médianes permet de contrôler le classement des dix points.
Données.
Nombre de couples : 10.
Médiane de x : 5,5.
Médiane de y : 5,5.
Couples discordants : (4, 8) et (6, 5).
Nombre de couples : 10.
Médiane de x : 5,5.
Médiane de y : 5,5.
Couples discordants : (4, 8) et (6, 5).
Étape 1. Les huit autres couples ont leurs deux coordonnées du même côté de 5,5. Il y a donc 8 couples concordants sur 10.
Étape 2. Le pourcentage de concordance est L = 100 × 8 / 10 = 80.
Étape 3. En remplaçant L par 80, on obtient :
Résultat. Le score transformé de concordance médiane vaut ici environ 0,809 et traduit une concordance dominante. Contrôle. Comme L = 80 est supérieur à 50, R doit être positif et compris entre 0 et 1, ce qui concorde avec le calcul. Sans hypothèse distributionnelle supplémentaire, cette valeur ne constitue pas une estimation générale de la corrélation de Pearson.
In practice
Avec des observations appariées, on commence par placer chaque couple par rapport aux deux médianes. Ce geste donne immédiatement le nombre de concordances, puis L et R. Une valeur très éloignée ne pèse pas davantage qu'une valeur à peine au-dessus de la médiane, car seul le signe de l'écart intervient.
Avant de retenir cette estimation, on examine les égalités aux médianes et la forme des données. Si l'objectif exige de mesurer directement une relation linéaire à partir des amplitudes, le coefficient de Pearson répond à un autre calcul. Si l'on veut seulement exploiter l'ordre des observations, une mesure fondée sur les rangs peut être plus appropriée.
Not to be confused with
Avec le coefficient de Pearson. Pearson utilise les amplitudes des écarts aux moyennes pour mesurer une liaison linéaire. La formule de Sheppard décrite ici part seulement des signes des écarts aux médianes. Deux jeux de données peuvent donc avoir le même L sans avoir le même coefficient de Pearson.
Avec le pourcentage L. L n'est pas lui-même le coefficient de corrélation. Dans l'exemple, L vaut 80 sur l'échelle des pourcentages, tandis que la transformation trigonométrique donne R ≈ 0,809 sur l'échelle de −1 à 1.
Limits and pitfalls
Égalité à une médiane. Si x ou y est exactement égal à sa médiane, l'écart correspondant vaut 0. Il faut annoncer si ce couple est écarté ou traité par une convention déterminée ; sinon, deux comptages de L peuvent différer.
Seuil charnière. L = 50 donne exactement R = 0, mais cela n'affirme pas que les variables sont indépendantes. Le calcul indique seulement un équilibre entre couples concordants et discordants selon les médianes.
Information perdue. Le passage aux seuls signes ignore la distance aux médianes. Des points très proches et très éloignés reçoivent le même poids s'ils occupent le même secteur ; il ne faut donc pas lire R comme un résumé de toutes les caractéristiques du nuage.
Portée du modèle. Le fait qu'une distribution soit non normale ne suffit pas, à lui seul, à valider automatiquement cette formule. La méthode d'estimation doit rester cohérente avec la structure des données et la dépendance que l'on cherche à mesurer.
Further reading
Le coefficient de corrélation replace R parmi les mesures de liaison entre deux variables et aide à interpréter son signe et son intensité.
La médiane d'une série statistique précise le seuil qui partage chaque variable avant le comptage des écarts concordants.
Explore mathematics differently
Discover our magazines, podcasts and games to explore mathematics differently.
See our offers
