Probabilités et statistiquesNotion · Glossaire
Théorie de l'information
La théorie de l'information est une branche des mathématiques fondée par Claude Shannon en 1948 qui quantifie l'information contenue dans des messages et les limites de la transmission de données. La notion centrale est l'entropie de Shannon, qui mesure l'incertitude ou la quantité d'information d'une source aléatoire. Cette théorie établit notamment le théorème de codage de canal : la capacité est le débit maximal auquel la probabilité d'erreur peut être rendue arbitrairement petite avec des blocs suffisamment longs.
Sommaire
Ce que vous allez apprendre
- Relier rareté d'un résultat et quantité d'information.
- Calculer l'entropie d'une source binaire en bits par symbole.
- Interpréter correctement la capacité d'un canal et sa portée asymptotique.
- Distinguer codage de source et codage de canal.
En clair
Imaginez une source qui envoie la lettre A trois fois sur quatre et la lettre B une fois sur quatre. Voir A surprend peu, tandis que voir B apporte davantage d'information. Si les deux lettres étaient aussi probables, chaque résultat dissiperait la même incertitude.
La théorie de l'information transforme cette intuition en nombres. Elle mesure l'incertitude moyenne avant la réception, puis étudie la manière de représenter les messages et de les transmettre malgré le bruit. Le bit est l'unité obtenue lorsque les logarithmes sont en base 2.
Définition
Fondée par Claude Shannon en 1948, la théorie de l'information est la branche des mathématiques qui quantifie l'information produite par une source aléatoire et étudie les limites du codage et de la transmission. Elle ne mesure pas le sens d'un message : elle dépend du modèle probabiliste de ses résultats possibles.
On note X le résultat émis par la source et pi la probabilité de son ie résultat. Lorsque les logarithmes sont en base 2, l'entropie de Shannon H(X), exprimée en bits par résultat, est la moyenne des informations −log2(pi) :
Un résultat rare contribue donc davantage qu'un résultat fréquent. Par convention, un terme de probabilité nulle contribue pour 0.
Pour une source sans mémoire, cette entropie fixe la limite moyenne vers laquelle un codage de source sans perte peut tendre sur de longs blocs. Pour un canal bruité, la capacité C est le débit maximal au-dessous duquel des codes de canal peuvent rendre la probabilité d'erreur arbitrairement petite, avec des blocs assez longs. Au-dessus de C, cette fiabilité asymptotique est impossible.
Un exemple, pas à pas
Une source émet seulement A ou B. Les données sont les suivantes :
• la probabilité de A vaut 3/4 ;
• la probabilité de B vaut 1/4 ;
• le logarithme choisi est en base 2, donc le résultat s'exprime en bits par symbole.
• la probabilité de A vaut 3/4 ;
• la probabilité de B vaut 1/4 ;
• le logarithme choisi est en base 2, donc le résultat s'exprime en bits par symbole.
1. L'information associée à A vaut bit.
2. L'information associée à B vaut exactement bits. B est plus informatif parce qu'il est plus rare.
3. On pondère chaque information par sa probabilité, puis on additionne :
L'entropie de la source est donc d'environ 0,811 bit par symbole.
4. Le contrôle est immédiat : une source binaire a une entropie comprise entre 0 et 1 bit par symbole. La valeur 0,811 respecte cet intervalle et reste inférieure à 1, car A et B ne sont pas équiprobables.
En pratique
En compression sans perte, on estime les probabilités des symboles avant de choisir le code. Si elles sont très inégales, un code à longueur variable peut réduire la longueur moyenne ; un code fixe reste préférable lorsque la simplicité d'accès prime.
Pour transmettre sur un canal bruité, on compare le débit visé à la capacité du modèle de canal. Si le débit est assez bas, on ajoute une redondance structurée pour corriger les erreurs ; réduire le débit est l'alternative lorsque la fiabilité observée reste insuffisante.
En cryptographie, l'entropie sert à évaluer l'incertitude d'une source de clés ou de secrets. Une distribution très déséquilibrée révèle moins d'incertitude qu'une distribution uniforme ; il faut alors améliorer la source plutôt que compter seulement la longueur affichée.
À ne pas confondre
Information de Shannon et signification. La première dépend des probabilités, pas de l'importance humaine du contenu. Un message banal mais très improbable peut porter beaucoup d'information au sens de Shannon.
Codage de source et codage de canal. Le codage de source cherche principalement une représentation compacte ; le codage de canal ajoute une redondance contrôlée contre le bruit. Une taille réduite signale le premier objectif, une meilleure correction d'erreurs le second.
Entropie et information d'un résultat. L'information −log2(p) concerne un résultat de probabilité p. L'entropie est la moyenne de cette quantité sur tous les résultats possibles ; dans l'exemple, 2 bits pour B ne signifient pas une entropie de 2 bits.
Limites et pièges
Cas charnières d'une source binaire. Si un résultat est certain, l'entropie vaut 0 bit ; si les deux résultats ont chacun une probabilité de 1/2, elle vaut 1 bit. Une valeur hors de cet intervalle signale un calcul ou une normalisation erronés.
Dépendances entre symboles. Additionner les entropies symbole par symbole suppose une indépendance qui peut être absente. Si certaines suites apparaissent plus souvent, il faut modéliser les blocs ou utiliser une entropie conditionnelle au lieu d'ignorer la mémoire de la source.
Probabilités nulles. L'écriture log2(0) n'est pas définie, mais la contribution limite d'un événement de probabilité nulle est prise égale à 0. Il ne faut jamais tenter de calculer directement ce logarithme.
Capacité et erreur nulle. Le théorème de codage est asymptotique : sous la capacité, il garantit que la probabilité d'erreur peut devenir arbitrairement petite, pas nécessairement nulle pour un bloc fini. Il faut donc annoncer la longueur des blocs et le niveau d'erreur visé.
Pour aller plus loin
Entropie. Cette entrée approfondit la notion qui mesure l'incertitude moyenne d'une distribution.
variable aléatoire. Cette fiche précise l'objet probabiliste X dont les valeurs et les probabilités entrent dans l'entropie.
Claude Shannon, l'Américain précurseur. Cette lecture replace le fondateur de la théorie de l'information dans son parcours scientifique.
Explorez les mathématiques autrement
Retrouvez nos magazines, podcasts et jeux pour explorer les mathématiques autrement.
Découvrir les offres
