Las imágenes de nuestras pantallas son discretas y están formadas por un número finito de píxeles, cada uno caracterizado por una luminancia y, en su caso, por información de crominancia (véase el artículo « Los componentes de nuestras imágenes: luminancia y crominancia »). Esta información se transmite en bloques de diez bits. Su difusión resulta cada vez más costosa a medida que aumenta el número de líneas y de píxeles por línea.
Así, en televisión, al pasar de la norma UIT 601 (definición estándar) a la norma UIT 709 (alta definición), la tasa de bits de cada imagen ha aumentado de 270 Mbit/s (1 Mbit o megabit = 106 bits) a casi 1,5 Gbit/s (1 Gbit o gigabit = 109 bits). Por tanto, es importante comprimirlas. Eso es lo que hace el formato JPEG (Joint Photographic Experts Group), que define un algoritmo de compresión/descompresión o codificación/decodificación (códec) para cualquier imagen fija.
Una descomposición en bloques ---------------------------
La idea consiste en trabajar los píxeles bloque a bloque. En la práctica, los bloques están formados por «microimágenes» cuadradas de 8 × 8 píxeles. La luminancia de cada píxel se codifica en diez bits mediante un número entero comprendido entre 0 y 1023. El tratamiento de la crominancia es idéntico.
El procedimiento numérico llamado transformada discreta del coseno (véase el artículo « De la transformación de Fourier a la transformada discreta del coseno »), inspirado directamente en las transformadas de Fourier, convierte esta información numérica en su representación espectral, es decir, en una matriz de números asociados a pares de frecuencias predeterminadas. La elección concreta de la forma de la matriz que se construye no tiene nada de azarosa: en la matriz de coeficientes DCT (i, j) asociada a cada bloque de píxeles, el coeficiente DCT (0, 0) y sus vecinos se construyen a partir de las frecuencias más bajas (valores de i y j en la fórmula «próximos a cero»), mientras que DCT (7, 7) y sus vecinos tienen en cuenta las frecuencias más altas (valores de i y j «próximos al máximo», aquí 7). En efecto, un bloque de píxeles I(u, v) de 8 × 8, con u y v entre 0 y 7, se convierte en otro bloque según la fórmula siguiente: