Laboratorio de cuantización

cómo la cuantización convierte tonos suaves en escalones

Cargando simulación interactiva...

la compresión suele empezar con el dolor de la cuantización 🖖

La cuantización es donde los valores continuos o de alta precisión se redondean a un libro de códigos finito. El error suele ser pequeño por muestra, pero los degradados suaves lo revelan como bandas de contorno porque los píxeles vecinos redondean a los mismos pocos valores de salida. El dithering añade ruido deliberadamente antes de redondear: aumenta el ruido local, pero rompe las bandas coherentes, lo cual suele verse mejor para la visión humana y se comprime de forma distinta en los códecs. • Degradado de origen frente a salida: la franja superior muestra el degradado de entrada matemáticamente suave. La franja inferior muestra la salida cuantizada, redondeada a los niveles seleccionados. Con profundidades de bits bajas, este redondeo crea bandas de contorno visibles. • Gráfico del error de cuantización: representa la diferencia (salida − entrada) en cada posición del degradado. La línea amarilla es el error, y la línea verde representa el error cero. Grandes ondas de error periódicas indican banding, mientras que añadir dithering aleatoriza este error convirtiéndolo en ruido de alta frecuencia.

Los bits solo indican cuántos pasos tienes 🖖

Un degradado en el mundo real es continuo, pero una computadora debe elegir de una lista fija de valores. La profundidad de bits define la longitud de esa lista: cada bit adicional duplica la cantidad, así que 8 bits dan 2⁸ = 256 tonos y 10 bits dan 1024. Menos pasos significan un redondeo más grueso; por eso, al bajar a 6 bits (64 tonos), un cielo suave se rompe en franjas visibles.

Cada bit extra aporta unos 6 dB 🖖

En el valor de SNR se esconde una regla limpia: en la cuantización uniforme, cada bit adicional mejora la relación señal-ruido en unos 6.02 dB, según SNR ≈ 6.02·N + 1.76 dB para una senoide a plena escala. La misma fórmula rige los convertidores de audio y los codificadores de imagen, de modo que una pista de audio de 16 bits y una imagen de 16 bits comparten el mismo piso de ruido de cuantización teórico. Un bit más, 6 dB de ganancia, sin importar el medio.

UNA ETAPA DE UNA CADENA: QUÉ LLEGA, QUÉ SALE Y QUÉ SE ROMPE DESPUÉS

Dónde encaja esto en la tubería de codificación

Un codificador de vídeo no es un algoritmo, sino ocho etapas en un orden fijo, y el orden no es arbitrario: cada etapa existe porque la anterior hizo posible su trabajo. Esta herramienta modela una de ellas. La cadena de abajo enlaza con las otras siete.

Laboratorio de cuantización — divide los coeficientes por un tamaño de paso y redondea: el único paso deliberadamente con pérdida

Qué llega
Coeficientes de la transformada del residuo, a precisión completa.
Qué sale
Enteros más gruesos, con la mayoría de los coeficientes pequeños de alta frecuencia redondeados a cero.
Qué supone la etapa siguiente
La codificación entrópica supone largas rachas de ceros que explotar. Esta etapa es la que las fabrica.
Qué se estropea aquí
Es la única etapa que descarta información a propósito, así que aquí se decide realmente la calidad. Un paso demasiado grueso hace que un degradado suave se derrumbe en bandas visibles, porque tonos vecinos redondean al mismo entero.

Problema resuelto al detalle

  1. Reconciliar 56,18 dB de cuantización de 8 bits con la regla del libro de texto 6 pasos

    La cuantización de 8 bits da 56,18 dB aquí, pero la regla del libro de texto dice 6,02 × 8 + 1,76 = 49,92 dB. Ambos son correctos. Concílielos.

    1. El tamaño de paso es el rango dividido entre los intervalos entre niveles, no entre los niveles: 256 niveles dejan 255 intervalos, y el error de desfase por una unidad supone 0,017 dB que nadie notaría y una fórmula errónea que todo el mundo heredaría.

    2. El redondeo al nivel más cercano deja un error distribuido uniformemente a lo largo de un paso. Su valor RMS es el paso dividido por √12, que es la única pieza de estadística de toda la deducción.

    3. Compare esa predicción con lo que la herramienta midió en las 900 muestras. Una concordancia dentro del 1% es lo que vale la hipótesis del error uniforme en una rampa real.

    4. La SNR es la relación entre los dos valores RMS en decibelios. Ambos números están impresos, por lo que este paso es una comprobación en lugar de una deducción.

    5. Ahora la regla del libro de texto, con su supuesto hecho explícito. Se deduce para una senoidal que justo llena el rango de entrada.

    6. Calcule la relación entre los dos valores RMS y conviértala. La corrección reduce la diferencia a menos de cuatro centésimas de decibelio.

    Respuesta

    La diferencia de 6,2 dB es el factor de cresta, y nada más. 6,02N + 1,76 no es una ley sobre conversores, es una ley sobre ondas senoidales a escala completa: una senoidal que llena el rango tiene un valor RMS de 1/(2√2) = 0,354 de este. Esta rampa de la imagen tiene un valor RMS de 0,724, algo más del doble, y 20 log₁₀(2,05) es 6,22 dB. Al sumarlo se obtiene 56,14 frente a los 56,18 del panel, correspondiendo los 0,04 dB restantes a que el error medido queda un 0,7% por debajo del teórico Δ/√12. Por tanto, la SNR especificada de cualquier sistema real es una afirmación tanto sobre la señal como sobre el hardware, razón por la cual los ingenieros de audio indican el headroom por separado y por la que un pasaje silencioso en un disco de 16 bits no obtiene 96 dB de nada.

Referencias (1)

Problemas de ejemplo

  • cine 10 bits - Configuración de 10 bits tipo etalonaje con transiciones tonales suaves
  • web 8 bits - Flujo estándar de 8 bits con pasos de cuantización moderados
  • bajo 6 bits - La baja precisión muestra bandas de contorno visibles
  • 6 bits con dithering - El dithering cambia ruido suave por menos bandas