Formatos de audio, bitrates y por qué una pista suena más alta

Cómo elegir entre MP3, AAC, Opus, WAV y FLAC, qué cambian de verdad la frecuencia de muestreo y la profundidad de bits, y por qué normalizar por pico deja una pista floja igual de floja.

Mantén el máster sin pérdidas: WAV mientras trabajas y FLAC para guardarlo. Entrega en AAC u Opus cuando sepas qué va a reproducir el archivo, y en MP3 cuando no lo sepas. La voz sale en mono y con un bitrate bajo. Ajusta el nivel por LUFS, no por pico, y deja un decibelio de margen por debajo del fondo de escala.

Esa es la decisión. El resto explica por qué.

Para qué sirve cada formato

FormatoTipoPara quéPor minutoCompatibilidad
WAVPCM sin comprimirMásteres10,6 MBUniversal
FLACSin pérdidasArchivado5 a 7 MBAmplia
MP3Con pérdidasReproductores desconocidos1,4 MB (192 kbps)En todas partes
AACCon pérdidasApps, vídeo0,9 MB (128 kbps)Universal
Vorbis (OGG)Con pérdidasJuegos0,9 MB (128 kbps)Escritorio
OpusCon pérdidasVoz, web0,7 MB (96 kbps)Software moderno

Sin pérdidas significa que las muestras decodificadas son idénticas a las que entraron; FLAC ahorra espacio prediciendo cada muestra a partir de las anteriores y guardando solo el error. Los formatos con pérdidas descartan información de forma permanente, usando un modelo de lo que el oído no va a notar.

uncompressed   44100 x 16 x 2 / 8 = 176400 B/s = 10.6 MB per minute
lossy          192000 / 8 x 60    = 1.44 MB per minute

Frecuencia de muestreo y profundidad de bits

La frecuencia de muestreo es cada cuánto se mide la forma de onda. El límite de Nyquist dice que una señal muestreada transporta frecuencias hasta la mitad de la frecuencia de muestreo y nada por encima, así que 44,1 kHz cubre todo lo que queda por debajo de 22,05 kHz, y el oído humano se detiene en torno a los 20 kHz, antes con la edad. Usa 48 kHz cuando acompañe a vídeo; las frecuencias más altas solo ayudan durante la producción.

La profundidad de bits fija el rango dinámico, no el detalle. Cada bit vale unos 6 dB, así que 16 bits sitúan el suelo de ruido unos 96 dB por debajo del fondo de escala y 24 bits unos 144 dB, de los cuales los conversores entregan unos 120. Esos bits son margen de grabación: mantén el nivel conservador y súbelo después sin levantar un siseo audible. Los archivos ya terminados y nivelados no los necesitan.

Sobremuestrear no aporta nada: interpolar de 44,1 kHz a 96 kHz duplica el archivo sin añadir información, y rellenar hasta 24 bits se trae consigo el suelo de ruido original. Cada remuestreo pasa por un filtro, así que un viaje a 48 kHz y vuelta es una pequeña pérdida a cambio de nada.

El bitrate y dónde deja de ayudar subirlo

MaterialMP3AACOpus
Voz, mono644824 a 32
Palabra hablada, estéreo1288048
Música, uso diario19212896
Música, sin quejas256 a 320192128 a 160

Las cifras son kbps. MP3 acusa su edad por los dos extremos: por debajo de unos 96 kbps emborrona de forma audible, y por encima de unos 192 kbps las mejoras cuestan mucho de oír, así que 320 kbps compran tranquilidad más que calidad. AAC necesita unos dos tercios del bitrate para el mismo resultado. Opus va todavía mejor, y su ventaja se ensancha a medida que baja el bitrate, porque con poco ancho de banda cambia a un modo construido alrededor de cómo se produce el habla, así que una voz que como MP3 necesita 64 kbps se apaña con la mitad.

Subir el bitrate al convertir un archivo con pérdidas en otro no recupera nada. Un MP3 de 128 kbps recodificado a 320 kbps conserva fielmente los artefactos del archivo pequeño dentro de uno grande, y el segundo codificador gasta bits tratándolos como audio real. Trabaja a partir del máster sin pérdidas.

Mono, estéreo y la mezcla a mono

El estéreo cuesta aproximadamente el doble que el mono con la misma calidad. Una persona ante un micrófono no produce información estéreo, así que un archivo de palabra hablada en estéreo son dos canales casi idénticos, y pasar a mono reduce el tamaño a la mitad sin perder nada. La música y las grabaciones de sala se quedan en estéreo.

Mezclar a mono no sale gratis. La reducción promedia los canales, así que todo lo que esté en oposición de fase entre izquierda y derecha se cancela: un efecto de ensanchado o un cable de micrófono invertido pueden adelgazar o desaparecer solo en mono. Compruébalo antes de publicar y atenúa unos 3 dB, ya que la suma sube el nivel.

Pico, RMS y LUFS

El pico es el valor de muestra más alto, en dBFS, con 0 como techo digital absoluto. Normalizar por pico escala el archivo para que su muestra más fuerte caiga en el objetivo, así que una grabación floja con un portazo dentro sigue sonando floja: el portazo sube hasta el techo y todo lo demás apenas se mueve. El RMS promedia la energía en una ventana, más cerca de lo que se oye pero tratando 60 Hz y 3 kHz por igual. Los LUFS ponderan la medición para modelar la audición, descartan los pasajes silenciosos y dan una sola cifra para todo el programa. Las plataformas miden en LUFS.

DestinoObjetivo habitual
Spotify, YouTube, Amazon Musicunos -14 LUFS
Apple Musicunos -16 LUFS
Pódcast-16 LUFS en estéreo, -19 LUFS en mono
Radiodifusión europea (EBU R 128)-23 LUFS

Como las plataformas llevan todo hacia un objetivo, masterizar más alto ya no suena más alto; la plataforma baja la pista y el oyente se queda con la dinámica aplastada y sin la sonoridad. Así terminó la guerra del volumen, después de dos décadas en las que un limitado cada vez más agresivo dejó másteres con casi ninguna diferencia entre el nivel de pico y el medio, que se oyen planos y cansan.

El recorte se produce cuando una muestra que superaría el fondo de escala se trunca al máximo, aplanando las crestas de la forma de onda y generando distorsión armónica. El pico real va más allá: la forma de onda reconstruida entre muestras puede subir por encima de la muestra más alta almacenada, así que un archivo que mide -0,1 dBFS puede alcanzar +0,5 dBTP y recortar a la salida. Deja el techo en -1 dBTP, o más abajo si después viene una codificación con pérdidas. La herramienta de volumen de audio puede normalizar a un objetivo en lugar de desplazar por decibelios fijos.

Chasquidos, uniones y recortes

Corta una forma de onda en un punto cualquiera y lo normal es que caiga a mitad de ciclo, en un valor distinto de cero, así que la salida baja al silencio en una sola muestra. Ese escalón es un impulso de banda ancha, que se oye como un chasquido. De cinco a veinte milisegundos de fundido en cada punto de edición lo eliminan y son demasiado breves para oírlos; en una unión, un fundido cruzado de diez a cincuenta milisegundos queda aún más limpio.

Las uniones exigen acuerdo. Los archivos tienen que compartir la frecuencia de muestreo, porque un archivo de 48 kHz concatenado en un flujo de 44,1 kHz se reproduce un nueve por ciento más lento y más grave, y también el número de canales, o una sección acaba en los canales equivocados. Iguala también la sonoridad. Remuestrea con el conversor de audio, nivela con la herramienta de volumen y después usa la de unir audio. La herramienta de velocidad de audio se ocupa de los cambios de velocidad deliberados: remuestrear mueve el tono y la velocidad a la vez, mientras que mantener el tono requiere estiramiento temporal, que puede emborronar los transitorios.

Recortar puede saltarse por completo la recodificación, sin coste de calidad. WAV es preciso a nivel de muestra, ya que el recorte es una copia de bytes; los formatos comprimidos se construyen a partir de tramas, y un corte copiado solo puede caer en un límite de trama.

MP3 frame = 1152 samples = 26.12 ms at 44.1 kHz
cut asked for at 12.000 s
nearest boundaries: frame 459 = 11.990 s, frame 460 = 12.016 s

AAC usa tramas de 1024 muestras, unos 21 ms a 48 kHz, y Opus normalmente usa paquetes de 20 ms. MP3 tiene además una reserva de bits, que permite a una trama tomar prestado espacio de las anteriores, así que a la primera trama después de un corte pueden faltarle datos y dar un fallo audible. Cuando el límite tenga que ser exacto, deja que la herramienta de recorte de audio recodifique y asume una generación de pérdida.

Qué puede digerir un navegador

Todo esto ocurre en memoria. Los archivos se decodifican a muestras en bruto antes de poder medir, fundir, unir o recodificar nada, normalmente como flotantes de 32 bits: una hora de estéreo a 44,1 kHz son unos 635 MB en PCM de 16 bits y 1,27 GB ya decodificada. El techo de memoria de una pestaña queda muy por debajo de lo que puede direccionar una aplicación de escritorio, así que el límite es la duración, no el formato. Recorta primero, o divide una grabación larga y une después las partes.