Audioformate, Bitraten und warum ein Track lauter klingt

Wie du zwischen MP3, AAC, Opus, WAV und FLAC wählst, was Abtastrate und Bittiefe wirklich verändern und warum eine Normalisierung auf den Spitzenpegel einen leisen Track leise lässt.

Halte das Master verlustfrei, WAV während der Arbeit und FLAC zum Aufbewahren. Liefere in AAC oder Opus aus, wenn du weißt, womit die Datei abgespielt wird, in MP3, wenn nicht. Sprache geht in Mono und mit niedriger Bitrate raus. Setze den Pegel nach LUFS, nicht nach Spitzenwert, und lass ein Dezibel Headroom unter Vollaussteuerung.

Das ist die Entscheidung. Der Rest erklärt, warum.

Wofür jedes Format da ist

FormatTypWofürPro MinuteUnterstützung
WAVRohes PCMMaster10,6 MBUniversell
FLACVerlustfreiArchivierung5 bis 7 MBBreit
MP3VerlustbehaftetUnbekannte Player1,4 MB (192 kbps)Überall
AACVerlustbehaftetApps, Video0,9 MB (128 kbps)Universell
Vorbis (OGG)VerlustbehaftetSpiele0,9 MB (128 kbps)Desktop
OpusVerlustbehaftetSprache, Web0,7 MB (96 kbps)Moderne Software

Verlustfrei bedeutet, dass die decodierten Samples identisch mit dem sind, was hineinging; FLAC spart Platz, indem es jedes Sample aus den vorherigen vorhersagt und nur den Fehler speichert. Verlustbehaftete Formate verwerfen Informationen dauerhaft und stützen sich dabei auf ein Modell davon, was das Ohr nicht bemerkt.

uncompressed   44100 x 16 x 2 / 8 = 176400 B/s = 10.6 MB per minute
lossy          192000 / 8 x 60    = 1.44 MB per minute

Abtastrate und Bittiefe

Die Abtastrate gibt an, wie oft die Wellenform gemessen wird. Das Nyquist-Kriterium besagt, dass ein abgetastetes Signal Frequenzen bis zur halben Abtastrate trägt und nichts darüber, 44,1 kHz deckt also alles unter 22,05 kHz ab, und das menschliche Gehör hört bei etwa 20 kHz auf, mit zunehmendem Alter früher. Nutze 48 kHz zusammen mit Video; höhere Raten helfen nur während der Produktion.

Die Bittiefe legt den Dynamikumfang fest, nicht die Detailtreue. Jedes Bit ist etwa 6 dB wert, 16 Bit legt den Rauschteppich also rund 96 dB unter Vollaussteuerung und 24 Bit rund 144 dB, wovon Wandler etwa 120 liefern. Diese Bits sind Aufnahme-Headroom: Halte den Pegel zurückhaltend und hebe ihn später an, ohne hörbares Rauschen mit hochzuziehen. Fertige, ausgepegelte Dateien brauchen sie nicht.

Hochrechnen bringt nichts: 44,1 kHz auf 96 kHz zu interpolieren verdoppelt die Datei, ohne Information hinzuzufügen, und das Auffüllen auf 24 Bit bringt den ursprünglichen Rauschteppich mit. Jede Neuabtastung lässt einen Filter laufen, ein Ausflug nach 48 kHz und zurück ist also ein kleiner Verlust für nichts.

Bitrate, und ab wann mehr nichts mehr bringt

MaterialMP3AACOpus
Sprache, Mono644824 bis 32
Wortbeitrag, Stereo1288048
Musik, Alltag19212896
Musik, ohne Beanstandungen256 bis 320192128 bis 160

Die Zahlen sind kbps. MP3 zeigt sein Alter an beiden Enden: unterhalb von etwa 96 kbps verschmiert es hörbar, und oberhalb von etwa 192 kbps sind Verbesserungen sehr schwer zu hören, 320 kbps kaufen also Sicherheit statt Qualität. AAC braucht für dasselbe Ergebnis etwa zwei Drittel der Bitrate. Opus schneidet noch besser ab, und sein Vorsprung wächst, je niedriger die Bitrate wird, denn bei geringer Bandbreite schaltet es in einen Modus um, der darauf aufbaut, wie Sprache entsteht; eine Stimme, die als MP3 64 kbps braucht, ist mit der Hälfte davon in Ordnung.

Die Bitrate anzuheben, wenn eine verlustbehaftete Datei in eine andere umgewandelt wird, stellt nichts wieder her. Ein mit 128 kbps codiertes MP3, das mit 320 kbps neu codiert wird, bewahrt die Artefakte der kleinen Datei getreu in einer großen, und der zweite Encoder gibt Bits dafür aus, sie wie echtes Audiomaterial zu behandeln. Arbeite vom verlustfreien Master aus.

Mono, Stereo und die Monosummierung

Stereo kostet bei gleicher Qualität etwa doppelt so viel wie Mono. Eine Person an einem Mikrofon erzeugt keine Stereoinformation, eine Wortdatei in Stereo besteht also aus zwei nahezu identischen Kanälen, und Mono halbiert die Größe, ohne dass etwas verloren geht. Musik und Raumaufnahmen bleiben stereo.

Die Summierung ist nicht umsonst. Der Downmix mittelt die Kanäle, alles, was zwischen links und rechts phasenverkehrt ist, löscht sich also aus: ein Verbreiterungseffekt oder ein verpoltes Mikrofonkabel kann nur in Mono dünn werden oder ganz verschwinden. Prüfe das vor der Veröffentlichung und senke den Pegel um etwa 3 dB ab, denn das Summieren hebt ihn an.

Peak, RMS und LUFS

Peak ist der höchste Sample-Wert, in dBFS, mit 0 als harter digitaler Obergrenze. Eine Normalisierung auf den Spitzenwert skaliert die Datei so, dass ihr lautestes Sample auf dem Zielwert landet; eine leise Aufnahme mit einer einzigen zugeschlagenen Tür darin bleibt also leise: Das Zuschlagen wandert an die Decke, alles andere bewegt sich kaum. RMS mittelt die Energie über ein Fenster, kommt dem Gehörten näher, behandelt aber 60 Hz und 3 kHz als gleichwertig. LUFS gewichtet die Messung so, dass sie das Gehör nachbildet, blendet leise Passagen aus und meldet einen einzigen Wert für das gesamte Programm. Plattformen messen LUFS.

ZielTypischer Zielwert
Spotify, YouTube, Amazon Musicetwa -14 LUFS
Apple Musicetwa -16 LUFS
Podcasts-16 LUFS in Stereo, -19 LUFS in Mono
Europäischer Rundfunk (EBU R 128)-23 LUFS

Weil Plattformen alles auf einen Zielwert ziehen, spielt ein lauteres Mastering nicht mehr lauter ab; die Plattform dreht den Track herunter, und der Hörer bekommt die gequetschte Dynamik ohne die Lautheit. So endete der Lautheitskrieg, nachdem zwei Jahrzehnte immer härteren Limitings Master hinterlassen hatten, bei denen fast kein Abstand mehr zwischen Spitzen- und Durchschnittspegel lag, hörbar als flach und ermüdend.

Clipping heißt, dass ein Sample, das die Vollaussteuerung überschreiten würde, auf das Maximum abgeschnitten wird; das flacht die Spitzen der Wellenform ab und erzeugt harmonische Verzerrungen. True Peak geht weiter: Die zwischen den Samples rekonstruierte Wellenform kann über das höchste gespeicherte Sample hinausgehen, eine Datei, die -0,1 dBFS misst, kann also +0,5 dBTP erreichen und beim Ausspielen clippen. Lass die Obergrenze bei -1 dBTP, tiefer, wenn noch eine verlustbehaftete Codierung folgt. Audio Volume kann auf einen Zielwert normalisieren, statt um eine feste Anzahl Dezibel zu verschieben.

Klicks, Übergänge und Schnitte

Wenn du eine Wellenform an einer beliebigen Stelle schneidest, liegt der Schnitt meist mitten in einer Schwingung, bei einem Wert ungleich null, das Ausgangssignal fällt also innerhalb eines einzigen Samples auf Stille. Dieser Sprung ist ein Breitbandimpuls und wird als Klick gehört. Fünf bis zwanzig Millisekunden Blende an jedem Schnittpunkt beseitigen ihn und sind zu kurz, um hörbar zu sein; an einer Nahtstelle ist eine Überblendung von zehn bis fünfzig Millisekunden noch sauberer.

Nahtstellen brauchen Übereinstimmung. Die Dateien müssen dieselbe Abtastrate haben, denn eine 48-kHz-Datei, die in einen 44,1-kHz-Stream aneinandergehängt wird, spielt etwa neun Prozent zu langsam und zu tief ab, und dieselbe Kanalzahl, sonst landet ein Abschnitt in den falschen Kanälen. Gleiche auch die Lautheit an. Rechne mit dem Audio Converter um, pegle mit Audio Volume aus und nutze dann Merge Audio. Audio Speed übernimmt bewusste Geschwindigkeitsänderungen: Neuabtastung verschiebt Tonhöhe und Tempo gemeinsam, während das Halten der Tonhöhe Time Stretching erfordert, das Transienten verschmieren kann.

Das Beschneiden kann eine erneute Codierung vollständig überspringen, ohne Qualitätsverlust. WAV ist sampelgenau, denn der Schnitt ist eine Bytekopie; komprimierte Formate bestehen aus Frames, und ein kopierender Schnitt kann nur auf einer Frame-Grenze landen.

MP3 frame = 1152 samples = 26.12 ms at 44.1 kHz
cut asked for at 12.000 s
nearest boundaries: frame 459 = 11.990 s, frame 460 = 12.016 s

AAC verwendet Frames aus 1024 Samples, etwa 21 ms bei 48 kHz, und Opus nutzt normalerweise Pakete von 20 ms. MP3 hat zusätzlich ein Bit-Reservoir, mit dem ein Frame Platz von früheren borgen kann, sodass dem ersten Frame nach einem Schnitt Daten fehlen können und er hörbar stört. Wo die Grenze exakt sitzen muss, lass Trim Audio neu codieren und nimm eine Generation Verlust in Kauf.

Was ein Browser verkraftet

All das geschieht im Arbeitsspeicher. Dateien werden zu rohen Samples decodiert, bevor irgendetwas gemessen, geblendet, zusammengefügt oder neu codiert werden kann, üblicherweise als 32-Bit-Gleitkommazahlen: Eine Stunde Stereo mit 44,1 kHz sind etwa 635 MB als 16-Bit-PCM und 1,27 GB im decodierten Zustand. Die Speicherobergrenze eines Tabs liegt weit unter dem, was eine Desktop-Anwendung adressieren kann, die Grenze ist also die Länge, nicht das Format. Schneide zuerst zu, oder teile eine lange Aufnahme auf und füge die Teile zusammen.