Vorstellung von Tonn SDK v2: KI-gestützte Audiopostproduktion für Film, Fernsehen und Werbung

Seit 2023 hat die Tonn-Plattform über fünf Millionen Musiktitel über unsere Mixing- und Mastering-Engine verarbeitet. Heute starten wir Tonn SDK v2, ein speziell für die Postproduktion entwickeltes Modul, das dieselbe Audiointelligenz in Arbeitsabläufe für Film, Fernsehen, Streaming, Werbung und Podcasting bringt.

Das ist kein umfunktioniertes Musik-Tool. Es ist eine völlig neue Verarbeitungspipeline, die auf die tatsächliche Arbeitsweise der Postproduktion zugeschnitten ist: dialogorientiert, konform mit den Auslieferungsspezifikationen und gebaut für die Formate, die Sender und Plattformen verlangen.

Das Postproduktionsmodul ist ab sofort im Tonn C++ SDK verfügbar, die Cloud-API-Verfügbarkeit folgt in den nächsten Wochen.

Warum die Postproduktion einen neuen Ansatz braucht

Audiopostproduktion hat ein Konsistenzproblem. Jedes Projekt hat seine eigene Mischung aus Dialog, Musik, Soundeffekten, Foley und Atmosphäre, und jede Auslieferungsplattform hat ihre eigene Lautheits-Spezifikation. Einen Mix so klingen zu lassen, dass er sich gut anhört und die QC für Netflix, YouTube, Broadcast-TV und Kino besteht, bedeutet Stunden manueller Arbeit pro Auslieferungsdatei.

Wir haben Tonn SDK v2 entwickelt, um diesen Prozess programmierbar zu machen. Ein API-Aufruf. Korrekte Lautheit. Konforme Auslieferung. Verarbeitete Stems, wenn Sie sie brauchen.

Was ist enthalten

Native Track-Typen für die Postproduktion

Das SDK spricht die Sprache der Postproduktion nativ und bietet 10 dedizierte Track-Kategorien: Dialog (Haupt- und Nebenstimmen), Musik, SFX, Atmosphäre, Foley, ADR, Voiceover (Varianten mit tiefer und hoher Tonlage) sowie eine Kategorie für allgemeine Zwecke. Das bedeutet, dass die Verarbeitungsengine versteht, womit sie arbeitet, und Dialog anders behandelt als einen Musikteppich oder eine Foley-Spur.

Intelligente Dialogverbesserung

Drei Verarbeitungsmodi, abgestimmt auf unterschiedliche Inhaltstypen:

  • Preserve für Dokumentationen und natürlich wirkende Inhalte, bei denen minimale Eingriffe den ursprünglichen Charakter bewahren

  • Enhance für Standard-TV, Streaming und Interview-Inhalte, mit einer Klarheitssteigerung ohne Überverarbeitung

  • AD Enhanced für Werbespots, Ankündigungen und Voiceover, wodurch die Verständlichkeit so weit wie möglich gesteigert wird

Unter der Haube führt die Engine eine Erkennung des Rauschbodens, eine Bewertung der Frequenzbalance, eine Clipping-Analyse und ein Reverb-Profiling durch, bevor irgendeine Verarbeitung angewendet wird. Sie passt sich dem an, was sie hört.

ADR-zu-Location-Sound-Abgleich

Eine der schwierigsten Aufgaben in der Postproduktion ist es, neu aufgenommenen Dialog (ADR) natürlich mit dem ursprünglichen Location-Sound zu verbinden. Die DialogueMatcher des SDK analysiert Frequenzgang, Dynamik, Klangfarbe und Nachhallcharakteristika der Originalaufnahme und wendet dann passende Verarbeitung auf die ADR-Aufnahme an. Sie gibt Ähnlichkeitsscores zurück, damit Sie den Abgleich programmatisch überprüfen können.

Automatisches Sidechain-Ducking

Hintergrundaudio (Musik, SFX, Atmosphäre) wird automatisch abgesenkt, wenn Dialog erkannt wird. Fünf Presets decken gängige Szenarien ab, von einer subtilen Absenkung um -6 dB für Hintergrundmusik bis zu einem aggressiven Schnitt von -20 dB für Sprache über Musik. Ein vollständig benutzerdefinierter Modus gibt Ihnen Kontrolle über Tiefe der Absenkung, Attack und Release. Multi-Track-Ducking wird unterstützt, sodass eine Dialog-Sidechain mehrere Hintergrundspuren gleichzeitig steuern kann.

Sieben Lieferformat-Presets

Jedes Preset ist auf einen bestimmten Lieferstandard kalibriert, mit Ziel-Lautheit, True-Peak-Grenzen und LRA-(Loudness Range)-Beschränkungen:

Format

Ziel

Standard

Film

-24 LUFS / -2 dBTP

Kino / Dolby-Referenz

TV

-23 LUFS / -2 dBTP

EBU R128

Streaming

-27 LUFS / -2.3 dBTP

Große Streaming-Plattformen

YouTube

-14 LUFS / -1 dBTP

Von YouTube empfohlen

Broadcast

-23 LUFS / -1 dBTP

Strenges EBU R128

Werbemix

-23 LUFS / -1 dBTP

EBU R128 für Werbung

Podcast

-16 LUFS / -1 dBTP

Podcast-Standard

Die Ausgabe enthält einen Konformitätsbericht mit Pass/Fail-Auswertung für Programm-Lautheit, Dialog-Lautheit, True Peak, Programm-LRA und Dialog-LRA. Sie können diesen direkt für Endnutzer anzeigen oder in Ihre QC-Pipeline einspeisen.

Ausgabe verarbeiteter Stems

Optional können Sie individuell verarbeitete Stems zusammen mit dem finalen Mix exportieren. Nützlich für QC, Revision und nachgelagerte Editorial-Arbeiten.

GPU-Beschleunigung

Die Verarbeitung ist auf macOS (Metal) und Linux (CUDA) per GPU beschleunigt, mit automatischem Fallback auf die CPU, wenn keine GPU verfügbar ist.

Hören Sie es in Aktion

Hier sind zwei Vorher-nachher-Beispiele, die das Postproduktionsmodul in Aktion zeigen.

Beispiel 1: Werbespot

Dieses Beispiel verwendet das Lieferprofil Werbemix mit aktivierter Sidechain-Ducking-Funktion, wobei die Dialogspur als Sidechain-Quelle dient. Die Mastering-Stufe zielt auf EBU R128 für Werbung ab.

Beispiel 2: Animation für Streaming

Dieses Beispiel verwendet das Streaming-Lieferprofil ohne angewendetes Ducking. Das Mastering zielt auf die Lautheits-Spezifikation der großen Streaming-Plattformen ab.

Ab sofort im C++ SDK verfügbar. Cloud API folgt bald.

Das Postproduktionsmodul wird ab heute im Tonn C++ SDK mit vollständiger Dokumentation, Beispielanwendungen und JSON-Konfigurationsvorlagen für gängige Workflows ausgeliefert.

Wir bringen diese Funktionen in den kommenden Wochen zu unserer Cloud-API. Postproduktionsdienste verwenden dasselbe Kreditsystem wie unsere bestehende Musik-API, sodass jeder Kunde mit API-Credits die neuen Endpunkte sofort nutzen kann. Kein separater Plan oder keine separate Lizenz erforderlich.

Wie es weitergeht

Wir haben eine klare Roadmap für die Erweiterung des Postproduktionsmoduls:

  • Start der Cloud-API in den kommenden Wochen, beginnend mit Dialogverbesserung, Mastering für Lieferformate und Lautheitskonformität

  • Vollständige Pipeline-Endpunkte, einschließlich Sidechain-Ducking, ADR-Abgleich und des gebündelten Postproduktions-Mixes, kurz danach

  • Unterstützung für Surround- und immersive Audioformate ist auf unserer Roadmap (die Metadaten des Lieferformats enthalten bereits Felder für Surround und Kanalanzahl)

Wenn Sie Tools für Postproduktion, Rundfunk, Podcasting oder Videoplattformen entwickeln, würden wir uns freuen, mit Ihnen zu sprechen. Die SDK-Dokumentation ist live, und Sie können sich für den API-Zugang unter tonn-portal.roexaudio.com registrieren.

Das Tonn SDK und die API werden von RoEx entwickelt, dem Audio-Technologieunternehmen hinter Automix und Mix Check Studio. Seit 2023 haben wir über 5 Millionen Tracks verarbeitet.