Vorstellung von Tonn SDK v2: KI-gestützte Audiopostproduktion für Film, Fernsehen und Werbung

Seit 2023 hat die Tonn-Plattform über fünf Millionen Musiktitel über unsere Mixing- und Mastering-Engine verarbeitet. Heute starten wir Tonn SDK v2, ein speziell für die Postproduktion entwickeltes Modul, das dieselbe Audiointelligenz in Arbeitsabläufe für Film, Fernsehen, Streaming, Werbung und Podcasting bringt.
Das ist kein umfunktioniertes Musik-Tool. Es ist eine völlig neue Verarbeitungspipeline, die auf die tatsächliche Arbeitsweise der Postproduktion zugeschnitten ist: dialogorientiert, konform mit den Auslieferungsspezifikationen und gebaut für die Formate, die Sender und Plattformen verlangen.
Das Postproduktionsmodul ist ab sofort im Tonn C++ SDK verfügbar, die Cloud-API-Verfügbarkeit folgt in den nächsten Wochen.
Warum die Postproduktion einen neuen Ansatz braucht
Audiopostproduktion hat ein Konsistenzproblem. Jedes Projekt hat seine eigene Mischung aus Dialog, Musik, Soundeffekten, Foley und Atmosphäre, und jede Auslieferungsplattform hat ihre eigene Lautheits-Spezifikation. Einen Mix so klingen zu lassen, dass er sich gut anhört und die QC für Netflix, YouTube, Broadcast-TV und Kino besteht, bedeutet Stunden manueller Arbeit pro Auslieferungsdatei.
Wir haben Tonn SDK v2 entwickelt, um diesen Prozess programmierbar zu machen. Ein API-Aufruf. Korrekte Lautheit. Konforme Auslieferung. Verarbeitete Stems, wenn Sie sie brauchen.
Was ist enthalten
Native Track-Typen für die Postproduktion
Das SDK spricht die Sprache der Postproduktion nativ und bietet 10 dedizierte Track-Kategorien: Dialog (Haupt- und Nebenstimmen), Musik, SFX, Atmosphäre, Foley, ADR, Voiceover (Varianten mit tiefer und hoher Tonlage) sowie eine Kategorie für allgemeine Zwecke. Das bedeutet, dass die Verarbeitungsengine versteht, womit sie arbeitet, und Dialog anders behandelt als einen Musikteppich oder eine Foley-Spur.
Intelligente Dialogverbesserung
Drei Verarbeitungsmodi, abgestimmt auf unterschiedliche Inhaltstypen:
Preserve für Dokumentationen und natürlich wirkende Inhalte, bei denen minimale Eingriffe den ursprünglichen Charakter bewahren
Enhance für Standard-TV, Streaming und Interview-Inhalte, mit einer Klarheitssteigerung ohne Überverarbeitung
AD Enhanced für Werbespots, Ankündigungen und Voiceover, wodurch die Verständlichkeit so weit wie möglich gesteigert wird
Unter der Haube führt die Engine eine Erkennung des Rauschbodens, eine Bewertung der Frequenzbalance, eine Clipping-Analyse und ein Reverb-Profiling durch, bevor irgendeine Verarbeitung angewendet wird. Sie passt sich dem an, was sie hört.
ADR-zu-Location-Sound-Abgleich
Eine der schwierigsten Aufgaben in der Postproduktion ist es, neu aufgenommenen Dialog (ADR) natürlich mit dem ursprünglichen Location-Sound zu verbinden. Die DialogueMatcher des SDK analysiert Frequenzgang, Dynamik, Klangfarbe und Nachhallcharakteristika der Originalaufnahme und wendet dann passende Verarbeitung auf die ADR-Aufnahme an. Sie gibt Ähnlichkeitsscores zurück, damit Sie den Abgleich programmatisch überprüfen können.
Automatisches Sidechain-Ducking
Hintergrundaudio (Musik, SFX, Atmosphäre) wird automatisch abgesenkt, wenn Dialog erkannt wird. Fünf Presets decken gängige Szenarien ab, von einer subtilen Absenkung um -6 dB für Hintergrundmusik bis zu einem aggressiven Schnitt von -20 dB für Sprache über Musik. Ein vollständig benutzerdefinierter Modus gibt Ihnen Kontrolle über Tiefe der Absenkung, Attack und Release. Multi-Track-Ducking wird unterstützt, sodass eine Dialog-Sidechain mehrere Hintergrundspuren gleichzeitig steuern kann.
Sieben Lieferformat-Presets
Jedes Preset ist auf einen bestimmten Lieferstandard kalibriert, mit Ziel-Lautheit, True-Peak-Grenzen und LRA-(Loudness Range)-Beschränkungen:
Format | Ziel | Standard |
|---|---|---|
Film | -24 LUFS / -2 dBTP | Kino / Dolby-Referenz |
TV | -23 LUFS / -2 dBTP | EBU R128 |
Streaming | -27 LUFS / -2.3 dBTP | Große Streaming-Plattformen |
YouTube | -14 LUFS / -1 dBTP | Von YouTube empfohlen |
Broadcast | -23 LUFS / -1 dBTP | Strenges EBU R128 |
Werbemix | -23 LUFS / -1 dBTP | EBU R128 für Werbung |
Podcast | -16 LUFS / -1 dBTP | Podcast-Standard |
Die Ausgabe enthält einen Konformitätsbericht mit Pass/Fail-Auswertung für Programm-Lautheit, Dialog-Lautheit, True Peak, Programm-LRA und Dialog-LRA. Sie können diesen direkt für Endnutzer anzeigen oder in Ihre QC-Pipeline einspeisen.
Ausgabe verarbeiteter Stems
Optional können Sie individuell verarbeitete Stems zusammen mit dem finalen Mix exportieren. Nützlich für QC, Revision und nachgelagerte Editorial-Arbeiten.
GPU-Beschleunigung
Die Verarbeitung ist auf macOS (Metal) und Linux (CUDA) per GPU beschleunigt, mit automatischem Fallback auf die CPU, wenn keine GPU verfügbar ist.
Hören Sie es in Aktion
Hier sind zwei Vorher-nachher-Beispiele, die das Postproduktionsmodul in Aktion zeigen.
Beispiel 1: Werbespot
Dieses Beispiel verwendet das Lieferprofil Werbemix mit aktivierter Sidechain-Ducking-Funktion, wobei die Dialogspur als Sidechain-Quelle dient. Die Mastering-Stufe zielt auf EBU R128 für Werbung ab.
Beispiel 2: Animation für Streaming
Dieses Beispiel verwendet das Streaming-Lieferprofil ohne angewendetes Ducking. Das Mastering zielt auf die Lautheits-Spezifikation der großen Streaming-Plattformen ab.
Ab sofort im C++ SDK verfügbar. Cloud API folgt bald.
Das Postproduktionsmodul wird ab heute im Tonn C++ SDK mit vollständiger Dokumentation, Beispielanwendungen und JSON-Konfigurationsvorlagen für gängige Workflows ausgeliefert.
Wir bringen diese Funktionen in den kommenden Wochen zu unserer Cloud-API. Postproduktionsdienste verwenden dasselbe Kreditsystem wie unsere bestehende Musik-API, sodass jeder Kunde mit API-Credits die neuen Endpunkte sofort nutzen kann. Kein separater Plan oder keine separate Lizenz erforderlich.
Wie es weitergeht
Wir haben eine klare Roadmap für die Erweiterung des Postproduktionsmoduls:
Start der Cloud-API in den kommenden Wochen, beginnend mit Dialogverbesserung, Mastering für Lieferformate und Lautheitskonformität
Vollständige Pipeline-Endpunkte, einschließlich Sidechain-Ducking, ADR-Abgleich und des gebündelten Postproduktions-Mixes, kurz danach
Unterstützung für Surround- und immersive Audioformate ist auf unserer Roadmap (die Metadaten des Lieferformats enthalten bereits Felder für Surround und Kanalanzahl)
Wenn Sie Tools für Postproduktion, Rundfunk, Podcasting oder Videoplattformen entwickeln, würden wir uns freuen, mit Ihnen zu sprechen. Die SDK-Dokumentation ist live, und Sie können sich für den API-Zugang unter tonn-portal.roexaudio.com registrieren.
Das Tonn SDK und die API werden von RoEx entwickelt, dem Audio-Technologieunternehmen hinter Automix und Mix Check Studio. Seit 2023 haben wir über 5 Millionen Tracks verarbeitet.
Lernen