Présentation de Tonn SDK v2 : la post-production audio propulsée par l’IA pour le cinéma, la télévision et la publicité

Depuis 2023, la plateforme Tonn a traité plus de cinq millions de morceaux de musique grâce à notre moteur de mixage et de mastering. Aujourd’hui, nous lançons Tonn SDK v2, un module de post-production conçu sur mesure qui apporte cette même intelligence audio aux workflows de cinéma, de télévision, de streaming, de publicité et de podcasting.
Ce n’est pas un outil musical réutilisé. C’est un pipeline de traitement entièrement nouveau, conçu autour de la manière dont la post-production fonctionne réellement : centré sur les dialogues, conforme aux spécifications de livraison et adapté aux formats exigés par les diffuseurs et les plateformes.
Le module de post-production est disponible dès maintenant dans le Tonn C++ SDK, et la disponibilité de l’API cloud arrivera dans les prochaines semaines.
Pourquoi la post-production a besoin d’une nouvelle approche
La post-production audio a un problème de cohérence. Chaque projet comporte son propre mélange de dialogues, musique, effets sonores, bruitages Foley et ambiance, et chaque plateforme de diffusion a sa propre spécification de loudness. Obtenir un mix qui sonne juste et qui passe le contrôle qualité pour Netflix, YouTube, la télévision hertzienne et le cinéma signifie des heures de travail manuel par livrable.
Nous avons conçu Tonn SDK v2 pour rendre ce processus programmable. Un seul appel API. Un niveau de loudness correct. Une livraison conforme. Des stems traités si vous en avez besoin.
Ce qu’il y a dans la boîte
Types de pistes natifs pour la post-production
Le SDK parle nativement le langage de la post-production, avec 10 catégories de pistes dédiées : Dialogue (principal et secondaire), Musique, SFX, Ambiance, Foley, ADR, Voiceover (variantes à tonalité basse et haute), et une catégorie polyvalente. Cela signifie que le moteur de traitement comprend ce qu’il traite et traite les dialogues différemment d’une nappe musicale ou d’une piste Foley.
Amélioration intelligente des dialogues
Trois modes de traitement adaptés à différents types de contenus :
Préserver pour les documentaires et les contenus naturalistes, où une intervention minimale conserve le caractère original intact
Améliorer pour les contenus TV standard, streaming et interviews, en apportant un gain de clarté sans surtraitement
AD amélioré pour les publicités, annonces et voix off, en poussant l’intelligibilité aussi loin que possible
Sous le capot, le moteur effectue une détection du bruit de fond, une évaluation de l’équilibre fréquentiel, une analyse du clipping et un profilage de la réverbération avant d’appliquer le moindre traitement. Il s’adapte à ce qu’il entend.
Correspondance entre ADR et son de prise de vue
L’une des tâches les plus difficiles en post-production consiste à faire en sorte que des dialogues réenregistrés (ADR) s’intègrent naturellement au son de prise de vue original. DialogueMatcher du SDK analyse la réponse en fréquence, la dynamique, le timbre et les caractéristiques de réverbération de l’enregistrement d’origine, puis applique un traitement de correspondance à la prise ADR. Il renvoie des scores de similarité afin que vous puissiez vérifier la correspondance de manière programmatique.
Ducking automatique par sidechain
L’audio de fond (musique, SFX, ambiance) s’atténue automatiquement lorsque des dialogues sont détectés. Cinq préréglages couvrent les scénarios courants, d’une réduction subtile de -6 dB pour la musique de fond à une coupure agressive de -20 dB pour une narration sur musique. Un mode entièrement personnalisé vous donne le contrôle sur la profondeur de réduction, l’attaque et le relâchement. Le ducking multpiste est pris en charge, de sorte qu’un seul sidechain de dialogue peut contrôler simultanément plusieurs pistes de fond.
Sept préréglages de formats de livraison
Chaque préréglage est calibré selon une norme de livraison spécifique, avec des cibles de loudness, des limites de true peak et des contraintes de LRA (plage de loudness) :
Format | Cible | Norme |
|---|---|---|
Film | -24 LUFS / -2 dBTP | Référence cinéma / Dolby |
TV | -23 LUFS / -2 dBTP | EBU R128 |
Streaming | -27 LUFS / -2.3 dBTP | Principales plateformes de streaming |
YouTube | -14 LUFS / -1 dBTP | Recommandé par YouTube |
Broadcast | -23 LUFS / -1 dBTP | EBU R128 strict |
Mix pub | -23 LUFS / -1 dBTP | EBU R128 pour la publicité |
Podcast | -16 LUFS / -1 dBTP | Norme podcast |
La sortie inclut un rapport de conformité avec statut réussi/échoué couvrant le loudness du programme, le loudness des dialogues, le true peak, la LRA du programme et la LRA des dialogues. Vous pouvez l’afficher directement aux utilisateurs finaux ou l’intégrer à votre pipeline de contrôle qualité.
Sortie des stems traités
Exportez en option des stems traités individuellement en plus du mix final. Utile pour le contrôle qualité, les révisions et le travail éditorial en aval.
Accélération GPU
Le traitement est accéléré par GPU sur macOS (Metal) et Linux (CUDA), avec un basculement automatique vers le CPU lorsqu’aucun GPU n’est disponible.
Écoutez-le en action
Voici deux exemples avant/après montrant le module de post-production à l’œuvre.
Exemple 1 : spot publicitaire
Cet exemple utilise le profil de livraison Mix pub avec ducking par sidechain activé, en utilisant la piste de dialogue comme source de sidechain. L’étape de mastering cible l’EBU R128 pour la publicité.
Exemple 2 : animation pour le streaming
Cet exemple utilise le profil de livraison streaming sans aucun ducking appliqué. Le mastering cible la spécification de loudness de la principale plateforme de streaming.
Disponible dès maintenant dans le SDK C++. API cloud bientôt disponible.
Le module de post-production est disponible dès aujourd’hui dans le Tonn C++ SDK, avec une documentation complète, des applications d’exemple et des modèles de configuration JSON pour les workflows courants.
Nous apportons ces capacités à notre API cloud dans les prochaines semaines. Les services de post-production utiliseront le même système de crédits que notre API musicale existante, afin que tout client disposant de crédits API puisse commencer à utiliser immédiatement les nouveaux endpoints. Aucun plan ni licence séparé n’est requis.
Et ensuite
Nous avons une feuille de route claire pour faire évoluer le module de post-production :
Lancement de l’API cloud dans les prochaines semaines, en commençant par l’amélioration des dialogues, le mastering des formats de livraison et la conformité au loudness
Endpoints de pipeline complet, incluant le ducking par sidechain, la correspondance ADR et le mix de post-production intégré, peu après
Prise en charge du son surround et immersif sur notre feuille de route (les métadonnées des formats de livraison comportent déjà des champs surround et nombre de canaux)
Si vous développez des outils pour la post-production, la diffusion, le podcasting ou les plateformes vidéo, nous serions ravis d’en discuter. La documentation du SDK est en ligne, et vous pouvez vous inscrire pour obtenir un accès API sur tonn-portal.roexaudio.com.
Le SDK et l’API Tonn sont développés par RoEx, l’entreprise de technologie audio à l’origine d’Automix et de Mix Check Studio. Nous avons traité plus de 5 millions de pistes depuis 2023.
Pour les entreprises et les développeurs
Apprendre