Apresentando Tonn SDK v2: Pós-Produção de Áudio com IA para Cinema, TV e Publicidade

Desde 2023, a plataforma Tonn processou mais de cinco milhões de faixas musicais por meio do nosso mecanismo de mixagem e masterização. Hoje, estamos lançando o Tonn SDK v2, um módulo de pós-produção desenvolvido especificamente para levar essa mesma inteligência de áudio a fluxos de trabalho de cinema, televisão, streaming, publicidade e podcasting.
Isto não é uma ferramenta de música reaproveitada. É um pipeline de processamento inteiramente novo, projetado em torno da forma como a pós-produção realmente funciona: com diálogo em primeiro lugar, em conformidade com as especificações de entrega e construído para os formatos exigidos por emissoras e plataformas.
O módulo de pós-produção já está disponível no Tonn C++ SDK, com a API em nuvem chegando nas próximas semanas.
Por que a pós-produção precisa de uma nova abordagem
A pós-produção de áudio tem um problema de consistência. Cada projeto tem sua própria mistura de diálogo, música, efeitos sonoros, foley e ambiência, e cada plataforma de entrega tem sua própria especificação de loudness. Fazer uma mixagem soar bem e passar na QC para Netflix, YouTube, TV aberta e cinema significa horas de trabalho manual por entrega.
Desenvolvemos o Tonn SDK v2 para tornar esse processo programável. Uma chamada de API. Loudness correto. Entrega em conformidade. Stems processados, se você precisar deles.
O que vem na caixa
Tipos nativos de faixas de pós-produção
O SDK fala nativamente a linguagem da pós-produção, com 10 categorias de faixa dedicadas: Diálogo (principal e secundário), Música, SFX, Ambiência, Foley, ADR, Voiceover (variantes grave e aguda) e uma categoria de uso geral. Isso significa que o mecanismo de processamento entende com o que está trabalhando e trata o diálogo de forma diferente de uma base musical ou de uma faixa de foley.
Aprimoramento inteligente de diálogo
Três modos de processamento ajustados para diferentes tipos de conteúdo:
Preservar para documentários e conteúdo naturalista, onde a intervenção mínima mantém o caráter original intacto
Aprimorar para TV padrão, streaming e conteúdo de entrevista, aplicando um aumento de clareza sem excesso de processamento
AD Aprimorado para comerciais, anúncios e voiceover, elevando a inteligibilidade ao máximo possível
Nos bastidores, o mecanismo realiza detecção do piso de ruído, avaliação do equilíbrio de frequências, análise de clipping e perfil de reverberação antes de aplicar qualquer processamento. Ele se adapta ao que ouve.
Correspondência de ADR com som de locação
Uma das tarefas mais difíceis na pós-produção é fazer com que o diálogo regravado (ADR) soe naturalmente em relação ao som original de locação. O DialogueMatcher do SDK analisa a resposta de frequência, a dinâmica, o timbre e as características de reverberação da gravação original, e então aplica um processamento de correspondência à tomada de ADR. Ele retorna pontuações de similaridade para que você possa verificar a correspondência programaticamente.
Ducking automático por sidechain
O áudio de fundo (música, SFX, ambiência) faz ducking automaticamente quando o diálogo é detectado. Cinco predefinições cobrem cenários comuns, desde uma redução sutil de -6 dB para música de fundo até um corte agressivo de -20 dB para narração sobre a trilha. Um modo totalmente personalizado permite controlar a profundidade da redução, ataque e release. Há suporte a ducking em múltiplas faixas, então um único sidechain de diálogo pode controlar várias faixas de fundo simultaneamente.
Sete predefinições de formato de entrega
Cada predefinição é calibrada para um padrão específico de entrega, com metas de loudness, limites de true peak e restrições de LRA (Loudness Range):
Formato | Meta | Padrão |
|---|---|---|
Filme | -24 LUFS / -2 dBTP | Cinema / referência Dolby |
TV | -23 LUFS / -2 dBTP | EBU R128 |
Streaming | -27 LUFS / -2.3 dBTP | Principais plataformas de streaming |
YouTube | -14 LUFS / -1 dBTP | Recomendado pelo YouTube |
Broadcast | -23 LUFS / -1 dBTP | EBU R128 rigoroso |
Mix de anúncios | -23 LUFS / -1 dBTP | EBU R128 para publicidade |
Podcast | -16 LUFS / -1 dBTP | Padrão de podcast |
A saída inclui um relatório de conformidade de aprovado/reprovado cobrindo loudness do programa, loudness do diálogo, true peak, LRA do programa e LRA do diálogo. Você pode exibi-lo diretamente aos usuários finais ou inseri-lo no seu pipeline de QC.
Saída de stems processados
Opcionalmente, exporte stems processados individualmente junto com a mixagem final. Útil para QC, revisões e trabalho editorial downstream.
Aceleração por GPU
O processamento é acelerado por GPU tanto no macOS (Metal) quanto no Linux (CUDA), com fallback automático para CPU quando não há GPU disponível.
Ouça na prática
Aqui estão dois exemplos de antes e depois mostrando o módulo de pós-produção em ação.
Exemplo 1: Comercial
Este exemplo usa o perfil de entrega Ad Mix com ducking por sidechain ativado, usando a faixa de diálogo como fonte de sidechain. A etapa de masterização mira o EBU R128 para publicidade.
Exemplo 2: Animação para streaming
Este exemplo usa o perfil de entrega de streaming sem ducking aplicado. A masterização mira a especificação de loudness da principal plataforma de streaming.
Disponível agora no SDK C++. API em nuvem em breve.
O módulo de pós-produção é lançado hoje no Tonn C++ SDK, com documentação completa, aplicativos de exemplo e modelos de configuração JSON para fluxos de trabalho comuns.
Estamos levando esses recursos para nossa API em nuvem nas próximas semanas. Os serviços de pós-produção usarão o mesmo sistema de créditos da nossa API de música existente, então qualquer cliente com créditos de API pode começar a usar os novos endpoints imediatamente. Nenhum plano ou licença separado é necessário.
O que vem a seguir
Temos um roadmap claro para expandir o módulo de pós-produção:
Lançamento da API em nuvem nas próximas semanas, começando com aprimoramento de diálogo, masterização para formatos de entrega e conformidade de loudness
Endpoints de pipeline completo, incluindo ducking por sidechain, correspondência de ADR e a mixagem de pós-produção incluída no pacote, logo em seguida
Suporte a áudio surround e imersivo está no nosso roadmap (os metadados do formato de entrega já incluem campos de surround e contagem de canais)
Se você está desenvolvendo ferramentas para pós-produção, transmissão, podcasting ou plataformas de vídeo, adoraríamos conversar. A documentação do SDK já está no ar, e você pode se cadastrar para acesso à API em tonn-portal.roexaudio.com.
O SDK e a API Tonn são desenvolvidos pela RoEx, a empresa de tecnologia de áudio por trás do Automix e do Mix Check Studio. Processamos mais de 5 milhões de faixas desde 2023.
Para empresas e desenvolvedores
Aprender