Apresentando Tonn SDK v2: Pós-Produção de Áudio com IA para Cinema, TV e Publicidade

Desde 2023, a plataforma Tonn processou mais de cinco milhões de faixas musicais por meio do nosso mecanismo de mixagem e masterização. Hoje, estamos lançando o Tonn SDK v2, um módulo de pós-produção desenvolvido especificamente para levar essa mesma inteligência de áudio a fluxos de trabalho de cinema, televisão, streaming, publicidade e podcasting.

Isto não é uma ferramenta de música reaproveitada. É um pipeline de processamento inteiramente novo, projetado em torno da forma como a pós-produção realmente funciona: com diálogo em primeiro lugar, em conformidade com as especificações de entrega e construído para os formatos exigidos por emissoras e plataformas.

O módulo de pós-produção já está disponível no Tonn C++ SDK, com a API em nuvem chegando nas próximas semanas.

Por que a pós-produção precisa de uma nova abordagem

A pós-produção de áudio tem um problema de consistência. Cada projeto tem sua própria mistura de diálogo, música, efeitos sonoros, foley e ambiência, e cada plataforma de entrega tem sua própria especificação de loudness. Fazer uma mixagem soar bem e passar na QC para Netflix, YouTube, TV aberta e cinema significa horas de trabalho manual por entrega.

Desenvolvemos o Tonn SDK v2 para tornar esse processo programável. Uma chamada de API. Loudness correto. Entrega em conformidade. Stems processados, se você precisar deles.

O que vem na caixa

Tipos nativos de faixas de pós-produção

O SDK fala nativamente a linguagem da pós-produção, com 10 categorias de faixa dedicadas: Diálogo (principal e secundário), Música, SFX, Ambiência, Foley, ADR, Voiceover (variantes grave e aguda) e uma categoria de uso geral. Isso significa que o mecanismo de processamento entende com o que está trabalhando e trata o diálogo de forma diferente de uma base musical ou de uma faixa de foley.

Aprimoramento inteligente de diálogo

Três modos de processamento ajustados para diferentes tipos de conteúdo:

  • Preservar para documentários e conteúdo naturalista, onde a intervenção mínima mantém o caráter original intacto

  • Aprimorar para TV padrão, streaming e conteúdo de entrevista, aplicando um aumento de clareza sem excesso de processamento

  • AD Aprimorado para comerciais, anúncios e voiceover, elevando a inteligibilidade ao máximo possível

Nos bastidores, o mecanismo realiza detecção do piso de ruído, avaliação do equilíbrio de frequências, análise de clipping e perfil de reverberação antes de aplicar qualquer processamento. Ele se adapta ao que ouve.

Correspondência de ADR com som de locação

Uma das tarefas mais difíceis na pós-produção é fazer com que o diálogo regravado (ADR) soe naturalmente em relação ao som original de locação. O DialogueMatcher do SDK analisa a resposta de frequência, a dinâmica, o timbre e as características de reverberação da gravação original, e então aplica um processamento de correspondência à tomada de ADR. Ele retorna pontuações de similaridade para que você possa verificar a correspondência programaticamente.

Ducking automático por sidechain

O áudio de fundo (música, SFX, ambiência) faz ducking automaticamente quando o diálogo é detectado. Cinco predefinições cobrem cenários comuns, desde uma redução sutil de -6 dB para música de fundo até um corte agressivo de -20 dB para narração sobre a trilha. Um modo totalmente personalizado permite controlar a profundidade da redução, ataque e release. Há suporte a ducking em múltiplas faixas, então um único sidechain de diálogo pode controlar várias faixas de fundo simultaneamente.

Sete predefinições de formato de entrega

Cada predefinição é calibrada para um padrão específico de entrega, com metas de loudness, limites de true peak e restrições de LRA (Loudness Range):

Formato

Meta

Padrão

Filme

-24 LUFS / -2 dBTP

Cinema / referência Dolby

TV

-23 LUFS / -2 dBTP

EBU R128

Streaming

-27 LUFS / -2.3 dBTP

Principais plataformas de streaming

YouTube

-14 LUFS / -1 dBTP

Recomendado pelo YouTube

Broadcast

-23 LUFS / -1 dBTP

EBU R128 rigoroso

Mix de anúncios

-23 LUFS / -1 dBTP

EBU R128 para publicidade

Podcast

-16 LUFS / -1 dBTP

Padrão de podcast

A saída inclui um relatório de conformidade de aprovado/reprovado cobrindo loudness do programa, loudness do diálogo, true peak, LRA do programa e LRA do diálogo. Você pode exibi-lo diretamente aos usuários finais ou inseri-lo no seu pipeline de QC.

Saída de stems processados

Opcionalmente, exporte stems processados individualmente junto com a mixagem final. Útil para QC, revisões e trabalho editorial downstream.

Aceleração por GPU

O processamento é acelerado por GPU tanto no macOS (Metal) quanto no Linux (CUDA), com fallback automático para CPU quando não há GPU disponível.

Ouça na prática

Aqui estão dois exemplos de antes e depois mostrando o módulo de pós-produção em ação.

Exemplo 1: Comercial

Este exemplo usa o perfil de entrega Ad Mix com ducking por sidechain ativado, usando a faixa de diálogo como fonte de sidechain. A etapa de masterização mira o EBU R128 para publicidade.

Exemplo 2: Animação para streaming

Este exemplo usa o perfil de entrega de streaming sem ducking aplicado. A masterização mira a especificação de loudness da principal plataforma de streaming.

Disponível agora no SDK C++. API em nuvem em breve.

O módulo de pós-produção é lançado hoje no Tonn C++ SDK, com documentação completa, aplicativos de exemplo e modelos de configuração JSON para fluxos de trabalho comuns.

Estamos levando esses recursos para nossa API em nuvem nas próximas semanas. Os serviços de pós-produção usarão o mesmo sistema de créditos da nossa API de música existente, então qualquer cliente com créditos de API pode começar a usar os novos endpoints imediatamente. Nenhum plano ou licença separado é necessário.

O que vem a seguir

Temos um roadmap claro para expandir o módulo de pós-produção:

  • Lançamento da API em nuvem nas próximas semanas, começando com aprimoramento de diálogo, masterização para formatos de entrega e conformidade de loudness

  • Endpoints de pipeline completo, incluindo ducking por sidechain, correspondência de ADR e a mixagem de pós-produção incluída no pacote, logo em seguida

  • Suporte a áudio surround e imersivo está no nosso roadmap (os metadados do formato de entrega já incluem campos de surround e contagem de canais)

Se você está desenvolvendo ferramentas para pós-produção, transmissão, podcasting ou plataformas de vídeo, adoraríamos conversar. A documentação do SDK já está no ar, e você pode se cadastrar para acesso à API em tonn-portal.roexaudio.com.

O SDK e a API Tonn são desenvolvidos pela RoEx, a empresa de tecnologia de áudio por trás do Automix e do Mix Check Studio. Processamos mais de 5 milhões de faixas desde 2023.