Presentamos Tonn SDK v2: posproducción de audio impulsada por IA para cine, televisión y publicidad

Desde 2023, la plataforma Tonn ha procesado más de cinco millones de pistas musicales a través de nuestro motor de mezcla y masterización. Hoy lanzamos Tonn SDK v2, un módulo de posproducción diseñado específicamente que lleva esa misma inteligencia de audio a flujos de trabajo de cine, televisión, streaming, publicidad y podcasting.

No se trata de una herramienta musical reutilizada. Es un canal de procesamiento totalmente nuevo diseñado en torno a cómo funciona realmente la posproducción: centrado primero en el diálogo, conforme a las especificaciones de entrega y construido para los formatos que exigen las cadenas y las plataformas.

El módulo de posproducción ya está disponible en el Tonn C++ SDK, y la disponibilidad de la API en la nube llegará en las próximas semanas.

Por qué la posproducción necesita un nuevo enfoque

La posproducción de audio tiene un problema de consistencia. Cada proyecto tiene su propia mezcla de diálogo, música, efectos de sonido, foley y ambiente, y cada plataforma de entrega tiene su propia especificación de sonoridad. Conseguir que una mezcla suene bien y pase el control de calidad de Netflix, YouTube, la televisión en abierto y el cine implica horas de trabajo manual por entregable.

Hemos creado Tonn SDK v2 para que ese proceso sea programable. Una llamada a la API. Sonoridad correcta. Entrega conforme a la norma. Stems procesados si los necesitas.

Qué incluye

Tipos nativos de pista para posproducción

El SDK habla el lenguaje de la posproducción de forma nativa, con 10 categorías de pista dedicadas: Diálogo (principal y secundario), Música, SFX, Ambiente, Foley, ADR, Voiceover (variantes de tono bajo y alto) y una categoría de uso general. Esto significa que el motor de procesamiento entiende con qué está trabajando y trata el diálogo de forma distinta a una base musical o a una pista de foley.

Mejora inteligente del diálogo

Tres modos de procesamiento adaptados a distintos tipos de contenido:

  • Conservar para documentales y contenidos naturalistas, donde una intervención mínima mantiene intacto el carácter original

  • Mejorar para TV estándar, streaming y entrevistas, aplicando un refuerzo de claridad sin sobreprocesar

  • AD mejorado para anuncios, comunicados y voiceover, maximizando la inteligibilidad todo lo posible

Bajo el capó, el motor realiza detección del piso de ruido, evaluación del balance de frecuencias, análisis de clipping y perfilado de reverberación antes de aplicar cualquier procesamiento. Se adapta a lo que escucha.

Correspondencia del sonido ADR con la localización

Una de las tareas más difíciles en posproducción es hacer que el diálogo regrabado (ADR) encaje de forma natural con el sonido original de localización. DialogueMatcher del SDK analiza la respuesta en frecuencia, la dinámica, el timbre y las características de reverberación de la grabación original, y luego aplica un procesamiento de coincidencia a la toma ADR. Devuelve puntuaciones de similitud para que puedas verificar la coincidencia de forma programática.

Atenuación automática por sidechain

El audio de fondo (música, SFX, ambiente) se atenúa automáticamente cuando se detecta diálogo. Cinco preajustes cubren escenarios comunes, desde una sutil reducción de -6 dB para música de fondo hasta un recorte agresivo de -20 dB para narración sobre música. Un modo totalmente personalizado te da control sobre la profundidad de la reducción, el ataque y la liberación. Se admite la atenuación multitrack, de modo que un solo sidechain de diálogo puede controlar varias pistas de fondo a la vez.

Siete preajustes de formato de entrega

Cada preajuste está calibrado para un estándar de entrega específico con objetivos de sonoridad, límites de pico real y restricciones de LRA (rango de sonoridad):

Formato

Objetivo

Estándar

Cine

-24 LUFS / -2 dBTP

Cine / referencia Dolby

TV

-23 LUFS / -2 dBTP

EBU R128

Streaming

-27 LUFS / -2.3 dBTP

Principales plataformas de streaming

YouTube

-14 LUFS / -1 dBTP

Recomendado por YouTube

Emisión

-23 LUFS / -1 dBTP

EBU R128 estricto

Mezcla publicitaria

-23 LUFS / -1 dBTP

EBU R128 para publicidad

Pódcast

-16 LUFS / -1 dBTP

Estándar de pódcast

La salida incluye un informe de cumplimiento apto/no apto que cubre la sonoridad del programa, la sonoridad del diálogo, el pico real, el LRA del programa y el LRA del diálogo. Puedes mostrarlo directamente a los usuarios finales o integrarlo en tu canal de control de calidad.

Exportación de stems procesados

Exporta opcionalmente los stems procesados individualmente junto con la mezcla final. Útil para control de calidad, revisiones y trabajo editorial posterior.

Aceleración por GPU

El procesamiento se acelera por GPU en macOS (Metal) y Linux (CUDA), con fallback automático a CPU cuando no hay una GPU disponible.

Escúchalo en acción

Aquí tienes dos ejemplos de antes y después que muestran el módulo de posproducción en acción.

Ejemplo 1: Spot publicitario

Este ejemplo utiliza el perfil de entrega Ad Mix con la atenuación por sidechain activada, usando la pista de diálogo como fuente de sidechain. La fase de masterización apunta a EBU R128 para publicidad.

Ejemplo 2: Animación para streaming

Este ejemplo utiliza el perfil de entrega para streaming sin aplicar atenuación. La masterización se ajusta a la especificación de sonoridad de la principal plataforma de streaming.

Disponible ahora en el C++ SDK. La API en la nube llegará pronto.

El módulo de posproducción se publica hoy en el Tonn C++ SDK con documentación completa, aplicaciones de ejemplo y plantillas de configuración JSON para flujos de trabajo comunes.

Llevaremos estas capacidades a nuestra API en la nube en las próximas semanas. Los servicios de posproducción usarán el mismo sistema de créditos que nuestra API de música existente, por lo que cualquier cliente con créditos de API puede empezar a usar los nuevos endpoints de inmediato. No se requiere un plan ni una licencia aparte.

Qué sigue

Tenemos una hoja de ruta clara para ampliar el módulo de posproducción:

  • Lanzamiento de la API en la nube en las próximas semanas, empezando por la mejora del diálogo, la masterización por formato de entrega y el cumplimiento de sonoridad

  • Endpoints de canal completo, incluidos la atenuación por sidechain, la coincidencia ADR y la mezcla de posproducción integrada, poco después

  • El soporte para audio envolvente e inmersivo está en nuestra hoja de ruta (los metadatos del formato de entrega ya incluyen campos de surround y número de canales)

Si estás creando herramientas para posproducción, emisión, podcasting o plataformas de vídeo, nos encantaría hablar. La documentación del SDK ya está disponible y puedes registrarte para acceder a la API en tonn-portal.roexaudio.com.

El SDK y la API de Tonn están desarrollados por RoEx, la empresa de tecnología de audio detrás de Automix y Mix Check Studio. Hemos procesado más de 5 millones de pistas desde 2023.