Presentamos Tonn SDK v2: posproducción de audio impulsada por IA para cine, televisión y publicidad

Desde 2023, la plataforma Tonn ha procesado más de cinco millones de pistas musicales a través de nuestro motor de mezcla y masterización. Hoy lanzamos Tonn SDK v2, un módulo de posproducción diseñado específicamente que lleva esa misma inteligencia de audio a flujos de trabajo de cine, televisión, streaming, publicidad y podcasting.
No se trata de una herramienta musical reutilizada. Es un canal de procesamiento totalmente nuevo diseñado en torno a cómo funciona realmente la posproducción: centrado primero en el diálogo, conforme a las especificaciones de entrega y construido para los formatos que exigen las cadenas y las plataformas.
El módulo de posproducción ya está disponible en el Tonn C++ SDK, y la disponibilidad de la API en la nube llegará en las próximas semanas.
Por qué la posproducción necesita un nuevo enfoque
La posproducción de audio tiene un problema de consistencia. Cada proyecto tiene su propia mezcla de diálogo, música, efectos de sonido, foley y ambiente, y cada plataforma de entrega tiene su propia especificación de sonoridad. Conseguir que una mezcla suene bien y pase el control de calidad de Netflix, YouTube, la televisión en abierto y el cine implica horas de trabajo manual por entregable.
Hemos creado Tonn SDK v2 para que ese proceso sea programable. Una llamada a la API. Sonoridad correcta. Entrega conforme a la norma. Stems procesados si los necesitas.
Qué incluye
Tipos nativos de pista para posproducción
El SDK habla el lenguaje de la posproducción de forma nativa, con 10 categorías de pista dedicadas: Diálogo (principal y secundario), Música, SFX, Ambiente, Foley, ADR, Voiceover (variantes de tono bajo y alto) y una categoría de uso general. Esto significa que el motor de procesamiento entiende con qué está trabajando y trata el diálogo de forma distinta a una base musical o a una pista de foley.
Mejora inteligente del diálogo
Tres modos de procesamiento adaptados a distintos tipos de contenido:
Conservar para documentales y contenidos naturalistas, donde una intervención mínima mantiene intacto el carácter original
Mejorar para TV estándar, streaming y entrevistas, aplicando un refuerzo de claridad sin sobreprocesar
AD mejorado para anuncios, comunicados y voiceover, maximizando la inteligibilidad todo lo posible
Bajo el capó, el motor realiza detección del piso de ruido, evaluación del balance de frecuencias, análisis de clipping y perfilado de reverberación antes de aplicar cualquier procesamiento. Se adapta a lo que escucha.
Correspondencia del sonido ADR con la localización
Una de las tareas más difíciles en posproducción es hacer que el diálogo regrabado (ADR) encaje de forma natural con el sonido original de localización. DialogueMatcher del SDK analiza la respuesta en frecuencia, la dinámica, el timbre y las características de reverberación de la grabación original, y luego aplica un procesamiento de coincidencia a la toma ADR. Devuelve puntuaciones de similitud para que puedas verificar la coincidencia de forma programática.
Atenuación automática por sidechain
El audio de fondo (música, SFX, ambiente) se atenúa automáticamente cuando se detecta diálogo. Cinco preajustes cubren escenarios comunes, desde una sutil reducción de -6 dB para música de fondo hasta un recorte agresivo de -20 dB para narración sobre música. Un modo totalmente personalizado te da control sobre la profundidad de la reducción, el ataque y la liberación. Se admite la atenuación multitrack, de modo que un solo sidechain de diálogo puede controlar varias pistas de fondo a la vez.
Siete preajustes de formato de entrega
Cada preajuste está calibrado para un estándar de entrega específico con objetivos de sonoridad, límites de pico real y restricciones de LRA (rango de sonoridad):
Formato | Objetivo | Estándar |
|---|---|---|
Cine | -24 LUFS / -2 dBTP | Cine / referencia Dolby |
TV | -23 LUFS / -2 dBTP | EBU R128 |
Streaming | -27 LUFS / -2.3 dBTP | Principales plataformas de streaming |
YouTube | -14 LUFS / -1 dBTP | Recomendado por YouTube |
Emisión | -23 LUFS / -1 dBTP | EBU R128 estricto |
Mezcla publicitaria | -23 LUFS / -1 dBTP | EBU R128 para publicidad |
Pódcast | -16 LUFS / -1 dBTP | Estándar de pódcast |
La salida incluye un informe de cumplimiento apto/no apto que cubre la sonoridad del programa, la sonoridad del diálogo, el pico real, el LRA del programa y el LRA del diálogo. Puedes mostrarlo directamente a los usuarios finales o integrarlo en tu canal de control de calidad.
Exportación de stems procesados
Exporta opcionalmente los stems procesados individualmente junto con la mezcla final. Útil para control de calidad, revisiones y trabajo editorial posterior.
Aceleración por GPU
El procesamiento se acelera por GPU en macOS (Metal) y Linux (CUDA), con fallback automático a CPU cuando no hay una GPU disponible.
Escúchalo en acción
Aquí tienes dos ejemplos de antes y después que muestran el módulo de posproducción en acción.
Ejemplo 1: Spot publicitario
Este ejemplo utiliza el perfil de entrega Ad Mix con la atenuación por sidechain activada, usando la pista de diálogo como fuente de sidechain. La fase de masterización apunta a EBU R128 para publicidad.
Ejemplo 2: Animación para streaming
Este ejemplo utiliza el perfil de entrega para streaming sin aplicar atenuación. La masterización se ajusta a la especificación de sonoridad de la principal plataforma de streaming.
Disponible ahora en el C++ SDK. La API en la nube llegará pronto.
El módulo de posproducción se publica hoy en el Tonn C++ SDK con documentación completa, aplicaciones de ejemplo y plantillas de configuración JSON para flujos de trabajo comunes.
Llevaremos estas capacidades a nuestra API en la nube en las próximas semanas. Los servicios de posproducción usarán el mismo sistema de créditos que nuestra API de música existente, por lo que cualquier cliente con créditos de API puede empezar a usar los nuevos endpoints de inmediato. No se requiere un plan ni una licencia aparte.
Qué sigue
Tenemos una hoja de ruta clara para ampliar el módulo de posproducción:
Lanzamiento de la API en la nube en las próximas semanas, empezando por la mejora del diálogo, la masterización por formato de entrega y el cumplimiento de sonoridad
Endpoints de canal completo, incluidos la atenuación por sidechain, la coincidencia ADR y la mezcla de posproducción integrada, poco después
El soporte para audio envolvente e inmersivo está en nuestra hoja de ruta (los metadatos del formato de entrega ya incluyen campos de surround y número de canales)
Si estás creando herramientas para posproducción, emisión, podcasting o plataformas de vídeo, nos encantaría hablar. La documentación del SDK ya está disponible y puedes registrarte para acceder a la API en tonn-portal.roexaudio.com.
El SDK y la API de Tonn están desarrollados por RoEx, la empresa de tecnología de audio detrás de Automix y Mix Check Studio. Hemos procesado más de 5 millones de pistas desde 2023.
Para empresas y desarrolladores
Aprender