Lanzamiento de Seed Audio 1.0 de Doubao: genera en un paso voces, música de acompañamiento y efectos de ambiente

La plataforma de IA “Doubao” de ByteDance publicó oficialmente esta semana el modelo de generación de audio Seed Audio 1.0, también conocido como el modelo de generación de audio de Doubao 1.0, y al mismo tiempo lanzó una prueba para creadores abierta en el centro de experiencia de Volcano Ark. La plataforma también invita a una prueba a los desarrolladores del lado empresarial mediante API.

En el pasado, al crear un segmento de doblaje, las voces humanas, la música de fondo y los efectos de sonido normalmente se grababan por separado, cada uno con su propia línea de tiempo, y al final había que unirlos manualmente en un software de edición. Lo que Doubao quiere hacer ahora es generar, en una sola inferencia, todo el escenario sonoro completo, sin que la persona tenga que actuar como cableado intermedio.

Los usuarios individuales pueden empezar directamente en el centro de experiencia de Volcano Ark; los desarrolladores internacionales se conectan mediante BytePlus. Este modelo también ya está integrado en la propia app de Doubao.

De leer un guion a montar un escenario

Seed Audio 1.0 no es un TTS tradicional. TTS es texto a voz: en términos simples, es leer un texto. En cambio, Seed Audio 1.0 considera las voces humanas, la música de fondo, los efectos de sonido y los sonidos ambientales como elementos dentro del mismo escenario sonoro, mapeándolos en una representación acústica unificada.

En pocas palabras, el modelo no procesa por separado quién habla y qué está poniendo el fondo, sino que trata todo el escenario como una sola cosa y lo genera de una vez.

Admite referencias multimodales de zero-shot. En pocas palabras, sin necesidad de volver a entrenar, puedes introducir un texto o un audio como ejemplo, y el modelo puede imitar el timbre y el estilo de ese sonido. Un solo prompt puede organizar simultáneamente diálogos de varios personajes, música de fondo y efectos de foley; y aunque el audio generado se alargue hasta cerca de 2 minutos, los timbres de varios personajes no se desafinan a mitad del camino.

El control de la línea de tiempo llega a 100 milisegundos: cuándo empiezan a hablar los diálogos y cuándo entran los efectos de sonido puede ajustarse con mucha precisión. El soporte de idiomas supera las 20 lenguas: están incluido el chino, el inglés y el japonés; además, el timbre y el estilo pueden ajustarse por separado, sin tener que cambiar a una voz distinta para cambiar la forma de hablar.

Estas capacidades apuntan a la creación de audio de nivel cinematográfico: doblaje, composición de música, foley, mezcla, entre otras etapas; y también se extiende a audiolibros, radionovelas, Podcasts, videos cortos, juegos y medios interactivos. Es decir, tareas que antes requerían la división de trabajo de todo un equipo de postproducción ahora se concentran en un solo modelo.

Por qué tratar el sonido por separado y volver a mirarlo

La idea tradicional de generación de voz suele dividir la tarea en varias líneas: una para síntesis de voz, otra para música y otra para efectos de sonido. Cada una se entrena y se genera por separado, y luego el usuario las une en la misma línea de tiempo.

La lógica de Seed Audio 1.0 es lo contrario: primero mete todos los elementos sonoros en el mismo espacio de representación y luego los genera de una sola vez. La ventaja de hacerlo así es que, por naturaleza, el timbre entre personajes y la música y los efectos dentro del escenario están sincronizados, sin necesidad de calibración posterior.

Los tres pasos de ElevenLabs, el paso único de Doubao

La comparación más clara es con el Studio de ElevenLabs. El enfoque de ElevenLabs es usar tres API independientes: voz, música y efectos de sonido. Cada una genera por separado y el usuario tiene que recortar y alinear en la línea de tiempo. Doubao quiere sustituir estos pasos con una sola inferencia.

En precios, ElevenLabs Pro cuesta 99 dólares al mes; Doubao, mediante el motor Volcano, cobra por tokens, es decir, se paga según el uso, con costos claramente más bajos en escenarios en chino.

El doblaje, la música y los efectos de sonido antes eran tres oficios, tres conjuntos de software y tres exportaciones. Lo que Seed Audio 1.0 quiere demostrar es que estos procesos pueden comprimirse para completarse en una sola inferencia.

En cuanto a si realmente puede reemplazar el trabajo especializado en escenarios como doblaje cinematográfico, audiolibros y Podcasts, depende de lo que digan los creadores después de usarlo.

Ver original
Esta página puede contener contenido de terceros, que se proporciona únicamente con fines informativos (sin garantías ni declaraciones) y no debe considerarse como un respaldo por parte de Gate a las opiniones expresadas ni como asesoramiento financiero o profesional. Consulte el Descargo de responsabilidad para obtener más detalles.
  • Recompensa
  • Comentar
  • Republicar
  • Compartir
Comentar
Añadir un comentario
Añadir un comentario
Sin comentarios
  • Fijado