Seed Audio 1.0 от Doubao запущен: вокал + музыка + окружающие звуки генерируются за один шаг

Команда Doubao, входящая в ByteDance, на этой неделе официально представила аудиогенеративную модель Seed Audio 1.0, а также одновременно запустила открытое для создателей тестирование в центре экспериментов Volcano Ark. Эта модель рассматривает голоса, фоновую музыку, звуковые эффекты и окружающие звуки как элементы одного и того же звукового окружения: за один проход она генерирует полноценную аудиодорожку длительностью до 2 минут и поддерживает более 20 языков.

(Хронология: ByteDance выпустила AI-модель «OmniHuman-1»: позволяет Хуан Цзюньсяня сделать рэпером, а Тейлор Свифт — петь японские песни, и пользователи в восторге от сверхправдоподобия)

(Дополнение по контексту: ByteDance первой запустила «акции Doubao» — выпустила независимые опционы, чтобы перекрыть попытки Tencent переманить таланты, и тем самым объявила войну за AI-кадры)

Оглавление

Toggle

  • От чтения закадра до сборки сцены
  • Почему звук нужно заново воспринимать как единый объект
  • Три шага ElevenLabs и один шаг Doubao

ByteDance, через продукт Doubao, на этой неделе официально представила Seed Audio 1.0, также известную как аудиогенеративная модель Doubao 1.0. Одновременно модель была размещена в Volcano Ark для открытого тестирования создателями, а API для корпоративного сегмента тоже пригласили к бета-участию.

Раньше, чтобы сделать один фрагмент озвучки, голос, музыка и звуковые эффекты обычно записывались отдельно — раздельно по времени, а затем в монтажном софте вручную склеивались в нужном таймлайне. На этот раз Doubao хочет другое: чтобы за один проход генерации сразу рождалось целое звуковое окружение — и пользователю не нужно было выступать в роли промежуточного «соединителя кабелей».

Для обычных пользователей модель можно сразу освоить в Volcano Ark, а международные разработчики подключают её через BytePlus; сама модель также уже встроена в приложение Doubao.

От чтения закадра до сборки сцены

Seed Audio 1.0 — это не традиционный TTS. TTS — это текст в речь: простыми словами, текст «зачитывается» голосом. А Seed Audio 1.0 относит голоса, фоновую музыку, звуковые эффекты и окружающие звуки к элементам одного звукового окружения и отображает всё в едином акустическом представлении.

Проще говоря: модель не разделяет задачу на «кто говорит» и «какая музыка играет на фоне», а воспринимает целую сцену как одну вещь и генерирует её целиком.

Она поддерживает zero-shot мульти-модальные референсы: не нужно заново обучать — достаточно подать текст или отрывок аудио в качестве примера, и модель сможет имитировать тембр и стиль. Одна подсказка может одновременно задать реплики нескольких персонажей, фоновую музыку и имитацию эффектов, то есть те самые звуковые эффекты, что обычно используют в озвучке; даже если сгенерированная аудиодорожка будет растягиваться почти до 2 минут, тембры нескольких персонажей не «уплывут» и не съедут по высоте/интонации по ходу.

Точность управления по таймлайну — до 100 миллисекунд: можно очень точно зафиксировать, когда персонаж начинает говорить и когда появляются эффекты. Поддерживаемых языков — более 20: в том числе китайский, английский и японский. Тембр и стиль можно настраивать отдельно, не нужно ради смены манеры речи каждый раз менять и «голос».

Эти возможности соответствуют уровню аудиопроизводства для кино и ТВ: озвучка, музыка, звуковые эффекты, сведение и т.д., и выходят за рамки обычного монтажа — на аудиокниги, радиопостановки, подкасты, короткие видео, игры и интерактивные медиа. По сути, то, что раньше требовало целую команду постпродакшна, собирается в одном единственном моделировании.

Почему нужно по-новому смотреть на звук как на единый объект

Раньше подход к генерации речи обычно строился так: задачу разбивали на несколько линий — синтез речи отдельно, музыка отдельно, эффекты отдельно. Всё обучалось и генерировалось раздельно, а затем пользователю нужно было самому сопоставлять и выравнивать это по общему таймлайну.

Логика Seed Audio 1.0 устроена наоборот: сначала все элементы звука помещаются в одно пространство представления, а затем генерируются за один раз. В этом ключевая выгода: тембры персонажей и музыка с эффектами в сцене синхронизированы изначально — не нужно потом делать ручную калибровку.

Три шага ElevenLabs и один шаг Doubao

Самое удобное сравнение — Studio от ElevenLabs. Их подход: есть три независимых API для речи, музыки и эффектов — каждое генерируется отдельно, а пользователю приходится самому собирать и выравнивать по таймлайну. Doubao же пытается заменить эти этапы одним проходом генерации.

По цене: ElevenLabs Pro стоит 99 долларов в месяц, а Doubao использует токеновую тарификацию от движка Volcano — то есть оплата по фактическому использованию, и в китайских сценариях это заметно дешевле.

Озвучка, музыка и звуковые эффекты раньше были тремя отдельными профессиями, тремя наборами софта и тремя экспортами. Seed Audio 1.0 как раз пытается доказать, что эти операции можно сжать в один проход генерации.

А сможет ли она реально заменить профессиональное разделение труда в сценариях вроде кино- и ТВ-озвучки, аудиокниг и Podcast — покажет то, что скажут создатели после использования.

Посмотреть Оригинал
На этой странице может содержаться сторонний контент, который предоставляется исключительно в информационных целях (не в качестве заявлений/гарантий) и не должен рассматриваться как поддержка взглядов компании Gate или как финансовый или профессиональный совет. Подробности смотрите в разделе «Отказ от ответственности» .
  • Награда
  • комментарий
  • Репост
  • Поделиться
комментарий
Добавить комментарий
Добавить комментарий
Нет комментариев
  • Закреплено