إطلاق Seed Audio 1.0 من Doubao: توليد خطوة واحدة لأصوات البشر والموسيقى التصويرية والمؤثرات البيئية

字節跳動旗下豆包團隊本週正式發表音訊生成模型 Seed Audio 1.0,同步上線火山方舟體驗中心開放創作者測試。這款模型把人聲、配樂、音效、環境聲視為同一個聲音場景,一次生成長達 2 分鐘、支援 20 余種語言的完整音軌。
(前情提要:字節跳動發布AI模型「OmniHuman-1」:讓黃仁勳變Rapper、泰勒絲唱日文歌,網讚超逼真)
(背景補充:字節跳動首創「豆包股」!發行獨立期權防堵騰訊挖角,打響 AI 人才保衛戰)

本文目錄

Toggle

  • 从念稿子到搭场景
  • 为什么要把声音拆开重新看待
  • ElevenLabs 的三步,豆包的一步

字節跳動旗下豆包本週正式發表 Seed Audio 1.0,也叫豆包音訊生成模型 1.0,同步上線火山方舟體驗中心開放創作者測試,企業端 API 也一起邀測。

過去做一段配音,人聲、配樂、音效通常得分開錄、分開對時間軸,最後才在剪輯軟體裡手動拼在一起。這次豆包想做的,是讓一次推理就把整個聲音場景生出來,人不用再當中间的接線生。

個人用戶可以在火山方舟體驗中心直接上手,國際開發者則透過 BytePlus 接入,這個模型也已經整合進豆包 app 本身。

從念稿子到搭場景

Seed Audio 1.0 不是傳統的 TTS。TTS 是文字轉語音,簡單來说就是把一段文字唸出來;而 Seed Audio 1.0 把人聲、背景音樂、音效、環境聲都當成同一個聲音場景裡的元素,對映進一個統一的聲學表徵。

簡單來说就是,模型不是分開處理誰在說話和背景在放什麼,而是把整個場景當成一件事一起生成。

它支援零樣本(zero-shot)多模態參考,簡單來說就是,不用重新訓練,丟一段文字或一段音訊當範例,模型就能模仿那個聲音的音色與風格。一條提示詞可以同時安排多角色對白、背景音樂與擬音特效,擬音也就是配音圈說的音效;就算生成的音訊拉長到將近 2 分鐘,裡面好幾個角色的音色也不會中途走調。

時間軸的控制精度到 100 毫秒,对白什麼時候開口、音效什麼時候進場,都能卡得很准。語言支援超過 20 種,中文、英語、日語都在其中,音色和風格也可以分開調,不必為了換一種說話方式重新更換一個聲音。

這套能力對應的是影視級音訊創作,涵蓋配音、配樂、擬音、混音等環節,也延伸到有聲書、廣播劇、Podcast、短影音、遊戲與互動媒體,等於把過去需要一整組後期團隊分工的活,收攏到一個模型裡。

為什麼要把聲音拆開重新看待

過去語音生成的思路,通常是把任務拆成好幾條線:語音合成一條、配樂一條、音效一條,各自訓練、各自输出,用戶再自己把它們對在同一條時間軸上。

Seed Audio 1.0 的邏辑反過來,先把所有聲音元素放進同一個表徵空間,再一次生成。這麼做的好處,是角色之間的音色、場景裡的音樂與音效天生就是同步的,不用事後校準。

ElevenLabs 的三步,豆包的一步

拿 ElevenLabs 的 Studio 对照最清楚。ElevenLabs 的做法是语音、音乐、音效三個独立 API,各自生成,用戶要自己在时间軸上拼接对齐;豆包想用一次推理取代這些環節。

在价格上,ElevenLabs Pro 一个月要 99 美元,豆包走火山引擎的 token 计费,也就是按用量算钱;在中文场景下成本明显更低。

配音、配樂、音效,過去是三個工种,三套軟體,三次匯出。Seed Audio 1.0 想證明的是,这些工序可以压进同一次推理里完成。

至於它能不能真的取代影視配音、有聲書、Podcast 等場景里的專業分工,创作者用了之后怎么说。

شاهد النسخة الأصلية
قد تحتوي هذه الصفحة على محتوى من جهات خارجية، يتم تقديمه لأغراض إعلامية فقط (وليس كإقرارات/ضمانات)، ولا ينبغي اعتباره موافقة على آرائه من قبل Gate، ولا بمثابة نصيحة مالية أو مهنية. انظر إلى إخلاء المسؤولية للحصول على التفاصيل.
  • أعجبني
  • تعليق
  • إعادة النشر
  • مشاركة
تعليق
إضافة تعليق
إضافة تعليق
لا توجد تعليقات
  • مُثبت