العقود الآجلة
وصول إلى مئات العقود الدائمة
CFD
الذهب
منصّة واحدة للأصول التقليدية العالمية
الخیارات المتاحة
Hot
تداول خيارات الفانيلا على الطريقة الأوروبية
الحساب الموحد
زيادة كفاءة رأس المال إلى أقصى حد
التداول التجريبي
مقدمة حول تداول العقود الآجلة
استعد لتداول العقود الآجلة
أحداث مستقبلية
"انضم إلى الفعاليات لكسب المكافآت "
التداول التجريبي
استخدم الأموال الافتراضية لتجربة التداول بدون مخاطر
CFD
مشتقات عقود الفروقات على الأسهم
الأسهم الأمريكية
وصول إلى الأسهم الأمريكية وصناديق ETF الحقيقية
أسهم هونغ كونغ
تداول أسهم عالية الجودة مدرجة في هونغ كونغ
الأسهم الكورية
SK Hynix
تداول الأسهم الكورية الحقيقية واستثمر في الأصول الشائعة
العقود الآجلة للأسهم
رافع مالية عالية، وتداول على مدار 24/7
الأسهم المُرمَّزة
مدعومة بأصول أسهم حقيقية
IPO Access
افتح الوصول الكامل إلى الاكتتابات العامة للأسهم العالمية
GUSD
3.8٪
سك GUSD للحصول على عوائد أصول العالم الحقيقي (RWA) للخزانة
أنشطة الأسهم
تداول الأسهم الرائجة واحصل على إنزالات جوية سخية
إطلاق
CandyDrop
اجمع الحلوى لتحصل على توزيعات مجانية.
منصة الإطلاق
-التخزين السريع، واربح رموزًا مميزة جديدة محتملة!
HODLer Airdrop
احتفظ بـ GT واحصل على توزيعات مجانية ضخمة مجانًا
Pre-IPOs
افتح الوصول الكامل إلى الاكتتابات العامة للأسهم العالمية
نقاط Alpha
تداول الأصول على السلسلة واكسب التوزيعات المجانية
نقاط العقود الآجلة
اكسب نقاط العقود الآجلة وطالب بمكافآت التوزيع المجاني
عروض ترويجية
AI
Gate AI
شريكك الذكي الشامل في الذكاء الاصطناعي
Gate AI Bot
استخدم Gate AI مباشرة في تطبيقك الاجتماعي
GateClaw
Gate الأزرق، جاهز للاستخدام
Gate for AI Agent
البنية التحتية للذكاء الاصطناعي، Gate MCP، Skills و CLI
Gate Skills Hub
أكثر من 10 آلاف مهارة
من المكتب إلى التداول، مكتبة المهارات الشاملة تجعل الذكاء الاصطناعي أكثر فعالية
إطلاق Seed Audio 1.0 من Doubao: توليد خطوة واحدة لأصوات البشر والموسيقى التصويرية والمؤثرات البيئية
字節跳動旗下豆包團隊本週正式發表音訊生成模型 Seed Audio 1.0,同步上線火山方舟體驗中心開放創作者測試。這款模型把人聲、配樂、音效、環境聲視為同一個聲音場景,一次生成長達 2 分鐘、支援 20 余種語言的完整音軌。
(前情提要:字節跳動發布AI模型「OmniHuman-1」:讓黃仁勳變Rapper、泰勒絲唱日文歌,網讚超逼真)
(背景補充:字節跳動首創「豆包股」!發行獨立期權防堵騰訊挖角,打響 AI 人才保衛戰)
本文目錄
Toggle
字節跳動旗下豆包本週正式發表 Seed Audio 1.0,也叫豆包音訊生成模型 1.0,同步上線火山方舟體驗中心開放創作者測試,企業端 API 也一起邀測。
過去做一段配音,人聲、配樂、音效通常得分開錄、分開對時間軸,最後才在剪輯軟體裡手動拼在一起。這次豆包想做的,是讓一次推理就把整個聲音場景生出來,人不用再當中间的接線生。
個人用戶可以在火山方舟體驗中心直接上手,國際開發者則透過 BytePlus 接入,這個模型也已經整合進豆包 app 本身。
從念稿子到搭場景
Seed Audio 1.0 不是傳統的 TTS。TTS 是文字轉語音,簡單來说就是把一段文字唸出來;而 Seed Audio 1.0 把人聲、背景音樂、音效、環境聲都當成同一個聲音場景裡的元素,對映進一個統一的聲學表徵。
簡單來说就是,模型不是分開處理誰在說話和背景在放什麼,而是把整個場景當成一件事一起生成。
它支援零樣本(zero-shot)多模態參考,簡單來說就是,不用重新訓練,丟一段文字或一段音訊當範例,模型就能模仿那個聲音的音色與風格。一條提示詞可以同時安排多角色對白、背景音樂與擬音特效,擬音也就是配音圈說的音效;就算生成的音訊拉長到將近 2 分鐘,裡面好幾個角色的音色也不會中途走調。
時間軸的控制精度到 100 毫秒,对白什麼時候開口、音效什麼時候進場,都能卡得很准。語言支援超過 20 種,中文、英語、日語都在其中,音色和風格也可以分開調,不必為了換一種說話方式重新更換一個聲音。
這套能力對應的是影視級音訊創作,涵蓋配音、配樂、擬音、混音等環節,也延伸到有聲書、廣播劇、Podcast、短影音、遊戲與互動媒體,等於把過去需要一整組後期團隊分工的活,收攏到一個模型裡。
為什麼要把聲音拆開重新看待
過去語音生成的思路,通常是把任務拆成好幾條線:語音合成一條、配樂一條、音效一條,各自訓練、各自输出,用戶再自己把它們對在同一條時間軸上。
Seed Audio 1.0 的邏辑反過來,先把所有聲音元素放進同一個表徵空間,再一次生成。這麼做的好處,是角色之間的音色、場景裡的音樂與音效天生就是同步的,不用事後校準。
ElevenLabs 的三步,豆包的一步
拿 ElevenLabs 的 Studio 对照最清楚。ElevenLabs 的做法是语音、音乐、音效三個独立 API,各自生成,用戶要自己在时间軸上拼接对齐;豆包想用一次推理取代這些環節。
在价格上,ElevenLabs Pro 一个月要 99 美元,豆包走火山引擎的 token 计费,也就是按用量算钱;在中文场景下成本明显更低。
配音、配樂、音效,過去是三個工种,三套軟體,三次匯出。Seed Audio 1.0 想證明的是,这些工序可以压进同一次推理里完成。
至於它能不能真的取代影視配音、有聲書、Podcast 等場景里的專業分工,创作者用了之后怎么说。