Фьючерсы
Доступ к сотням фьючерсов
CFD
Золото
Одна платформа мировых активов
Опционы
Hot
Торги опционами Vanilla в европейском стиле
Единый счет
Увеличьте эффективность вашего капитала
Демо-торговля
Введение в торговлю фьючерсами
Подготовьтесь к торговле фьючерсами
Фьючерсные события
Получайте награды в событиях
Демо-торговля
Используйте виртуальные средства для торговли без риска
CFD
Деривативы CFD на акции
Акции США
Доступ к реальным акциям США и ETF
Акции Гонконга
Торгуйте качественными акциями, котирующимися в Гонконге
Корейские акции
SK Hynix
Торгуйте реальными корейскими акциями и инвестируйте в популярные активы
Фьючерсы на акции
Высокое кредитное плечо, круглосуточная торговля
Токенизированные акции
Обеспечено реальными акциями
IPO Access
Откройте полный доступ к глобальным IPO акций
GUSD
3.8%
Создать GUSD для получения доходности казначейских RWA
Мероприятия, связанные с акциями
Торгуйте популярными акциями и получайте щедрые эирдропы
Запуск
CandyDrop
Собирайте конфеты, чтобы заработать аирдропы
Launchpool
Быстрый стейкинг, заработайте потенциальные новые токены
HODLer Airdrop
Удерживайте GT и получайте огромные аирдропы бесплатно
Pre-IPOs
Откройте полный доступ к глобальным IPO акций
Alpha Points
Торгуйте и получайте аирдропы
Фьючерсные баллы
Зарабатывайте баллы и получайте награды аирдропа
Инвестиции
Simple Earn
Зарабатывайте проценты с помощью неиспользуемых токенов
Автоинвест.
Автоинвестиции на регулярной основе.
Бивалютные инвестиции
Доход от волатильности рынка
Мягкий стейкинг
Получайте вознаграждения с помощью гибкого стейкинга
Криптозаймы
0 Fees
Заложите одну криптовалюту, чтобы занять другую
Центр кредитования
Единый центр кредитования
VIP-центр богатства
Планы премиального роста
Gate Wealth
Возьмите под контроль свое финансовое будущее
Количественный фонд
Лучшие стратегии
Стейкинг
Делайте стейкинг криптовалюты, чтобы заработать на продуктах PoS
Умное плечо
Плечо без риска ликвидации
GUSD
3.8%
Пополнение и погашение в любое время, без комиссии
Рекламные акции
Промоакции
Участвуйте и получайте награды
Реферал
200 USDT
Приглашайте друзей за бонусы
Партнерская программа
Эксклюзивные комиссионные
Gate Booster
Растите влияние и получайте аирдроп
Анонсы
Обновления в реальном времени
Блог Gate
Статьи о криптоиндустрии
VIP-услуги
Огромные скидки на комиссии
Управление активами
Универсальное решение для управления активами
Институциональный
Крипто-решения для бизнеса
Разработчикам (API)
Подключение к экосистеме приложений Gate
Внебиржевые банковские переводы
Ввод и вывод фиатных денег
Брокерская программа
Щедрые механизмы скидок API
AI
Gate AI
Ваш универсальный AI-ассистент для любых задач
Gate AI Bot
Используйте Gate AI прямо в вашем социальном приложении
GateClaw
Gate Синий Лобстер — готов к использованию
Gate for AI Agent
AI-инфраструктура: Gate MCP, Skills и CLI
Gate Skills Hub
Более 10 тыс навыков
От офиса до трейдинга: единая база навыков для эффективного использования ИИ
Seed Audio 1.0 от Doubao запущен: вокал + музыка + окружающие звуки генерируются за один шаг
Команда Doubao, входящая в ByteDance, на этой неделе официально представила аудиогенеративную модель Seed Audio 1.0, а также одновременно запустила открытое для создателей тестирование в центре экспериментов Volcano Ark. Эта модель рассматривает голоса, фоновую музыку, звуковые эффекты и окружающие звуки как элементы одного и того же звукового окружения: за один проход она генерирует полноценную аудиодорожку длительностью до 2 минут и поддерживает более 20 языков.
(Хронология: ByteDance выпустила AI-модель «OmniHuman-1»: позволяет Хуан Цзюньсяня сделать рэпером, а Тейлор Свифт — петь японские песни, и пользователи в восторге от сверхправдоподобия)
(Дополнение по контексту: ByteDance первой запустила «акции Doubao» — выпустила независимые опционы, чтобы перекрыть попытки Tencent переманить таланты, и тем самым объявила войну за AI-кадры)
Оглавление
Toggle
ByteDance, через продукт Doubao, на этой неделе официально представила Seed Audio 1.0, также известную как аудиогенеративная модель Doubao 1.0. Одновременно модель была размещена в Volcano Ark для открытого тестирования создателями, а API для корпоративного сегмента тоже пригласили к бета-участию.
Раньше, чтобы сделать один фрагмент озвучки, голос, музыка и звуковые эффекты обычно записывались отдельно — раздельно по времени, а затем в монтажном софте вручную склеивались в нужном таймлайне. На этот раз Doubao хочет другое: чтобы за один проход генерации сразу рождалось целое звуковое окружение — и пользователю не нужно было выступать в роли промежуточного «соединителя кабелей».
Для обычных пользователей модель можно сразу освоить в Volcano Ark, а международные разработчики подключают её через BytePlus; сама модель также уже встроена в приложение Doubao.
От чтения закадра до сборки сцены
Seed Audio 1.0 — это не традиционный TTS. TTS — это текст в речь: простыми словами, текст «зачитывается» голосом. А Seed Audio 1.0 относит голоса, фоновую музыку, звуковые эффекты и окружающие звуки к элементам одного звукового окружения и отображает всё в едином акустическом представлении.
Проще говоря: модель не разделяет задачу на «кто говорит» и «какая музыка играет на фоне», а воспринимает целую сцену как одну вещь и генерирует её целиком.
Она поддерживает zero-shot мульти-модальные референсы: не нужно заново обучать — достаточно подать текст или отрывок аудио в качестве примера, и модель сможет имитировать тембр и стиль. Одна подсказка может одновременно задать реплики нескольких персонажей, фоновую музыку и имитацию эффектов, то есть те самые звуковые эффекты, что обычно используют в озвучке; даже если сгенерированная аудиодорожка будет растягиваться почти до 2 минут, тембры нескольких персонажей не «уплывут» и не съедут по высоте/интонации по ходу.
Точность управления по таймлайну — до 100 миллисекунд: можно очень точно зафиксировать, когда персонаж начинает говорить и когда появляются эффекты. Поддерживаемых языков — более 20: в том числе китайский, английский и японский. Тембр и стиль можно настраивать отдельно, не нужно ради смены манеры речи каждый раз менять и «голос».
Эти возможности соответствуют уровню аудиопроизводства для кино и ТВ: озвучка, музыка, звуковые эффекты, сведение и т.д., и выходят за рамки обычного монтажа — на аудиокниги, радиопостановки, подкасты, короткие видео, игры и интерактивные медиа. По сути, то, что раньше требовало целую команду постпродакшна, собирается в одном единственном моделировании.
Почему нужно по-новому смотреть на звук как на единый объект
Раньше подход к генерации речи обычно строился так: задачу разбивали на несколько линий — синтез речи отдельно, музыка отдельно, эффекты отдельно. Всё обучалось и генерировалось раздельно, а затем пользователю нужно было самому сопоставлять и выравнивать это по общему таймлайну.
Логика Seed Audio 1.0 устроена наоборот: сначала все элементы звука помещаются в одно пространство представления, а затем генерируются за один раз. В этом ключевая выгода: тембры персонажей и музыка с эффектами в сцене синхронизированы изначально — не нужно потом делать ручную калибровку.
Три шага ElevenLabs и один шаг Doubao
Самое удобное сравнение — Studio от ElevenLabs. Их подход: есть три независимых API для речи, музыки и эффектов — каждое генерируется отдельно, а пользователю приходится самому собирать и выравнивать по таймлайну. Doubao же пытается заменить эти этапы одним проходом генерации.
По цене: ElevenLabs Pro стоит 99 долларов в месяц, а Doubao использует токеновую тарификацию от движка Volcano — то есть оплата по фактическому использованию, и в китайских сценариях это заметно дешевле.
Озвучка, музыка и звуковые эффекты раньше были тремя отдельными профессиями, тремя наборами софта и тремя экспортами. Seed Audio 1.0 как раз пытается доказать, что эти операции можно сжать в один проход генерации.
А сможет ли она реально заменить профессиональное разделение труда в сценариях вроде кино- и ТВ-озвучки, аудиокниг и Podcast — покажет то, что скажут создатели после использования.