De acordo com Beating, o Seed Audio 1.0 da ByteDance foi lançado em 22 de julho, permitindo a geração de diálogos, efeitos sonoros e áudio ambiente com um único prompt, com precisão de temporização de 100 ms. O modelo aceita entradas de texto e de áudio de referência, pode gerar aproximadamente dois minutos de áudio por sessão com capacidade estendida e mantém vozes consistentes dos personagens entre as saídas.
O áudio apresenta mais de 90% de usabilidade na maioria dos cenários, com Mean Opinion Score (MOS) acima de 4 na maior parte dos idiomas suportados. O Seed Audio 1.0 oferece suporte a 20+ idiomas com transferência de voz entre idiomas e personalização de tom. O modelo agora está disponível no centro de experiências Volcano Ark, com integração via API aberta.