A ByteDance Lança o Seed Audio 1.0, Gerando Diálogos e Efeitos Sonoros a Partir de Um Único Prompt

De acordo com Beating, o Seed Audio 1.0 da ByteDance foi lançado em 22 de julho, permitindo a geração de diálogos, efeitos sonoros e áudio ambiente com um único prompt, com precisão de temporização de 100 ms. O modelo aceita entradas de texto e de áudio de referência, pode gerar aproximadamente dois minutos de áudio por sessão com capacidade estendida e mantém vozes consistentes dos personagens entre as saídas.

O áudio apresenta mais de 90% de usabilidade na maioria dos cenários, com Mean Opinion Score (MOS) acima de 4 na maior parte dos idiomas suportados. O Seed Audio 1.0 oferece suporte a 20+ idiomas com transferência de voz entre idiomas e personalização de tom. O modelo agora está disponível no centro de experiências Volcano Ark, com integração via API aberta.

Isenção de responsabilidade: as informações nesta página podem ter origem em fontes terceiras e servem apenas como referência. Não representam as opiniões da Gate e não constituem orientação financeira, de investimentos ou jurídica. A negociação de ativos virtuais envolve alto risco. Não tome decisões baseando-se apenas nas informações desta página. Para mais detalhes, consulte a Isenção de responsabilidade.
Comentário
0/400
Sem comentários