Xiaomi disponibiliza em código aberto o OmniVoice, modelo de clonagem de voz com zero-shot compatível com 646 idiomas

De acordo com Beating, a equipe Kaldi do AI Lab da Xiaomi disponibilizou em código aberto o OmniVoice, um modelo de TTS para clonagem de voz zero-shot que oferece suporte a 646 idiomas. O modelo clona características da voz a partir de apenas segundos de áudio de referência e funciona entre idiomas — uma única voz pode sintetizar fala em mandarim, japonês, coreano e outros idiomas. Todo o código, pesos e dados de treinamento são disponibilizados em código aberto sob licença Apache-2.0.

O OmniVoice usa uma arquitetura simplificada com um único Transformer bidirecional que mapeia diretamente texto para tokens acústicos discretos, alcançando inferência 40x mais rápida que o tempo real no PyTorch. Treinado com 580.000 horas de áudio de 50 conjuntos de dados open-source, o OmniVoice superou sistemas comerciais em similaridade de voz e inteligibilidade em 24 idiomas testados e correspondeu ou superou gravações humanas em 102 idiomas.

Isenção de responsabilidade: as informações nesta página podem ter origem em fontes terceiras e servem apenas como referência. Não representam as opiniões da Gate e não constituem orientação financeira, de investimentos ou jurídica. A negociação de ativos virtuais envolve alto risco. Não tome decisões baseando-se apenas nas informações desta página. Para mais detalhes, consulte a Isenção de responsabilidade.
Comentário
0/400
Sem comentários