Según Beating, Seed Audio 1.0 de ByteDance se lanzó el 22 de julio y permite generar diálogo, efectos de sonido y audio ambiental con una precisión de temporización de 100 ms mediante un único prompt. El modelo admite entradas de texto y audio de referencia; puede producir aproximadamente dos minutos de audio por generación con capacidad ampliada, y mantiene voces de personajes consistentes en todas las salidas.
El audio muestra más de un 90% de usabilidad en la mayoría de los escenarios, con un Mean Opinion Score (MOS) superior a 4 en la mayor parte de los idiomas admitidos. Seed Audio 1.0 admite más de 20 idiomas con transferencia de voz entre idiomas y personalización del tono. El modelo ya está disponible a través del centro de experiencias Volcano Ark, con una integración de API abierta.