Saltar al contenido principal
Seed-Audio 1.0 selecciona la voz mediante audio_references en la API de generacion de audio. Cada elemento puede ser:
  • ID de voz preestablecida — usa un voice_type de la tabla siguiente, p. ej. zh_female_vv_uranus_bigtts
  • URL de audio de referencia — sube un clip de referencia para clonar la voz
Todas las voces preestablecidas permiten controlar emocion, tono y estilo mediante indicaciones en lenguaje natural. Las voces en chino tambien pueden leer texto en ingles.
En prompt, usa @audioN para referenciar el elemento N de audio_references (la numeracion empieza en 1), lo que permite mezclar varias voces en un mismo clip. El “2.0” en el nombre de una voz indica la version de la biblioteca de voces y no guarda relacion con la version del modelo.

Voces generales

288 voces en total: en su mayoria chino, mas 15 voces de personaje ICL (ingles americano / australiano / britanico).