Skip to main content
Qwen Audio 3.1 TTS Flash wählt Stimmen über den Parameter voice in der Sprachsynthese-API. Die 68 Systemstimmen sind direkt nutzbar, ohne vorher eine Stimme zu erstellen.
  • Bei voice ist Groß-/Kleinschreibung zu beachten; den Wert genau wie unten angegeben übernehmen
  • Ohne voice wird standardmäßig longanhuan_v3.1 verwendet
  • In Anfragen die Spalte voice verwenden; Namen, Geschlecht, Klangeigenschaften und Einsatzgebiete helfen bei der Auswahl
  • Der Text muss in einer von der Stimme unterstützten Sprache sein, sonst sind falsche Aussprache oder unnatürliche Sprache möglich

Beispiele

Den folgenden Anfragekörper an POST /v1/audios/generations senden und voice durch die gewünschte ID ersetzen. Alle Parameter und die Aufgabenabfrage siehe Sprachsynthese-API.
Alle Stimmen unterstützen instruction und Emotionstags im Text, etwa [excited] und [laughing], zur Steuerung von Emotion und Tonfall. Siehe die Beschreibungen von prompt und instruction in der Sprachsynthese-API.

Mehrsprachige Stimmen und Dialekte

4 Stimmen. Jede unterstützt alle folgenden Dialekte und Sprachen:
  • Dialekte: Shanghaier, Kantonesisch, Nordostchinesisch sowie die Dialekte von Chongqing, Shaanxi, Yunnan, Ningbo und Gansu
  • Sprachen: Japanisch, Koreanisch, Französisch, Deutsch, Portugiesisch, Italienisch, Vietnamesisch und Indonesisch
Für Dialektsynthese den Dialekt in instruction angeben, etwa 请用上海话表达 (Shanghaier Dialekt verwenden).

Hochwertige chinesische Stimmen

22 Stimmen, nur für Mandarin-Chinesisch.

Hochwertige englische Stimmen

15 Stimmen, nur für Englisch.

Weitere Systemstimmen

27 Stimmen. Unterstützte Sprachen sind für diese Gruppe nicht einzeln angegeben; die Synthesequalität mit Text in der Zielsprache prüfen.

Benutzerdefinierte Stimmen

Eigene Stimmen mit Voice Enrollment erstellen: eine Aufnahme zum Klonen oder eine Textbeschreibung zum Design übergeben. Nach Abschluss den vollständigen zurückgegebenen Namen voice an die Sprachsynthese-API übergeben.
  • Nur das Konto, das eine benutzerdefinierte Stimme erstellt hat, kann sie verwenden
  • Standardmäßig 6 Stunden nach Abschluss der Erstellung gültig; Syntheseaufrufe verlängern die Gültigkeit nicht
  • Nach Ablauf ergibt die Synthese 404 (voice_expired); mit Voice Enrollment eine neue Stimme erstellen
  • Stimmen des alten Modells qwen-voice-design sind nicht kompatibel; bei der Migration mit Voice Enrollment neu erstellen