Skip to main content
POST

Autorisierungen

Authorization
string
header
erforderlich

Alle Endpunkte erfordern Bearer-Token-Authentifizierung

API-Key erhalten:

Den API-Key auf der Seite API-Key-Verwaltung abrufen

Diesen Anfrageheader hinzufügen:

Body

application/json

Mindestens eines der Textfelder prompt oder input muss nicht leer sein. Sind beide angegeben, müssen ihre Inhalte übereinstimmen. Sind response_format und format beide angegeben, müssen auch ihre Werte übereinstimmen.

prompt
string
erforderlich

Zu synthetisierender Text

Vorgaben:

  • Höchstens 5000 Zeichen
  • Bei langen Texten Satzzeichen beibehalten: lange Passagen ohne Satzgrenzen können upstream auf etwa 1500 Ausgabe-Tokens (etwa 120 Sekunden Audio) gekürzt werden. Die Aufgabe gilt dennoch als erfolgreich und wird nach den tatsächlich erzeugten Tokens berechnet; das Gateway kann diese Kürzung nicht erkennen
  • Alternativ input verwenden. Mindestens ein nicht leeres Textfeld ist erforderlich; möglichst nur eines übergeben. Abweichende Inhalte ergeben 400 (parameter_conflict)
  • Der Text muss in einer von der Stimme unterstützten Sprache sein, sonst sind Aussprachefehler möglich

Emotions- und paralinguistische Tags: Direkt in den Text einfügen, ohne zusätzliche Parameter; der Tag-Text zählt als Abrechnungszeichen

  • Steuerungstags: Legen die Emotion oder den Stil des folgenden Textes bis zum nächsten Steuerungstag fest. [sad] traurig, [amazed] erstaunt, [deep and loud shouting] tiefes, lautes Schreien, [trembling] zitternd, [angry] wütend, [excited] aufgeregt, [sarcastic] sarkastisch, [curious] neugierig, [like dracula] tief und unheimlich, [bored] gelangweilt, [tired] müde, [scornful] verächtlich, [shouting] schreiend, [asmr] sanftes ASMR-Flüstern, [panicked] panisch, [mischievously] schelmisch, [empathetic] einfühlsam, [whispers] flüsternd, [reluctantly] widerwillig, [crying] weinend, [serious] ernst, [very slowly] sehr langsam, [very fast] sehr schnell
  • Paralinguistische Tags: Fügen an dieser Stelle einen Stimmeffekt ein, ohne die Emotion des umgebenden Textes zu ändern. [gasp] nach Luft schnappen, [sighing] seufzen, [clears throat] räuspern, [giggles] kichern, [laughing] lachen, [cough] husten, [snorts] schnauben

Beispiel: [excited]今天的天气真不错![laughing]我们一起出去玩吧!

Bei enable_ssml: true wird dieses Feld als SSML verarbeitet

Maximum string length: 5000
Pattern: \S
Beispiel:

"我家的后面有一个很大的花园。"

model
enum<string>
Standard:qwen-audio-3.1-tts-flash
erforderlich

Modellname

Verfügbare Optionen:
qwen-audio-3.1-tts-flash
Beispiel:

"qwen-audio-3.1-tts-flash"

input
string

Alias für prompt mit denselben Längen- und Nutzungsregeln

  • Mindestens prompt oder input als nicht leeren Text angeben
  • Bei Angabe beider Felder müssen die Inhalte übereinstimmen, sonst 400 (parameter_conflict)
Maximum string length: 5000
Beispiel:

"我家的后面有一个很大的花园。"

voice
string
Standard:longanhuan_v3.1

Stimmenname, Groß-/Kleinschreibung beachten

  • 68 Systemstimmen; Namen, Geschlecht und Einsatzgebiete siehe Stimmenliste
  • Ohne Angabe wird longanhuan_v3.1 verwendet
  • Eigene Stimmen aus Voice Enrollment sind ebenfalls möglich: geklont qwen-audio-3.1-tts-flash-{prefix}-{32-character-id}, entworfen qwen-audio-3.1-tts-flash-vd-{prefix}-{32-character-id}. Nur das erstellende Konto kann sie verwenden. Stimmen anderer Modelle, etwa qwen-tts-vd-… von qwen-voice-design, ergeben 400 (invalid_voice). Nicht vorhandene oder fremde Stimmen ergeben 404 (voice_not_found)
  • Benutzerdefinierte Stimmen laufen standardmäßig 6 Stunden nach Abschluss der Erstellung ab. Danach gibt die Synthese 404 (voice_expired) zurück; mit Voice Enrollment eine neue Stimme erstellen
Beispiel:

"longanhuan_v3.1"

response_format
enum<string>
Standard:mp3

Audioausgabeformat: mp3, wav oder opus, Standard mp3

  • opus verwendet einen Ogg-Opus-Container
  • Alternativ format verwenden. Möglichst nur ein Feld übergeben; unterschiedliche Werte ergeben 400 (parameter_conflict)
Verfügbare Optionen:
mp3,
wav,
opus
Beispiel:

"mp3"

format
enum<string>

Alias für response_format; unterstützt mp3, wav und opus

  • Ohne beide Felder wird mp3 verwendet
  • Bei Angabe beider Felder müssen die Werte übereinstimmen, sonst 400 (parameter_conflict)
Verfügbare Optionen:
mp3,
wav,
opus
Beispiel:

"mp3"

sample_rate
enum<integer> | null
Standard:24000

Ausgabe-Abtastrate (Hz)

  • Bei response_format: opus werden 22050 und 44100 nicht unterstützt
  • Ohne Angabe oder bei null gilt der Standardwert; 0 oder Werte außerhalb der Liste ergeben 400
Verfügbare Optionen:
8000,
12000,
16000,
22050,
24000,
44100,
48000,
null
Beispiel:

24000

volume
integer
Standard:50

Lautstärke von 0 bis 100

Erforderlicher Bereich: 0 <= x <= 100
Beispiel:

50

speech_rate
number
Standard:1

Sprechgeschwindigkeitsfaktor

  • 1.0: normale Geschwindigkeit (Standard)
  • 2.0: doppelte Geschwindigkeit; 0.5: halbe Geschwindigkeit

Bereich 0.5 bis 2.0. Eine Änderung beeinflusst die Anzahl der Ausgabe-Tokens nicht

Erforderlicher Bereich: 0.5 <= x <= 2
Beispiel:

1

pitch
number
Standard:1

Tonhöhenfaktor

  • 1.0: Standardtonhöhe
  • Über 1.0 höher, unter 1.0 tiefer

Bereich 0.5 bis 2.0

Eine Tonhöhenänderung verändert auch Sprechgeschwindigkeit und Audiodauer

  • Höhere Tonhöhe beschleunigt und verkürzt, tiefere verlangsamt und verlängert. Die Dauer verändert sich ungefähr umgekehrt proportional zum Quadrat des Tonhöhenwerts
  • Bei einem Satz von etwa 2.8 Sekunden bei 1.0: 0.8 etwa 4.3 Sekunden, 1.2 etwa 2.1 Sekunden, 0.5 etwa 10.9 Sekunden, 2.0 etwa 0.7 Sekunden
  • Kleine Änderungen zwischen 0.8 und 1.2 empfohlen; nahe 0.5 oder 2.0 ist die Sprache deutlich zu langsam oder zu schnell
  • Ist gleichzeitig speech_rate ungleich 1.0 gesetzt, bleibt pitch wirkungslos; beide lassen sich nicht kombinieren
  • Die Tonhöhe verändert die Anzahl der Ausgabe-Tokens nicht
Erforderlicher Bereich: 0.5 <= x <= 2
Beispiel:

1

instruction
string

Natürlichsprachliche Anweisungen für Emotion, Tonfall, Rolle, Dialekt und Ausdruck

Vorgaben:

  • Höchstens 100 Abrechnungszeichen: Han-Zeichen (einschließlich japanischer Kanji und koreanischer Hanja) zählen als 2; alle anderen Zeichen, einschließlich Kana und Hangul, als 1 (etwa 50 Han-Zeichen oder 100 englische Zeichen). Überschreitung ergibt 400

Beispiele:

  • 用欢快、热情的语气说 (fröhlich und begeistert sprechen)
  • 请用上海话表达 (Shanghaier Dialekt; mehrsprachige und Dialektstimmen)
  • Speak slowly in a calm and gentle tone

Anweisungen zählen nicht als Eingabe-Tokens, können aber die Audiodauer und damit die Ausgabe-Tokens beeinflussen

Der Parameter heißt instruction (Singular); instructions ergibt 400

Beispiel:

"用欢快、热情的语气说"

language
enum<string>

Hinweis zur Zielsprache für bessere Aussprache von Zahlen, Abkürzungen und Symbolen sowie bessere Synthese weniger verbreiteter Sprachen

Bei zh wird beispielsweise 110 in hello, this is 110 chinesisch als „yao yao ling“ gelesen

Ohne Angabe erkennt das Modell die Sprache automatisch; dieser Parameter übersetzt den Text nicht

Verfügbare Optionen:
zh,
en,
fr,
de,
ja,
ko,
ru,
pt,
th,
id,
vi,
es,
it,
ms,
fil,
ar
Beispiel:

"zh"

enable_ssml
boolean
Standard:false

prompt als SSML verarbeiten

Wenn aktiviert, sind SSML-Tags möglich, etwa <break time="1s"/> für eine Pause: <speak>欢迎收听今天的节目。<break time="1s"/>我们马上开始。</speak>

SSML-Pausen zählen nicht als Ausgabe-Tokens

Beispiel:

false

hot_fix
object

Benutzerdefinierte Aussprache und Textersetzung zur Korrektur mehrdeutiger Zeichen, Eigennamen und anderer Aussprachen

  • pronunciation: Wörter mit Pinyin versehen; Silben durch Leerzeichen trennen, Töne als Ziffern angeben, etwa tian1 qi4
  • replace: Wörter vor der Synthese ersetzen. Synthese und Abrechnung erfolgen anhand des ersetzten Texts; auch dieser darf höchstens 5000 Zeichen haben, sonst 400 (prompt_too_long)

Beide Listen zusammen dürfen höchstens 200 Einträge enthalten, gezählt als Schlüssel-Wert-Paare in den Objekten. Überschreitung ergibt 400 (invalid_parameter)

Mindestens eine Liste angeben. Jede angegebene Liste muss ein nicht leeres Array von Objekten der Form {"Wort": "Wert"} sein

Beispiel:

enable_aigc_tag
boolean
Standard:false

Unsichtbare AIGC-Kennzeichnung in das erzeugte Audio einbetten (für wav / mp3 / opus)

Beispiel:

false

callback_url
string<uri>

HTTPS-Callback-URL für das Aufgabenergebnis

Zeitpunkt:

  • Bei Abschluss (completed) oder Fehlschlag (failed); dieses Modell unterstützt keinen Abbruch
  • Versand nach Bestätigung der Abrechnung

Sicherheitsvorgaben:

  • Nur HTTPS
  • Keine privaten IP-Adressen (127.0.0.1, 10.x.x.x, 172.16–31.x.x, 192.168.x.x usw.)
  • URL mit höchstens 2048 Zeichen

Zustellung:

  • Timeout: 10 Sekunden
  • Bei Fehlschlag höchstens 3 Wiederholungen nach 1 / 2 / 4 Sekunden
  • Callback-Inhalt im gleichen Format wie die Aufgabenabfrage
  • 2xx gilt als Erfolg; andere Statuscodes lösen Wiederholungen aus
Beispiel:

"https://your-domain.com/webhooks/tts-completed"

Antwort

Aufgabe zur Sprachsynthese erfolgreich erstellt

created
integer

Zeitstempel der Aufgabenerstellung

Beispiel:

1790000000

id
string

Aufgaben-ID

Beispiel:

"task-unified-1790000000-abcd1234"

model
string

Tatsächlich verwendetes Modell

Beispiel:

"qwen-audio-3.1-tts-flash"

object
enum<string>

Konkreter Typ des Aufgabenobjekts

Verfügbare Optionen:
audio.generation.task
progress
integer

Aufgabenfortschritt in Prozent (0–100)

Erforderlicher Bereich: 0 <= x <= 100
Beispiel:

0

status
enum<string>

Aufgabenstatus

Verfügbare Optionen:
pending,
processing,
completed,
failed
Beispiel:

"pending"

task_info
object

Details der Audioaufgabe

type
enum<string>

Ausgabetyp der Aufgabe

Verfügbare Optionen:
audio
Beispiel:

"audio"

usage
object

Verbrauchs- und Abrechnungsinformationen