Skip to main content
POST

Autorisierungen

Authorization
string
header
erforderlich

Alle Endpunkte erfordern Bearer-Token-Authentifizierung

API-Key erhalten:

Den API-Key auf der Seite API-Key-Verwaltung abrufen

Diesen Anfrageheader hinzufügen:

Body

application/json

Eine Stimme aus einer Aufnahme einer Person erstellen. audio_url wählt Stimmenklonen; die Designfelder voice_prompt, preview_text, sample_rate und response_format weglassen. Nicht leerer Designtext, eine Abtastrate ungleich null oder ein nicht leeres Format ergeben 400; sample_rate: 0/null und response_format: ""/null gelten als nicht angegeben.

model
enum<string>
Standard:voice-enrollment
erforderlich

Modellname

Verfügbare Optionen:
voice-enrollment
Beispiel:

"voice-enrollment"

audio_url
string<uri>
erforderlich

URL der zu klonenden Aufnahme. Dieses Feld wählt Stimmenklonen und darf nicht zusammen mit voice_prompt angegeben werden

URL-Vorgaben:

  • HTTP oder HTTPS, öffentlich ohne Authentifizierung erreichbar
  • Lokale oder private Adressen ergeben 400 (invalid_media_url)
  • Höchstens 2048 Zeichen
  • Nicht-HTTP(S)-Protokolle wie FTP ergeben 400 (invalid_media_url)
  • Nur URLs, kein Base64; eine Base64-Daten-URI ergibt 400 (invalid_parameter)

Audioanforderungen (andernfalls kann die Aufgabe fehlschlagen):

  • WAV, MP3 oder M4A
  • Höchstens 60 Sekunden; zu wenig Sprache kann ebenfalls fehlschlagen (eine 2-Sekunden-Aufnahme schlug im Test fehl)
  • Dateigröße höchstens 10 MB
  • Abtastrate mindestens 16 kHz
  • Klare menschliche Sprache; Stille, Musik und andere Nicht-Sprach-Audios werden abgelehnt

Empfohlene Aufnahme:

  • 10–20 Sekunden, davon mindestens 5 Sekunden ununterbrochenes, klares Vorlesen; Pausen höchstens 2 Sekunden
  • Mono; bei Stereo wird nur der erste Kanal verwendet
  • Keine Hintergrundmusik, Geräusche oder anderen Stimmen; normal sprechen, nicht singen

Bei nicht herunterladbaren oder ungeeigneten Audios schlägt die Aufgabe fehl, mit vollständiger Erstattung

Nur die eigene Stimme oder eine Stimme mit ausdrücklicher Erlaubnis klonen

Maximum string length: 2048
Pattern: [^\u0009-\u000D\u0020\u0085\u00A0\u1680\u2000-\u200A\u2028\u2029\u202F\u205F\u3000]
Beispiel:

"https://your-cdn.com/samples/my-voice.wav"

preferred_name
string
erforderlich

Präfix des Stimmennamens

Vorgaben:

  • 1–10 englische Buchstaben oder Ziffern; keine Unterstriche oder anderen Symbole
  • Großbuchstaben werden in Kleinbuchstaben umgewandelt
  • Muss nicht eindeutig sein

Vollständiger Name: beim Klonen qwen-audio-3.1-tts-flash-{preferred_name}-{32-character-id}, beim Design qwen-audio-3.1-tts-flash-vd-{preferred_name}-{32-character-id}

Beispiel für myvoice: qwen-audio-3.1-tts-flash-myvoice-5996beec833d41f4982158347ba97fae

Maximum string length: 10
Pattern: ^[a-zA-Z0-9]+$
Beispiel:

"myvoice"

language
enum<string>

Beim Klonen die Sprache der Aufnahme, zur genaueren Extraktion der Stimme. Beim Design die bevorzugte Sprache der Stimme; sie sollte mit preview_text übereinstimmen

Ohne Angabe gilt zh

Verfügbare Optionen:
zh,
en,
ja,
ko,
de,
fr,
it,
ru,
pt,
es
Beispiel:

"zh"

target_model
enum<string>
Standard:qwen-audio-3.1-tts-flash

TTS-Modell, das die Stimme verwendet. Derzeit nur ein Wert, der ohne Angabe automatisch gilt; andere Werte ergeben 400

Verfügbare Optionen:
qwen-audio-3.1-tts-flash
Beispiel:

"qwen-audio-3.1-tts-flash"

callback_url
string<uri>

HTTPS-Callback-URL für das Aufgabenergebnis

Zeitpunkt:

  • Bei Abschluss (completed) oder Fehlschlag (failed)
  • Versand nach Bestätigung der Abrechnung

Sicherheitsvorgaben:

  • Nur HTTPS
  • Keine privaten IP-Adressen (127.0.0.1, 10.x.x.x, 172.16–31.x.x, 192.168.x.x usw.)
  • URL mit höchstens 2048 Zeichen

Zustellung:

  • Timeout: 10 Sekunden
  • Bei Fehlschlag höchstens 3 Wiederholungen nach 1 / 2 / 4 Sekunden
  • Callback-Inhalt im gleichen Format wie die Aufgabenabfrage
  • 2xx gilt als Erfolg; andere Statuscodes lösen Wiederholungen aus
Beispiel:

"https://your-domain.com/webhooks/voice-completed"

Antwort

Aufgabe zur Stimmenerstellung angenommen

created
integer

Zeitstempel der Aufgabenerstellung

Beispiel:

1775123456

id
string

Aufgaben-ID

Beispiel:

"task-unified-1775123456-abcd1234"

model
string

Tatsächlich verwendetes Modell

Beispiel:

"voice-enrollment"

object
enum<string>

Konkreter Typ des Aufgabenobjekts

Verfügbare Optionen:
audio.generation.task
progress
integer

Aufgabenfortschritt in Prozent (0–100)

Erforderlicher Bereich: 0 <= x <= 100
Beispiel:

0

status
enum<string>

Aufgabenstatus

Verfügbare Optionen:
pending,
processing,
completed,
failed
Beispiel:

"pending"

task_info
object

Details der Audioaufgabe

type
enum<string>

Ausgabetyp der Aufgabe

Verfügbare Optionen:
audio
Beispiel:

"audio"

usage
object

Verbrauchs- und Abrechnungsinformationen