GPT Image 2.5 Flare & Sunburst sind jetzt auf EvoLink verfügbarGPT Image 2.5 testen

Qwen Audio 3.1 TTS Flash API

Qwen Audio 3.1 TTS Flash über die einheitliche EvoLink-API: 68 Stimmen, Stimmklonen und Stimmdesign. Modell-IDs, Token-Preise und asynchrone Integration.

AlibabaText-zu-SpracheVerfügbar
Ab $1.765 / 1M Ausgabe-Tokens
Text-zu-SpracheSystemstimmenStimmklonenStimmdesignEmotionssteuerungMehrsprachig & Dialekte
ProduktionsrouteLive
Modell-Highlights
Natürliche Sprache mit anweisungsbasierter Steuerung von Emotion, Dialekt und Tempo
Anwendungsfälle
Sprachassistenten, Hörbücher, Videovertonung, Kundenservice
Eingabe
Text bis zu 5.000 Zeichen, plus optionale Stilanweisung
Ausgabe
MP3-, WAV- oder Opus-Audio mit einer System-, geklonten oder entworfenen Stimme

Testen Sie Qwen Audio 3.1 TTS Flash, bevor Sie die API integrieren.

Wandeln Sie Text mit einer Systemstimme in Sprache um, oder wechseln Sie das Modell zu Voice Enrollment, um Ihre eigene Stimme zu klonen oder zu entwerfen und sofort zu nutzen.

Sprach-Task erstellen

Fest auf qwen-audio-3.1-tts-flash
80/5,000

Bis zu 5.000 Zeichen. Fügen Sie Tags wie [excited] oder [laughing] in den Text ein, um den Vortrag zu steuern.

Wählen Sie eine Systemstimme aus der Liste oder geben Sie hier direkt einen Stimmnamen ein bzw. fügen ihn ein – auch den einer eigenen Stimme. Bei Stimmnamen wird zwischen Groß- und Kleinschreibung unterschieden. Wählen Sie eine Stimme, die die Sprache Ihres Textes unterstützt.

0/100

Optional. Steuert Emotion, Tempo oder Dialekt. Bis zu 100 Abrechnungszeichen (Han-Schriftzeichen, auch japanische Kanji, zählen als 2; Kana, Hangul und alle anderen Zeichen als 1).

Optionaler Hinweis auf die Sprache des Textes.

1.0x
1.0x

Die Tonhöhe verändert auch die Dauer und hat keine Wirkung, wenn das Tempo nicht 1.0 beträgt.

50
Schätzung ~$0.00090.0578 Credits
Vorab reserviert: 106 Eingabe- + 468 Ausgabe-Tokens, geschätzt anhand Ihres Textes. Abgerechnet werden die tatsächlich verbrauchten Tokens – ein Überschuss wird erstattet, ein Fehlbetrag nachberechnet.
Bereit
Generiertes Audio

Ihr Audio erscheint hier.

Verlauf
Tasks von Qwen Audio 3.1 TTS Flash erscheinen hier.

Kennen Sie Ihre Kosten für Qwen Audio 3.1 TTS Flash, bevor Sie Credits kaufen.

Die Sprachsynthese wird nach den tatsächlich verbrauchten Tokens abgerechnet, mit getrennten Preisen für Eingabe und Ausgabe. Das Erstellen einer eigenen Stimme kostet eine kleine Pauschale pro Stimme. Fehlgeschlagene Tasks werden vollständig erstattet.

Kosten des ersten Tests

Ein kurzer Satz · 14 Eingabe- + 33 Ausgabe-Tokens
Gemessenes Beispiel
Credits0.0043

Ein kurzer Satz

Ungefähre Kosten~$0.0001

Etwa 158.139 solche Sätze mit 10 $ Guthaben.

Behalten Sie im Playground die Standardstimme bei und geben Sie einen Satz ein. Beim Erstellen des Tasks werden Credits anhand der Textlänge reserviert und anschließend auf die tatsächlich verbrauchten Tokens abgerechnet – ein Überschuss wird erstattet, ein Fehlbetrag nachberechnet.

Testbudget-Leitfaden für Qwen Audio 3.1 TTS Flash

Wählen Sie den Betrag nach der Anzahl geplanter Tests.
Guthaben aufladen
$10
Etwa 475 lange Artikel mit je 5.000 chinesischen Zeichen

Für eine erste Validierung.

$50
Etwa 2.375 lange Artikel mit je 5.000 chinesischen Zeichen

Zum Vertonen mehrerer Artikel oder Lektionen.

$100
Etwa 4.751 lange Artikel mit je 5.000 chinesischen Zeichen

Für Tests vor der Produktionsintegration.

Kostenbeispiele für Qwen Audio 3.1 TTS Flash

Ein kurzer Satz14 Eingabe- + 33 Ausgabe-Tokens · gemessen
~$0.0001
~0.0043 cr
Ein langer Artikel5.000 chinesische Zeichen · 5,000 Eingabe- + 11,300 Ausgabe-Tokens · gemessen
~$0.022
~1.431 cr
Eine eigene Stimme erstellen1 Stimme · Stimmklonen oder Stimmdesign
$0.0001
0.001 cr

Die Token-Zahlen sind gemessene Beispiele. Der tatsächliche Verbrauch hängt von Sprache, Stimme und Art der Wiedergabe ab: Ziffern, Großbuchstaben und Symbole werden einzeln vorgelesen und verbrauchen mehr Ausgabe-Tokens.

Preise für Qwen Audio 3.1 TTS Flash

Qwen Audio 3.1 TTS Flashqwen-audio-3.1-tts-flash
Ausgabe-Tokens$1.765/1M Tokens

Die generierte Sprache. Längeres Audio verbraucht mehr Ausgabe-Tokens.

Eingabe-Tokens$0.221/1M Tokens

Der gesendete Text. Die Stilanweisung wird nicht mitgezählt.

Voice Enrollmentvoice-enrollment
Stimme erstellen$0.0001/Stimme

Stimmklonen (audio_url) oder Stimmdesign (voice_prompt), gleicher Preis. Die Stimme ist an qwen-audio-3.1-tts-flash gebunden.

Hinweise zur Abrechnung

  • Bei der Sprachsynthese werden Credits beim Erstellen des Tasks anhand der Textlänge geschätzt und reserviert. Nach Abschluss des Tasks werden die tatsächlich verbrauchten Eingabe- und Ausgabe-Tokens abgerechnet – ein Überschuss wird erstattet, ein Fehlbetrag nachberechnet.
  • Jede der beiden Token-Gebühren wird auf die kleinste Credit-Einheit (0.0001 Credits) aufgerundet, bevor sie addiert werden.
  • Das Erstellen einer Stimme wird einmalig abgerechnet. Die Sprachsynthese mit einer eigenen Stimme kostet genauso viel wie mit einer Systemstimme.
  • Fehlgeschlagene Tasks werden vollständig erstattet. Anfragen, die die Validierung nicht bestehen, liefern 400 und werden nicht berechnet.

Qwen Audio 3.1 TTS Flash API: Text-zu-Sprache mit System-, geklonten und entworfenen Stimmen

Qwen Audio 3.1 TTS Flash wandelt Text mit 68 Systemstimmen und anweisungsbasierter Steuerung von Emotion, Tempo und Dialekt in natürliche Sprache um. Auf derselben Seite erstellt Voice Enrollment Ihre eigene Stimme dafür: Klonen Sie eine einwilligende Person aus einer kurzen Aufnahme oder entwerfen Sie eine neue Stimme aus einer Textbeschreibung. EvoLink stellt beides als asynchrone Tasks an einem Audio-Endpunkt mit einem API-Key bereit.

Eingabe
Text ≤5.000 Zeichen
Ausgabe
MP3 / WAV / Opus
Stimmen
68 System- + eigene
Abtastrate
8–48 kHz
Abrechnung
Pro verbrauchtem Token

Modell-IDs von Qwen Audio 3.1 TTS Flash für API-Aufrufe

Qwen Audio 3.1 TTS Flash

qwen-audio-3.1-tts-flash

Text-zu-Sprache. Senden Sie prompt und optional eine Stimme und erhalten Sie eine Audiodatei zurück. Abrechnung nach Eingabe- und Ausgabe-Tokens.

Voice Enrollment

voice-enrollment

Erstellen Sie eine eigene Stimme für Qwen Audio 3.1 TTS Flash. Senden Sie audio_url, um eine Stimme aus einer Aufnahme zu klonen, oder voice_prompt und preview_text, um eine aus einer Beschreibung zu entwerfen. Pauschalpreis pro Stimme.

Wichtige API-Parameter von Qwen Audio 3.1 TTS Flash

Zuerst die Parameter der Sprachsynthese, dann die Felder von voice-enrollment. Das vollständige Request- und Response-Schema finden Sie im API-Tab.

promptstring

Standard: erforderlich

Zu synthetisierender Text, bis zu 5.000 Zeichen. Emotions-Tags wie [excited] können direkt im Text stehen.

voicestring

Standard: longanhuan_v3.1

Eine Systemstimme (Groß-/Kleinschreibung beachten) oder eine Stimme, die Ihr Konto mit voice-enrollment erstellt hat.

instructionstring

Standard: keine

Steuerung von Emotion, Tempo oder Dialekt in natürlicher Sprache. Bis zu 100 Abrechnungszeichen.

response_formatenum

Standard: mp3

mp3, wav oder opus. Opus unterstützt nur 8, 12, 16, 24 und 48 kHz.

speech_rate / pitchnumber

Standard: 1.0

Beide reichen von 0.5 bis 2.0. Die Tonhöhe verändert auch die Dauer und wird ignoriert, wenn speech_rate nicht 1.0 beträgt.

audio_urlstring · voice-enrollment

Standard: erforderlich für Klonen

Öffentlicher HTTP(S)-Link zu einer WAV-, MP3- oder M4A-Sprachprobe mit klarer Sprache, bis 60 s und 10 MB. Wählt Stimmklonen.

voice_prompt + preview_textstring · voice-enrollment

Standard: erforderlich für Design

Stimmbeschreibung mit bis zu 500 Zeichen und ein Satz mit 15–200 Zeichen für den Vorschau-Clip. Wählt Stimmdesign.

preferred_namestring · voice-enrollment

Standard: erforderlich

1–10 Buchstaben oder Ziffern. Wird Teil des zurückgegebenen Stimmnamens.

Qwen Audio 3.1 TTS Flash auf zwei Wegen nutzen: EvoLink API oder Agent

Nutzen Sie die EvoLink API für Produktintegrationen und Batch-Aufgaben oder rufen Sie sie in Codex, Claude oder Gemini für schnelle Kreativ- und Entwicklungsworkflows auf. Beide Wege verwenden denselben EvoLink API-Key, dasselbe Guthaben, dieselben Modellrouten und dieselbe Aufgabenhistorie.

Option 1

Über die EvoLink API integrieren

Geeignet für: Produkt-Backends, Batch-Aufgaben, automatisierte Workflows

Rufen Sie die einheitliche Stimme-API von EvoLink serverseitig auf und steuern Sie Modell-ID, Parameter, Aufgabenwarteschlange, Callbacks und Ergebnisspeicherung selbst.

  1. 1Ergebnis und Kosten mit einem realen Briefing im Playground prüfen
  2. 2Einen EvoLink API-Key in der Konsole erstellen
  3. 3Die passende Modell-ID aus den Routenkarten oben wählen
  4. 4Aufgabe absenden und Ergebnis per Polling oder HTTPS-Callback abrufen
Option 2

Mit einem Agenten aufrufen

Geeignet für: Kreativ- und Entwicklungsaufgaben in Codex, Claude und Gemini

Übergeben Sie dem Agenten Ziel, Materialien und Abnahmekriterien. Er wählt die Route, erstellt den Request, verfolgt die Aufgabe und liefert das Ergebnis, ohne dass jeder Schritt manuell programmiert werden muss.

  1. 1EVOLINK_API_KEY lokal als Umgebungsvariable setzen; niemals in Code oder Prompt schreiben
  2. 2Ausgabeziel, Referenzen und die wichtigsten Parameter beschreiben
  3. 3Den Agenten eine Qwen Audio 3.1 TTS Flash-Route aufrufen und die Task-ID speichern lassen
  4. 4Den Agenten bis zum Endstatus pollen, das Ergebnis herunterladen und Fehlergründe melden lassen

Was Sie mit Qwen Audio 3.1 TTS Flash bauen können

Sprachassistenten mit Qwen Audio 3.1 TTS Flash

Geben Sie einem Assistenten eine einheitliche Stimme und steuern Sie den Tonfall pro Antwort mit einer kurzen Stilanweisung.

Hörbücher und Kurse mit Qwen Audio 3.1 TTS Flash

Vertonen Sie Kapitel mit bis zu 5.000 Zeichen pro Anfrage mit einer ruhigen Erzählstimme.

Videovertonung und Synchronisation

Erzeugen Sie Voice-over auf Mandarin, in chinesischen Dialekten, Englisch und weiteren Sprachen – mit Emotions-Tags direkt im Text.

Eine Markenstimme mit Voice Enrollment

Klonen Sie eine einwilligende Person oder entwerfen Sie eine neue Stimme und verwenden Sie den Stimmnamen in den folgenden 6 Stunden in Ihren Syntheseaufrufen.

Qwen Audio 3.1 TTS Flash API: Codebeispiel und Fehlerbehandlung

Dieses Beispiel zeigt den kürzesten lauffähigen Ablauf: Aufgabe erstellen, zurückgegebene Task-ID speichern und anschließend pollen oder auf einen HTTPS-Callback warten. Vollständige Parameter und Antwortfelder finden Sie im API-Tab.

Vollständige API-Dokumentation
cURL
curl -X POST https://api.evolink.ai/v1/audios/generations \
  -H "Authorization: Bearer $EVOLINK_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen-audio-3.1-tts-flash",
    "prompt": "Hello, and welcome to EvoLink. This is a quick demo of Qwen Audio 3.1 TTS Flash.",
    "voice": "Emily_v3.1",
    "instruction": "Speak warmly, at a relaxed pace",
    "response_format": "mp3"
  }'

# Save the returned task ID, then query; the audio link is in results[0]:
curl https://api.evolink.ai/v1/tasks/{task_id} \
  -H "Authorization: Bearer $EVOLINK_API_KEY"

Parameterprüfung fehlgeschlagen

Prüfen Sie jeden Wert anhand der Parameterkarten oben: Wertebereiche, zulässige Optionen, Anzahl der Materialien und Dateitypen müssen zur gewählten Route passen.

Authentifizierungs- oder Guthabenproblem

Prüfen Sie den Authorization Bearer Token sowie verfügbares Guthaben und Aufgabenabrechnung in der Konsole.

Inhalt oder Material abgelehnt

Prüfen Sie Persönlichkeitsrechte, Markenmaterial, lesbaren Text, sensible Inhalte und die Konformität der Eingabedateien.

Aufgabe fehlgeschlagen oder Zeitüberschreitung

Eine Qwen Audio 3.1 TTS Flash-Aufgabe mit endgültigem Status „fehlgeschlagen“ wird nicht berechnet. Bewahren Sie die Task-ID auf und klären Sie vor einem neuen Versuch, ob Parameterprüfung, Moderation oder Ausführung die Ursache war.

Callback nicht empfangen

callback_url muss eine öffentliche HTTPS-URL sein und darf nicht auf localhost oder ein privates Netzwerk zeigen. Bewahren Sie die Task-ID als Polling-Fallback auf.

Systemstimmen vs. Stimmklonen vs. Stimmdesign

MerkmalSystemstimmeStimmklonenStimmdesign
Modell-IDqwen-audio-3.1-tts-flashvoice-enrollmentvoice-enrollment
Das liefern SieEin Stimmname aus der ListeEine Sprachprobe (audio_url)Eine Stimmbeschreibung + Vorschautext
Das erhalten SieAudioEin StimmnameEin Stimmname + Vorschau-Clip
EinrichtungskostenKeine~$0.0001 pro Stimme~$0.0001 pro Stimme
Am besten fürSchneller EinstiegNachbildung einer bestimmten, einwilligenden PersonNeue Stimmen, Figuren, Erkundung des Markentons

Routing, Task-Lebenszyklus und Abrechnung von Qwen Audio 3.1 TTS Flash

Zwei Modell-IDs an einem Endpunkt

Senden Sie qwen-audio-3.1-tts-flash, um Sprache zu synthetisieren, und voice-enrollment, um eine Stimme zu erstellen. Beide gehen an POST /v1/audios/generations und liefern eine Task-ID.

Asynchrone Tasks

Rufen Sie /v1/tasks/{task_id} ab oder verwenden Sie callback_url. Die Dauer hängt vom Text und der Stimmoperation ab; eine feste Latenz wird nicht garantiert. Audiolinks verfallen nach 24 Stunden.

Ihre Stimmen bleiben Ihre

Eine eigene Stimme funktioniert nur mit qwen-audio-3.1-tts-flash und nur für das Konto, das sie erstellt hat. Der Stimmname eines anderen Kontos liefert 404. Eine Stimme ist nach dem Erstellen 6 Stunden lang nutzbar.

Warum Qwen Audio 3.1 TTS Flash über EvoLink nutzen

Frühe Validierung

Unbekannte Parameter, ein ungültiger Stimmname oder zu langer Text scheitern sofort mit 400, statt Credits zu reservieren und später fehlzuschlagen.

Einheitliche API

Ein API-Key funktioniert für Qwen, Seed Audio, Video-, Bild- und LLM-Modelle.

Einheitliches Guthaben

Verfolgen Sie Credits, Ausgaben und Modellnutzung in einer Konsole.

Task-Status-Tracking

Sehen Sie, ob ein Task eingereicht, in Bearbeitung, abgeschlossen oder fehlgeschlagen ist – mit dem tatsächlichen Fehlergrund.

Zahlen Sie nur, was Sie nutzen

Sprache wird nach tatsächlichem Token-Verbrauch abgerechnet, und für einen fehlgeschlagenen Task reservierte Credits werden vollständig zurückerstattet.

Weitere Audiomodelle auf EvoLink neben Qwen Audio 3.1 TTS Flash

Doubao Seed Audio 1.0

Doubao Seed Audio 1.0

Promptbasiertes Audio von BytePlus für Stimme, Dialog, Soundeffekte, Musik und Atmosphäre.

API ansehen
Suno

Suno

Musikgenerierung von Suno mit Gesang, Songtexten und Instrumentalstücken.

API ansehen

Häufige Fragen zu Qwen Audio 3.1 TTS Flash

Unterstützt EvoLink für dieses Modell Streaming oder WebSocket?

Diese EvoLink-Route verwendet asynchrone HTTP-Aufgaben ohne SSE- oder WebSocket-Streaming. Senden Sie die Anfrage an POST /v1/audios/generations und rufen Sie die Audio-URL über GET /v1/tasks/{task_id} ab. Die Streaming-APIs des Anbieters verwenden ein anderes Protokoll.

Ist Qwen Audio 3.1 TTS Flash dasselbe Modell wie Qwen3-TTS?

Nein. Diese Seite behandelt das gehostete Modell qwen-audio-3.1-tts-flash. Qwen3-TTS, Qwen Audio TTS-Next und Qwen Audio Realtime sind separate Modelle mit anderen Modell-IDs, Parametern, Gewichten und Streaming-Funktionen.

Wie lautet die Modell-ID von Qwen Audio 3.1 TTS Flash?

Verwenden Sie qwen-audio-3.1-tts-flash für die Sprachsynthese und voice-enrollment, um eine eigene Stimme zu erstellen. Beide werden an POST /v1/audios/generations gesendet.

Was kostet Qwen Audio 3.1 TTS Flash?

Sprache wird nach den tatsächlich verbrauchten Tokens abgerechnet, mit getrennten Preisen für Eingabe und Ausgabe, die live im Bereich Preise angezeigt werden. Das Erstellen einer eigenen Stimme kostet eine kleine Pauschale pro Stimme. Fehlgeschlagene Tasks werden vollständig erstattet.

Warum wird mehr reserviert, als mir am Ende berechnet wird?

Die Token-Zahl steht erst nach der Synthese fest, daher werden beim Erstellen des Tasks Credits anhand der Textlänge reserviert – in der Regel mehr, als am Ende berechnet wird. Nach Abschluss werden die tatsächlich verbrauchten Tokens abgerechnet und der Überschuss wird erstattet. Text, der Zeichen für Zeichen vorgelesen wird (etwa Ziffern-, Buchstaben- oder Symbolfolgen), kann mehr verbrauchen als reserviert; der Fehlbetrag wird dann nachberechnet.

Wie erstelle und verwende ich meine eigene Stimme?

Rufen Sie voice-enrollment mit audio_url auf, um eine Stimme zu klonen, oder mit voice_prompt und preview_text, um eine zu entwerfen. Lesen Sie result_data.voice aus dem abgeschlossenen Task und übergeben Sie den Wert als Parameter voice an qwen-audio-3.1-tts-flash. Eine eigene Stimme ist nach dem Erstellen 6 Stunden lang nutzbar; danach erstellen Sie eine neue.

Was ist der Unterschied zwischen Stimmklonen und Stimmdesign?

Stimmklonen bildet eine reale Person aus einer kurzen Aufnahme nach und liefert nur den Stimmnamen. Stimmdesign erstellt eine neue Stimme aus einer Textbeschreibung und liefert zusätzlich einen Vorschau-Clip. Beides kostet gleich viel und funktioniert nur mit qwen-audio-3.1-tts-flash.

Was macht eine gute Sprachprobe für das Stimmklonen aus?

Pflicht: WAV, MP3 oder M4A, bis 60 s und 10 MB, mindestens 16 kHz, mit klarer Sprache. Am besten eignen sich 10–20 Sekunden eines einzelnen Sprechers, mono, Pausen von höchstens 2 Sekunden und ohne Hintergrundmusik oder Rauschen.

Kann jemand anderes meine eigene Stimme verwenden?

Nein. Eine eigene Stimme kann nur von dem Konto verwendet werden, das sie erstellt hat; andere Konten erhalten für denselben Stimmnamen einen 404.

Wessen Stimme darf ich klonen?

Nur Ihre eigene Stimme oder eine Stimme, für die Sie eine ausdrückliche Nutzungserlaubnis haben. Das Klonen fremder Stimmen ohne Einwilligung ist nicht erlaubt.

Wie steuere ich Emotion, Tempo oder Dialekt?

Übergeben Sie eine kurze Anweisung wie „langsam und sanft sprechen“ oder schreiben Sie Tags wie [excited] direkt in den Text. Die vier mehrsprachigen Stimmen sprechen auch mehrere chinesische Dialekte, wenn die Anweisung einen verlangt.

Was passiert, wenn ein Task fehlschlägt?

Fehlgeschlagene Tasks werden nicht berechnet – die reservierten Credits werden vollständig erstattet. Das Task-Ergebnis zeigt den Fehlergrund.