Qwen Audio 3.1 TTS Flash über die einheitliche EvoLink-API: 68 Stimmen, Stimmklonen und Stimmdesign. Modell-IDs, Token-Preise und asynchrone Integration.
ProduktionsrouteDiese Rate zeigt die plattformseitige Verfügbarkeit — nur bestätigte Serverfehler (HTTP 500 / leere Antwort) zählen als Ausfälle. Nutzerseitige Probleme (Inhaltsmoderation, ungültige Parameter, Abbruch) sowie Rate-Limits, Timeouts und Auth-Fehler sind ausgenommen. Vor echtem Traffic können leere Zeitfenster als verfügbar erscheinen.Live
Live
Modell-Highlights
Natürliche Sprache mit anweisungsbasierter Steuerung von Emotion, Dialekt und Tempo
Testen Sie Qwen Audio 3.1 TTS Flash, bevor Sie die API integrieren.
Wandeln Sie Text mit einer Systemstimme in Sprache um, oder wechseln Sie das Modell zu Voice Enrollment, um Ihre eigene Stimme zu klonen oder zu entwerfen und sofort zu nutzen.
Sprach-Task erstellen
Fest auf qwen-audio-3.1-tts-flash
80/5,000
Bis zu 5.000 Zeichen. Fügen Sie Tags wie [excited] oder [laughing] in den Text ein, um den Vortrag zu steuern.
Wählen Sie eine Systemstimme aus der Liste oder geben Sie hier direkt einen Stimmnamen ein bzw. fügen ihn ein – auch den einer eigenen Stimme. Bei Stimmnamen wird zwischen Groß- und Kleinschreibung unterschieden. Wählen Sie eine Stimme, die die Sprache Ihres Textes unterstützt.
0/100
Optional. Steuert Emotion, Tempo oder Dialekt. Bis zu 100 Abrechnungszeichen (Han-Schriftzeichen, auch japanische Kanji, zählen als 2; Kana, Hangul und alle anderen Zeichen als 1).
Optionaler Hinweis auf die Sprache des Textes.
1.0x
1.0x
Die Tonhöhe verändert auch die Dauer und hat keine Wirkung, wenn das Tempo nicht 1.0 beträgt.
50
Schätzung ~$0.00090.0578 Credits
Vorab reserviert: 106 Eingabe- + 468 Ausgabe-Tokens, geschätzt anhand Ihres Textes. Abgerechnet werden die tatsächlich verbrauchten Tokens – ein Überschuss wird erstattet, ein Fehlbetrag nachberechnet.
Bereit
Generiertes Audio
Ihr Audio erscheint hier.
0:00 / 0:00
Verlauf
Tasks von Qwen Audio 3.1 TTS Flash erscheinen hier.
Kennen Sie Ihre Kosten für Qwen Audio 3.1 TTS Flash, bevor Sie Credits kaufen.
Die Sprachsynthese wird nach den tatsächlich verbrauchten Tokens abgerechnet, mit getrennten Preisen für Eingabe und Ausgabe. Das Erstellen einer eigenen Stimme kostet eine kleine Pauschale pro Stimme. Fehlgeschlagene Tasks werden vollständig erstattet.
Kosten des ersten Tests
Ein kurzer Satz · 14 Eingabe- + 33 Ausgabe-Tokens
Gemessenes Beispiel
Credits0.0043
Ein kurzer Satz
Ungefähre Kosten~$0.0001
Etwa 158.139 solche Sätze mit 10 $ Guthaben.
Behalten Sie im Playground die Standardstimme bei und geben Sie einen Satz ein. Beim Erstellen des Tasks werden Credits anhand der Textlänge reserviert und anschließend auf die tatsächlich verbrauchten Tokens abgerechnet – ein Überschuss wird erstattet, ein Fehlbetrag nachberechnet.
Testbudget-Leitfaden für Qwen Audio 3.1 TTS Flash
Wählen Sie den Betrag nach der Anzahl geplanter Tests.
Eine eigene Stimme erstellen1 Stimme · Stimmklonen oder Stimmdesign
$0.0001
0.001 cr
Die Token-Zahlen sind gemessene Beispiele. Der tatsächliche Verbrauch hängt von Sprache, Stimme und Art der Wiedergabe ab: Ziffern, Großbuchstaben und Symbole werden einzeln vorgelesen und verbrauchen mehr Ausgabe-Tokens.
Preise für Qwen Audio 3.1 TTS Flash
Qwen Audio 3.1 TTS Flashqwen-audio-3.1-tts-flash
Abrechnungsposten
Das ist enthalten
Preis
Abrechnung
Ausgabe-Tokens
Die generierte Sprache. Längeres Audio verbraucht mehr Ausgabe-Tokens.
$1.765/1M Tokens120 Credits
Nach tatsächlichem Verbrauch
Eingabe-Tokens
Der gesendete Text. Die Stilanweisung wird nicht mitgezählt.
$0.221/1M Tokens15 Credits
Nach tatsächlichem Verbrauch
Ausgabe-Tokens$1.765/1M Tokens
Die generierte Sprache. Längeres Audio verbraucht mehr Ausgabe-Tokens.
Eingabe-Tokens$0.221/1M Tokens
Der gesendete Text. Die Stilanweisung wird nicht mitgezählt.
Voice Enrollmentvoice-enrollment
Abrechnungsposten
Das ist enthalten
Preis
Abrechnung
Stimme erstellen
Stimmklonen (audio_url) oder Stimmdesign (voice_prompt), gleicher Preis. Die Stimme ist an qwen-audio-3.1-tts-flash gebunden.
$0.0001/Stimme0.001 Credits
Pro erstellter Stimme
Stimme erstellen$0.0001/Stimme
Stimmklonen (audio_url) oder Stimmdesign (voice_prompt), gleicher Preis. Die Stimme ist an qwen-audio-3.1-tts-flash gebunden.
Hinweise zur Abrechnung
Bei der Sprachsynthese werden Credits beim Erstellen des Tasks anhand der Textlänge geschätzt und reserviert. Nach Abschluss des Tasks werden die tatsächlich verbrauchten Eingabe- und Ausgabe-Tokens abgerechnet – ein Überschuss wird erstattet, ein Fehlbetrag nachberechnet.
Jede der beiden Token-Gebühren wird auf die kleinste Credit-Einheit (0.0001 Credits) aufgerundet, bevor sie addiert werden.
Das Erstellen einer Stimme wird einmalig abgerechnet. Die Sprachsynthese mit einer eigenen Stimme kostet genauso viel wie mit einer Systemstimme.
Fehlgeschlagene Tasks werden vollständig erstattet. Anfragen, die die Validierung nicht bestehen, liefern 400 und werden nicht berechnet.
Qwen Audio 3.1 TTS Flash API: Text-zu-Sprache mit System-, geklonten und entworfenen Stimmen
Qwen Audio 3.1 TTS Flash wandelt Text mit 68 Systemstimmen und anweisungsbasierter Steuerung von Emotion, Tempo und Dialekt in natürliche Sprache um. Auf derselben Seite erstellt Voice Enrollment Ihre eigene Stimme dafür: Klonen Sie eine einwilligende Person aus einer kurzen Aufnahme oder entwerfen Sie eine neue Stimme aus einer Textbeschreibung. EvoLink stellt beides als asynchrone Tasks an einem Audio-Endpunkt mit einem API-Key bereit.
Eingabe
Text ≤5.000 Zeichen
Ausgabe
MP3 / WAV / Opus
Stimmen
68 System- + eigene
Abtastrate
8–48 kHz
Abrechnung
Pro verbrauchtem Token
Modell-IDs von Qwen Audio 3.1 TTS Flash für API-Aufrufe
Qwen Audio 3.1 TTS Flash
qwen-audio-3.1-tts-flash
Text-zu-Sprache. Senden Sie prompt und optional eine Stimme und erhalten Sie eine Audiodatei zurück. Abrechnung nach Eingabe- und Ausgabe-Tokens.
Voice Enrollment
voice-enrollment
Erstellen Sie eine eigene Stimme für Qwen Audio 3.1 TTS Flash. Senden Sie audio_url, um eine Stimme aus einer Aufnahme zu klonen, oder voice_prompt und preview_text, um eine aus einer Beschreibung zu entwerfen. Pauschalpreis pro Stimme.
Wichtige API-Parameter von Qwen Audio 3.1 TTS Flash
Zuerst die Parameter der Sprachsynthese, dann die Felder von voice-enrollment. Das vollständige Request- und Response-Schema finden Sie im API-Tab.
promptstring
Standard: erforderlich
Zu synthetisierender Text, bis zu 5.000 Zeichen. Emotions-Tags wie [excited] können direkt im Text stehen.
voicestring
Standard: longanhuan_v3.1
Eine Systemstimme (Groß-/Kleinschreibung beachten) oder eine Stimme, die Ihr Konto mit voice-enrollment erstellt hat.
instructionstring
Standard: keine
Steuerung von Emotion, Tempo oder Dialekt in natürlicher Sprache. Bis zu 100 Abrechnungszeichen.
response_formatenum
Standard: mp3
mp3, wav oder opus. Opus unterstützt nur 8, 12, 16, 24 und 48 kHz.
speech_rate / pitchnumber
Standard: 1.0
Beide reichen von 0.5 bis 2.0. Die Tonhöhe verändert auch die Dauer und wird ignoriert, wenn speech_rate nicht 1.0 beträgt.
audio_urlstring · voice-enrollment
Standard: erforderlich für Klonen
Öffentlicher HTTP(S)-Link zu einer WAV-, MP3- oder M4A-Sprachprobe mit klarer Sprache, bis 60 s und 10 MB. Wählt Stimmklonen.
Stimmbeschreibung mit bis zu 500 Zeichen und ein Satz mit 15–200 Zeichen für den Vorschau-Clip. Wählt Stimmdesign.
preferred_namestring · voice-enrollment
Standard: erforderlich
1–10 Buchstaben oder Ziffern. Wird Teil des zurückgegebenen Stimmnamens.
Qwen Audio 3.1 TTS Flash auf zwei Wegen nutzen: EvoLink API oder Agent
Nutzen Sie die EvoLink API für Produktintegrationen und Batch-Aufgaben oder rufen Sie sie in Codex, Claude oder Gemini für schnelle Kreativ- und Entwicklungsworkflows auf. Beide Wege verwenden denselben EvoLink API-Key, dasselbe Guthaben, dieselben Modellrouten und dieselbe Aufgabenhistorie.
Rufen Sie die einheitliche Stimme-API von EvoLink serverseitig auf und steuern Sie Modell-ID, Parameter, Aufgabenwarteschlange, Callbacks und Ergebnisspeicherung selbst.
1Ergebnis und Kosten mit einem realen Briefing im Playground prüfen
2Einen EvoLink API-Key in der Konsole erstellen
3Die passende Modell-ID aus den Routenkarten oben wählen
4Aufgabe absenden und Ergebnis per Polling oder HTTPS-Callback abrufen
Geeignet für: Kreativ- und Entwicklungsaufgaben in Codex, Claude und Gemini
Übergeben Sie dem Agenten Ziel, Materialien und Abnahmekriterien. Er wählt die Route, erstellt den Request, verfolgt die Aufgabe und liefert das Ergebnis, ohne dass jeder Schritt manuell programmiert werden muss.
1EVOLINK_API_KEY lokal als Umgebungsvariable setzen; niemals in Code oder Prompt schreiben
2Ausgabeziel, Referenzen und die wichtigsten Parameter beschreiben
3Den Agenten eine Qwen Audio 3.1 TTS Flash-Route aufrufen und die Task-ID speichern lassen
4Den Agenten bis zum Endstatus pollen, das Ergebnis herunterladen und Fehlergründe melden lassen
Was Sie mit Qwen Audio 3.1 TTS Flash bauen können
Sprachassistenten mit Qwen Audio 3.1 TTS Flash
Geben Sie einem Assistenten eine einheitliche Stimme und steuern Sie den Tonfall pro Antwort mit einer kurzen Stilanweisung.
Hörbücher und Kurse mit Qwen Audio 3.1 TTS Flash
Vertonen Sie Kapitel mit bis zu 5.000 Zeichen pro Anfrage mit einer ruhigen Erzählstimme.
Videovertonung und Synchronisation
Erzeugen Sie Voice-over auf Mandarin, in chinesischen Dialekten, Englisch und weiteren Sprachen – mit Emotions-Tags direkt im Text.
Eine Markenstimme mit Voice Enrollment
Klonen Sie eine einwilligende Person oder entwerfen Sie eine neue Stimme und verwenden Sie den Stimmnamen in den folgenden 6 Stunden in Ihren Syntheseaufrufen.
Qwen Audio 3.1 TTS Flash API: Codebeispiel und Fehlerbehandlung
Dieses Beispiel zeigt den kürzesten lauffähigen Ablauf: Aufgabe erstellen, zurückgegebene Task-ID speichern und anschließend pollen oder auf einen HTTPS-Callback warten. Vollständige Parameter und Antwortfelder finden Sie im API-Tab.
curl -X POST https://api.evolink.ai/v1/audios/generations \
-H "Authorization: Bearer $EVOLINK_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "qwen-audio-3.1-tts-flash",
"prompt": "Hello, and welcome to EvoLink. This is a quick demo of Qwen Audio 3.1 TTS Flash.",
"voice": "Emily_v3.1",
"instruction": "Speak warmly, at a relaxed pace",
"response_format": "mp3"
}'
# Save the returned task ID, then query; the audio link is in results[0]:
curl https://api.evolink.ai/v1/tasks/{task_id} \
-H "Authorization: Bearer $EVOLINK_API_KEY"
Parameterprüfung fehlgeschlagen
Prüfen Sie jeden Wert anhand der Parameterkarten oben: Wertebereiche, zulässige Optionen, Anzahl der Materialien und Dateitypen müssen zur gewählten Route passen.
Authentifizierungs- oder Guthabenproblem
Prüfen Sie den Authorization Bearer Token sowie verfügbares Guthaben und Aufgabenabrechnung in der Konsole.
Inhalt oder Material abgelehnt
Prüfen Sie Persönlichkeitsrechte, Markenmaterial, lesbaren Text, sensible Inhalte und die Konformität der Eingabedateien.
Aufgabe fehlgeschlagen oder Zeitüberschreitung
Eine Qwen Audio 3.1 TTS Flash-Aufgabe mit endgültigem Status „fehlgeschlagen“ wird nicht berechnet. Bewahren Sie die Task-ID auf und klären Sie vor einem neuen Versuch, ob Parameterprüfung, Moderation oder Ausführung die Ursache war.
Callback nicht empfangen
callback_url muss eine öffentliche HTTPS-URL sein und darf nicht auf localhost oder ein privates Netzwerk zeigen. Bewahren Sie die Task-ID als Polling-Fallback auf.
Systemstimmen vs. Stimmklonen vs. Stimmdesign
Merkmal
Systemstimme
Stimmklonen
Stimmdesign
Modell-ID
qwen-audio-3.1-tts-flash
voice-enrollment
voice-enrollment
Das liefern Sie
Ein Stimmname aus der Liste
Eine Sprachprobe (audio_url)
Eine Stimmbeschreibung + Vorschautext
Das erhalten Sie
Audio
Ein Stimmname
Ein Stimmname + Vorschau-Clip
Einrichtungskosten
Keine
~$0.0001 pro Stimme
~$0.0001 pro Stimme
Am besten für
Schneller Einstieg
Nachbildung einer bestimmten, einwilligenden Person
Neue Stimmen, Figuren, Erkundung des Markentons
Routing, Task-Lebenszyklus und Abrechnung von Qwen Audio 3.1 TTS Flash
Zwei Modell-IDs an einem Endpunkt
Senden Sie qwen-audio-3.1-tts-flash, um Sprache zu synthetisieren, und voice-enrollment, um eine Stimme zu erstellen. Beide gehen an POST /v1/audios/generations und liefern eine Task-ID.
Asynchrone Tasks
Rufen Sie /v1/tasks/{task_id} ab oder verwenden Sie callback_url. Die Dauer hängt vom Text und der Stimmoperation ab; eine feste Latenz wird nicht garantiert. Audiolinks verfallen nach 24 Stunden.
Ihre Stimmen bleiben Ihre
Eine eigene Stimme funktioniert nur mit qwen-audio-3.1-tts-flash und nur für das Konto, das sie erstellt hat. Der Stimmname eines anderen Kontos liefert 404. Eine Stimme ist nach dem Erstellen 6 Stunden lang nutzbar.
Warum Qwen Audio 3.1 TTS Flash über EvoLink nutzen
Frühe Validierung
Unbekannte Parameter, ein ungültiger Stimmname oder zu langer Text scheitern sofort mit 400, statt Credits zu reservieren und später fehlzuschlagen.
Einheitliche API
Ein API-Key funktioniert für Qwen, Seed Audio, Video-, Bild- und LLM-Modelle.
Einheitliches Guthaben
Verfolgen Sie Credits, Ausgaben und Modellnutzung in einer Konsole.
Task-Status-Tracking
Sehen Sie, ob ein Task eingereicht, in Bearbeitung, abgeschlossen oder fehlgeschlagen ist – mit dem tatsächlichen Fehlergrund.
Zahlen Sie nur, was Sie nutzen
Sprache wird nach tatsächlichem Token-Verbrauch abgerechnet, und für einen fehlgeschlagenen Task reservierte Credits werden vollständig zurückerstattet.
Weitere Audiomodelle auf EvoLink neben Qwen Audio 3.1 TTS Flash
Doubao Seed Audio 1.0
Promptbasiertes Audio von BytePlus für Stimme, Dialog, Soundeffekte, Musik und Atmosphäre.
Unterstützt EvoLink für dieses Modell Streaming oder WebSocket?
Diese EvoLink-Route verwendet asynchrone HTTP-Aufgaben ohne SSE- oder WebSocket-Streaming. Senden Sie die Anfrage an POST /v1/audios/generations und rufen Sie die Audio-URL über GET /v1/tasks/{task_id} ab. Die Streaming-APIs des Anbieters verwenden ein anderes Protokoll.
Ist Qwen Audio 3.1 TTS Flash dasselbe Modell wie Qwen3-TTS?
Nein. Diese Seite behandelt das gehostete Modell qwen-audio-3.1-tts-flash. Qwen3-TTS, Qwen Audio TTS-Next und Qwen Audio Realtime sind separate Modelle mit anderen Modell-IDs, Parametern, Gewichten und Streaming-Funktionen.
Wie lautet die Modell-ID von Qwen Audio 3.1 TTS Flash?
Verwenden Sie qwen-audio-3.1-tts-flash für die Sprachsynthese und voice-enrollment, um eine eigene Stimme zu erstellen. Beide werden an POST /v1/audios/generations gesendet.
Was kostet Qwen Audio 3.1 TTS Flash?
Sprache wird nach den tatsächlich verbrauchten Tokens abgerechnet, mit getrennten Preisen für Eingabe und Ausgabe, die live im Bereich Preise angezeigt werden. Das Erstellen einer eigenen Stimme kostet eine kleine Pauschale pro Stimme. Fehlgeschlagene Tasks werden vollständig erstattet.
Warum wird mehr reserviert, als mir am Ende berechnet wird?
Die Token-Zahl steht erst nach der Synthese fest, daher werden beim Erstellen des Tasks Credits anhand der Textlänge reserviert – in der Regel mehr, als am Ende berechnet wird. Nach Abschluss werden die tatsächlich verbrauchten Tokens abgerechnet und der Überschuss wird erstattet. Text, der Zeichen für Zeichen vorgelesen wird (etwa Ziffern-, Buchstaben- oder Symbolfolgen), kann mehr verbrauchen als reserviert; der Fehlbetrag wird dann nachberechnet.
Wie erstelle und verwende ich meine eigene Stimme?
Rufen Sie voice-enrollment mit audio_url auf, um eine Stimme zu klonen, oder mit voice_prompt und preview_text, um eine zu entwerfen. Lesen Sie result_data.voice aus dem abgeschlossenen Task und übergeben Sie den Wert als Parameter voice an qwen-audio-3.1-tts-flash. Eine eigene Stimme ist nach dem Erstellen 6 Stunden lang nutzbar; danach erstellen Sie eine neue.
Was ist der Unterschied zwischen Stimmklonen und Stimmdesign?
Stimmklonen bildet eine reale Person aus einer kurzen Aufnahme nach und liefert nur den Stimmnamen. Stimmdesign erstellt eine neue Stimme aus einer Textbeschreibung und liefert zusätzlich einen Vorschau-Clip. Beides kostet gleich viel und funktioniert nur mit qwen-audio-3.1-tts-flash.
Was macht eine gute Sprachprobe für das Stimmklonen aus?
Pflicht: WAV, MP3 oder M4A, bis 60 s und 10 MB, mindestens 16 kHz, mit klarer Sprache. Am besten eignen sich 10–20 Sekunden eines einzelnen Sprechers, mono, Pausen von höchstens 2 Sekunden und ohne Hintergrundmusik oder Rauschen.
Kann jemand anderes meine eigene Stimme verwenden?
Nein. Eine eigene Stimme kann nur von dem Konto verwendet werden, das sie erstellt hat; andere Konten erhalten für denselben Stimmnamen einen 404.
Wessen Stimme darf ich klonen?
Nur Ihre eigene Stimme oder eine Stimme, für die Sie eine ausdrückliche Nutzungserlaubnis haben. Das Klonen fremder Stimmen ohne Einwilligung ist nicht erlaubt.
Wie steuere ich Emotion, Tempo oder Dialekt?
Übergeben Sie eine kurze Anweisung wie „langsam und sanft sprechen“ oder schreiben Sie Tags wie [excited] direkt in den Text. Die vier mehrsprachigen Stimmen sprechen auch mehrere chinesische Dialekte, wenn die Anweisung einen verlangt.
Was passiert, wenn ein Task fehlschlägt?
Fehlgeschlagene Tasks werden nicht berechnet – die reservierten Credits werden vollständig erstattet. Das Task-Ergebnis zeigt den Fehlergrund.