GPT Image 2.5 Flare & Sunburst sont disponibles sur EvoLinkEssayer GPT Image 2.5

Qwen Audio 3.1 TTS Flash API

Qwen Audio 3.1 TTS Flash via l’API unifiée EvoLink : 68 voix, clonage et conception de voix. ID, tarifs par token et intégration asynchrone.

AlibabaSynthèse vocaleDisponible
Dès $1.765 / 1M de tokens de sortie
Synthèse vocaleVoix systèmeClonage de voixConception de voixContrôle des émotionsMultilingue et dialectes
Route productionLive
Points forts du modèle
Voix naturelle avec contrôle de l'émotion, du dialecte et du rythme par instruction
Cas d'usage
Assistants vocaux, livres audio, narration vidéo, service client
Entrée
Texte jusqu'à 5 000 caractères, plus une instruction de style facultative
Sortie
Audio MP3, WAV ou Opus avec une voix système, clonée ou conçue

Essayez Qwen Audio 3.1 TTS Flash avant d'intégrer l'API.

Transformez du texte en parole avec une voix système, ou passez le modèle sur Voice Enrollment pour cloner ou concevoir votre propre voix et l'utiliser immédiatement.

Créer une tâche de synthèse vocale

Fixé sur qwen-audio-3.1-tts-flash
80/5,000

Jusqu'à 5 000 caractères. Ajoutez des balises comme [excited] ou [laughing] dans le texte pour façonner l'interprétation.

Choisissez une voix système dans la liste, ou saisissez ou collez ici un nom de voix, y compris celui d'une voix que vous avez créée. Les noms de voix sont sensibles à la casse. Choisissez une voix compatible avec la langue de votre texte.

0/100

Facultatif. Contrôle l'émotion, le rythme ou le dialecte. Jusqu'à 100 caractères facturables (les sinogrammes, y compris les kanji japonais, comptent pour 2 ; les kana, le hangul et tous les autres caractères comptent pour 1).

Indication facultative sur la langue du texte.

1.0x
1.0x

La hauteur modifie aussi la durée et n'a aucun effet lorsque la vitesse n'est pas 1.0.

50
Estimation ~$0.00090.0578 crédits
Réservé à l'avance : 106 tokens d'entrée + 468 tokens de sortie, estimés d'après votre texte. Vous êtes facturé pour les tokens réellement utilisés : l'excédent est restitué et tout complément est facturé.
Prête
Audio généré

Votre audio apparaîtra ici.

Historique
Les tâches Qwen Audio 3.1 TTS Flash apparaîtront ici.

Connaissez votre coût Qwen Audio 3.1 TTS Flash avant d'ajouter des crédits.

La synthèse vocale est facturée selon les tokens réellement utilisés, avec des tarifs distincts pour l'entrée et la sortie. La création d'une voix personnalisée coûte un petit forfait fixe par voix. Les tâches échouées sont intégralement remboursées.

Coût du premier test

Une courte phrase · 14 tokens d'entrée + 33 tokens de sortie
Échantillon mesuré
Crédits0.0043

Une courte phrase

Coût estimé~$0.0001

Environ 158 139 phrases comme celle-ci avec 10 $ de crédits.

Dans le Playground, gardez la voix par défaut et saisissez une phrase. Des crédits sont réservés à la création de la tâche selon la longueur du texte, puis ajustés aux tokens réellement utilisés : l'excédent est restitué et tout complément est facturé.

Guide du budget de test pour Qwen Audio 3.1 TTS Flash

Choisissez un montant selon le nombre de tests prévus.
Ajouter des crédits
$10
Environ 475 longs articles de 5 000 caractères chinois

Pour une première validation.

$50
Environ 2 375 longs articles de 5 000 caractères chinois

Pour narrer un lot d'articles ou de cours.

$100
Environ 4 751 longs articles de 5 000 caractères chinois

Pour tester avant l'intégration en production.

Exemples de coûts pour Qwen Audio 3.1 TTS Flash

Une courte phrase14 tokens d'entrée + 33 tokens de sortie · mesuré
~$0.0001
~0.0043 cr
Un long article5 000 caractères chinois · 5,000 tokens d'entrée + 11,300 tokens de sortie · mesuré
~$0.022
~1.431 cr
Créer une voix personnalisée1 voix · clonage de voix ou conception de voix
$0.0001
0.001 cr

Les nombres de tokens sont des échantillons mesurés. L'utilisation réelle dépend de la langue, de la voix et de la façon dont le texte est lu : les chiffres, les majuscules et les symboles sont lus un par un et consomment davantage de tokens de sortie.

Tarifs de Qwen Audio 3.1 TTS Flash

Qwen Audio 3.1 TTS Flashqwen-audio-3.1-tts-flash
Tokens de sortie$1.765/1M de tokens

La parole générée. Un audio plus long consomme davantage de tokens de sortie.

Tokens d'entrée$0.221/1M de tokens

Le texte que vous envoyez. L'instruction de style n'est pas comptée.

Voice Enrollmentvoice-enrollment
Créer une voix$0.0001/voix

Clonage de voix (audio_url) ou conception de voix (voice_prompt), même tarif. La voix est associée à qwen-audio-3.1-tts-flash.

Notes de facturation

  • La synthèse vocale réserve des crédits à la création de la tâche, estimés d'après la longueur du texte. À la fin de la tâche, vous êtes facturé pour les tokens d'entrée et de sortie réellement utilisés : l'excédent est restitué et tout complément est facturé.
  • Chacune des deux charges de tokens est arrondie à la plus petite unité de crédit (0.0001 crédit) avant d'être additionnée.
  • La création d'une voix est facturée une seule fois. La synthèse vocale avec une voix personnalisée coûte autant qu'avec une voix système.
  • Les tâches échouées sont intégralement remboursées. Les requêtes qui échouent à la validation renvoient 400 et ne sont pas facturées.

API Qwen Audio 3.1 TTS Flash : synthèse vocale avec voix système, clonées et conçues

Qwen Audio 3.1 TTS Flash transforme le texte en parole naturelle avec 68 voix système et un contrôle par instruction de l’émotion, du rythme et du dialecte. Sur la même page, Voice Enrollment crée votre propre voix pour ce modèle : clonez un locuteur consentant à partir d’un court enregistrement, ou concevez une nouvelle voix à partir d’une description textuelle. EvoLink expose les deux sous forme de tâches asynchrones sur un seul endpoint audio avec une seule clé API.

Entrée
Texte ≤5 000 caractères
Sortie
MP3 / WAV / Opus
Voix
68 système + les vôtres
Fréquence d’échantillonnage
8–48 kHz
Facturation
Par token utilisé

ID de modèle de Qwen Audio 3.1 TTS Flash pour les appels API

Qwen Audio 3.1 TTS Flash

qwen-audio-3.1-tts-flash

Synthèse vocale. Envoyez prompt et une voix facultative ; vous recevez un fichier audio. Facturé selon les tokens d’entrée et de sortie.

Voice Enrollment

voice-enrollment

Créez une voix personnalisée pour Qwen Audio 3.1 TTS Flash. Envoyez audio_url pour cloner une voix à partir d’un enregistrement, ou voice_prompt et preview_text pour en concevoir une à partir d’une description. Forfait fixe par voix.

Paramètres API clés de Qwen Audio 3.1 TTS Flash

Les paramètres de synthèse vocale d’abord, puis les champs utilisés par voice-enrollment. Ouvrez l’onglet API pour le schéma complet de requête et de réponse.

promptstring

Valeur par défaut: requis

Texte à synthétiser, jusqu’à 5 000 caractères. Des balises d’émotion comme [excited] peuvent être écrites directement dans le texte.

voicestring

Valeur par défaut: longanhuan_v3.1

Une voix système (sensible à la casse), ou une voix créée par votre compte avec voice-enrollment.

instructionstring

Valeur par défaut: aucune

Contrôle en langage naturel de l’émotion, du rythme ou du dialecte. Jusqu’à 100 caractères facturables.

response_formatenum

Valeur par défaut: mp3

mp3, wav ou opus. Opus ne prend en charge que 8, 12, 16, 24 et 48 kHz.

speech_rate / pitchnumber

Valeur par défaut: 1.0

Les deux vont de 0.5 à 2.0. La hauteur modifie aussi la durée et est ignorée lorsque speech_rate n’est pas 1.0.

audio_urlstring · voice-enrollment

Valeur par défaut: requis pour le clonage

Lien public HTTP(S) vers un échantillon WAV, MP3 ou M4A contenant une parole claire, jusqu’à 60 s et 10 MB. Sélectionne le clonage de voix.

voice_prompt + preview_textstring · voice-enrollment

Valeur par défaut: requis pour la conception

Description de la voix jusqu’à 500 caractères, et une phrase de 15–200 caractères pour l’extrait d’aperçu. Sélectionne la conception de voix.

preferred_namestring · voice-enrollment

Valeur par défaut: requis

1–10 lettres (a–z, A–Z) ou chiffres. Il fait partie du nom de voix renvoyé.

Deux façons d’utiliser Qwen Audio 3.1 TTS Flash : API EvoLink ou Agent

Utilisez l’API EvoLink pour intégrer le modèle à un produit ou traiter des lots, ou appelez-la depuis Codex, Claude ou Gemini pour des workflows créatifs et de développement rapides. Les deux méthodes partagent la même clé API EvoLink, le même solde, les mêmes routes de modèle et le même historique de tâches.

Option 1

Intégrer avec l’API EvoLink

Idéal pour : backends produit, tâches par lots, workflows automatisés

Appelez l’API voix unifiée d’EvoLink depuis votre serveur et contrôlez l’ID du modèle, les paramètres, la file de tâches, les callbacks et le stockage des résultats.

  1. 1Tester le rendu et le coût avec un brief réel dans le Playground
  2. 2Créer une clé API EvoLink dans la console
  3. 3Choisir l’ID de modèle adapté à votre tâche parmi les cartes de routes ci-dessus
  4. 4Soumettre la tâche et récupérer le résultat par polling ou callback HTTPS
Option 2

Appeler l’API avec un Agent

Idéal pour : création et développement dans Codex, Claude et Gemini

Donnez à l’Agent l’objectif, les ressources et les critères de validation. Il choisit la route, construit la requête, suit la tâche et renvoie le résultat sans vous obliger à coder chaque étape.

  1. 1Définir EVOLINK_API_KEY dans l’environnement local, jamais dans le code ni dans un prompt
  2. 2Décrire l’objectif, les références et les paramètres clés
  3. 3Demander à l’Agent d’appeler une route Qwen Audio 3.1 TTS Flash et d’enregistrer le task ID
  4. 4Laisser l’Agent suivre l’état final, télécharger le résultat et expliquer les échecs

Ce que vous pouvez créer avec Qwen Audio 3.1 TTS Flash

Assistants vocaux avec Qwen Audio 3.1 TTS Flash

Donnez à un assistant une voix cohérente et ajustez son ton à chaque réponse avec une courte instruction de style.

Livres audio et cours avec Qwen Audio 3.1 TTS Flash

Narrez des chapitres de jusqu’à 5 000 caractères par requête avec une voix de narrateur posée.

Narration vidéo et doublage

Générez des voix off en mandarin, en dialectes chinois, en anglais et plus encore, avec des balises d’émotion intégrées au texte.

Une voix de marque avec Voice Enrollment

Clonez un locuteur consentant ou concevez une nouvelle voix, puis utilisez le nom de voix dans vos appels de synthèse pendant les 6 heures qui suivent.

API Qwen Audio 3.1 TTS Flash : exemple de code et gestion des erreurs

Cet exemple montre le flux exécutable minimal : créer une tâche, enregistrer le task ID retourné, puis effectuer un polling ou attendre un callback HTTPS. Consultez l’onglet API pour tous les paramètres et formats de réponse.

Voir la documentation API complète
cURL
curl -X POST https://api.evolink.ai/v1/audios/generations \
  -H "Authorization: Bearer $EVOLINK_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen-audio-3.1-tts-flash",
    "prompt": "Hello, and welcome to EvoLink. This is a quick demo of Qwen Audio 3.1 TTS Flash.",
    "voice": "Emily_v3.1",
    "instruction": "Speak warmly, at a relaxed pace",
    "response_format": "mp3"
  }'

# Save the returned task ID, then query; the audio link is in results[0]:
curl https://api.evolink.ai/v1/tasks/{task_id} \
  -H "Authorization: Bearer $EVOLINK_API_KEY"

Échec de validation des paramètres

Vérifiez chaque valeur avec les cartes de paramètres ci-dessus : plages, options autorisées, nombre de ressources et formats de fichiers doivent correspondre à la route choisie.

Problème d’authentification ou de solde

Vérifiez le jeton Authorization Bearer, le solde disponible et la facturation de la tâche dans la console.

Contenu ou ressource refusé

Vérifiez les droits à l’image, les éléments de marque, le texte lisible, le contenu sensible et la conformité des ressources.

Tâche échouée ou expirée

Une tâche Qwen Audio 3.1 TTS Flash dont l’état final est « échoué » n’est pas facturée. Conservez le task ID et identifiez s’il s’agit d’un problème de validation, de modération ou d’exécution avant de relancer.

Callback non reçu

callback_url doit être une URL HTTPS publique, et non localhost ou une adresse de réseau privé. Conservez toujours le task ID comme solution de repli pour le polling.

Voix système, clonage de voix et conception de voix

CaractéristiqueVoix systèmeClonage de voixConception de voix
ID de modèleqwen-audio-3.1-tts-flashvoice-enrollmentvoice-enrollment
Ce que vous fournissezUn nom de voix de la listeUn échantillon vocal (audio_url)Une description de voix + un texte d’aperçu
Ce que vous obtenezDe l’audioUn nom de voixUn nom de voix + un extrait d’aperçu
Coût de mise en placeAucun~$0.0001 par voix~$0.0001 par voix
Idéal pourDémarrer rapidementReproduire un locuteur précis et consentantNouvelles voix, personnages, exploration du ton de marque

Routage, cycle de vie des tâches et facturation de Qwen Audio 3.1 TTS Flash

Deux ID de modèle sur un seul endpoint

Envoyez qwen-audio-3.1-tts-flash pour synthétiser de la parole et voice-enrollment pour créer une voix. Les deux vont vers POST /v1/audios/generations et renvoient un ID de tâche.

Tâches asynchrones

Interrogez /v1/tasks/{task_id} ou utilisez callback_url. La durée dépend du texte et de l’opération vocale ; aucune latence fixe n’est garantie. Les liens audio expirent après 24 heures.

Vos voix restent les vôtres

Une voix personnalisée ne fonctionne qu’avec qwen-audio-3.1-tts-flash et uniquement pour le compte qui l’a créée. Utiliser le nom de voix d’un autre compte renvoie 404. Une voix est utilisable pendant 6 heures après sa création.

Pourquoi utiliser Qwen Audio 3.1 TTS Flash via EvoLink

Validation en amont

Les paramètres inconnus, un nom de voix invalide ou un texte trop long échouent immédiatement avec 400, au lieu de réserver des crédits et d’échouer plus tard.

API unifiée

Une clé API fonctionne pour Qwen, Seed Audio, la vidéo, l’image et les LLM.

Solde unifié

Suivez les crédits, les dépenses et l’utilisation des modèles dans une seule console.

Suivi du statut des tâches

Voyez si une tâche est soumise, en cours, terminée ou échouée, avec la raison réelle de l’échec.

Payez ce que vous utilisez

La parole est facturée selon l’utilisation réelle des tokens, et les crédits réservés pour une tâche échouée sont intégralement restitués.

Autres modèles audio sur EvoLink en plus de Qwen Audio 3.1 TTS Flash

Doubao Seed Audio 1.0

Doubao Seed Audio 1.0

Audio BytePlus à partir de prompts pour la voix, les dialogues, les effets sonores, la musique et les ambiances.

Voir l'API
Suno

Suno

Génération musicale Suno avec voix chantées, paroles et pistes instrumentales.

Voir l'API

FAQ sur Qwen Audio 3.1 TTS Flash

EvoLink prend-il en charge le streaming ou WebSocket pour ce modèle ?

Cette route EvoLink utilise des tâches HTTP asynchrones, sans streaming SSE ni WebSocket. Envoyez la requête à POST /v1/audios/generations, puis récupérez l’URL audio via GET /v1/tasks/{task_id}. Les API de streaming du fournisseur utilisent un autre protocole.

Qwen Audio 3.1 TTS Flash est-il le même modèle que Qwen3-TTS ?

Non. Cette page concerne le modèle hébergé qwen-audio-3.1-tts-flash. Qwen3-TTS, Qwen Audio TTS-Next et Qwen Audio Realtime sont des modèles distincts avec leurs propres identifiants, paramètres, poids et fonctions de streaming.

Quel est l’ID de modèle de Qwen Audio 3.1 TTS Flash ?

Utilisez qwen-audio-3.1-tts-flash pour la synthèse vocale et voice-enrollment pour créer une voix personnalisée. Les deux sont envoyés à POST /v1/audios/generations.

Combien coûte Qwen Audio 3.1 TTS Flash ?

La parole est facturée selon les tokens réellement utilisés, avec des tarifs d’entrée et de sortie distincts affichés en direct dans la section Tarifs. La création d’une voix personnalisée coûte un petit forfait fixe par voix. Les tâches échouées sont intégralement remboursées.

Pourquoi un montant plus élevé est-il réservé que celui finalement facturé ?

Le nombre de tokens n’est connu qu’après la synthèse : des crédits sont donc réservés à la création de la tâche d’après la longueur du texte, généralement plus que le montant final. À la fin, vous êtes facturé pour les tokens réellement utilisés et l’excédent est restitué. Un texte lu caractère par caractère (suites de chiffres, de lettres ou de symboles) peut consommer plus que le montant réservé ; le complément est alors facturé.

Comment créer et utiliser ma propre voix ?

Appelez voice-enrollment avec audio_url pour cloner une voix, ou avec voice_prompt et preview_text pour en concevoir une, lisez result_data.voice dans la tâche terminée, puis passez-le comme paramètre voice à qwen-audio-3.1-tts-flash. Une voix personnalisée est utilisable pendant 6 heures après sa création ; ensuite, créez-en une nouvelle.

Quelle est la différence entre le clonage de voix et la conception de voix ?

Le clonage de voix reproduit un locuteur réel à partir d’un court enregistrement et renvoie uniquement le nom de voix. La conception de voix crée une nouvelle voix à partir d’une description textuelle et renvoie aussi un extrait d’aperçu. Les deux ont le même prix et ne fonctionnent qu’avec qwen-audio-3.1-tts-flash.

Qu’est-ce qu’un bon échantillon pour le clonage de voix ?

Obligatoire : WAV, MP3 ou M4A, jusqu’à 60 s et 10 MB, 16 kHz ou plus, avec une parole claire. Pour de meilleurs résultats, utilisez 10 à 20 secondes d’un seul locuteur, un audio mono, des pauses de 2 secondes maximum, et aucune musique de fond ni bruit.

Quelqu’un d’autre peut-il utiliser ma voix personnalisée ?

Non. Une voix personnalisée ne peut être utilisée que par le compte qui l’a créée ; les autres comptes obtiennent une erreur 404 pour le même nom de voix.

Quelles voix puis-je cloner ?

Uniquement votre propre voix ou une voix que vous avez l’autorisation explicite d’utiliser. Cloner la voix de quelqu’un sans son consentement est interdit.

Comment contrôler l’émotion, le rythme ou le dialecte ?

Envoyez une courte instruction comme « parlez lentement et avec douceur », ou écrivez des balises comme [excited] directement dans le texte. Les quatre voix multilingues parlent aussi plusieurs dialectes chinois lorsque l’instruction en demande un.

Que se passe-t-il si une tâche échoue ?

Les tâches échouées ne sont pas facturées : les crédits réservés sont intégralement restitués. Le résultat de la tâche indique la raison de l’échec.