Qwen Audio 3.1 TTS Flash via l’API unifiée EvoLink : 68 voix, clonage et conception de voix. ID, tarifs par token et intégration asynchrone.
Alibaba·Synthèse vocale·Disponible
Dès $1.765 / 1M de tokens de sortie
Synthèse vocaleVoix systèmeClonage de voixConception de voixContrôle des émotionsMultilingue et dialectes
Route productionCe taux reflète la disponibilité côté plateforme — seules les erreurs serveur confirmées (HTTP 500 / réponse vide) comptent comme échecs. Les problèmes côté utilisateur (modération de contenu, paramètres invalides, annulation) ainsi que les limites de débit, timeouts et erreurs d'authentification sont exclus. Avant l'arrivée de trafic réel, les intervalles vides peuvent apparaître comme disponibles.Live
Live
Points forts du modèle
Voix naturelle avec contrôle de l'émotion, du dialecte et du rythme par instruction
Cas d'usage
Assistants vocaux, livres audio, narration vidéo, service client
Entrée
Texte jusqu'à 5 000 caractères, plus une instruction de style facultative
Sortie
Audio MP3, WAV ou Opus avec une voix système, clonée ou conçue
Essayez Qwen Audio 3.1 TTS Flash avant d'intégrer l'API.
Transformez du texte en parole avec une voix système, ou passez le modèle sur Voice Enrollment pour cloner ou concevoir votre propre voix et l'utiliser immédiatement.
Créer une tâche de synthèse vocale
Fixé sur qwen-audio-3.1-tts-flash
80/5,000
Jusqu'à 5 000 caractères. Ajoutez des balises comme [excited] ou [laughing] dans le texte pour façonner l'interprétation.
Choisissez une voix système dans la liste, ou saisissez ou collez ici un nom de voix, y compris celui d'une voix que vous avez créée. Les noms de voix sont sensibles à la casse. Choisissez une voix compatible avec la langue de votre texte.
0/100
Facultatif. Contrôle l'émotion, le rythme ou le dialecte. Jusqu'à 100 caractères facturables (les sinogrammes, y compris les kanji japonais, comptent pour 2 ; les kana, le hangul et tous les autres caractères comptent pour 1).
Indication facultative sur la langue du texte.
1.0x
1.0x
La hauteur modifie aussi la durée et n'a aucun effet lorsque la vitesse n'est pas 1.0.
50
Estimation ~$0.00090.0578 crédits
Réservé à l'avance : 106 tokens d'entrée + 468 tokens de sortie, estimés d'après votre texte. Vous êtes facturé pour les tokens réellement utilisés : l'excédent est restitué et tout complément est facturé.
Prête
Audio généré
Votre audio apparaîtra ici.
0:00 / 0:00
Historique
Les tâches Qwen Audio 3.1 TTS Flash apparaîtront ici.
Connaissez votre coût Qwen Audio 3.1 TTS Flash avant d'ajouter des crédits.
La synthèse vocale est facturée selon les tokens réellement utilisés, avec des tarifs distincts pour l'entrée et la sortie. La création d'une voix personnalisée coûte un petit forfait fixe par voix. Les tâches échouées sont intégralement remboursées.
Coût du premier test
Une courte phrase · 14 tokens d'entrée + 33 tokens de sortie
Échantillon mesuré
Crédits0.0043
Une courte phrase
Coût estimé~$0.0001
Environ 158 139 phrases comme celle-ci avec 10 $ de crédits.
Dans le Playground, gardez la voix par défaut et saisissez une phrase. Des crédits sont réservés à la création de la tâche selon la longueur du texte, puis ajustés aux tokens réellement utilisés : l'excédent est restitué et tout complément est facturé.
Guide du budget de test pour Qwen Audio 3.1 TTS Flash
Choisissez un montant selon le nombre de tests prévus.
Environ 475 longs articles de 5 000 caractères chinois
Pour une première validation.
$50
Environ 2 375 longs articles de 5 000 caractères chinois
Pour narrer un lot d'articles ou de cours.
$100
Environ 4 751 longs articles de 5 000 caractères chinois
Pour tester avant l'intégration en production.
Exemples de coûts pour Qwen Audio 3.1 TTS Flash
Une courte phrase14 tokens d'entrée + 33 tokens de sortie · mesuré
~$0.0001
~0.0043 cr
Un long article5 000 caractères chinois · 5,000 tokens d'entrée + 11,300 tokens de sortie · mesuré
~$0.022
~1.431 cr
Créer une voix personnalisée1 voix · clonage de voix ou conception de voix
$0.0001
0.001 cr
Les nombres de tokens sont des échantillons mesurés. L'utilisation réelle dépend de la langue, de la voix et de la façon dont le texte est lu : les chiffres, les majuscules et les symboles sont lus un par un et consomment davantage de tokens de sortie.
Tarifs de Qwen Audio 3.1 TTS Flash
Qwen Audio 3.1 TTS Flashqwen-audio-3.1-tts-flash
Poste de facturation
Ce que cela couvre
Tarif
Facturation
Tokens de sortie
La parole générée. Un audio plus long consomme davantage de tokens de sortie.
$1.765/1M de tokens120 Crédits
Selon l'utilisation réelle
Tokens d'entrée
Le texte que vous envoyez. L'instruction de style n'est pas comptée.
$0.221/1M de tokens15 Crédits
Selon l'utilisation réelle
Tokens de sortie$1.765/1M de tokens
La parole générée. Un audio plus long consomme davantage de tokens de sortie.
Tokens d'entrée$0.221/1M de tokens
Le texte que vous envoyez. L'instruction de style n'est pas comptée.
Voice Enrollmentvoice-enrollment
Poste de facturation
Ce que cela couvre
Tarif
Facturation
Créer une voix
Clonage de voix (audio_url) ou conception de voix (voice_prompt), même tarif. La voix est associée à qwen-audio-3.1-tts-flash.
$0.0001/voix0.001 Crédits
Par voix créée
Créer une voix$0.0001/voix
Clonage de voix (audio_url) ou conception de voix (voice_prompt), même tarif. La voix est associée à qwen-audio-3.1-tts-flash.
Notes de facturation
La synthèse vocale réserve des crédits à la création de la tâche, estimés d'après la longueur du texte. À la fin de la tâche, vous êtes facturé pour les tokens d'entrée et de sortie réellement utilisés : l'excédent est restitué et tout complément est facturé.
Chacune des deux charges de tokens est arrondie à la plus petite unité de crédit (0.0001 crédit) avant d'être additionnée.
La création d'une voix est facturée une seule fois. La synthèse vocale avec une voix personnalisée coûte autant qu'avec une voix système.
Les tâches échouées sont intégralement remboursées. Les requêtes qui échouent à la validation renvoient 400 et ne sont pas facturées.
API Qwen Audio 3.1 TTS Flash : synthèse vocale avec voix système, clonées et conçues
Qwen Audio 3.1 TTS Flash transforme le texte en parole naturelle avec 68 voix système et un contrôle par instruction de l’émotion, du rythme et du dialecte. Sur la même page, Voice Enrollment crée votre propre voix pour ce modèle : clonez un locuteur consentant à partir d’un court enregistrement, ou concevez une nouvelle voix à partir d’une description textuelle. EvoLink expose les deux sous forme de tâches asynchrones sur un seul endpoint audio avec une seule clé API.
Entrée
Texte ≤5 000 caractères
Sortie
MP3 / WAV / Opus
Voix
68 système + les vôtres
Fréquence d’échantillonnage
8–48 kHz
Facturation
Par token utilisé
ID de modèle de Qwen Audio 3.1 TTS Flash pour les appels API
Qwen Audio 3.1 TTS Flash
qwen-audio-3.1-tts-flash
Synthèse vocale. Envoyez prompt et une voix facultative ; vous recevez un fichier audio. Facturé selon les tokens d’entrée et de sortie.
Voice Enrollment
voice-enrollment
Créez une voix personnalisée pour Qwen Audio 3.1 TTS Flash. Envoyez audio_url pour cloner une voix à partir d’un enregistrement, ou voice_prompt et preview_text pour en concevoir une à partir d’une description. Forfait fixe par voix.
Paramètres API clés de Qwen Audio 3.1 TTS Flash
Les paramètres de synthèse vocale d’abord, puis les champs utilisés par voice-enrollment. Ouvrez l’onglet API pour le schéma complet de requête et de réponse.
promptstring
Valeur par défaut: requis
Texte à synthétiser, jusqu’à 5 000 caractères. Des balises d’émotion comme [excited] peuvent être écrites directement dans le texte.
voicestring
Valeur par défaut: longanhuan_v3.1
Une voix système (sensible à la casse), ou une voix créée par votre compte avec voice-enrollment.
instructionstring
Valeur par défaut: aucune
Contrôle en langage naturel de l’émotion, du rythme ou du dialecte. Jusqu’à 100 caractères facturables.
response_formatenum
Valeur par défaut: mp3
mp3, wav ou opus. Opus ne prend en charge que 8, 12, 16, 24 et 48 kHz.
speech_rate / pitchnumber
Valeur par défaut: 1.0
Les deux vont de 0.5 à 2.0. La hauteur modifie aussi la durée et est ignorée lorsque speech_rate n’est pas 1.0.
audio_urlstring · voice-enrollment
Valeur par défaut: requis pour le clonage
Lien public HTTP(S) vers un échantillon WAV, MP3 ou M4A contenant une parole claire, jusqu’à 60 s et 10 MB. Sélectionne le clonage de voix.
Description de la voix jusqu’à 500 caractères, et une phrase de 15–200 caractères pour l’extrait d’aperçu. Sélectionne la conception de voix.
preferred_namestring · voice-enrollment
Valeur par défaut: requis
1–10 lettres (a–z, A–Z) ou chiffres. Il fait partie du nom de voix renvoyé.
Deux façons d’utiliser Qwen Audio 3.1 TTS Flash : API EvoLink ou Agent
Utilisez l’API EvoLink pour intégrer le modèle à un produit ou traiter des lots, ou appelez-la depuis Codex, Claude ou Gemini pour des workflows créatifs et de développement rapides. Les deux méthodes partagent la même clé API EvoLink, le même solde, les mêmes routes de modèle et le même historique de tâches.
Option 1
Intégrer avec l’API EvoLink
Idéal pour : backends produit, tâches par lots, workflows automatisés
Appelez l’API voix unifiée d’EvoLink depuis votre serveur et contrôlez l’ID du modèle, les paramètres, la file de tâches, les callbacks et le stockage des résultats.
1Tester le rendu et le coût avec un brief réel dans le Playground
2Créer une clé API EvoLink dans la console
3Choisir l’ID de modèle adapté à votre tâche parmi les cartes de routes ci-dessus
4Soumettre la tâche et récupérer le résultat par polling ou callback HTTPS
Idéal pour : création et développement dans Codex, Claude et Gemini
Donnez à l’Agent l’objectif, les ressources et les critères de validation. Il choisit la route, construit la requête, suit la tâche et renvoie le résultat sans vous obliger à coder chaque étape.
1Définir EVOLINK_API_KEY dans l’environnement local, jamais dans le code ni dans un prompt
2Décrire l’objectif, les références et les paramètres clés
3Demander à l’Agent d’appeler une route Qwen Audio 3.1 TTS Flash et d’enregistrer le task ID
4Laisser l’Agent suivre l’état final, télécharger le résultat et expliquer les échecs
Ce que vous pouvez créer avec Qwen Audio 3.1 TTS Flash
Assistants vocaux avec Qwen Audio 3.1 TTS Flash
Donnez à un assistant une voix cohérente et ajustez son ton à chaque réponse avec une courte instruction de style.
Livres audio et cours avec Qwen Audio 3.1 TTS Flash
Narrez des chapitres de jusqu’à 5 000 caractères par requête avec une voix de narrateur posée.
Narration vidéo et doublage
Générez des voix off en mandarin, en dialectes chinois, en anglais et plus encore, avec des balises d’émotion intégrées au texte.
Une voix de marque avec Voice Enrollment
Clonez un locuteur consentant ou concevez une nouvelle voix, puis utilisez le nom de voix dans vos appels de synthèse pendant les 6 heures qui suivent.
API Qwen Audio 3.1 TTS Flash : exemple de code et gestion des erreurs
Cet exemple montre le flux exécutable minimal : créer une tâche, enregistrer le task ID retourné, puis effectuer un polling ou attendre un callback HTTPS. Consultez l’onglet API pour tous les paramètres et formats de réponse.
curl -X POST https://api.evolink.ai/v1/audios/generations \
-H "Authorization: Bearer $EVOLINK_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "qwen-audio-3.1-tts-flash",
"prompt": "Hello, and welcome to EvoLink. This is a quick demo of Qwen Audio 3.1 TTS Flash.",
"voice": "Emily_v3.1",
"instruction": "Speak warmly, at a relaxed pace",
"response_format": "mp3"
}'
# Save the returned task ID, then query; the audio link is in results[0]:
curl https://api.evolink.ai/v1/tasks/{task_id} \
-H "Authorization: Bearer $EVOLINK_API_KEY"
Échec de validation des paramètres
Vérifiez chaque valeur avec les cartes de paramètres ci-dessus : plages, options autorisées, nombre de ressources et formats de fichiers doivent correspondre à la route choisie.
Problème d’authentification ou de solde
Vérifiez le jeton Authorization Bearer, le solde disponible et la facturation de la tâche dans la console.
Contenu ou ressource refusé
Vérifiez les droits à l’image, les éléments de marque, le texte lisible, le contenu sensible et la conformité des ressources.
Tâche échouée ou expirée
Une tâche Qwen Audio 3.1 TTS Flash dont l’état final est « échoué » n’est pas facturée. Conservez le task ID et identifiez s’il s’agit d’un problème de validation, de modération ou d’exécution avant de relancer.
Callback non reçu
callback_url doit être une URL HTTPS publique, et non localhost ou une adresse de réseau privé. Conservez toujours le task ID comme solution de repli pour le polling.
Voix système, clonage de voix et conception de voix
Caractéristique
Voix système
Clonage de voix
Conception de voix
ID de modèle
qwen-audio-3.1-tts-flash
voice-enrollment
voice-enrollment
Ce que vous fournissez
Un nom de voix de la liste
Un échantillon vocal (audio_url)
Une description de voix + un texte d’aperçu
Ce que vous obtenez
De l’audio
Un nom de voix
Un nom de voix + un extrait d’aperçu
Coût de mise en place
Aucun
~$0.0001 par voix
~$0.0001 par voix
Idéal pour
Démarrer rapidement
Reproduire un locuteur précis et consentant
Nouvelles voix, personnages, exploration du ton de marque
Routage, cycle de vie des tâches et facturation de Qwen Audio 3.1 TTS Flash
Deux ID de modèle sur un seul endpoint
Envoyez qwen-audio-3.1-tts-flash pour synthétiser de la parole et voice-enrollment pour créer une voix. Les deux vont vers POST /v1/audios/generations et renvoient un ID de tâche.
Tâches asynchrones
Interrogez /v1/tasks/{task_id} ou utilisez callback_url. La durée dépend du texte et de l’opération vocale ; aucune latence fixe n’est garantie. Les liens audio expirent après 24 heures.
Vos voix restent les vôtres
Une voix personnalisée ne fonctionne qu’avec qwen-audio-3.1-tts-flash et uniquement pour le compte qui l’a créée. Utiliser le nom de voix d’un autre compte renvoie 404. Une voix est utilisable pendant 6 heures après sa création.
Pourquoi utiliser Qwen Audio 3.1 TTS Flash via EvoLink
Validation en amont
Les paramètres inconnus, un nom de voix invalide ou un texte trop long échouent immédiatement avec 400, au lieu de réserver des crédits et d’échouer plus tard.
API unifiée
Une clé API fonctionne pour Qwen, Seed Audio, la vidéo, l’image et les LLM.
Solde unifié
Suivez les crédits, les dépenses et l’utilisation des modèles dans une seule console.
Suivi du statut des tâches
Voyez si une tâche est soumise, en cours, terminée ou échouée, avec la raison réelle de l’échec.
Payez ce que vous utilisez
La parole est facturée selon l’utilisation réelle des tokens, et les crédits réservés pour une tâche échouée sont intégralement restitués.
Autres modèles audio sur EvoLink en plus de Qwen Audio 3.1 TTS Flash
Doubao Seed Audio 1.0
Audio BytePlus à partir de prompts pour la voix, les dialogues, les effets sonores, la musique et les ambiances.
EvoLink prend-il en charge le streaming ou WebSocket pour ce modèle ?
Cette route EvoLink utilise des tâches HTTP asynchrones, sans streaming SSE ni WebSocket. Envoyez la requête à POST /v1/audios/generations, puis récupérez l’URL audio via GET /v1/tasks/{task_id}. Les API de streaming du fournisseur utilisent un autre protocole.
Qwen Audio 3.1 TTS Flash est-il le même modèle que Qwen3-TTS ?
Non. Cette page concerne le modèle hébergé qwen-audio-3.1-tts-flash. Qwen3-TTS, Qwen Audio TTS-Next et Qwen Audio Realtime sont des modèles distincts avec leurs propres identifiants, paramètres, poids et fonctions de streaming.
Quel est l’ID de modèle de Qwen Audio 3.1 TTS Flash ?
Utilisez qwen-audio-3.1-tts-flash pour la synthèse vocale et voice-enrollment pour créer une voix personnalisée. Les deux sont envoyés à POST /v1/audios/generations.
Combien coûte Qwen Audio 3.1 TTS Flash ?
La parole est facturée selon les tokens réellement utilisés, avec des tarifs d’entrée et de sortie distincts affichés en direct dans la section Tarifs. La création d’une voix personnalisée coûte un petit forfait fixe par voix. Les tâches échouées sont intégralement remboursées.
Pourquoi un montant plus élevé est-il réservé que celui finalement facturé ?
Le nombre de tokens n’est connu qu’après la synthèse : des crédits sont donc réservés à la création de la tâche d’après la longueur du texte, généralement plus que le montant final. À la fin, vous êtes facturé pour les tokens réellement utilisés et l’excédent est restitué. Un texte lu caractère par caractère (suites de chiffres, de lettres ou de symboles) peut consommer plus que le montant réservé ; le complément est alors facturé.
Comment créer et utiliser ma propre voix ?
Appelez voice-enrollment avec audio_url pour cloner une voix, ou avec voice_prompt et preview_text pour en concevoir une, lisez result_data.voice dans la tâche terminée, puis passez-le comme paramètre voice à qwen-audio-3.1-tts-flash. Une voix personnalisée est utilisable pendant 6 heures après sa création ; ensuite, créez-en une nouvelle.
Quelle est la différence entre le clonage de voix et la conception de voix ?
Le clonage de voix reproduit un locuteur réel à partir d’un court enregistrement et renvoie uniquement le nom de voix. La conception de voix crée une nouvelle voix à partir d’une description textuelle et renvoie aussi un extrait d’aperçu. Les deux ont le même prix et ne fonctionnent qu’avec qwen-audio-3.1-tts-flash.
Qu’est-ce qu’un bon échantillon pour le clonage de voix ?
Obligatoire : WAV, MP3 ou M4A, jusqu’à 60 s et 10 MB, 16 kHz ou plus, avec une parole claire. Pour de meilleurs résultats, utilisez 10 à 20 secondes d’un seul locuteur, un audio mono, des pauses de 2 secondes maximum, et aucune musique de fond ni bruit.
Quelqu’un d’autre peut-il utiliser ma voix personnalisée ?
Non. Une voix personnalisée ne peut être utilisée que par le compte qui l’a créée ; les autres comptes obtiennent une erreur 404 pour le même nom de voix.
Quelles voix puis-je cloner ?
Uniquement votre propre voix ou une voix que vous avez l’autorisation explicite d’utiliser. Cloner la voix de quelqu’un sans son consentement est interdit.
Comment contrôler l’émotion, le rythme ou le dialecte ?
Envoyez une courte instruction comme « parlez lentement et avec douceur », ou écrivez des balises comme [excited] directement dans le texte. Les quatre voix multilingues parlent aussi plusieurs dialectes chinois lorsque l’instruction en demande un.
Que se passe-t-il si une tâche échoue ?
Les tâches échouées ne sont pas facturées : les crédits réservés sont intégralement restitués. Le résultat de la tâche indique la raison de l’échec.