Qwen Audio 3.1 TTS Flash con la API unificada de EvoLink: 68 voces, clonación y diseño de voz. ID, precios por token e integración asíncrona.
Alibaba·Texto a voz·Disponible
Desde $1.765 / 1M de tokens de salida
Texto a vozVoces del sistemaClonación de vozDiseño de vozControl de emocionesMultilingüe y dialectos
Ruta de producciónEsta tasa refleja la disponibilidad del lado de la plataforma: solo los errores de servidor confirmados (HTTP 500 / respuesta vacía) cuentan como fallos. Los problemas del lado del usuario (moderación de contenido, parámetros inválidos, cancelación), así como los límites de tasa, timeouts y errores de autenticación quedan excluidos. Antes de que llegue tráfico real, los intervalos vacíos pueden mostrarse como disponibles.Live
Live
Lo más destacado
Voz natural con control por instrucciones de emoción, dialecto y ritmo
Casos de uso
Asistentes de voz, audiolibros, narración de vídeo, atención al cliente
Entrada
Texto de hasta 5.000 caracteres, más una instrucción de estilo opcional
Salida
Audio MP3, WAV u Opus con una voz del sistema, clonada o diseñada
Prueba Qwen Audio 3.1 TTS Flash antes de integrar la API.
Convierte texto en voz con una voz del sistema, o cambia el modelo a Voice Enrollment para clonar o diseñar tu propia voz y usarla al instante.
Crear tarea de síntesis de voz
Fijado en qwen-audio-3.1-tts-flash
80/5,000
Hasta 5.000 caracteres. Añade etiquetas como [excited] o [laughing] en el texto para dar forma a la entonación.
Elige una voz del sistema de la lista, o escribe o pega aquí un nombre de voz, incluido el de una voz que hayas creado. Los nombres de voz distinguen entre mayúsculas y minúsculas. Elige una voz compatible con el idioma de tu texto.
0/100
Opcional. Controla la emoción, el ritmo o el dialecto. Hasta 100 caracteres facturables (los caracteres han, incluidos los kanji japoneses, cuentan como 2; los kana, el hangul y el resto de caracteres cuentan como 1).
Pista opcional sobre el idioma del texto.
1.0x
1.0x
El tono también cambia la duración y no tiene efecto cuando la velocidad no es 1.0.
50
Estimación ~$0.00090.0578 créditos
Se reservan por adelantado 106 tokens de entrada + 468 tokens de salida, estimados a partir de tu texto. Se te factura por los tokens realmente usados: el exceso se devuelve y la diferencia que falte se cobra.
Lista
Audio generado
Tu audio aparecerá aquí.
0:00 / 0:00
Historial
Las tareas de Qwen Audio 3.1 TTS Flash aparecerán aquí.
Conoce tu coste con Qwen Audio 3.1 TTS Flash antes de añadir créditos.
La síntesis de voz se cobra por los tokens realmente usados, con tarifas distintas para la entrada y la salida. Crear una voz personalizada cuesta una pequeña tarifa fija por voz. Las tareas fallidas se reembolsan por completo.
Coste de la primera prueba
Una frase corta · 14 tokens de entrada + 33 tokens de salida
Muestra medida
Créditos0.0043
Una frase corta
Coste aproximado~$0.0001
Unas 158.139 frases como esta con 10 $ en créditos.
En el Playground, deja la voz predeterminada e introduce una frase. Al crear la tarea se reservan créditos según la longitud del texto; después se ajusta a los tokens realmente usados: el exceso se devuelve y la diferencia que falte se cobra.
Guía de presupuesto de pruebas de Qwen Audio 3.1 TTS Flash
Unos 475 artículos largos de 5.000 caracteres chinos
Para una primera validación.
$50
Unos 2375 artículos largos de 5.000 caracteres chinos
Para narrar un lote de artículos o lecciones.
$100
Unos 4751 artículos largos de 5.000 caracteres chinos
Para probar antes de integrar en producción.
Ejemplos de coste de Qwen Audio 3.1 TTS Flash
Una frase corta14 tokens de entrada + 33 tokens de salida · medido
~$0.0001
~0.0043 cr
Un artículo largo5.000 caracteres chinos · 5,000 tokens de entrada + 11,300 tokens de salida · medido
~$0.022
~1.431 cr
Crear una voz personalizada1 voz · clonación de voz o diseño de voz
$0.0001
0.001 cr
Los recuentos de tokens son muestras medidas. El uso real depende del idioma, de la voz y de cómo se lea el texto: los dígitos, las mayúsculas y los símbolos se leen uno por uno y usan más tokens de salida.
Precios de Qwen Audio 3.1 TTS Flash
Qwen Audio 3.1 TTS Flashqwen-audio-3.1-tts-flash
Concepto de facturación
Qué cubre
Tarifa
Facturación
Tokens de salida
La voz generada. Un audio más largo usa más tokens de salida.
$1.765/1M de tokens120 Créditos
Según el uso real
Tokens de entrada
El texto que envías. La instrucción de estilo no se cuenta.
$0.221/1M de tokens15 Créditos
Según el uso real
Tokens de salida$1.765/1M de tokens
La voz generada. Un audio más largo usa más tokens de salida.
Tokens de entrada$0.221/1M de tokens
El texto que envías. La instrucción de estilo no se cuenta.
Voice Enrollmentvoice-enrollment
Concepto de facturación
Qué cubre
Tarifa
Facturación
Crear una voz
Clonación de voz (audio_url) o diseño de voz (voice_prompt), al mismo precio. La voz queda vinculada a qwen-audio-3.1-tts-flash.
$0.0001/voz0.001 Créditos
Por voz creada
Crear una voz$0.0001/voz
Clonación de voz (audio_url) o diseño de voz (voice_prompt), al mismo precio. La voz queda vinculada a qwen-audio-3.1-tts-flash.
Notas de facturación
La síntesis de voz reserva créditos al crear la tarea, estimados según la longitud del texto. Cuando la tarea termina, se te factura por los tokens de entrada y salida realmente usados: el exceso se devuelve y la diferencia que falte se cobra.
Cada uno de los dos cargos por tokens se redondea hacia arriba a la unidad de crédito más pequeña (0.0001 créditos) antes de sumarlos.
Crear una voz se cobra una sola vez. Sintetizar voz con una voz personalizada cuesta lo mismo que con una voz del sistema.
Las tareas fallidas se reembolsan por completo. Las solicitudes que no superan la validación devuelven 400 y no se cobran.
API de Qwen Audio 3.1 TTS Flash: texto a voz con voces del sistema, clonadas y diseñadas
Qwen Audio 3.1 TTS Flash convierte texto en voz natural con 68 voces del sistema y control por instrucciones de la emoción, el ritmo y el dialecto. En la misma página, Voice Enrollment crea tu propia voz para él: clona a un hablante que da su consentimiento a partir de una grabación breve, o diseña una voz nueva a partir de una descripción de texto. EvoLink expone ambos como tareas asíncronas en un único endpoint de audio con una sola clave API.
Entrada
Texto ≤5.000 caracteres
Salida
MP3 / WAV / Opus
Voces
68 del sistema + las tuyas
Frecuencia de muestreo
8–48 kHz
Facturación
Por token usado
ID de modelo de Qwen Audio 3.1 TTS Flash para llamadas a la API
Qwen Audio 3.1 TTS Flash
qwen-audio-3.1-tts-flash
Texto a voz. Envía prompt y una voz opcional; recibes un archivo de audio. Se factura por tokens de entrada y salida.
Voice Enrollment
voice-enrollment
Crea una voz personalizada para Qwen Audio 3.1 TTS Flash. Envía audio_url para clonar una voz a partir de una grabación, o voice_prompt y preview_text para diseñar una a partir de una descripción. Tarifa fija por voz.
Parámetros clave de la API de Qwen Audio 3.1 TTS Flash
Primero los parámetros de síntesis de voz y después los campos que usa voice-enrollment. Abre la pestaña API para ver el esquema completo de solicitud y respuesta.
promptstring
Valor predeterminado: obligatorio
Texto que se va a sintetizar, hasta 5.000 caracteres. Se pueden escribir etiquetas de emoción como [excited] directamente en el texto.
voicestring
Valor predeterminado: longanhuan_v3.1
Una voz del sistema (distingue entre mayúsculas y minúsculas), o una voz creada por tu cuenta con voice-enrollment.
instructionstring
Valor predeterminado: ninguno
Control en lenguaje natural de la emoción, el ritmo o el dialecto. Hasta 100 caracteres facturables.
response_formatenum
Valor predeterminado: mp3
mp3, wav u opus. Opus solo admite 8, 12, 16, 24 y 48 kHz.
speech_rate / pitchnumber
Valor predeterminado: 1.0
Ambos van de 0.5 a 2.0. El tono también cambia la duración y se ignora cuando speech_rate no es 1.0.
audio_urlstring · voice-enrollment
Valor predeterminado: obligatorio para clonación
Enlace HTTP(S) público a una muestra WAV, MP3 o M4A con habla clara, hasta 60 s y 10 MB. Selecciona la clonación de voz.
Descripción de la voz de hasta 500 caracteres y una frase de 15–200 caracteres para el clip de vista previa. Selecciona el diseño de voz.
preferred_namestring · voice-enrollment
Valor predeterminado: obligatorio
1–10 letras o dígitos. Pasa a formar parte del nombre de voz devuelto.
Dos formas de usar Qwen Audio 3.1 TTS Flash: API de EvoLink o Agent
Usa la API de EvoLink para integrar el modelo en un producto o ejecutar lotes, o llámala desde Codex, Claude o Gemini para tareas creativas y de desarrollo. Ambos métodos comparten la misma clave API, saldo, rutas e historial de tareas.
Opción 1
Integrar con la API de EvoLink
Ideal para: backends de producto, tareas por lotes y workflows automatizados
Llama a la API de voz unificada de EvoLink desde tu servidor y controla el ID del modelo, parámetros, cola de tareas, callbacks y almacenamiento de resultados.
1Validar el resultado y el coste con un brief real en Playground
2Crear una clave API de EvoLink en la consola
3Elegir el ID de modelo adecuado para tu tarea en las tarjetas de rutas de arriba
4Enviar la tarea y recuperar el resultado por polling o callback HTTPS
Ideal para: tareas creativas y de desarrollo en Codex, Claude y Gemini
Entrega al Agent el objetivo, los recursos y los criterios de aceptación. Podrá elegir la ruta, crear la solicitud, seguir la tarea y devolver el resultado sin que programes cada paso.
1Configurar EVOLINK_API_KEY como variable de entorno local; nunca incluirla en el código ni en el prompt
2Describir el objetivo, las referencias y los parámetros clave
3Pedir al Agent que llame a una ruta Qwen Audio 3.1 TTS Flash y guarde el task ID
4Dejar que consulte el estado final, descargue el resultado y explique los fallos
Qué puedes crear con Qwen Audio 3.1 TTS Flash
Asistentes de voz con Qwen Audio 3.1 TTS Flash
Dale al asistente una voz coherente y ajusta su tono en cada respuesta con una breve instrucción de estilo.
Audiolibros y cursos con Qwen Audio 3.1 TTS Flash
Narra capítulos de hasta 5.000 caracteres por solicitud con una voz de narrador serena.
Narración y doblaje de vídeo
Genera locuciones en mandarín, dialectos del chino, inglés y más, con etiquetas de emoción dentro del texto.
Una voz de marca con Voice Enrollment
Clona a un hablante que da su consentimiento o diseña una voz nueva, y usa el nombre de voz en tus llamadas de síntesis durante las 6 horas siguientes.
API Qwen Audio 3.1 TTS Flash: ejemplo de código y gestión de errores
Este ejemplo muestra el flujo ejecutable mínimo: crear una tarea, guardar el task ID devuelto y después consultar el estado o esperar un callback HTTPS. Abre la pestaña API para ver todos los parámetros y respuestas.
curl -X POST https://api.evolink.ai/v1/audios/generations \
-H "Authorization: Bearer $EVOLINK_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "qwen-audio-3.1-tts-flash",
"prompt": "Hello, and welcome to EvoLink. This is a quick demo of Qwen Audio 3.1 TTS Flash.",
"voice": "Emily_v3.1",
"instruction": "Speak warmly, at a relaxed pace",
"response_format": "mp3"
}'
# Save the returned task ID, then query; the audio link is in results[0]:
curl https://api.evolink.ai/v1/tasks/{task_id} \
-H "Authorization: Bearer $EVOLINK_API_KEY"
Error de validación de parámetros
Comprueba cada valor con las tarjetas de parámetros de arriba: rangos, opciones permitidas, cantidad de recursos y formatos de archivo deben coincidir con la ruta elegida.
Problema de autenticación o saldo
Revisa el token Authorization Bearer y confirma el saldo disponible y la facturación de la tarea en la consola.
Contenido o recurso rechazado
Revisa derechos de imagen, recursos de marca, texto legible, contenido sensible y conformidad de los archivos de entrada.
Tarea fallida o con tiempo de espera agotado
Una tarea Qwen Audio 3.1 TTS Flash cuyo estado final es fallido no se cobra. Conserva el task ID e identifica si la causa es validación, moderación o ejecución antes de volver a intentarlo.
Callback no recibido
callback_url debe ser una URL HTTPS pública, no localhost ni una red privada. Conserva siempre el task ID como alternativa para el polling.
Voces del sistema vs clonación de voz vs diseño de voz
Característica
Voz del sistema
Clonación de voz
Diseño de voz
ID de modelo
qwen-audio-3.1-tts-flash
voice-enrollment
voice-enrollment
Qué aportas
Un nombre de voz de la lista
Una muestra de voz (audio_url)
Una descripción de voz + texto de vista previa
Qué obtienes
Audio
Un nombre de voz
Un nombre de voz + clip de vista previa
Coste de preparación
Ninguno
~$0.0001 por voz
~$0.0001 por voz
Ideal para
Empezar rápidamente
Reproducir a un hablante concreto que da su consentimiento
Voces nuevas, personajes, exploración del tono de marca
Enrutamiento, ciclo de vida de tareas y facturación de Qwen Audio 3.1 TTS Flash
Dos ID de modelo en un mismo endpoint
Envía qwen-audio-3.1-tts-flash para sintetizar voz y voice-enrollment para crear una voz. Ambos van a POST /v1/audios/generations y devuelven un ID de tarea.
Tareas asíncronas
Consulte /v1/tasks/{task_id} o use callback_url. El tiempo depende del texto y de la operación de voz; no se garantiza una latencia fija. Los enlaces de audio caducan a las 24 horas.
Tus voces son solo tuyas
Una voz personalizada solo funciona con qwen-audio-3.1-tts-flash y solo para la cuenta que la creó. Usar el nombre de voz de otra persona devuelve 404. Una voz se puede usar durante 6 horas después de crearla.
Por qué usar Qwen Audio 3.1 TTS Flash a través de EvoLink
Validación temprana
Los parámetros desconocidos, un nombre de voz no válido o un texto demasiado largo fallan de inmediato con 400, en lugar de reservar créditos y fallar más tarde.
API unificada
Una clave API funciona para Qwen, Seed Audio, vídeo, imagen y modelos LLM.
Saldo unificado
Controla créditos, gastos y uso de modelos en una sola consola.
Seguimiento del estado de tareas
Ve si una tarea está enviada, en proceso, completada o fallida, con el motivo real del fallo.
Paga solo lo que usas
La voz se liquida según el uso real de tokens, y los créditos reservados para una tarea fallida se devuelven por completo.
Otros modelos de audio en EvoLink además de Qwen Audio 3.1 TTS Flash
Doubao Seed Audio 1.0
Audio de BytePlus basado en prompts para voz, diálogos, efectos de sonido, música y ambientes.
Preguntas frecuentes sobre Qwen Audio 3.1 TTS Flash
¿EvoLink admite streaming o WebSocket para este modelo?
Esta ruta de EvoLink usa tareas HTTP asíncronas, sin streaming SSE ni WebSocket. Envíe la solicitud a POST /v1/audios/generations y obtenga la URL del audio mediante GET /v1/tasks/{task_id}. Las API de streaming del proveedor usan un protocolo diferente.
¿Qwen Audio 3.1 TTS Flash es el mismo modelo que Qwen3-TTS?
No. Esta página corresponde al modelo alojado qwen-audio-3.1-tts-flash. Qwen3-TTS, Qwen Audio TTS-Next y Qwen Audio Realtime son modelos distintos con sus propios ID, parámetros, pesos y funciones de streaming.
¿Cuál es el ID de modelo de Qwen Audio 3.1 TTS Flash?
Usa qwen-audio-3.1-tts-flash para la síntesis de voz y voice-enrollment para crear una voz personalizada. Ambos se envían a POST /v1/audios/generations.
¿Cuánto cuesta Qwen Audio 3.1 TTS Flash?
La voz se cobra por los tokens realmente usados, con tarifas distintas para la entrada y la salida que se muestran en vivo en la sección Precios. Crear una voz personalizada cuesta una pequeña tarifa fija por voz. Las tareas fallidas se reembolsan por completo.
¿Por qué se reserva más de lo que se me cobra al final?
El número de tokens solo se conoce después de la síntesis, así que al crear la tarea se reservan créditos según la longitud del texto, normalmente más de lo que se cobra al final. Cuando termina, se te factura por los tokens realmente usados y el exceso se devuelve. El texto que se lee carácter por carácter (cadenas de dígitos, letras o símbolos) puede consumir más de lo reservado; en ese caso se cobra la diferencia.
¿Cómo creo y uso mi propia voz?
Llama a voice-enrollment con audio_url para clonar una voz, o con voice_prompt y preview_text para diseñar una, lee result_data.voice de la tarea terminada y pásalo como parámetro voice a qwen-audio-3.1-tts-flash. Una voz personalizada se puede usar durante 6 horas después de crearla; después, crea una nueva.
¿Cuál es la diferencia entre clonación de voz y diseño de voz?
La clonación de voz reproduce a un hablante real a partir de una grabación breve y solo devuelve el nombre de voz. El diseño de voz crea una voz nueva a partir de una descripción de texto y devuelve además un clip de vista previa. Ambos cuestan lo mismo y solo funcionan con qwen-audio-3.1-tts-flash.
¿Qué hace que una muestra para clonación de voz sea buena?
Obligatorio: WAV, MP3 o M4A, hasta 60 s y 10 MB, a 16 kHz o más y con habla clara. Para obtener los mejores resultados, usa 10–20 segundos de un solo hablante, audio mono, pausas de 2 segundos como máximo y sin música de fondo ni ruido.
¿Puede otra persona usar mi voz personalizada?
No. Una voz personalizada solo puede usarla la cuenta que la creó; las demás cuentas reciben un 404 con el mismo nombre de voz.
¿De quién puedo clonar la voz?
Solo tu propia voz o una voz que tengas permiso explícito para usar. No está permitido clonar la voz de alguien sin su consentimiento.
¿Cómo controlo la emoción, el ritmo o el dialecto?
Envía una instrucción breve como «habla despacio y con suavidad», o escribe etiquetas como [excited] directamente en el texto. Las cuatro voces multilingües también hablan varios dialectos del chino cuando la instrucción lo pide.
¿Qué pasa si una tarea falla?
Las tareas fallidas no se cobran: los créditos reservados se reembolsan por completo. El resultado de la tarea muestra el motivo del fallo.