GPT Image 2.5 Flare & Sunburst ya están disponibles en EvoLinkProbar GPT Image 2.5

Qwen Audio 3.1 TTS Flash API

Qwen Audio 3.1 TTS Flash con la API unificada de EvoLink: 68 voces, clonación y diseño de voz. ID, precios por token e integración asíncrona.

AlibabaTexto a vozDisponible
Desde $1.765 / 1M de tokens de salida
Texto a vozVoces del sistemaClonación de vozDiseño de vozControl de emocionesMultilingüe y dialectos
Ruta de producciónLive
Lo más destacado
Voz natural con control por instrucciones de emoción, dialecto y ritmo
Casos de uso
Asistentes de voz, audiolibros, narración de vídeo, atención al cliente
Entrada
Texto de hasta 5.000 caracteres, más una instrucción de estilo opcional
Salida
Audio MP3, WAV u Opus con una voz del sistema, clonada o diseñada

Prueba Qwen Audio 3.1 TTS Flash antes de integrar la API.

Convierte texto en voz con una voz del sistema, o cambia el modelo a Voice Enrollment para clonar o diseñar tu propia voz y usarla al instante.

Crear tarea de síntesis de voz

Fijado en qwen-audio-3.1-tts-flash
80/5,000

Hasta 5.000 caracteres. Añade etiquetas como [excited] o [laughing] en el texto para dar forma a la entonación.

Elige una voz del sistema de la lista, o escribe o pega aquí un nombre de voz, incluido el de una voz que hayas creado. Los nombres de voz distinguen entre mayúsculas y minúsculas. Elige una voz compatible con el idioma de tu texto.

0/100

Opcional. Controla la emoción, el ritmo o el dialecto. Hasta 100 caracteres facturables (los caracteres han, incluidos los kanji japoneses, cuentan como 2; los kana, el hangul y el resto de caracteres cuentan como 1).

Pista opcional sobre el idioma del texto.

1.0x
1.0x

El tono también cambia la duración y no tiene efecto cuando la velocidad no es 1.0.

50
Estimación ~$0.00090.0578 créditos
Se reservan por adelantado 106 tokens de entrada + 468 tokens de salida, estimados a partir de tu texto. Se te factura por los tokens realmente usados: el exceso se devuelve y la diferencia que falte se cobra.
Lista
Audio generado

Tu audio aparecerá aquí.

Historial
Las tareas de Qwen Audio 3.1 TTS Flash aparecerán aquí.

Conoce tu coste con Qwen Audio 3.1 TTS Flash antes de añadir créditos.

La síntesis de voz se cobra por los tokens realmente usados, con tarifas distintas para la entrada y la salida. Crear una voz personalizada cuesta una pequeña tarifa fija por voz. Las tareas fallidas se reembolsan por completo.

Coste de la primera prueba

Una frase corta · 14 tokens de entrada + 33 tokens de salida
Muestra medida
Créditos0.0043

Una frase corta

Coste aproximado~$0.0001

Unas 158.139 frases como esta con 10 $ en créditos.

En el Playground, deja la voz predeterminada e introduce una frase. Al crear la tarea se reservan créditos según la longitud del texto; después se ajusta a los tokens realmente usados: el exceso se devuelve y la diferencia que falte se cobra.

Guía de presupuesto de pruebas de Qwen Audio 3.1 TTS Flash

Elige un importe según cuántas pruebas prevés.
Añadir créditos
$10
Unos 475 artículos largos de 5.000 caracteres chinos

Para una primera validación.

$50
Unos 2375 artículos largos de 5.000 caracteres chinos

Para narrar un lote de artículos o lecciones.

$100
Unos 4751 artículos largos de 5.000 caracteres chinos

Para probar antes de integrar en producción.

Ejemplos de coste de Qwen Audio 3.1 TTS Flash

Una frase corta14 tokens de entrada + 33 tokens de salida · medido
~$0.0001
~0.0043 cr
Un artículo largo5.000 caracteres chinos · 5,000 tokens de entrada + 11,300 tokens de salida · medido
~$0.022
~1.431 cr
Crear una voz personalizada1 voz · clonación de voz o diseño de voz
$0.0001
0.001 cr

Los recuentos de tokens son muestras medidas. El uso real depende del idioma, de la voz y de cómo se lea el texto: los dígitos, las mayúsculas y los símbolos se leen uno por uno y usan más tokens de salida.

Precios de Qwen Audio 3.1 TTS Flash

Qwen Audio 3.1 TTS Flashqwen-audio-3.1-tts-flash
Tokens de salida$1.765/1M de tokens

La voz generada. Un audio más largo usa más tokens de salida.

Tokens de entrada$0.221/1M de tokens

El texto que envías. La instrucción de estilo no se cuenta.

Voice Enrollmentvoice-enrollment
Crear una voz$0.0001/voz

Clonación de voz (audio_url) o diseño de voz (voice_prompt), al mismo precio. La voz queda vinculada a qwen-audio-3.1-tts-flash.

Notas de facturación

  • La síntesis de voz reserva créditos al crear la tarea, estimados según la longitud del texto. Cuando la tarea termina, se te factura por los tokens de entrada y salida realmente usados: el exceso se devuelve y la diferencia que falte se cobra.
  • Cada uno de los dos cargos por tokens se redondea hacia arriba a la unidad de crédito más pequeña (0.0001 créditos) antes de sumarlos.
  • Crear una voz se cobra una sola vez. Sintetizar voz con una voz personalizada cuesta lo mismo que con una voz del sistema.
  • Las tareas fallidas se reembolsan por completo. Las solicitudes que no superan la validación devuelven 400 y no se cobran.

API de Qwen Audio 3.1 TTS Flash: texto a voz con voces del sistema, clonadas y diseñadas

Qwen Audio 3.1 TTS Flash convierte texto en voz natural con 68 voces del sistema y control por instrucciones de la emoción, el ritmo y el dialecto. En la misma página, Voice Enrollment crea tu propia voz para él: clona a un hablante que da su consentimiento a partir de una grabación breve, o diseña una voz nueva a partir de una descripción de texto. EvoLink expone ambos como tareas asíncronas en un único endpoint de audio con una sola clave API.

Entrada
Texto ≤5.000 caracteres
Salida
MP3 / WAV / Opus
Voces
68 del sistema + las tuyas
Frecuencia de muestreo
8–48 kHz
Facturación
Por token usado

ID de modelo de Qwen Audio 3.1 TTS Flash para llamadas a la API

Qwen Audio 3.1 TTS Flash

qwen-audio-3.1-tts-flash

Texto a voz. Envía prompt y una voz opcional; recibes un archivo de audio. Se factura por tokens de entrada y salida.

Voice Enrollment

voice-enrollment

Crea una voz personalizada para Qwen Audio 3.1 TTS Flash. Envía audio_url para clonar una voz a partir de una grabación, o voice_prompt y preview_text para diseñar una a partir de una descripción. Tarifa fija por voz.

Parámetros clave de la API de Qwen Audio 3.1 TTS Flash

Primero los parámetros de síntesis de voz y después los campos que usa voice-enrollment. Abre la pestaña API para ver el esquema completo de solicitud y respuesta.

promptstring

Valor predeterminado: obligatorio

Texto que se va a sintetizar, hasta 5.000 caracteres. Se pueden escribir etiquetas de emoción como [excited] directamente en el texto.

voicestring

Valor predeterminado: longanhuan_v3.1

Una voz del sistema (distingue entre mayúsculas y minúsculas), o una voz creada por tu cuenta con voice-enrollment.

instructionstring

Valor predeterminado: ninguno

Control en lenguaje natural de la emoción, el ritmo o el dialecto. Hasta 100 caracteres facturables.

response_formatenum

Valor predeterminado: mp3

mp3, wav u opus. Opus solo admite 8, 12, 16, 24 y 48 kHz.

speech_rate / pitchnumber

Valor predeterminado: 1.0

Ambos van de 0.5 a 2.0. El tono también cambia la duración y se ignora cuando speech_rate no es 1.0.

audio_urlstring · voice-enrollment

Valor predeterminado: obligatorio para clonación

Enlace HTTP(S) público a una muestra WAV, MP3 o M4A con habla clara, hasta 60 s y 10 MB. Selecciona la clonación de voz.

voice_prompt + preview_textstring · voice-enrollment

Valor predeterminado: obligatorio para diseño

Descripción de la voz de hasta 500 caracteres y una frase de 15–200 caracteres para el clip de vista previa. Selecciona el diseño de voz.

preferred_namestring · voice-enrollment

Valor predeterminado: obligatorio

1–10 letras o dígitos. Pasa a formar parte del nombre de voz devuelto.

Dos formas de usar Qwen Audio 3.1 TTS Flash: API de EvoLink o Agent

Usa la API de EvoLink para integrar el modelo en un producto o ejecutar lotes, o llámala desde Codex, Claude o Gemini para tareas creativas y de desarrollo. Ambos métodos comparten la misma clave API, saldo, rutas e historial de tareas.

Opción 1

Integrar con la API de EvoLink

Ideal para: backends de producto, tareas por lotes y workflows automatizados

Llama a la API de voz unificada de EvoLink desde tu servidor y controla el ID del modelo, parámetros, cola de tareas, callbacks y almacenamiento de resultados.

  1. 1Validar el resultado y el coste con un brief real en Playground
  2. 2Crear una clave API de EvoLink en la consola
  3. 3Elegir el ID de modelo adecuado para tu tarea en las tarjetas de rutas de arriba
  4. 4Enviar la tarea y recuperar el resultado por polling o callback HTTPS
Opción 2

Llamar con un Agent

Ideal para: tareas creativas y de desarrollo en Codex, Claude y Gemini

Entrega al Agent el objetivo, los recursos y los criterios de aceptación. Podrá elegir la ruta, crear la solicitud, seguir la tarea y devolver el resultado sin que programes cada paso.

  1. 1Configurar EVOLINK_API_KEY como variable de entorno local; nunca incluirla en el código ni en el prompt
  2. 2Describir el objetivo, las referencias y los parámetros clave
  3. 3Pedir al Agent que llame a una ruta Qwen Audio 3.1 TTS Flash y guarde el task ID
  4. 4Dejar que consulte el estado final, descargue el resultado y explique los fallos

Qué puedes crear con Qwen Audio 3.1 TTS Flash

Asistentes de voz con Qwen Audio 3.1 TTS Flash

Dale al asistente una voz coherente y ajusta su tono en cada respuesta con una breve instrucción de estilo.

Audiolibros y cursos con Qwen Audio 3.1 TTS Flash

Narra capítulos de hasta 5.000 caracteres por solicitud con una voz de narrador serena.

Narración y doblaje de vídeo

Genera locuciones en mandarín, dialectos del chino, inglés y más, con etiquetas de emoción dentro del texto.

Una voz de marca con Voice Enrollment

Clona a un hablante que da su consentimiento o diseña una voz nueva, y usa el nombre de voz en tus llamadas de síntesis durante las 6 horas siguientes.

API Qwen Audio 3.1 TTS Flash: ejemplo de código y gestión de errores

Este ejemplo muestra el flujo ejecutable mínimo: crear una tarea, guardar el task ID devuelto y después consultar el estado o esperar un callback HTTPS. Abre la pestaña API para ver todos los parámetros y respuestas.

Ver documentación API completa
cURL
curl -X POST https://api.evolink.ai/v1/audios/generations \
  -H "Authorization: Bearer $EVOLINK_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen-audio-3.1-tts-flash",
    "prompt": "Hello, and welcome to EvoLink. This is a quick demo of Qwen Audio 3.1 TTS Flash.",
    "voice": "Emily_v3.1",
    "instruction": "Speak warmly, at a relaxed pace",
    "response_format": "mp3"
  }'

# Save the returned task ID, then query; the audio link is in results[0]:
curl https://api.evolink.ai/v1/tasks/{task_id} \
  -H "Authorization: Bearer $EVOLINK_API_KEY"

Error de validación de parámetros

Comprueba cada valor con las tarjetas de parámetros de arriba: rangos, opciones permitidas, cantidad de recursos y formatos de archivo deben coincidir con la ruta elegida.

Problema de autenticación o saldo

Revisa el token Authorization Bearer y confirma el saldo disponible y la facturación de la tarea en la consola.

Contenido o recurso rechazado

Revisa derechos de imagen, recursos de marca, texto legible, contenido sensible y conformidad de los archivos de entrada.

Tarea fallida o con tiempo de espera agotado

Una tarea Qwen Audio 3.1 TTS Flash cuyo estado final es fallido no se cobra. Conserva el task ID e identifica si la causa es validación, moderación o ejecución antes de volver a intentarlo.

Callback no recibido

callback_url debe ser una URL HTTPS pública, no localhost ni una red privada. Conserva siempre el task ID como alternativa para el polling.

Voces del sistema vs clonación de voz vs diseño de voz

CaracterísticaVoz del sistemaClonación de vozDiseño de voz
ID de modeloqwen-audio-3.1-tts-flashvoice-enrollmentvoice-enrollment
Qué aportasUn nombre de voz de la listaUna muestra de voz (audio_url)Una descripción de voz + texto de vista previa
Qué obtienesAudioUn nombre de vozUn nombre de voz + clip de vista previa
Coste de preparaciónNinguno~$0.0001 por voz~$0.0001 por voz
Ideal paraEmpezar rápidamenteReproducir a un hablante concreto que da su consentimientoVoces nuevas, personajes, exploración del tono de marca

Enrutamiento, ciclo de vida de tareas y facturación de Qwen Audio 3.1 TTS Flash

Dos ID de modelo en un mismo endpoint

Envía qwen-audio-3.1-tts-flash para sintetizar voz y voice-enrollment para crear una voz. Ambos van a POST /v1/audios/generations y devuelven un ID de tarea.

Tareas asíncronas

Consulte /v1/tasks/{task_id} o use callback_url. El tiempo depende del texto y de la operación de voz; no se garantiza una latencia fija. Los enlaces de audio caducan a las 24 horas.

Tus voces son solo tuyas

Una voz personalizada solo funciona con qwen-audio-3.1-tts-flash y solo para la cuenta que la creó. Usar el nombre de voz de otra persona devuelve 404. Una voz se puede usar durante 6 horas después de crearla.

Por qué usar Qwen Audio 3.1 TTS Flash a través de EvoLink

Validación temprana

Los parámetros desconocidos, un nombre de voz no válido o un texto demasiado largo fallan de inmediato con 400, en lugar de reservar créditos y fallar más tarde.

API unificada

Una clave API funciona para Qwen, Seed Audio, vídeo, imagen y modelos LLM.

Saldo unificado

Controla créditos, gastos y uso de modelos en una sola consola.

Seguimiento del estado de tareas

Ve si una tarea está enviada, en proceso, completada o fallida, con el motivo real del fallo.

Paga solo lo que usas

La voz se liquida según el uso real de tokens, y los créditos reservados para una tarea fallida se devuelven por completo.

Otros modelos de audio en EvoLink además de Qwen Audio 3.1 TTS Flash

Doubao Seed Audio 1.0

Doubao Seed Audio 1.0

Audio de BytePlus basado en prompts para voz, diálogos, efectos de sonido, música y ambientes.

Ver API
Suno

Suno

Generación musical de Suno con voces, letras y pistas instrumentales.

Ver API

Preguntas frecuentes sobre Qwen Audio 3.1 TTS Flash

¿EvoLink admite streaming o WebSocket para este modelo?

Esta ruta de EvoLink usa tareas HTTP asíncronas, sin streaming SSE ni WebSocket. Envíe la solicitud a POST /v1/audios/generations y obtenga la URL del audio mediante GET /v1/tasks/{task_id}. Las API de streaming del proveedor usan un protocolo diferente.

¿Qwen Audio 3.1 TTS Flash es el mismo modelo que Qwen3-TTS?

No. Esta página corresponde al modelo alojado qwen-audio-3.1-tts-flash. Qwen3-TTS, Qwen Audio TTS-Next y Qwen Audio Realtime son modelos distintos con sus propios ID, parámetros, pesos y funciones de streaming.

¿Cuál es el ID de modelo de Qwen Audio 3.1 TTS Flash?

Usa qwen-audio-3.1-tts-flash para la síntesis de voz y voice-enrollment para crear una voz personalizada. Ambos se envían a POST /v1/audios/generations.

¿Cuánto cuesta Qwen Audio 3.1 TTS Flash?

La voz se cobra por los tokens realmente usados, con tarifas distintas para la entrada y la salida que se muestran en vivo en la sección Precios. Crear una voz personalizada cuesta una pequeña tarifa fija por voz. Las tareas fallidas se reembolsan por completo.

¿Por qué se reserva más de lo que se me cobra al final?

El número de tokens solo se conoce después de la síntesis, así que al crear la tarea se reservan créditos según la longitud del texto, normalmente más de lo que se cobra al final. Cuando termina, se te factura por los tokens realmente usados y el exceso se devuelve. El texto que se lee carácter por carácter (cadenas de dígitos, letras o símbolos) puede consumir más de lo reservado; en ese caso se cobra la diferencia.

¿Cómo creo y uso mi propia voz?

Llama a voice-enrollment con audio_url para clonar una voz, o con voice_prompt y preview_text para diseñar una, lee result_data.voice de la tarea terminada y pásalo como parámetro voice a qwen-audio-3.1-tts-flash. Una voz personalizada se puede usar durante 6 horas después de crearla; después, crea una nueva.

¿Cuál es la diferencia entre clonación de voz y diseño de voz?

La clonación de voz reproduce a un hablante real a partir de una grabación breve y solo devuelve el nombre de voz. El diseño de voz crea una voz nueva a partir de una descripción de texto y devuelve además un clip de vista previa. Ambos cuestan lo mismo y solo funcionan con qwen-audio-3.1-tts-flash.

¿Qué hace que una muestra para clonación de voz sea buena?

Obligatorio: WAV, MP3 o M4A, hasta 60 s y 10 MB, a 16 kHz o más y con habla clara. Para obtener los mejores resultados, usa 10–20 segundos de un solo hablante, audio mono, pausas de 2 segundos como máximo y sin música de fondo ni ruido.

¿Puede otra persona usar mi voz personalizada?

No. Una voz personalizada solo puede usarla la cuenta que la creó; las demás cuentas reciben un 404 con el mismo nombre de voz.

¿De quién puedo clonar la voz?

Solo tu propia voz o una voz que tengas permiso explícito para usar. No está permitido clonar la voz de alguien sin su consentimiento.

¿Cómo controlo la emoción, el ritmo o el dialecto?

Envía una instrucción breve como «habla despacio y con suavidad», o escribe etiquetas como [excited] directamente en el texto. Las cuatro voces multilingües también hablan varios dialectos del chino cuando la instrucción lo pide.

¿Qué pasa si una tarea falla?

Las tareas fallidas no se cobran: los créditos reservados se reembolsan por completo. El resultado de la tarea muestra el motivo del fallo.