Seedance 2.5 ya está disponible en EvoLinkProbar Seedance 2.5

Qwen3.8 Max API

Alibaba Qwen-Generación de texto-desde $1.765 / 1M tokens de entrada$1.765 precio oficial-Disponible
Contexto de 1MRazonamiento controlableLlamadas a funciones + salida estructuradaCaché explícita + implícitaChat + Responses + Messages
Ruta de producciónActiva
Proveedor
Alibaba Qwen
Modelo
Qwen3.8 Max
Ventana de contexto
1.048.576 tokens
Protocolos
Chat · Responses · Messages

Elige Qwen3.8 Max

Una ruta premium de razonamiento disponible mediante tres protocolos API para programación a escala de repositorio, documentos largos, grandes conjuntos de evidencias, agentes prolongados y trabajo complejo con un contexto de 1.048.576 tokens.

Qwen3.8 Max

Modelo insignia Max de Alibaba Tongyi Qwen

Seleccionado
Desde $1.765 / 1M tokens de entrada$1.765 precio oficialqwen3.8-max
Ideal para

Ingeniería en repositorios completos, síntesis de varios documentos, agentes con muchas herramientas mediante Chat, Responses o Messages y tareas difíciles donde menos reintentos y correcciones compensen una ruta premium.

Entrada
$1.765 / 1M120 cr / 1M$1.765 precio oficial
Salida
$5.295 / 1M360 cr / 1M$5.295 precio oficial
Escritura de caché
$2.206 / 1M150 cr / 1M$2.206 precio oficial
Lectura de caché · implícita
$0.353 / 1M24 cr / 1M$0.353 precio oficial
Lectura de caché · explícita
$0.177 / 1M12 cr / 1M$0.177 precio oficial

Precio de Qwen3.8 Max

Estima una solicitud con la calculadora interactiva. Todos los grupos de usuarios utilizan la tarifa de Qwen3.8 Max basada en coste.

Qwen3.8 Max

Calculadora de tokens

Introduce la combinación de tokens de una solicitud.
Modo de lectura de caché

Cada solicitud usa un modo. Explícito: envía cache_control, crea la caché al 125 % del precio de entrada y paga el 10 % en cada acierto. Implícito: no envíes nada, sin cargo de escritura y con aciertos al 20 %.

Coste estimado de la solicitud

Qwen3.8 Max
Tarifa de coste
USD$0.0035
Credits0.2328
Tokens de entrada0.12 cr
Tokens de escritura de caché0 cr
Tokens de lectura de caché · Implícita0.0048 cr
Tokens de salida0.108 cr

Cargo mínimo: 0,01 créditos por solicitud.

Guía de presupuesto

Solicitudes aproximadas con la combinación actual de tokens.
Añadir créditos
$10
Unas 2920 solicitudes

Para una prueba rápida

$50
Unas 14604 solicitudes

Para desarrollo habitual

$100
Unas 29209 solicitudes

Para evaluación en producción

Precio del modelo

Qwen3.8 Max

Todas las longitudes de contexto
Tokens de entrada
$1.765 / 1M120 cr / 1M$1.765 precio oficial
Tokens de salida
$5.295 / 1M360 cr / 1M$5.295 precio oficial
Escritura de caché
$2.206 / 1M150 cr / 1M$2.206 precio oficial
Lectura · implícita
$0.353 / 1M24 cr / 1M$0.353 precio oficial
Lectura · explícita
$0.177 / 1M12 cr / 1M$0.177 precio oficial

Los USD y créditos se muestran por 1M tokens. La escritura solo se aplica a cachés explícitas. Una solicitud usa lectura explícita o implícita, nunca ambas. Los precios en vivo del backend prevalecen sobre estas tarifas de respaldo.

Precios de herramientas integradas

Búsqueda web · turboChat
$0.0005 por llamada0.03 cr por llamada
Búsqueda web · maxChat
$0.0006 por llamada0.04 cr por llamada
Herramienta de búsqueda webResponses
$0.0006 por llamada0.04 cr por llamada
Búsqueda de texto a imagenResponses
$0.0036 por llamada0.24 cr por llamada
Búsqueda de imagen a imagenResponses
$0.0071 por llamada0.48 cr por llamada
Análisis de PDFChat
$0.0030 por página0.2 cr por página

Las herramientas integradas se cobran además de los tokens y solo cuando la herramienta se ejecuta realmente, así que una solicitud que nunca busca no paga nada de esto. Anthropic Messages ignora las herramientas integradas en el proveedor: allí no se ejecuta nada y no se cobra nada.

API de Qwen3.8 Max para razonamiento de contexto largo y agentes

Accede al modelo insignia Max de Alibaba Tongyi Qwen mediante la API unificada de EvoLink. Qwen3.8 Max ofrece el mismo modelo por OpenAI Chat Completions, OpenAI Responses y Anthropic Messages con byte passthrough completo, una ventana de 1.048.576 tokens, razonamiento controlable y caché de prompts explícita e implícita para ingeniería a escala de repositorio, documentos largos y flujos de herramientas en varios pasos.

Qwen3.8 Max
Casos de uso de Qwen3.8 Max

Dónde encaja Qwen3.8 Max en una arquitectura de modelos para producción

Un modelo insignia no debe ser la ruta predeterminada para todo. Su mejor encaje son las tareas donde el contexto largo, el razonamiento sostenido o las secuencias complejas de herramientas reducen reintentos, traspasos y corrección humana.

Programación a escala de repositorio

Úsalo cuando una tarea dependa de documentación de arquitectura, servicios relacionados, historial de pruebas, diffs grandes y restricciones distribuidas entre archivos. Mide parches aceptados y tiempo de revisión, no solo la calidad de código aislado.

Análisis de documentos largos

Mantén especificaciones, estudios, contratos, registros o evidencias relacionadas en un mismo contexto. La recuperación y la estructura siguen importando: una ventana de 1M tokens no vuelve útil el contexto irrelevante.

Agentes con herramientas en tres protocolos

Adecuado para selección de herramientas en varios pasos, salida estructurada y acciones externas repetidas mediante Chat, Responses o Messages. Conserva mensajes, thinking, IDs de llamadas, argumentos y resultados entre turnos.

Cuándo conviene una ruta más ligera

Chat breve, clasificación, reescritura, extracción simple y acciones de interfaz sensibles a latencia rara vez necesitan razonamiento máximo o contexto de 1M. Mantén esas tareas en una ruta económica y escala solo cuando la dificultad lo justifique.

Señales de protocolo y caché

Qué diferencia a Qwen3.8 Max en EvoLink

Son capacidades contractuales de la ruta de EvoLink, no afirmaciones de benchmark. Valida latencia, calidad y caché con tus tareas antes de convertirla en la ruta predeterminada.

Byte passthrough en tres protocolos

OpenAI Chat, OpenAI Responses y Anthropic Messages llegan al mismo modelo con byte passthrough, por lo que thinking, signatures y marcadores de caché no se pierden al volver a serializarse en el gateway.

Caché de prompts explícita e implícita

cache_control marca prefijos reutilizables y factura los aciertos al 10 % del precio de entrada; la caché implícita se aplica automáticamente al 20 %. Los modos son excluyentes por solicitud y el gateway conserva los marcadores.

Esfuerzo de razonamiento controlable

El razonamiento está activo en xhigh por defecto y puede ajustarse a medium o low con reasoning_effort. El gateway transmite el campo sin forzarlo. No envíes reasoning_effort y thinking_budget juntos.

El thinking debe reenviarse entre turnos

preserve_thinking está activo por defecto. Cada reasoning_content del assistant debe reenviarse sin cambios y no puede integrarse en content. El razonamiento reenviado cuenta como tokens de entrada facturables.

Capacidades clave

Por qué Qwen3.8 Max puede resolver estas cargas

El valor aparece cuando contexto largo, razonamiento sostenido y prefijos reutilizables trabajan juntos. La capacidad por sí sola no mejora la respuesta: siguen siendo necesarias evidencia relevante, estructura clara y presupuesto de salida.

1M tokens como espacio de trabajo, no como objetivo

La ventana de 1.048.576 tokens mantiene código, especificaciones y resultados de herramientas relacionados sin fragmentación excesiva. La recuperación y compactación siguen siendo importantes porque el ruido consume atención y coste.

El razonamiento sostenido necesita presupuesto de salida

Los tokens de razonamiento y de respuesta final cuentan para el consumo. Trata el límite como capacidad, no como longitud habitual, y configura un presupuesto acorde a la tarea con reasoning_effort.

La caché compensa con prefijos estables

Las instrucciones del repositorio, prompts de sistema, referencias y esquemas de herramientas ofrecen más oportunidades cuando conservan su orden. Cambios frecuentes de modelo o estructura obligan a procesar de nuevo el prefijo largo.

Function calling, herramientas integradas y Structured Output

Qwen incluye function calling, herramientas integradas y Structured Output para el modelo de producción. Verifica mediante la ruta de EvoLink el comportamiento exacto de herramientas y esquemas antes de ampliar tráfico.

Comprobaciones de producción de la API de Qwen3.8 Max

Qué verificar antes de enviar tráfico de producción

Una carga adecuada puede fallar por usar el identificador equivocado, el campo máximo incorrecto o perder el estado del agente. Verifica la superficie de solicitud antes de evaluar la calidad del modelo.

01

Usar el ID qwen3.8-max

La ruta de EvoLink utiliza qwen3.8-max para Chat Completions, Responses y Anthropic Messages.

ID del modelo
02

Usar el campo máximo correcto por endpoint

Chat usa max_completion_tokens, Responses usa max_output_tokens y Anthropic Messages requiere max_tokens. Un campo incorrecto puede ignorarse o rechazarse upstream.

Endpoints
03

Reenviar thinking y estado de herramientas completos

Los agentes multi-turno deben conservar mensajes, bloques thinking y signature, IDs, argumentos y resultados. Guardar solo el texto final rompe la continuidad del estado.

Estado de herramientas
04

Devolver reasoning_content en cada turno

preserve_thinking está activo por defecto. Cada reasoning_content del assistant debe devolverse sin cambios y no puede fusionarse con content. Esos tokens se facturan como entrada.

Replay de thinking
05

Crear cachés explícitas en Chat o Messages

Las lecturas funcionan en los tres protocolos, pero crear una caché explícita grande en Responses es la vía upstream menos fiable. Marca prefijos cache_control en Chat Completions o Anthropic Messages y léelos desde cualquier protocolo.

Caché
Economía de producción

Comparar el coste por tarea aceptada, no solo el precio por token

Qwen3.8 Max solo justifica una ruta premium si reduce fragmentación, reintentos, secuencias de herramientas fallidas o revisión humana en la misma carga. Compara conjuntos de tareas idénticos.

Éxito al primer intentoEntregables aceptadosNúmero de reintentosTokens de salidaTasa de aciertos de cachéLlamadas válidas a herramientasTiempo hasta un resultado aceptadoCorrección humana y fallback

Si produce resultados utilizables con menos reintentos y revisión, una tarifa por token basada en coste puede reducir el coste total. Si la mejora no aparece, mantén la carga en una ruta más ligera.

Compara modelos líderes de contexto largo después de probar tus cargas

EvoLink

Comprueba primero si Qwen3.8 Max reduce reintentos y revisión en tus tareas. Después compara precio, contexto, caché y adecuación para elegir la ruta de producción.

Qwen3.8 Max
Entrada / salida$1.765 / $5.295
Contexto1M
CachéExplícita + implícita
Ideal paraIngeniería en repositorios completos, síntesis de varios documentos, agentes con muchas herramientas mediante Chat, Responses o Messages y tareas difíciles donde menos reintentos y correcciones compensen una ruta premium.
Claude Opus 5
Entrada / salida$4.75 / $23.75
Contexto1M
CachéLectura + escritura
Ideal paraReferencia premium para agentes de programación prolongados, revisiones complejas y flujos profesionales con mucho juicio.
Kimi K3
Entrada / salida$3 / $15
Contexto1M
CachéLectura + escritura
Ideal paraRuta de contexto largo de Moonshot para repositorios grandes y razonamiento sobre varios documentos a una tarifa intermedia.

Modelos relacionados

Claude Opus 5

Claude Opus 5

Referencia premium para agentes de programación prolongados, revisiones complejas y flujos profesionales con mucho juicio.

Ver modelo
Kimi K3

Kimi K3

Ruta de contexto largo de Moonshot para repositorios grandes y razonamiento sobre varios documentos a una tarifa intermedia.

Ver modelo
DeepSeek V4

DeepSeek V4

Referencia sensible al coste para programación, razonamiento y agentes de gran volumen con contexto de 1M.

Ver modelo
GPT-5.6

GPT-5.6

Los niveles Sol, Terra y Luna permiten comparar capacidad, latencia y flexibilidad de enrutamiento por coste.

Ver modelo

Guías de lanzamiento, evidencias e integración de Qwen3.8 Max

Lanzamiento y funciones de Qwen3.8 Max

Lanzamiento y funciones de Qwen3.8 Max

Separa la versión de producción, los canales iniciales, las capacidades oficiales y el estado de los pesos abiertos.

Leer la guía
Evidencias de benchmark de Qwen3.8 Max

Evidencias de benchmark de Qwen3.8 Max

Revisa resultados oficiales, evidencia independiente y el plan de pruebas de producción de EvoLink.

Leer la guía
Qwen3.8 Max vs Qwen3.7 Max

Qwen3.8 Max vs Qwen3.7 Max

Elige entre mantener, lanzar un canary o migrar con una lista reversible.

Leer la guía
Qwen3.8 Max vs Kimi K3

Qwen3.8 Max vs Kimi K3

Compara código, agentes, contexto largo, coste y roles principal, challenger y fallback.

Leer la guía

Preguntas frecuentes sobre la API de Qwen3.8 Max

¿Cuál es el ID del modelo de la API de Qwen3.8 Max?

Usa qwen3.8-max en EvoLink para Chat Completions, Responses y Anthropic Messages.

¿Qué protocolos API admite?

OpenAI Chat Completions, OpenAI Responses y Anthropic Messages. Los tres sirven el mismo modelo con byte passthrough completo.

¿Qué campo de tokens máximos debo usar?

Chat usa max_completion_tokens, Responses usa max_output_tokens y Anthropic Messages requiere max_tokens. Usar el campo nativo del endpoint es lo más seguro.

¿Admite un contexto de 1M tokens?

La ruta de EvoLink registra una ventana de 1.048.576 tokens. Úsala para archivos, documentos y estado del agente realmente relacionados, no para llenarla por defecto.

¿Cómo funciona el razonamiento?

Está activo por defecto y se controla con reasoning_effort: xhigh, medium o low. No envíes reasoning_effort y thinking_budget juntos. El gateway conserva los bloques de thinking y signature en Messages.

¿Debo reenviar reasoning_content en conversaciones de varios turnos?

Sí. preserve_thinking está activo por defecto. Cada reasoning_content del assistant debe reenviarse sin cambios y no puede combinarse con content. Esos tokens cuentan como entrada facturable.

¿Cómo funciona la caché y cuánto cuesta?

Se admiten caché explícita mediante cache_control e implícita automática; una solicitud usa solo una. Los aciertos explícitos cuestan el 10 %, los implícitos el 20 %. Escribir una caché explícita cuesta el 125 % de la entrada; la implícita no tiene escritura separada.

¿Puedo usar el SDK de OpenAI o Anthropic Messages?

Sí. Conserva tu clave de EvoLink, selecciona qwen3.8-max y usa Chat Completions, Responses o Anthropic Messages compatibles.

¿Es una buena ruta predeterminada para tiempo real o gran volumen?

Normalmente no sin pruebas. El razonamiento máximo y las salidas largas añaden latencia y coste a tareas simples. Mantén chat breve, clasificación y extracción ligera en una ruta menor.

¿Cómo se factura?

Se facturan entrada, salida, escritura y lectura de caché a tarifas basadas en coste; la lectura tiene una tarifa explícita y otra implícita. Los precios en vivo del backend tienen prioridad.