Qwen3.8 Max API
Elige Qwen3.8 Max
Una ruta premium de razonamiento disponible mediante tres protocolos API para programación a escala de repositorio, documentos largos, grandes conjuntos de evidencias, agentes prolongados y trabajo complejo con un contexto de 1.048.576 tokens.
Qwen3.8 Max
Modelo insignia Max de Alibaba Tongyi Qwen
qwen3.8-maxIngeniería en repositorios completos, síntesis de varios documentos, agentes con muchas herramientas mediante Chat, Responses o Messages y tareas difíciles donde menos reintentos y correcciones compensen una ruta premium.
Precio de Qwen3.8 Max
Estima una solicitud con la calculadora interactiva. Todos los grupos de usuarios utilizan la tarifa de Qwen3.8 Max basada en coste.
Calculadora de tokens
Introduce la combinación de tokens de una solicitud.Cada solicitud usa un modo. Explícito: envía cache_control, crea la caché al 125 % del precio de entrada y paga el 10 % en cada acierto. Implícito: no envíes nada, sin cargo de escritura y con aciertos al 20 %.
Coste estimado de la solicitud
Qwen3.8 MaxCargo mínimo: 0,01 créditos por solicitud.
Guía de presupuesto
Solicitudes aproximadas con la combinación actual de tokens.Para una prueba rápida
Para desarrollo habitual
Para evaluación en producción
Precio del modelo
| Modelo | Contexto | Tokens de entrada | Tokens de salida | Escritura de caché | Lectura · implícita | Lectura · explícita |
|---|---|---|---|---|---|---|
Qwen3.8 Maxqwen3.8-max | Todas las longitudes de contexto | $1.765 / 1M120 cr / 1M$1.765 precio oficial | $5.295 / 1M360 cr / 1M$5.295 precio oficial | $2.206 / 1M150 cr / 1M$2.206 precio oficial | $0.353 / 1M24 cr / 1M$0.353 precio oficial | $0.177 / 1M12 cr / 1M$0.177 precio oficial |
Qwen3.8 Max
Todas las longitudes de contextoLos USD y créditos se muestran por 1M tokens. La escritura solo se aplica a cachés explícitas. Una solicitud usa lectura explícita o implícita, nunca ambas. Los precios en vivo del backend prevalecen sobre estas tarifas de respaldo.
Precios de herramientas integradas
Las herramientas integradas se cobran además de los tokens y solo cuando la herramienta se ejecuta realmente, así que una solicitud que nunca busca no paga nada de esto. Anthropic Messages ignora las herramientas integradas en el proveedor: allí no se ejecuta nada y no se cobra nada.
API de Qwen3.8 Max para razonamiento de contexto largo y agentes
Accede al modelo insignia Max de Alibaba Tongyi Qwen mediante la API unificada de EvoLink. Qwen3.8 Max ofrece el mismo modelo por OpenAI Chat Completions, OpenAI Responses y Anthropic Messages con byte passthrough completo, una ventana de 1.048.576 tokens, razonamiento controlable y caché de prompts explícita e implícita para ingeniería a escala de repositorio, documentos largos y flujos de herramientas en varios pasos.

Dónde encaja Qwen3.8 Max en una arquitectura de modelos para producción
Un modelo insignia no debe ser la ruta predeterminada para todo. Su mejor encaje son las tareas donde el contexto largo, el razonamiento sostenido o las secuencias complejas de herramientas reducen reintentos, traspasos y corrección humana.
Programación a escala de repositorio
Úsalo cuando una tarea dependa de documentación de arquitectura, servicios relacionados, historial de pruebas, diffs grandes y restricciones distribuidas entre archivos. Mide parches aceptados y tiempo de revisión, no solo la calidad de código aislado.
Análisis de documentos largos
Mantén especificaciones, estudios, contratos, registros o evidencias relacionadas en un mismo contexto. La recuperación y la estructura siguen importando: una ventana de 1M tokens no vuelve útil el contexto irrelevante.
Agentes con herramientas en tres protocolos
Adecuado para selección de herramientas en varios pasos, salida estructurada y acciones externas repetidas mediante Chat, Responses o Messages. Conserva mensajes, thinking, IDs de llamadas, argumentos y resultados entre turnos.
Cuándo conviene una ruta más ligera
Chat breve, clasificación, reescritura, extracción simple y acciones de interfaz sensibles a latencia rara vez necesitan razonamiento máximo o contexto de 1M. Mantén esas tareas en una ruta económica y escala solo cuando la dificultad lo justifique.
Qué diferencia a Qwen3.8 Max en EvoLink
Son capacidades contractuales de la ruta de EvoLink, no afirmaciones de benchmark. Valida latencia, calidad y caché con tus tareas antes de convertirla en la ruta predeterminada.
Byte passthrough en tres protocolos
OpenAI Chat, OpenAI Responses y Anthropic Messages llegan al mismo modelo con byte passthrough, por lo que thinking, signatures y marcadores de caché no se pierden al volver a serializarse en el gateway.
Caché de prompts explícita e implícita
cache_control marca prefijos reutilizables y factura los aciertos al 10 % del precio de entrada; la caché implícita se aplica automáticamente al 20 %. Los modos son excluyentes por solicitud y el gateway conserva los marcadores.
Esfuerzo de razonamiento controlable
El razonamiento está activo en xhigh por defecto y puede ajustarse a medium o low con reasoning_effort. El gateway transmite el campo sin forzarlo. No envíes reasoning_effort y thinking_budget juntos.
El thinking debe reenviarse entre turnos
preserve_thinking está activo por defecto. Cada reasoning_content del assistant debe reenviarse sin cambios y no puede integrarse en content. El razonamiento reenviado cuenta como tokens de entrada facturables.
Por qué Qwen3.8 Max puede resolver estas cargas
El valor aparece cuando contexto largo, razonamiento sostenido y prefijos reutilizables trabajan juntos. La capacidad por sí sola no mejora la respuesta: siguen siendo necesarias evidencia relevante, estructura clara y presupuesto de salida.
1M tokens como espacio de trabajo, no como objetivo
La ventana de 1.048.576 tokens mantiene código, especificaciones y resultados de herramientas relacionados sin fragmentación excesiva. La recuperación y compactación siguen siendo importantes porque el ruido consume atención y coste.
El razonamiento sostenido necesita presupuesto de salida
Los tokens de razonamiento y de respuesta final cuentan para el consumo. Trata el límite como capacidad, no como longitud habitual, y configura un presupuesto acorde a la tarea con reasoning_effort.
La caché compensa con prefijos estables
Las instrucciones del repositorio, prompts de sistema, referencias y esquemas de herramientas ofrecen más oportunidades cuando conservan su orden. Cambios frecuentes de modelo o estructura obligan a procesar de nuevo el prefijo largo.
Function calling, herramientas integradas y Structured Output
Qwen incluye function calling, herramientas integradas y Structured Output para el modelo de producción. Verifica mediante la ruta de EvoLink el comportamiento exacto de herramientas y esquemas antes de ampliar tráfico.
Qué verificar antes de enviar tráfico de producción
Una carga adecuada puede fallar por usar el identificador equivocado, el campo máximo incorrecto o perder el estado del agente. Verifica la superficie de solicitud antes de evaluar la calidad del modelo.
Usar el ID qwen3.8-max
La ruta de EvoLink utiliza qwen3.8-max para Chat Completions, Responses y Anthropic Messages.
Usar el campo máximo correcto por endpoint
Chat usa max_completion_tokens, Responses usa max_output_tokens y Anthropic Messages requiere max_tokens. Un campo incorrecto puede ignorarse o rechazarse upstream.
Reenviar thinking y estado de herramientas completos
Los agentes multi-turno deben conservar mensajes, bloques thinking y signature, IDs, argumentos y resultados. Guardar solo el texto final rompe la continuidad del estado.
Devolver reasoning_content en cada turno
preserve_thinking está activo por defecto. Cada reasoning_content del assistant debe devolverse sin cambios y no puede fusionarse con content. Esos tokens se facturan como entrada.
Crear cachés explícitas en Chat o Messages
Las lecturas funcionan en los tres protocolos, pero crear una caché explícita grande en Responses es la vía upstream menos fiable. Marca prefijos cache_control en Chat Completions o Anthropic Messages y léelos desde cualquier protocolo.
Comparar el coste por tarea aceptada, no solo el precio por token
Qwen3.8 Max solo justifica una ruta premium si reduce fragmentación, reintentos, secuencias de herramientas fallidas o revisión humana en la misma carga. Compara conjuntos de tareas idénticos.
Si produce resultados utilizables con menos reintentos y revisión, una tarifa por token basada en coste puede reducir el coste total. Si la mejora no aparece, mantén la carga en una ruta más ligera.
Compara modelos líderes de contexto largo después de probar tus cargas
EvoLinkComprueba primero si Qwen3.8 Max reduce reintentos y revisión en tus tareas. Después compara precio, contexto, caché y adecuación para elegir la ruta de producción.
| Modelo | Qwen3.8 Max | Claude Opus 5 | Kimi K3 |
|---|---|---|---|
| Entrada / salida | $1.765 / $5.295 | $4.75 / $23.75 | $3 / $15 |
| Contexto | 1M | 1M | 1M |
| Caché | Explícita + implícita | Lectura + escritura | Lectura + escritura |
| Ideal para | Ingeniería en repositorios completos, síntesis de varios documentos, agentes con muchas herramientas mediante Chat, Responses o Messages y tareas difíciles donde menos reintentos y correcciones compensen una ruta premium. | Referencia premium para agentes de programación prolongados, revisiones complejas y flujos profesionales con mucho juicio. | Ruta de contexto largo de Moonshot para repositorios grandes y razonamiento sobre varios documentos a una tarifa intermedia. |
Modelos relacionados

Claude Opus 5
Referencia premium para agentes de programación prolongados, revisiones complejas y flujos profesionales con mucho juicio.
Ver modelo
Kimi K3
Ruta de contexto largo de Moonshot para repositorios grandes y razonamiento sobre varios documentos a una tarifa intermedia.
Ver modelo
DeepSeek V4
Referencia sensible al coste para programación, razonamiento y agentes de gran volumen con contexto de 1M.
Ver modelo
GPT-5.6
Los niveles Sol, Terra y Luna permiten comparar capacidad, latencia y flexibilidad de enrutamiento por coste.
Ver modeloGuías de lanzamiento, evidencias e integración de Qwen3.8 Max

Lanzamiento y funciones de Qwen3.8 Max
Separa la versión de producción, los canales iniciales, las capacidades oficiales y el estado de los pesos abiertos.
Leer la guía
Evidencias de benchmark de Qwen3.8 Max
Revisa resultados oficiales, evidencia independiente y el plan de pruebas de producción de EvoLink.
Leer la guía
Qwen3.8 Max vs Qwen3.7 Max
Elige entre mantener, lanzar un canary o migrar con una lista reversible.
Leer la guía
Qwen3.8 Max vs Kimi K3
Compara código, agentes, contexto largo, coste y roles principal, challenger y fallback.
Leer la guíaPreguntas frecuentes sobre la API de Qwen3.8 Max
¿Cuál es el ID del modelo de la API de Qwen3.8 Max?
Usa qwen3.8-max en EvoLink para Chat Completions, Responses y Anthropic Messages.
¿Qué protocolos API admite?
OpenAI Chat Completions, OpenAI Responses y Anthropic Messages. Los tres sirven el mismo modelo con byte passthrough completo.
¿Qué campo de tokens máximos debo usar?
Chat usa max_completion_tokens, Responses usa max_output_tokens y Anthropic Messages requiere max_tokens. Usar el campo nativo del endpoint es lo más seguro.
¿Admite un contexto de 1M tokens?
La ruta de EvoLink registra una ventana de 1.048.576 tokens. Úsala para archivos, documentos y estado del agente realmente relacionados, no para llenarla por defecto.
¿Cómo funciona el razonamiento?
Está activo por defecto y se controla con reasoning_effort: xhigh, medium o low. No envíes reasoning_effort y thinking_budget juntos. El gateway conserva los bloques de thinking y signature en Messages.
¿Debo reenviar reasoning_content en conversaciones de varios turnos?
Sí. preserve_thinking está activo por defecto. Cada reasoning_content del assistant debe reenviarse sin cambios y no puede combinarse con content. Esos tokens cuentan como entrada facturable.
¿Cómo funciona la caché y cuánto cuesta?
Se admiten caché explícita mediante cache_control e implícita automática; una solicitud usa solo una. Los aciertos explícitos cuestan el 10 %, los implícitos el 20 %. Escribir una caché explícita cuesta el 125 % de la entrada; la implícita no tiene escritura separada.
¿Puedo usar el SDK de OpenAI o Anthropic Messages?
Sí. Conserva tu clave de EvoLink, selecciona qwen3.8-max y usa Chat Completions, Responses o Anthropic Messages compatibles.
¿Es una buena ruta predeterminada para tiempo real o gran volumen?
Normalmente no sin pruebas. El razonamiento máximo y las salidas largas añaden latencia y coste a tareas simples. Mantén chat breve, clasificación y extracción ligera en una ruta menor.
¿Cómo se factura?
Se facturan entrada, salida, escritura y lectura de caché a tarifas basadas en coste; la lectura tiene una tarifa explícita y otra implícita. Los precios en vivo del backend tienen prioridad.