Qwen3.8-Max-Preview - Documentación completa de parámetros
🚧 Este modelo aun no esta disponible, mantente atento
- Llama a Qwen3.8-Max-Preview mediante el protocolo OpenAI Chat Completions
- Conversación de varios turnos: admite contexto de un solo turno o de varios turnos
- Prompt de sistema: define el rol y el comportamiento de la IA mediante un mensaje
role=system - Entrada multimodal:
contentacepta un array de content part, admitetext/image_url/input_audio/video_url - Caché de contexto: añade
cache_controlen un content part para declarar caché explícita; consulta los aciertos enusage.prompt_tokens_detailsde la respuesta - Modo de pensamiento: se activa con
enable_thinking=true, el contenido del pensamiento se devuelve mediantereasoning_content - Salida en streaming: cuando
stream=true, se devuelve por bloques mediante SSE
https://direct.evolink.ai, que ofrece mejor soporte para modelos de texto y admite conexiones persistentes; https://api.evolink.ai es la dirección principal multimodal, úsala cuando incluyas entrada de imagen / audio / video.Autorizaciones
##Todas las API requieren autenticación con Bearer Token##
Obtener la API Key:
Visita la página de gestión de API Keys para obtener tu API Key
Añadir al encabezado de la solicitud:
Cuerpo
Nombre del modelo de chat
qwen3.8-max-preview "qwen3.8-max-preview"
Lista de mensajes de la conversación, admite conversación de varios turnos. Los distintos roles (system / user / assistant / tool) tienen estructuras de campos diferentes; selecciona el rol correspondiente para ver los detalles.
- Mensaje de sistema
- Mensaje de usuario
- Mensaje de asistente
- Mensaje de herramienta
Indica si se activa el pensamiento profundo
true: el modelo devuelve el proceso de pensamiento mediantereasoning_contentfalse(predeterminado): no devuelve el proceso de pensamiento
Nota: algunos modelos requieren establecerlo explícitamente en
truepara devolver el contenido del pensamiento en llamadas sin streaming.
Temperatura de muestreo, controla la aleatoriedad de la salida. Los valores más bajos son más deterministas y los más altos, más variados. Rango [0, 2]. Se recomienda no ajustar temperature y top_p a la vez.
0 <= x <= 2Parámetro de muestreo de núcleo (Nucleus Sampling), muestrea de los primeros tokens por probabilidad acumulada. Rango (0, 1]. Se recomienda no ajustar temperature y top_p a la vez.
0 <= x <= 1Límite de longitud del contenido generado (número de tokens), incluye la cadena de pensamiento y la respuesta. Se recomienda este parámetro para los modelos de pensamiento. El valor predeterminado y el máximo coinciden con la longitud máxima de salida del modelo; al superarlo se detiene anticipadamente con finish_reason=length.
Parámetro heredado de límite de longitud de generación.
Obsoleto: para nuevas integraciones usa
max_completion_tokens. Este parámetro solo limita la parte de la respuesta (sin la cadena de pensamiento).
Indica si la respuesta se devuelve en streaming.
true: se devuelve por bloques mediante SSE (Server-Sent Events)false(predeterminado): se devuelve la respuesta completa de una sola vez
Opciones de respuesta en streaming, solo válidas cuando stream=true.
Lista de definiciones de herramientas para Function Calling. Cada herramienta debe definir un nombre, una descripción y un schema de parámetros.
Respuesta
Chat generado correctamente