Qwen3.8 Max API
选择 Qwen3.8 Max
Qwen3.8 Max 是一条通过三种 API 协议对外提供的旗舰推理路由,适合大型代码仓库、长文档分析、大量证据资料、长时间运行的智能体,以及需要 1,048,576 Token 工作上下文的复杂知识任务。
Qwen3.8 Max
阿里通义千问旗舰 Max 模型
qwen3.8-max大型代码仓库开发、多文档综合、在 Chat/Responses/Messages 上的多步工具调用智能体,以及能够通过减少重试和人工修改来抵消旗舰成本的困难任务。
Qwen3.8 Max 价格
通过完整的交互式价格体验,按 Token 组合估算单次请求费用。所有用户组统一使用成本级的 Qwen3.8 Max 价格。
Token 价格计算器
输入单次请求的 Token 组成。单个请求只会走一种模式,按你要估算的那种选。显式:传 cache_control,建缓存按输入价 125% 计费,之后每次命中按 10%。隐式:什么都不用传,没有写入费用,每次命中按 20%。
单次请求预估
Qwen3.8 Max每次请求最低消费 0.01 Credits。
预算参考
按当前 Token 组合估算可调用次数。快速测试
日常开发
生产评估
模型价格
| 模型 | 上下文 | 输入 Token | 输出 Token | 缓存写入 Token | 缓存读取 · 隐式 | 缓存读取 · 显式 |
|---|---|---|---|---|---|---|
Qwen3.8 Maxqwen3.8-max | 全部上下文长度 | $1.765 / 1M120 cr / 1M$1.765 官方价格 | $5.295 / 1M360 cr / 1M$5.295 官方价格 | $2.206 / 1M150 cr / 1M$2.206 官方价格 | $0.353 / 1M24 cr / 1M$0.353 官方价格 | $0.177 / 1M12 cr / 1M$0.177 官方价格 |
Qwen3.8 Max
全部上下文长度美元与 Credits 均按每百万 Token 展示。缓存写入只发生在显式缓存上;单个请求要么走显式缓存读、要么走隐式,不会同时计两笔。后端实时价格优先,兜底价格仅作为参考。
内置工具计费
内置工具在 Token 费之外按次或按页附加计费,且只有工具真正执行了才收——没触发搜索的请求不会产生这几笔。Anthropic Messages 端点上游会忽略内置工具,不执行也不计费。
Qwen3.8 Max API:面向长上下文推理与智能体的三协议模型
通过 EvoLink 统一 API 调用阿里通义千问旗舰 Max 模型。Qwen3.8 Max 通过 OpenAI Chat Completions、OpenAI Responses 与 Anthropic Messages 三端点提供同一模型,全部字节透传,支持 1,048,576 Token 上下文、可控思考,以及显式与隐式提示词缓存,适合跨文件代码工程、长文档分析和多步工具调用。

Qwen3.8 Max 适合放在生产模型栈的哪一层
旗舰模型不应成为所有请求的默认选择。当长上下文、持续推理或多步工具调用能减少重试、模型交接和人工返工时,它更高的成本才有机会转化为更低的任务总成本。
大型代码仓库开发与跨文件修改
当一个工程任务同时依赖架构说明、多个服务、历史测试、大型 Diff 和分散在不同文件中的约束时,可以保持更完整的工作上下文。评估时看补丁能否直接采用与审查耗时,而不只是单段代码是否漂亮。
长文档分析与多资料综合
适合同时处理规格文档、论文、合同、日志或知识库证据,并在同一上下文中追踪它们之间的关系。百万 Token 只是容量,检索、文档结构和证据筛选仍然决定回答质量。
三协议下的多步工具调用智能体
适合在 Chat、Responses 或 Messages 上进行连续工具选择、结构化输出和反复的外部操作。要在多轮请求中保留完整消息、思考、工具调用 ID、参数和结果。
简单任务继续使用轻量模型
短对话、分类、改写、简单抽取和对延迟敏感的界面操作通常用不到最大推理与百万上下文。先用成本更低的模型处理常规流量,只在任务难度确实上升时再切换。
Qwen3.8 Max 在 EvoLink 上的关键差异
以下是 EvoLink 路由的契约级能力,而非跑分结论。作为生产默认路由前,请在自己的任务上验证延迟、质量和缓存行为。
三协议字节透传
OpenAI Chat、OpenAI Responses 与 Anthropic Messages 均以字节透传抵达同一模型,思考、signature 与缓存标记不会在网关被有损重序列化。
显式与隐式提示词缓存
显式 cache_control 可标记可复用前缀,命中按输入价 10% 计费;隐式缓存自动生效,命中按 20% 计费。两种模式在单个请求内互斥。网关会保留 cache_control 标记而不是剥离。
推理力度由你控制
推理默认以 xhigh 开启,可通过 reasoning_effort 调整为 medium 或 low。网关原样透传该字段,不会强制开启或关闭思考。注意 reasoning_effort 与 thinking_budget 不能在同一请求中同时传。
多轮之间必须回放思考内容
该模型默认开启 preserve_thinking,历史对话中每一条 assistant 的 reasoning_content 都必须原样回传,且不能拼接到 content 字段中。回放的思考内容会按输入 Token 计费。
为什么 Qwen3.8 Max 能处理这些复杂任务
当长上下文、持续推理和提示词缓存结合使用时最有效。单独追求上下文长度不会自动提高结果质量,任务仍需要相关证据、清晰结构和输出预算。
百万 Token 是工作空间,不是填充目标
1,048,576 Token 上下文可同时保留相关代码、规格文档和历史工具结果,减少切块造成的信息损失。仍应先检索真正相关的内容,并及时压缩失去价值的上下文。
持续推理需要配合输出预算
推理过程和最终答案都会消耗 Token。把最大输出当成容量而非目标,用 reasoning_effort 设定与任务匹配的推理力度和输出预算。
稳定前缀才能让缓存真正省钱
仓库说明、系统提示词、参考资料和工具 Schema 保持稳定时更容易形成缓存命中。频繁更换模型或提示词结构会增加长前缀重新处理的成本。
函数调用、内置工具与结构化输出
千问正式模型目录标注了函数调用、内置工具与 Structured Output。它们定义了能力边界,但在扩大生产流量前,仍应通过 EvoLink 路由验证工作流需要的具体工具和 Schema 行为。
正式路由生产流量前必须确认的五件事
能力适合并不等于接入一定正确。上线前应确认模型标识、各端点的最大输出字段和会话状态,避免把接入差异误判成模型问题。
使用 qwen3.8-max 模型 ID
EvoLink 路由在 Chat Completions、Responses 与 Anthropic Messages 上统一使用 qwen3.8-max。
按端点使用正确的最大输出字段
Chat 使用 max_completion_tokens,Responses 使用 max_output_tokens,Anthropic Messages 必须传 max_tokens。字段用错可能被忽略或被上游拒绝。
完整回放思考与工具状态
多轮智能体应保留完整消息、思考与 signature 块、工具调用 ID、参数和结果。只保留最终文本会破坏状态连续性,即使上下文窗口足够大。
每一轮都要回传 reasoning_content
该模型默认开启 preserve_thinking,历史对话中每一条 assistant 的 reasoning_content 都必须原样回传,且不能拼接进 content 字段。请把它计入预算:回放的思考内容按输入 Token 计费。
在 Chat 或 Messages 上创建显式缓存
三个协议都能读取缓存,但在 Responses 端点上创建大段显式缓存是上游最不稳定的路径。建议在 Chat Completions 或 Anthropic Messages 上标记 cache_control 前缀,再从任意协议读取。
比较每个可交付任务的成本,而不只是 Token 单价
只有当 Qwen3.8 Max 在同一生产工作负载上减少切块、重试、失败的工具链或人工返工时,它才值得作为高端路由。应比较相同任务集,而不是孤立的单段价格。
如果它能用更少重试和更少审查得到可用结果,成本级 Token 单价仍可降低任务总成本。如果这些收益没有出现,就把任务保留在更轻量的路由上。
完成工作负载测试后,再对比主流长上下文模型
EvoLink先根据真实任务确认 Qwen3.8 Max 是否能减少重试和人工修改,再结合价格、上下文、缓存方式与任务类型选择生产路由。
| 模型 | Qwen3.8 Max | Claude Opus 5 | Kimi K3 |
|---|---|---|---|
| 输入 / 输出 | $1.765 / $5.295 | $4.75 / $23.75 | $3 / $15 |
| 上下文 | 1M | 1M | 1M |
| 缓存 | 显式 + 隐式 | 读写缓存 | 读写缓存 |
| 适用场景 | 大型代码仓库开发、多文档综合、在 Chat/Responses/Messages 上的多步工具调用智能体,以及能够通过减少重试和人工修改来抵消旗舰成本的困难任务。 | 适合作为长时间编程智能体、复杂审查和高判断力专业流程的高端基线。 | 月之暗面的长上下文路由,以中档价格覆盖大型代码仓库开发与多文档推理。 |
相关模型




Qwen3.8 Max 发布、证据与接入指南




Qwen3.8 Max API 常见问题
Qwen3.8 Max API 的模型 ID 是什么?
在 EvoLink 上,Chat Completions、Responses 与 Anthropic Messages 均使用 qwen3.8-max。
支持哪些 API 协议?
三种:OpenAI Chat Completions、OpenAI Responses 和 Anthropic Messages,均为同一模型且字节透传。
应该使用哪个最大输出字段?
Chat 用 max_completion_tokens,Responses 用 max_output_tokens,Anthropic Messages 必须传 max_tokens。使用端点原生字段最稳妥。
支持百万上下文吗?
EvoLink 路由记录 1,048,576 Token 上下文窗口。应用于保留真正关联的文件、文档和智能体状态,而不是默认塞满。
思考功能怎么用?
推理默认开启,可通过 reasoning_effort 控制档位:xhigh(默认)、medium、low。reasoning_effort 与 thinking_budget 不能同时传。网关原样透传,并在 Messages 端点保留思考与 signature 块。
多轮对话需要回传 reasoning_content 吗?
需要。Qwen3.8 Max 默认开启 preserve_thinking,历史对话中每一条 assistant 的 reasoning_content 都必须原样回传,且不能拼接到 content 字段中。回传的思考 Token 会计入输入 Token 并计费。
缓存怎么工作、如何计费?
同时支持显式缓存(cache_control)和自动隐式缓存,单个请求只会走其中一种。显式缓存命中按输入价 10% 计费,隐式命中按 20% 计费。显式缓存写入按输入价 125% 计费;隐式缓存无单独写入费用。
可以使用 OpenAI SDK 或 Anthropic Messages 吗?
可以。继续使用同一个 EvoLink API 密钥,选择 qwen3.8-max,通过兼容的 Chat Completions、Responses 或 Anthropic Messages 调用。
适合实时或大批量请求吗?
通常需要先测试。最大推理和长输出会给简单任务增加延迟和成本。短对话、分类和轻量抽取应保留在更小的路由上。
如何计费?
按四段 Token 计费——输入、输出、缓存写入和缓存读取,采用成本级价格,其中缓存读取分显式与隐式两档单价。后端实时价格优先于页面展示的兜底价。