
Qwen3.8 Max vs Kimi K3:编程、Agent、成本与路由
qwen3.8-max 正式路由先完成账户级冒烟测试,再作为 Challenger 进入同任务评测。不要给出笼统赢家结论。Kimi K3 当前 EvoLink 备用价格为每 1M tokens $3 输入、$0.30 缓存读取、$15 输出,实时后端价格优先。QwenCloud 市场页报告 Qwen3.8 Max 为 $2 / $0.25 / $6,但这是上游价格,不是当前 EvoLink 对比价。
当前路由策略
| 位置 | 当前候选 | 晋级条件 |
|---|---|---|
| Main Route | Kimi K3 | 在成功率、可靠性、延迟和成本达标时继续使用 |
| Challenger | Qwen3.8 Max | 冒烟测试后,用相同 Coding / Agent / Long-context 任务做 20–50 项重放 |
| Fallback | Kimi K3 或另一个已验证路由 | 必须提前验证超时、429/5xx、解析和回滚 |
| 对比项 | Qwen3.8 Max | Kimi K3 |
|---|---|---|
| EvoLink 状态 | qwen3.8-max 正式路由已上线,运营证据待积累 | kimi-k3 生产路由已上线 |
| 上下文 | 1M | 1,048,576 |
| 多模态 | 原生视觉语言,EvoLink 路由格式待验证 | 文本、图像、视频已文档化 |
| 成本结论 | 必须等 EvoLink 实时价格与成功任务数据 | 已可测量实际路由成本 |
不要用笼统“赢家”结论。同一任务下比较接受率、工具调用成功率、延迟、重试、输出 tokens 和人工修正时间,再决定路由位置。
编程:有潜力的挑战者 vs 现在就能测试的路由
两款模型都在吸引编程与 Agent 用户,但证据成熟度不同。
Qwen 将 Qwen3.8 定位为编程、复杂推理、数据分析和专业工作流的重大升级。官方客户端配置还为 Preview 暴露了较大的推理预算,因此它值得用于仓库探索、多文件实现和长程规划测试。
Kimi K3 已有完整 API 路径和 EvoLink 路由。它最大的现实优势并不是所有公开跑分都偏向 Kimi,而是团队今天就能运行准确工作负载、检查用量、衡量延迟并判断结果能否通过验收。
不要只做通用 Prompt 擂台,使用下面的编程测试:
| 测试 | 验收标准 | 为什么能区分模型 |
|---|---|---|
| 现有仓库 Bug 修复 | 根因修复、测试通过、无无关修改 | 衡量诊断能力和仓库纪律。 |
| 跨模块功能 | 接口一致、迁移完整、回滚有记录 | 衡量跨依赖规划能力。 |
| 隐蔽代码审查 | 找到预埋缺陷、解释风险、给出有效修复 | 衡量判断力,而不是代码量。 |
| 前端实现 | 视觉、响应式、无障碍、可维护性 | 区分视觉吸引力与生产代码。 |
| 长时间工具任务 | 调用正确、注入失败后可恢复、不循环 | 衡量 Agent 的长期可靠性。 |
不要把 Token Plan 编程客户端中的 Qwen 运行与裸 Kimi API 调用直接比较,再把全部差异归因于模型。必须记录客户端、工具、上下文准备、推理配置和重试策略。
这里还有一道部署边界:Qwen 个人 Token Plan 条款禁止把订阅 Key 用于自定义应用后端、自动化脚本或非交互批处理。因此,编程客户端测试成功只能证明“可以评测”,不能证明“已有可发布后端路由”。本文认为 Kimi 当前更有优势的是 API 就绪度,而不是没有证据支持的“底层模型全面更强”。
Agent:Harness 会改变结果
Qwen 为 Token Plan Preview 记录了联网搜索、代码解释和网页提取等内置工具。Kimi 则提供有文档的 Tool Calling 行为,并要求长推理与工具循环正确保存状态。
这不是两个完全相同的评测环境。
| Agent 层 | 需要保持一致的内容 | 失败信号 |
|---|---|---|
| 目标与 Prompt | 相同任务、约束、文件和完成定义 | 某个模型收到更清晰的任务说明。 |
| 工具权限 | 相同可用工具和破坏性操作限制 | 模型因为工具更好而显得更强。 |
| 状态 | 保留所需 assistant、reasoning 和 tool 历史 | 模型循环或丢失早期决策。 |
| 时间与预算 | 相同超时与通过验收的任务预算 | 某个路由无限消耗才完成。 |
| 审查标准 | 相同通过/失败和严重程度定义 | 结果退化为主观偏好。 |
关键指标是无人协助完成率、无效工具调用、失败恢复、人工介入次数、通过验收所需时间和缺陷率。如果审查者必须修复结果,“完成”本身并不够。

上下文:窗口大小只是入场券
Kimi 文档给出 1,048,576 tokens 上下文,Qwen 当前模型列表也为 Qwen3.8 Max Preview 记录 1M。两者标称窗口已经接近,但路由并不因此等价:输入政策、输出预算、媒体处理、缓存行为和长上下文检索质量仍需要路由级证据。
即使两者能接受相近长度的文本,四种行为仍可能不同:
- 能否从大输入中找到正确证据;
- 能否在多轮中保持指令;
- 能否避免远距离段落间的矛盾;
- 能否通过缓存经济地利用重复上下文。
按 64K、256K、512K 和产品真正需要的最大长度分层测试。在受控位置插入已知事实,要求引用,并把检索得分与最终答案质量分开。若正常工作负载还没到上限时准确率就明显下降,百万上下文本身没有意义。
多模态:验证输入合同与视觉依据
Qwen Token Plan 模型列表包含视觉理解;Moonshot 则为 Kimi K3 记录了文本、图片与视频输入。这带来重叠场景,例如 UI 审查、文档分析、图表提取、视觉编程和多模态研究,但不代表输入合同完全相同。
公平评测应做到:
- 使用同一批源素材;
- 把 OCR 准确性与推理质量分开;
- 要求模型基于并指出视觉证据作答;
- 分别统计遗漏与虚构细节;
- 记录每条路由的预处理、采样和文件限制。
在 Qwen3.8 路由有文档前,不要声称它支持某种具体格式、时长、文件大小或 EvoLink 媒体路径。
API 就绪度:Kimi 赢在证据,而不一定是能力
API 就绪不只是模型名称出现在工具选择器里。
| 就绪门槛 | Qwen3.8 Max | Kimi K3 |
|---|---|---|
| 稳定 EvoLink 路由 | 已上线,运营历史仍在积累 | 已确认 |
| EvoLink 模型 ID | qwen3.8-max | 模型页/文档已确认 |
| EvoLink 价格 | 查看实时产品页 | 模型页已公布 |
| 生产示例 | API 指南已提供 | EvoLink 文档已提供 |
| 速率与区域行为 | 根据当前账户与文档验证 | 根据当前账户与文档验证 |
| 回退测试 | 现在即可测试 | 现在即可测试 |
这不能证明 Kimi 的模型能力更强,只能证明团队目前可以在 EvoLink 上为 Kimi 做预算、集成、观测和回滚。
成本:比较成功任务,而不是促销 Credits
QwenCloud 已报告 Qwen3.8 Max 上游价格为每 1M tokens $2 输入、$0.25 缓存输入和 $6 输出;这不是 EvoLink 价格。与 Kimi K3 的生产比较必须等 Qwen 路由上线后,使用同一网关的实时价格。
Qwen3.8 价格公布后,使用以下框架:
通过验收的任务成本 = 输入 + 缓存输入 + 输出 + 工具 + 重试 + 回退 + 审查时间像关注输入价格一样关注输出长度。产生更多 Token 或重复工具工作的推理模型,可能轻易抵消看似便宜的单价优势。
建议的 EvoLink 路由策略
| 路由角色 | 当前候选 | 晋级条件 |
|---|---|---|
| 生产长上下文与多模态路由 | Kimi K3 | 验收率、可靠性和成本持续达标。 |
| Qwen 下一代准备 | Qwen3.8 Max(EvoLink 路由已上线) | 冻结任务与验收规则,按工作负载逐个验证。 |
| 挑战者路由 | Qwen3.8 Max | 只在同任务测试和路由验证通过后晋级。 |
| 供应商回退 | Claude、GPT 等受支持替代模型 | 发布前演练失败与回滚。 |
| 成本敏感日常路由 | 更小的受支持模型 | 仅把昂贵前沿路由留给真正获益的任务。 |
模型切换应发生在任务边界。保存可持久化的任务说明、仓库状态、产物和验收标准,不要在无关模型家族之间迁移正在进行的推理历史。
哪些情况下值得等 Qwen3.8
如果 Qwen 专属能力、已宣布的开放权重方向或 Qwen 工具体系是路线图核心,并且上线日期能承受不确定性,可以等待。
以下情况不应等待:
- 产品现在就能用受支持模型发布;
- 需要稳定模型 ID 和有文档的计费;
- 无法运营 Preview 回滚路径;
- 工作负载没有客观验收测试;
- 对客户的可用性承诺将依赖 Qwen 的时间表。
现在就用 Kimi 或其他可用模型构建评测 Harness,但在生产可用 API 路由出现前,不要投入大型 Qwen3.8 测试。即使它最终没有成为默认路由,这套 Harness 依然有价值。
用同路由评分卡比较,而不是只看功能清单
只有当两款模型使用相同 Prompt、上下文准备、工具、权限、Timeout、Retry Budget、Reviewer Rubric 和运行次数时,对比才可以指导生产路由。
| 维度 | 记录内容 | 路由判断 |
|---|---|---|
| 通过验收的完成率 | Pass / 全部尝试 | 稳定成功率更高者优先 |
| Tool 有效性 | 有效调用、错误参数、遗漏调用 | Repair 和循环更少者优先 |
| 失败恢复 | Tool、网络或 Schema 失败后能否继续 | Challenger 必须安全失败 |
| 长上下文召回 | 不同插入位置的正确证据 | 不能只凭窗口大小获胜 |
| 多模态 Grounding | 支持格式、引用和虚构细节 | 路由格式与准确性都计分 |
| 延迟 | p50、p95、p99、通过验收所需时间 | 按工作负载执行 SLO |
| Token 使用 | 输入、Cache、Thinking、输出 | 解释真实成本 |
| Retry 与 Fallback | 次数、原因、目标路由 | 计入二次调用成本 |
| 人工修正 | 每个成功任务的分钟数与严重程度 | Reviewer 时间计入成本 |
| 路由错误 | 4xx、429、5xx、Timeout、Malformed Response | Main Route 需要可预测错误语义 |
| 可观测性 | 模型修订、路由、区域、Usage、Trace ID | 结果必须可以归因 |
| 安全与权限 | 拒答、危险操作、权限越界 | Main Route 必须遵守产品控制 |
当前保留 Kimi K3 为 Main;Qwen3.8 完成 EvoLink 冒烟测试后进入 Challenger。只有重复 Canary 数据证明特定工作负载有明确收益,才将 Qwen3.8 晋级 Main,并在稳定期保留 Kimi 或另一条已验证 Fallback。
价格只能在同一商业渠道中归一化。QwenCloud 上游标价用于市场背景,EvoLink 实时 Backend 价格才决定 EvoLink 路由。最终公式应把输入、缓存输入、输出、工具、重试、Fallback 和 Reviewer 时间相加,再除以通过验收的任务数。
路由结论必须按工作负载拆分
仓库编程、文档理解、长上下文召回、视觉 Grounding 和多工具 Agent 可以得到不同赢家。评分报告应分别给出每个类别的 Main、Challenger 和 Fallback,不要用一个总分覆盖局部失败;还要记录模型修订日期,避免上线后把版本变化误认为稳定收益。
切换流量前,先完成模型判断
不要因为一条发布消息就直接注册。先完成以下判断;只有路由确实适合你的工作负载时,再创建 API Key。
- 01
发布了吗?
已发布。Qwen3.8 Max 是正式模型,Preview 仅作为历史渠道背景保留。
- 02
能用吗?
已在 EvoLink 上线。请在产品页确认实时路由与模型 ID。
- 03
适合我吗?
更适合长上下文推理、大型代码仓库和多工具 Agent;轻量任务应继续使用更小的路由。
- 04
多少钱?
以产品页实时价格模块为准,不要套用上游价格或 Preview 套餐价格。
- 05
怎么调用?
从 Chat Completions、Responses 或 Messages 中选择协议,再查看接入指南和参数文档。
五项判断都完成了? 创建 API Key.
常见问题
Qwen3.8 比 Kimi K3 更好吗?
目前没有足够的可比生产证据支撑这一结论。两条路由都已可用,应在计划发布的同一环境中执行同任务测试。
现在编程应该用哪个模型?
qwen3.8-max 作为 Challenger,用相同仓库、工具权限和验收标准评测。哪个模型上下文更大?
两者公开上限都约为 1M tokens。这只说明标称窗口接近,不代表召回质量、输出额度、媒体支持或路由行为相同。
哪个模型更便宜?
QwenCloud 上游标价与 EvoLink 路由价格不是同一商业口径。应按两条路由的实时价格和同任务成功成本决定。
两款模型都是多模态吗?
模型层面两者都是多模态:Kimi K3 支持文本、图片和视频理解,Qwen3.8 Max 是原生视觉语言模型;EvoLink 的 Qwen 格式与限制仍待路由验证。
EvoLink 已支持 Qwen3.8 吗?
qwen3.8-max;开始同任务对比前,先在账户中确认路由并完成冒烟测试。现在应该立即从 Kimi K3 迁移到 Qwen3.8 吗?
不应该自动迁移。重放相同工作负载,比较验收率、可靠性、延迟和成本,并保留 Kimi 或其他路由作为回退。
应该如何比较 Agent 可靠性?
在相同权限和预算下,衡量无人协助完成率、工具调用有效性、恢复、循环、介入次数、通过验收所需时间和缺陷率。
来源
- QwenCloud 模型发布日志
- Qwen3.8 Max 技术发布与 Benchmark
- Qwen Token Plan 概览
- Qwen 文本生成模型列表
- Qwen OpenAI 兼容 Chat API 参考
- Qwen Token Plan FAQ
- Kimi K3 价格与 API 概览
- Kimi K3 模型配置
- Kimi Code 概览
- EvoLink Kimi K3 模型页


