
Grok 4.6 vs Grok 4.5:Benchmark、成本与升级决策
xhigh 推理档、更高缓存输入价和供应商公布的 Benchmark 提升。实时接入与价格见 Grok 4.6 API 页面。快速对比
| 决策维度 | Grok 4.6 | Grok 4.5 | 路由含义 |
|---|---|---|---|
| 模型 ID | grok-4.6 | grok-4.5 | 模型 ID 应配置化。 |
| 上下文 | 50 万 | 50 万 | 容量不是升级理由。 |
| 推理档位 | low / medium / high / xhigh | low / medium / high | 只在困难任务测试 xhigh。 |
| 标准直连价 | $2 / $0.50 / $6 | $2 / $0.30 / $6 | 缓存密集任务需特别比较。 |
| 长上下文直连价 | $4 / $1 / $12 | $4 / $0.60 / $12 | 20 万以上仍有缓存价差。 |
| 首批评测 | 困难编程、Agent、视觉软件 | 已稳定的 Grok 流量 | 按工作负载晋级。 |
真正发生了什么变化
xAI 将 Grok 4.6 定位为采用 Agent 强化学习重新训练的模型,强调长任务专注、陌生代码库研究、功能实现和自测。这些供应商声明适合转化为评测任务,但不能替代真实仓库、工具和延迟预算下的验证。
Grok 4.5 仍是可靠基线。如果它已经满足 SLO,升级问题应是:4.6 是否减少失败、重试、工具循环和人工修正,而不是它是否更新。
如何理解官方 Benchmark
xAI 公布 4.6 在 CursorBench、DeepSWE、FrontierCode、Artificial Analysis 和 GDPVal 上高于 4.5,例如 CursorBench 为 69.9 对 66.7,DeepSWE 为 65.9 对 54.0。这些属于供应商结果,只能用来选择评测方向。
| Benchmark 问题 | 安全解读 | 生产验证 |
|---|---|---|
| 发布报告中 4.6 更高吗? | 是。 | 用最接近的内部任务复现。 |
| 能证明生产成本更低吗? | 不能。 | 计算每个合格任务成本。 |
| 能证明 4.5 应退役吗? | 不能。 | 分流并只灰度可能获益的任务。 |
成本并不完全相同
标准输入和输出直连价相同,但缓存输入不同:20 万 Prompt 以下,4.6 为 $0.50/百万,4.5 为 $0.30/百万。仓库 Agent 和长会话应把缓存命中纳入比较。EvoLink 价格以各自实时模块为准。
合格任务成本 = 输入 + 缓存输入 + 输出 + 工具调用
+ 重试 + 回退调用 + 人工审查哪些任务先迁移
| 工作负载 | 起始路由 | 晋级条件 |
|---|---|---|
| 陌生仓库功能开发 | 4.6 影子测试 | 完整改动率和测试通过率提高 |
| 长时间工具 Agent | 4.5/4.6 配对回放 | 循环和人工介入下降 |
| 视觉前端实现 | 4.6 评估 | 响应式、无障碍和设计系统通过 |
| 稳定对话与抽取 | 先保留 4.5 | 质量或总成本明确改善 |
| 缓存密集长会话 | 同上下文预算比较 | 计入缓存价和命中稳定性 |

EvoLink 上的安全升级方案
grok-4.5 作为回滚;对 20–50 个代表任务使用相同上下文和工具回放;记录合格结果、延迟、Token 结构、工具调用、重试与人工修正;先影子流量,再只对胜出的任务类型做小流量灰度。FAQ
Grok 4.6 比 Grok 4.5 强吗?
供应商 Benchmark 显示多项提升,但生产结论仍取决于同任务评测、工具可靠性、延迟和合格任务成本。
两者使用同一个模型 ID 吗?
grok-4.6 和 grok-4.5。价格完全一样吗?
标准输入和输出直连价相同,缓存输入价不同;EvoLink 价格应查看实时路由。
两者都是 50 万上下文吗?
是,两个官方模型页都记录为 500,000 Token。
现有 4.5 应用要立即切换吗?
不需要。先回放、影子测试和任务级灰度,并保留回退。
迁移要记录什么?
记录任务验收、延迟、输入/缓存/输出 Token、工具成功、重试、人工修正和总成本。


