
GPT-6.1 Sol vs GPT-6 Sol:普通 Token 同价,缓存更省,迁移条件有变
none 推理,并要求工具调用使用 Responses。原来通过 Chat Completions 调工具的 Agent,需要做的不只是替换模型 ID。GPT-6.1 Sol 和 GPT-6 Sol 的主要区别
| 决策项 | GPT-6 Sol | GPT-6.1 Sol | 现有 Agent 需要考虑什么 |
|---|---|---|---|
| 官方模型 ID | gpt-6-sol | gpt-6.1-sol | 固定版本,不依赖泛化的 Sol 别名 |
| 输入 / 输出 | 文本、图像 / 文本 | 文本、图像 / 文本 | 没有新增可据此设计的输出模态 |
| 上下文 / 最大输出 | 1,050,000 / 128,000 tokens | 相同 | 上下文窗口没有增加 |
| 知识截止 | 2026 年 4 月 20 日 | 2026 年 4 月 30 日 | 更晚的截止日期不是任务质量测量结果 |
| 推理档位 | none、low、medium、high、xhigh、max | low、medium、high、xhigh、max;无 none、minimal | 候选配置中移除不支持的档位 |
| Chat Completions 函数调用 | 仅 none 档位可用 | 不支持 | 带工具的工作流迁移到已验证的 Responses 路由 |
| Responses 工具调用 | 支持 | 支持 | 仍需验证工具循环与网关行为 |
| 流式 / 结构化输出 | OpenAI 文档列出 | OpenAI 文档列出 | 提供商支持不证明具体网关路由支持 |
官方性能证据具体说了什么
| 评估 | 相对 GPT-6 Sol 的报告变化 | 条件与决策边界 |
|---|---|---|
| DeepSWE v1.1 | 比旧型号最佳成绩高 6.4 个百分点 | 候选使用更低推理档位和成本;不是同档位比较 |
| AutomationBench 1.0.6 | 高 4.8 个百分点 | 同为 medium;适合参考多步工具工作流 |
| OSWorld 2.0 | 高 7 个百分点,任务成本低于一半 | 最大推理档位;offline v2026.08.08 集合的 partial reward |
这些证据让复杂代码修改和业务工具工作流成为有依据的试跑候选。OSWorld 的 partial reward 衡量任务进展,不能直接替代团队的二元任务通过率。OpenAI 也说明研究/API 环境可能与生产 ChatGPT 不同。引用结果时,应保留执行框架、推理档位和成本范围。
当前模型已能通过的常规任务,较少需要因为公告而全面替换。下面的成对任务评估用于确认哪些改进能迁移到自己的工作流;不能从这些成绩推导自己的延迟、重试率或 EvoLink 账单。
先决定端点,再判断性能
实际迁移至少有三种情况。把它们混成一场试跑,会让失败原因难以判断。
| 现有工作流 | 候选路径 | 首项验收 |
|---|---|---|
| Chat Completions,不用工具,使用支持的推理档位 | 按 6.1 Sol 官方不带工具的约定试跑 | 响应解析、输出形状、实际计费用量 |
Chat Completions,通过 none 调工具 | 工具工作流改用 Responses,并选择支持的推理档位 | 工具请求、结果关联、继续执行与重试行为 |
| Responses,带工具 | 保留工作流,固定新 ID 与支持的推理档位 | 完整工具循环、结构化结果,以及用到的流式和取消行为 |
none 也可能改变延迟、输出用量和行为。迁移带工具的工作流时,先盘点端点、推理档位、工具定义、结果标识与继续执行的处理方式。再将工具循环适配到 Responses,包括工具结果如何关联到发起调用的请求。在沙箱中回放一次成功动作、失败动作和取消执行,同时检查最终记录与文字回答。客户端若使用结构化输出或流式,也要核对解析。之后再开始质量比较。
将兼容性失败与任务未通过分开记录。开始小范围试用前,核验具体网关路由的约定与计费;旧模型、端点和解析器应作为一整套回退配置保留。
缓存读降价不等于整个任务同比例降价
| Token 类别 | GPT-6 Sol,输入不超过 272K | GPT-6.1 Sol,输入不超过 272K | GPT-6.1 Sol,输入超过 272K |
|---|---|---|---|
| 未缓存输入 | $2.00 | $2.00 | $4.00 |
| 缓存输入读取 | $0.20 | $0.10 | $0.20 |
| 缓存写入 | $2.50 | $2.50 | $5.00 |
| 输出 | $10.00 | $10.00 | $15.00 |
相对 6 Sol 的直接变化是缓存读取单价降低 50%。相对 6.1 Sol 自己的普通输入单价,缓存读取便宜 95%。两句话都不表示整个任务便宜 50% 或 95%,因为输出、未缓存输入和缓存写入没有相同幅度的降价。
| 100 万输入 tokens 中的缓存比例 | GPT-6 Sol 输入 + 输出 | GPT-6.1 Sol 输入 + 输出 | 直接节省 |
|---|---|---|---|
| 40% | $1.20 未缓存 + $0.08 缓存 + $1.00 输出 = $2.28 | $1.20 + $0.04 + $1.00 = $2.24 | $0.04 |
| 90% | $0.20 未缓存 + $0.18 缓存 + $1.00 输出 = $1.38 | $0.20 + $0.09 + $1.00 = $1.29 | $0.09 |
这些比例是计算假设,不是实测命中率,也不保证复用提示词就一定满足缓存条件。如果候选模型增加了推理输出或多重试一次,额外用量可能抵消示例中的节省。反过来,任务验收通过率提高,也可能带来远大于缓存差价的收益。两者都要测,不能只凭 token 价格表宣布升级成功。
用六类真实任务做成对评估

运行任一模型前,冻结近期任务、仓库版本与验收规则。既纳入常规任务,也纳入旧 Agent 失败或需要人工介入的样本。工具权限与重试上限保持一致;若端点或执行框架必须调整,应如实报告,不能假装实验完全受控。
| 任务 | 输入与期望结果 | 验收信号 | 成本或失败信号 | 试跑优先级 |
|---|---|---|---|---|
| 多文件修复 | 固定仓库与 issue → 补丁 | 所需测试通过,没有无关修改 | 重试、返工、审查介入 | 优先选失败任务和审查负担高的修改 |
| PR 审查 | 固定 diff 与规范 → 缺陷列表 | 缺陷经确认,误报可接受 | 核对误报的时间 | 新增发现若只增加核查噪声,则保留基线 |
| 重复上下文 Agent | 保存的上下文与允许工具 → 完成任务 | 保留约束,没有重复副作用 | 缓存读写与推理输出 | 用量确认缓存读取占比较高时试跑 |
| 文档问答 | 固定文档与问题 → 有依据的答案 | 字段正确,证据可追溯 | 无依据结论与审查时间 | 测表格和冲突证据,不只测简单查找 |
| 业务工具工作流 | 目标与沙箱工具 → 预期最终记录 | 执行顺序与记录状态正确 | 重复写入、工具结果关联错误 | 先核验工具循环,再判断模型质量 |
| 疑难任务升级 | 固定任务队列 → 验收通过的结果 | 全队列达到质量门槛 | 候选、升级与回退的合计成本 | 优先试独立的疑难任务路由 |
运行前确定拒绝条件。例如,业务流程即使最终文字回答正确,也可以因重复写入而被拒绝;补丁除了 Agent 可见测试,还可能需要隐藏测试。JSON 合法不代表提取字段正确。
每次尝试都记录任务 ID、模型身份、端点、推理档位、工具调用、用量、重试、是否通过与审查时间。报告样本数和成对结果分歧:小样本能发现阻断问题,却不足以建立可靠的总体提升结论。除平均值外,还要看单次失败,尤其当一个长任务就占据大部分账单时。
比较有效任务成本,再分阶段切换
使用这个核算定义:
人工审查成本必须明确。可以按已说明的费率计价,也可以在 API 成本旁同时报告审查分钟数,但不能只在其中一个型号的结果中省略。没有任务通过时,这个比值不可计算,应记录为试跑失败,不能报告成便宜的结果。
完整的 100 项任务成本案例
| 指标 | 6 Sol 基线 | 6.1:仅缓存价差 | 6.1:返工减少 | 6.1:输出/重试增加 |
|---|---|---|---|---|
| 未缓存输入 / 缓存读取,百万 tokens | 4 / 6 | 4 / 6 | 3.6 / 5.4 | 4.8 / 7.2 |
| 缓存写入 / 输出,百万 tokens | 0.4 / 1 | 0.4 / 1 | 0.36 / 0.9 | 0.48 / 1.8 |
| 额外重试次数 | 20 | 20 | 10 | 30 |
| Token 费用 | $20.20 | $19.60 | $17.64 | $29.52 |
| 设定的工具费用 | $3.00 | $3.00 | $2.70 | $3.60 |
| 审查分钟数 / 费用 | 240 / $120 | 240 / $120 | 180 / $90 | 300 / $150 |
| 试跑总成本 | $143.20 | $142.60 | $110.34 | $183.12 |
| 100 项任务中通过的数量 | 80 | 80 | 90 | 75 |
| 每项通过任务的成本 | $1.79 | $1.78 | $1.23 | $2.44 |
4 × $2 + 6 × $0.20 + 0.4 × $2.50 + 1 × $10 = $20.20。加上工具与审查后,每项通过任务的成本为 $143.20 ÷ 80 = $1.79。返工减少场景为 $110.34 ÷ 90 ≈ $1.23。行为不变时,缓存降价在整个队列里只节省 $0.60;返工减少可能带来更大收益,输出、重试和审查增加也可能抵消价差。本例不预测 6.1 Sol 会出现哪一种行为。实际评估时,用成对任务的用量、通过情况与审查记录替换全部假设,EvoLink 决策采用已验证的网关费率。
试跑前先确定进入小范围试用的门槛
复制这张评估表,用自己团队的服务要求替换示例规则。这些是编辑提供的起点,不是 OpenAI 建议或统计保证。
| 指标 | 两个型号都应记录什么 | 示例门槛 |
|---|---|---|
| 通过任务 | 通过/分配任务数及成对结果分歧 | 候选不低于基线,关键任务退步单独复查 |
| 有效成本 | 所有尝试的成本 / 通过任务数 | 不高于基线,除非事先接受质量提升带来的溢价 |
| 延迟 | 含工具和重试的端到端 p95 | 本例采用团队自定的 75 秒预算 |
| 工具正确性 | 错误动作、重复写入与最终记录状态 | 试跑中重复或未授权写入为 0;任何一次均阻止进入小范围试用 |
| 约定与计费 | 返回身份、支持功能、用量与实际收费 | 候选路由进入生产流量前已核验 |
以下决策接续上面的假设 100 项任务案例;延迟与动作结果也是额外设定。
| 结果 | 示例证据 | 下一步 |
|---|---|---|
| 开始小范围试用 | 通过 90 项,对照基线 80;$1.23 对 $1.79;p95 70 秒;没有错误写入;路由与计费已核验 | 先分配少量明确选定的流量,例如 5%,扩大前再次检查同一组门槛 |
| 继续离线评估 | 没有触及硬性门槛,但审查分歧使质量结论尚未确定 | 复核争议任务并扩充成对样本,生产仍使用基线 |
| 拒绝或回滚 | 只通过 75 项且成本 $2.44,或出现任何重复/未授权写入 | 恢复基线配置,诊断失败发生在哪一层 |
回滚时一起恢复模型、端点、推理档位、工具 schema 与解析器。换模型重试前先检查已有动作状态,避免重复副作用。统一网关有助于保留模型选择,各路由约定与重试语义仍需分别核验。
哪些情况下应该继续用 GPT-6 Sol
带工具的客户端还无法使用已验证 Responses 路由,新网关功能或账单未核验,或者试跑达不到质量与延迟门槛时,继续使用基线更合适。缓存复用少、输出占比高的工作流,可能很少受益于直接价差。当前模型已经低返工地完成常规任务时,先做针对疑难任务的试跑,比全量迁移更容易判断收益。
不能因为 6.1 Sol 更新,就宣布 6 Sol 已弃用。官方文档区分了两个型号,本文没有旧路由的已确认下线指令。有明确变更依据前,保留旧型号精确标识可选。
常见问题
GPT-6.1 Sol 比 GPT-6 Sol 更便宜吗?
按 OpenAI Standard 短输入标价,普通输入和输出不变,缓存读取为旧款的一半。整项任务成本仍取决于缓存用量、输出、重试与验收结果,EvoLink 费率需要单独核验。
只替换模型 ID 就能升级吗?
none 档调工具的 Agent,还需要迁移端点与推理设置。GPT-6.1 Sol 支持 none 推理吗?
low、medium、high、xhigh、max,默认是 medium;none 和 minimal 都不支持。新 Sol 的上下文更大吗?
没有。两款文档都列出 1,050,000-token 上下文和 128,000 最大输出。不要把输入输出共用的上下文预算误当成最大输入。
GPT-6.1 Sol 已经能通过 EvoLink 调用吗?
截至 9 月 29 日,本文尚未核验该路由、支持功能与销售费率。使用网关配置前,请核对当前目录和文档。
最有用的升级指标是什么?
有效任务成本,以及质量、延迟和不安全动作的拒绝条件。计入失败与回退成本,保留审查时间信息。返回一条更便宜的成功响应,不代表任务已经完成。
来源
- GPT-6.1 Sol 模型文档:新型号约定与规格。
- GPT-6 Sol 模型文档:基线约定与规格。
- OpenAI API 价格:Standard 费率、缓存计费与长输入条件。
- GPT-6.1 Sol 发布公告:发布定位与厂商评估,不是 EvoLink 复现。
官方来源核查日期为 2026 年 9 月 29 日。工作流示例是计算示例与测试方法,不是实测用量,也不保证节省金额。
