GPT Image 2.5 Flare 与 Sunburst 已上线 EvoLink立即体验
GPT-6.1 Sol vs GPT-6 Sol 升级主题的编辑插图:基线与候选模型之间隔着评估关卡
对比

GPT-6.1 Sol vs GPT-6 Sol:普通 Token 同价,缓存更省,迁移条件有变

Jacey
Jacey
2026年9月29日
23 分钟阅读
如果希望在 GPT-6 Sol 普通输入、输出标价下获得更强的复杂任务表现,尤其是 Agent 反复复用上下文时,值得试跑 GPT-6.1 Sol。新工具与推理约定通过测试前,仍应保留 GPT-6 Sol 作为基线。 OpenAI 9 月 29 日发布的新型号降低了缓存读取费率,但同时移除 none 推理,并要求工具调用使用 Responses。原来通过 Chat Completions 调工具的 Agent,需要做的不只是替换模型 ID。
本文面向已有 Sol 工作流、验收测试和实际用量账单的团队。EvoLink 的 GPT-6 Sol 模型页提供当前网关基线,GPT 合集提供更完整的模型选择入口。截至 2026 年 9 月 29 日,本文尚未核验 GPT-6.1 Sol 在 EvoLink 的接入、功能和销售费率。 以下比较基于 OpenAI 文档及评估方法,不是 EvoLink 双模型实测结果。
可在 GPT-6.1 Sol API 产品页 查看已配置的模型、token 计费角色与接入选项。目录收录或兜底价格不等于真实请求成功或实际账单已核验;生产切换前仍需分别确认。

GPT-6.1 Sol 和 GPT-6 Sol 的主要区别

决策项GPT-6 SolGPT-6.1 Sol现有 Agent 需要考虑什么
官方模型 IDgpt-6-solgpt-6.1-sol固定版本,不依赖泛化的 Sol 别名
输入 / 输出文本、图像 / 文本文本、图像 / 文本没有新增可据此设计的输出模态
上下文 / 最大输出1,050,000 / 128,000 tokens相同上下文窗口没有增加
知识截止2026 年 4 月 20 日2026 年 4 月 30 日更晚的截止日期不是任务质量测量结果
推理档位none、low、medium、high、xhigh、maxlow、medium、high、xhigh、max;无 none、minimal候选配置中移除不支持的档位
Chat Completions 函数调用仅 none 档位可用不支持带工具的工作流迁移到已验证的 Responses 路由
Responses 工具调用支持支持仍需验证工具循环与网关行为
流式 / 结构化输出OpenAI 文档列出OpenAI 文档列出提供商支持不证明具体网关路由支持
来源为 GPT-6 Sol 官方文档与 GPT-6.1 Sol 官方文档,核查日期为 9 月 29 日。两款默认均为 medium 推理。规格上限不变,兼容性与有效任务成本比上下文大小更值得比较。

官方性能证据具体说了什么

OpenAI 发布公告报告了相对 GPT-6 Sol 的以下变化。这是提供商评估,不是 EvoLink 实测。 “百分点”表示分数的绝对差,不是相对百分比提升。
评估相对 GPT-6 Sol 的报告变化条件与决策边界
DeepSWE v1.1比旧型号最佳成绩高 6.4 个百分点候选使用更低推理档位和成本;不是同档位比较
AutomationBench 1.0.6高 4.8 个百分点同为 medium;适合参考多步工具工作流
OSWorld 2.0高 7 个百分点,任务成本低于一半最大推理档位;offline v2026.08.08 集合的 partial reward

这些证据让复杂代码修改和业务工具工作流成为有依据的试跑候选。OSWorld 的 partial reward 衡量任务进展,不能直接替代团队的二元任务通过率。OpenAI 也说明研究/API 环境可能与生产 ChatGPT 不同。引用结果时,应保留执行框架、推理档位和成本范围。

当前模型已能通过的常规任务,较少需要因为公告而全面替换。下面的成对任务评估用于确认哪些改进能迁移到自己的工作流;不能从这些成绩推导自己的延迟、重试率或 EvoLink 账单。

先决定端点,再判断性能

实际迁移至少有三种情况。把它们混成一场试跑,会让失败原因难以判断。

现有工作流候选路径首项验收
Chat Completions,不用工具,使用支持的推理档位按 6.1 Sol 官方不带工具的约定试跑响应解析、输出形状、实际计费用量
Chat Completions,通过 none 调工具工具工作流改用 Responses,并选择支持的推理档位工具请求、结果关联、继续执行与重试行为
Responses,带工具保留工作流,固定新 ID 与支持的推理档位完整工具循环、结构化结果,以及用到的流式和取消行为
第二行属于接入迁移。失败请求可能完全不能说明模型解决任务的能力,因为旧约定本身已经不受支持。第一行即使沿用端点,移除 none 也可能改变延迟、输出用量和行为。

迁移带工具的工作流时,先盘点端点、推理档位、工具定义、结果标识与继续执行的处理方式。再将工具循环适配到 Responses,包括工具结果如何关联到发起调用的请求。在沙箱中回放一次成功动作、失败动作和取消执行,同时检查最终记录与文字回答。客户端若使用结构化输出或流式,也要核对解析。之后再开始质量比较。

将兼容性失败与任务未通过分开记录。开始小范围试用前,核验具体网关路由的约定与计费;旧模型、端点和解析器应作为一整套回退配置保留。

缓存读降价不等于整个任务同比例降价

下表为 OpenAI Standard 每 100 万 tokens 的美元价格,不是 EvoLink 销售价。这是比较摘要;网关当前费率仍以对应模型页为准。
Token 类别GPT-6 Sol,输入不超过 272KGPT-6.1 Sol,输入不超过 272KGPT-6.1 Sol,输入超过 272K
未缓存输入$2.00$2.00$4.00
缓存输入读取$0.20$0.10$0.20
缓存写入$2.50$2.50$5.00
输出$10.00$10.00$15.00
来源为 OpenAI 价格页,核查日期为 2026 年 9 月 29 日。输入超过 272K tokens 时,对应类别的更高费率作用于整条请求,不只作用于超出阈值的部分。Batch、Flex、Fast 与区域处理有各自条件,本例仅使用 Standard。

相对 6 Sol 的直接变化是缓存读取单价降低 50%。相对 6.1 Sol 自己的普通输入单价,缓存读取便宜 95%。两句话都不表示整个任务便宜 50% 或 95%,因为输出、未缓存输入和缓存写入没有相同幅度的降价。

假设一批请求合计输入 100 万 tokens、输出 10 万 tokens,每条请求的输入都处于短输入档位。用量报告已确认下列缓存输入比例;为了说明差价,暂不计缓存写入、工具、失败尝试与其他处理溢价。
100 万输入 tokens 中的缓存比例GPT-6 Sol 输入 + 输出GPT-6.1 Sol 输入 + 输出直接节省
40%$1.20 未缓存 + $0.08 缓存 + $1.00 输出 = $2.28$1.20 + $0.04 + $1.00 = $2.24$0.04
90%$0.20 未缓存 + $0.18 缓存 + $1.00 输出 = $1.38$0.20 + $0.09 + $1.00 = $1.29$0.09

这些比例是计算假设,不是实测命中率,也不保证复用提示词就一定满足缓存条件。如果候选模型增加了推理输出或多重试一次,额外用量可能抵消示例中的节省。反过来,任务验收通过率提高,也可能带来远大于缓存差价的收益。两者都要测,不能只凭 token 价格表宣布升级成功。

用六类真实任务做成对评估

已有任务经过控制、测量与受控放量,候选模型保持独立,说明 GPT-6.1 Sol 升级评估流程
已有任务经过控制、测量与受控放量,候选模型保持独立,说明 GPT-6.1 Sol 升级评估流程
编辑插图展示基线、测量与放量阶段,图中没有编码任何模型实测结果。

运行任一模型前,冻结近期任务、仓库版本与验收规则。既纳入常规任务,也纳入旧 Agent 失败或需要人工介入的样本。工具权限与重试上限保持一致;若端点或执行框架必须调整,应如实报告,不能假装实验完全受控。

任务输入与期望结果验收信号成本或失败信号试跑优先级
多文件修复固定仓库与 issue → 补丁所需测试通过,没有无关修改重试、返工、审查介入优先选失败任务和审查负担高的修改
PR 审查固定 diff 与规范 → 缺陷列表缺陷经确认,误报可接受核对误报的时间新增发现若只增加核查噪声,则保留基线
重复上下文 Agent保存的上下文与允许工具 → 完成任务保留约束,没有重复副作用缓存读写与推理输出用量确认缓存读取占比较高时试跑
文档问答固定文档与问题 → 有依据的答案字段正确,证据可追溯无依据结论与审查时间测表格和冲突证据,不只测简单查找
业务工具工作流目标与沙箱工具 → 预期最终记录执行顺序与记录状态正确重复写入、工具结果关联错误先核验工具循环,再判断模型质量
疑难任务升级固定任务队列 → 验收通过的结果全队列达到质量门槛候选、升级与回退的合计成本优先试独立的疑难任务路由

运行前确定拒绝条件。例如,业务流程即使最终文字回答正确,也可以因重复写入而被拒绝;补丁除了 Agent 可见测试,还可能需要隐藏测试。JSON 合法不代表提取字段正确。

每次尝试都记录任务 ID、模型身份、端点、推理档位、工具调用、用量、重试、是否通过与审查时间。报告样本数和成对结果分歧:小样本能发现阻断问题,却不足以建立可靠的总体提升结论。除平均值外,还要看单次失败,尤其当一个长任务就占据大部分账单时。

比较有效任务成本,再分阶段切换

使用这个核算定义:

有效任务成本 = 包含失败尝试、重试、工具与审查的试跑总成本 ÷ 验收通过的任务数。

人工审查成本必须明确。可以按已说明的费率计价,也可以在 API 成本旁同时报告审查分钟数,但不能只在其中一个型号的结果中省略。没有任务通过时,这个比值不可计算,应记录为试跑失败,不能报告成便宜的结果。

完整的 100 项任务成本案例

下表四列全部是计算假设,不是模型实测结果。 每列代表同一个 100 项任务队列。Token 总量包含首次尝试、重试和失败任务;每条请求都处于 Standard 短输入档位。四类 token 按账单分别报告的计费类别处理。工具费用是设定的总额,审查采用示例内部费率 $30/小时。暂不计区域或其他处理溢价。
指标6 Sol 基线6.1:仅缓存价差6.1:返工减少6.1:输出/重试增加
未缓存输入 / 缓存读取,百万 tokens4 / 64 / 63.6 / 5.44.8 / 7.2
缓存写入 / 输出,百万 tokens0.4 / 10.4 / 10.36 / 0.90.48 / 1.8
额外重试次数20201030
Token 费用$20.20$19.60$17.64$29.52
设定的工具费用$3.00$3.00$2.70$3.60
审查分钟数 / 费用240 / $120240 / $120180 / $90300 / $150
试跑总成本$143.20$142.60$110.34$183.12
100 项任务中通过的数量80809075
每项通过任务的成本$1.79$1.78$1.23$2.44
基线 Token 费用为 4 × $2 + 6 × $0.20 + 0.4 × $2.50 + 1 × $10 = $20.20。加上工具与审查后,每项通过任务的成本为 $143.20 ÷ 80 = $1.79。返工减少场景为 $110.34 ÷ 90 ≈ $1.23。

行为不变时,缓存降价在整个队列里只节省 $0.60;返工减少可能带来更大收益,输出、重试和审查增加也可能抵消价差。本例不预测 6.1 Sol 会出现哪一种行为。实际评估时,用成对任务的用量、通过情况与审查记录替换全部假设,EvoLink 决策采用已验证的网关费率。

试跑前先确定进入小范围试用的门槛

复制这张评估表,用自己团队的服务要求替换示例规则。这些是编辑提供的起点,不是 OpenAI 建议或统计保证。

指标两个型号都应记录什么示例门槛
通过任务通过/分配任务数及成对结果分歧候选不低于基线,关键任务退步单独复查
有效成本所有尝试的成本 / 通过任务数不高于基线,除非事先接受质量提升带来的溢价
延迟含工具和重试的端到端 p95本例采用团队自定的 75 秒预算
工具正确性错误动作、重复写入与最终记录状态试跑中重复或未授权写入为 0;任何一次均阻止进入小范围试用
约定与计费返回身份、支持功能、用量与实际收费候选路由进入生产流量前已核验

以下决策接续上面的假设 100 项任务案例;延迟与动作结果也是额外设定。

结果示例证据下一步
开始小范围试用通过 90 项,对照基线 80;$1.23 对 $1.79;p95 70 秒;没有错误写入;路由与计费已核验先分配少量明确选定的流量,例如 5%,扩大前再次检查同一组门槛
继续离线评估没有触及硬性门槛,但审查分歧使质量结论尚未确定复核争议任务并扩充成对样本,生产仍使用基线
拒绝或回滚只通过 75 项且成本 $2.44,或出现任何重复/未授权写入恢复基线配置,诊断失败发生在哪一层
100 项任务可以暴露阻断问题,不能证明整体普遍更强,也不能确定罕见动作错误率。逐项检查失败,并持续观察小范围试用。保留旧 GPT-6 Sol 配置,通过 GPT 合集考虑疑难任务的其他选择。记录实际执行型号,避免回退掩盖候选失败。

回滚时一起恢复模型、端点、推理档位、工具 schema 与解析器。换模型重试前先检查已有动作状态,避免重复副作用。统一网关有助于保留模型选择,各路由约定与重试语义仍需分别核验。

哪些情况下应该继续用 GPT-6 Sol

带工具的客户端还无法使用已验证 Responses 路由,新网关功能或账单未核验,或者试跑达不到质量与延迟门槛时,继续使用基线更合适。缓存复用少、输出占比高的工作流,可能很少受益于直接价差。当前模型已经低返工地完成常规任务时,先做针对疑难任务的试跑,比全量迁移更容易判断收益。

不能因为 6.1 Sol 更新,就宣布 6 Sol 已弃用。官方文档区分了两个型号,本文没有旧路由的已确认下线指令。有明确变更依据前,保留旧型号精确标识可选。

发布日期与渠道细节见 GPT-6.1 Sol 发布说明。生产切换的下一步是核验接入,再做自己的成对试跑;官方公告本身不能证明网关已准备就绪。

常见问题

GPT-6.1 Sol 比 GPT-6 Sol 更便宜吗?

按 OpenAI Standard 短输入标价,普通输入和输出不变,缓存读取为旧款的一半。整项任务成本仍取决于缓存用量、输出、重试与验收结果,EvoLink 费率需要单独核验。

只替换模型 ID 就能升级吗?

对于兼容且不用工具的工作流,核对支持的设置与响应处理后可能可以。通过 Chat Completions 在 none 档调工具的 Agent,还需要迁移端点与推理设置。

GPT-6.1 Sol 支持 none 推理吗?

不支持。OpenAI 列出 low、medium、high、xhigh、max,默认是 medium;none 和 minimal 都不支持。

新 Sol 的上下文更大吗?

没有。两款文档都列出 1,050,000-token 上下文和 128,000 最大输出。不要把输入输出共用的上下文预算误当成最大输入。

截至 9 月 29 日,本文尚未核验该路由、支持功能与销售费率。使用网关配置前,请核对当前目录和文档。

最有用的升级指标是什么?

有效任务成本,以及质量、延迟和不安全动作的拒绝条件。计入失败与回退成本,保留审查时间信息。返回一条更便宜的成功响应,不代表任务已经完成。

来源

官方来源核查日期为 2026 年 9 月 29 日。工作流示例是计算示例与测试方法,不是实测用量,也不保证节省金额。

准备好把 AI 成本降低 89% 吗?

现在就开始使用 EvoLink,体验智能 API 路由的强大能力。