
GPT-6 Astra API 接入指南:首次调用、档位选择、从 GPT-5.6 迁移与算清账

gpt-6-astra,与 GPT-5.6 共用同一个 OpenAI 兼容端点和 API Key,价格比 OpenAI 官方低 10%。configuration_update 或 30m 缓存选项可用。这些功能在 EvoLink 上均需单独验证对应路由后再使用。速查卡
| 项目 | 值 |
|---|---|
| Model ID | gpt-6-astra(OpenAI 和 EvoLink 都没有 gpt-6 别名) |
| 端点 | https://api.evolink.ai/v1(OpenAI 兼容) |
| API 表面(OpenAI) | Responses、Chat Completions(不支持工具调用)、Batch;EvoLink 的功能支持需单独验证 |
| 上下文 | 1,050,000 Token,输入输出共用;最大输入 922,000;最大输出 128,000 |
| 模态 | 文本、图片输入;文本输出 |
| 知识截止 | 2026 年 4 月 30 日 |
| 推理档位 | low、medium、high、xhigh、max;none 和 minimal 返回 400 |
| 已移除参数 | temperature、top_p、logprobs |
| 提示词缓存 | 支持;缓存写入按输入价 1.25 倍;TTL 选项为 30m |
| OpenAI 标价(输入 ≤ 272K) | 每百万 Token:输入 $10 / 缓存读取 $1 / 缓存写入 $12.50 / 输出 $50 |
| 长上下文档(输入 > 272K) | 整单按输入与缓存 2 倍、输出 1.5 倍计 |
| EvoLink 价格 | 比官方价低 10%;当前数字见 API 页面 |
| 不支持 | 微调、Realtime、Assistants、Embeddings、图像或音频生成 |
准备与首次请求
第一步:拿 EvoLink API Key
第二步:装 OpenAI SDK
pip install openai # Python
npm install openai # Node.js第三步:发第一个请求
先发送一个基础 Responses 请求。OpenAI 要求工具调用使用 Responses;高级 Responses 功能需在 EvoLink 对应路由上单独验证。
curl https://api.evolink.ai/v1/responses \
-H "Authorization: Bearer $EVOLINK_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gpt-6-astra",
"input": "用一段话解释缓存读取和缓存写入的区别。",
"reasoning": {"effort": "medium"}
}'from openai import OpenAI
client = OpenAI(
api_key="your-evolink-api-key",
base_url="https://api.evolink.ai/v1",
)
response = client.responses.create(
model="gpt-6-astra",
input="用一段话解释缓存读取和缓存写入的区别。",
reasoning={"effort": "medium"},
)
print(response.output_text)
print(response.model, response.usage)import OpenAI from "openai";
const client = new OpenAI({
apiKey: "your-evolink-api-key",
baseURL: "https://api.evolink.ai/v1",
});
const response = await client.responses.create({
model: "gpt-6-astra",
input: "用一段话解释缓存读取和缓存写入的区别。",
reasoning: { effort: "medium" },
});
console.log(response.output_text);
console.log(response.model, response.usage);response.model 和 response.usage 打出来。返回的模型字符串应该是 gpt-6-astra,usage 里有输入、缓存、推理和输出四项 token 数,对账要靠它。Chat Completions 上的纯文本请求
temperature、top_p 或 tools:response = client.chat.completions.create(
model="gpt-6-astra",
messages=[{"role": "user", "content": "把这份更新日志压缩成三条要点:..."}],
reasoning_effort="low",
)
print(response.choices[0].message.content)Chat Completions 与 Responses 的区别
| 功能 | Chat Completions | Responses API |
|---|---|---|
| 文本进、文本出 | 支持 | 支持 |
| 图片输入 | 支持 | 支持 |
| 流式 | 支持 | 支持 |
| 结构化输出 | 支持 | 支持 |
| 提示词缓存 | 支持 | 支持 |
| 函数 / 工具调用 | 不支持 | 支持 |
| 异步工具调用 | 不支持 | 支持 |
中途引导(WebSocket response.steer) | 不支持 | 支持 |
对话中途改档位且保留缓存(configuration_update) | 不支持 | 支持 |
reasoning.mode: "pro" | 不支持 | 支持 |
temperature、top_p、logprobs | 拒绝 | 拒绝 |
如果你的 Agent 循环今天跑在 Chat Completions 上,要么迁到 Responses,要么留在 GPT-5.6:这条限制只针对 Astra,GPT-5.6 的工具调用在两个表面都能用。
previous_response_id,对话历史要显式放进 input。推理档位怎么选
none 或 minimal 的,从 low 起步再对比。发布后头几天公开迁移记录的开发者,编码任务上普遍从 medium 起步;中文社区的说法是"medium 就是甜点,max 消耗巨大"。这些是社区经验,不是 EvoLink 实测。| 档位 | 适合什么 | 注意什么 |
|---|---|---|
low | 抽取、分类、短改写,以及原来在 GPT-5.6 上跑 none 的任务 | 仍有推理 token,不是免费档 |
medium | 编码任务、多步工具调用、文档工作的默认起点 | 第三方数据显示比 low 质量提升明显、成本增量温和 |
high | 仓库级改动、长研究链 | 首 token 延迟和 token 消耗急剧上升 |
xhigh | high 过不了验收的高难 Agent 任务 | 贵;用你自己的评测集确认 |
max | 不设限的推理预算 | 第三方测得首 token 延迟以分钟计;离线 Batch 之外很少划算 |
OpenAI 还提供以下两项控制能力。EvoLink 对各项的支持尚未验证,以下作为上游文档参考:
configuration_update让一段 Responses 对话在轮次之间改档位而不作废缓存。从medium起步,只把失败的轮次升档。reasoning.mode: "pro"是 Responses 上单独的质量模式,当作一个独立的评测候选,不要当第六档。
按请求设档位:
response = client.responses.create(
model="gpt-6-astra",
input=[{"role": "user", "content": "重构这个模块,并逐条解释改动。"}],
reasoning={"effort": "high"},
max_output_tokens=8000,
)在 Responses 上调工具
function_call 项,执行后以 function_call_output 回传。tools = [{
"type": "function",
"name": "get_build_status",
"description": "返回某分支最近一次 CI 构建的状态。",
"parameters": {
"type": "object",
"properties": {"branch": {"type": "string"}},
"required": ["branch"],
},
}]
first = client.responses.create(
model="gpt-6-astra",
input=[{"role": "user", "content": "main 分支绿了吗?没绿的话总结失败原因。"}],
tools=tools,
reasoning={"effort": "medium"},
)
calls = [item for item in first.output if item.type == "function_call"]
outputs = []
for call in calls:
# 在这里执行你的工具
outputs.append({
"type": "function_call_output",
"call_id": call.call_id,
"output": '{"status": "failed", "step": "unit-tests", "log_url": "https://ci.example/123"}',
})
second = client.responses.create(
model="gpt-6-astra",
input=[{"role": "user", "content": "main 分支绿了吗?没绿的话总结失败原因。"}]
+ list(first.output) + outputs,
tools=tools,
reasoning={"effort": "medium"},
)
print(second.output_text)"async": true,模型可在工具运行时继续推理。EvoLink 对此尚未验证;同步循环成功不能证明异步调用可用。结构化输出与流式
text.format 传 JSON Schema:response = client.responses.create(
model="gpt-6-astra",
input="从这段文字里抽出 model ID、上下文窗口和最大输出:...",
text={
"format": {
"type": "json_schema",
"name": "model_spec",
"schema": {
"type": "object",
"properties": {
"model_id": {"type": "string"},
"context_tokens": {"type": "integer"},
"max_output_tokens": {"type": "integer"},
},
"required": ["model_id", "context_tokens", "max_output_tokens"],
"additionalProperties": False,
},
"strict": True,
}
},
reasoning={"effort": "low"},
)
print(response.output_text)stream=True。高档位下首 token 可能要等几十秒,交互路径一律用流式并显示推理进度。从 GPT-5.6 迁移
下表列出 OpenAI 的迁移要求。在 EvoLink 上切换流量前,需逐项验证请求字段和可选功能,不能仅凭更换模型 ID 判断兼容性。
| 改动 | GPT-5.6 | GPT-6 Astra |
|---|---|---|
| Model ID | gpt-5.6-sol、gpt-5.6-terra、gpt-5.6-luna | gpt-6-astra |
| 采样参数 | 接受 temperature、top_p | 删掉,否则 400 |
推理档位 none / minimal | 接受 | 改成 low |
| 工具调用表面 | Chat Completions 或 Responses | 仅 Responses |
| 缓存选项 | prompt_cache_retention | prompt_cache_options: {"ttl": "30m"} |
| ZDR 下的对话状态 | previous_response_id | 把历史放进 input |
| Codex CLI | 近期版本均可 | 0.153.0 以上 |
一个典型 Chat Completions 调用的 diff:
response = client.chat.completions.create(
- model="gpt-5.6-sol",
+ model="gpt-6-astra",
messages=messages,
- temperature=0.2,
- reasoning_effort="none",
+ reasoning_effort="low",
)AGENTS.md 这类文件里的指令跟得更死、偏好列表和表格。早期用户也报告了反向问题:一个小需求改出两万多行。系统提示里把"最小改动"写明确,并保留 GPT-5.6 路由随时回退。三条计费规则:272K、缓存、Batch 与 Flex
规则一:输入超过 272K,整单重新计价
输入与缓存费率翻倍,输出费率 1.5 倍,按整个请求计,不是只算超出的部分。
| 请求 | 输入费用 | 输出费用(20K token) | 合计 |
|---|---|---|---|
| 272,000 输入 token | 272K × $10 = $2.72 | 20K × $50 = $1.00 | $3.72 |
| 280,000 输入 token | 280K × $20 = $5.60 | 20K × $75 = $1.50 | $7.10 |
多出 8,000 个 token,账单接近翻倍。发送前先数 token,接近阈值就压缩上下文,或者把请求路由到 GPT-5.6 Sol,它的长上下文费率是 $8 / $30。
规则二:缓存从第一次复用就划算
k 次:- 不缓存:每百万前缀 token
10 × (k + 1)美元 - 缓存:
12.50 + 1 × k
k = 1 时是 $20 对 $13.50,第一次复用就赚回来,之后差距越拉越大。把稳定内容(系统提示、工具 schema、参考文档)放在输入最前面,并注意 30 分钟 TTL:会话空闲更久要再付一次写入。规则三:Batch 和 Flex 半价
OpenAI 的 Batch 和 Flex 按 Standard 的 50% 计价,可用于评估离线测试、夜间处理和数据回填。Fast 模式为 2 倍价,Astra 没有延迟 SLA,且不适用于欧盟数据驻留。EvoLink 对这些模式的支持和计费尚未验证,不能直接把上游折扣用于 EvoLink 成本估算。
三条规则合起来
configuration_update 前,须先验证对应路由是否支持。| 负载 | 最省钱的安全配置 |
|---|---|
| 交互式编码 Agent,上下文 50K–150K | Responses,medium,开缓存,上下文控制在 272K 以下 |
| 夜间仓库分析 | Batch,high,分块在 272K 以下 |
| 大规模短抽取 | Chat Completions,low;质量允许的话用 GPT-5.6 Terra / Luna |
| 带重试的长研究链 | Responses,medium 起步用 configuration_update 升档,回退到 Sol |
订阅额度还是 API 按量
发布后中文社区讨论最多的不是 API,是 Codex 和 ChatGPT 订阅里的额度:Astra 在 Codex 订阅中的消耗是 Sol 的 2.5 倍,有人 Plus 一小时烧掉一周额度,有人 Pro 20x 开 xhigh 一轮消耗 4%。这类账和 API 账的算法不一样:
- 订阅额度按套餐周期重置,用完就等;超过重置周期的工作只能升套餐或拆到多个账号。
- API 按量按 token 计,没有周上限,但每一个 token 都在账单上。
对"每天都要跑 Agent"的团队,用 API 按量把大任务放到 Batch、把重复上下文放进缓存,通常比多买几个订阅可控。对"偶尔用、不想算账"的个人,订阅仍然简单。两边都要看的是同一个数字:每个合格任务花了多少钱。上一节的三条规则决定了 API 侧这个数字的下限。
怎么验中转站跑的是不是真 Astra
发布 48 小时内,中文社区同时出现了大量"中转站已上架 GPT-6 Astra"和"疑似降智""其实是 4o"的帖子,倍率从官方价 0.1 倍到 2.9 倍都有。0.1 倍的价格低于 OpenAI 的 Batch 半价,自己就说明问题。不猜的验法有三个,都是 Astra 独有的行为:
- 传
temperature。 真 Astra 返回 400,旧模型照常返回。 reasoning_effort设成none。 真 Astra 拒绝,GPT-5.6 接受。- 看返回体。
model字段是不是gpt-6-astra,usage里有没有 reasoning token 计数。没有推理 token 的不是 Astra。
第四个办法更稳但要花钱:问一个知识截止日期附近(2026 年 4 月)的事实,Astra 的截止日期是 4 月 30 日,GPT-5.6 Sol 是 2 月 16 日。
限速与回退
OpenAI 按使用层级公布了 Astra 的限速。这些数字重要,因为一个满上下文的请求就可能超过每分钟的 token 预算。
| OpenAI 层级 | 每分钟请求数 | 每分钟 token 数 |
|---|---|---|
| Tier 1 | 500 | 500,000 |
| Tier 2 | 5,000 | 1,000,000 |
| Tier 3 | 5,000 | 2,000,000 |
| Tier 4 | 10,000 | 4,000,000 |
| Tier 5 | 15,000 | 40,000,000 |
EvoLink 的限额按账号设置,压测前先看控制台。三类失败要单独处理:
- 请求形状导致的 400。
temperature、top_p、none档,或在 Chat Completions 上带tools。改请求,不要重试。 - 429 或 5xx。 退避重试,然后同一个 Key 回退到
gpt-5.6-sol。超时、重试与回退指南讲了这套模式。 - 被 OpenAI 安全监控停掉的任务。 Astra 运行时有异步错位监控,触发后 API 任务直接停止。记日志、通知操作员、把任务路由到回退模型,不要循环重试。
def call_with_fallback(**kwargs):
for model in ("gpt-6-astra", "gpt-5.6-sol"):
try:
return client.responses.create(model=model, **kwargs)
except Exception as err: # 生产环境收窄到 429/5xx
last = err
raise last常见问题
GPT-6 的 model ID 是什么?
gpt-6-astra。OpenAI 和 EvoLink 都没有 gpt-6 通用别名,Chat Completions 和 Responses 用同一个字符串。GPT-6 Astra 在 Chat Completions 上能调工具吗?
不能。OpenAI 文档规定该模型的工具调用仅支持 Responses;Chat Completions 可接收文本和图片输入。通过 EvoLink 发送图片仍需验证对应路由。
推理档位从哪一档起步?
medium 起步,原先使用 none 或 minimal 的任务从 low 起步。OpenAI 提供 configuration_update 按任务升档;通过 EvoLink 使用前须验证对应路由。GPT-6 Astra 接受 temperature 参数吗?
temperature、top_p、logprobs 都返回 400,从请求里删掉。输入超过 272K 的请求怎么计费?
整个请求进入长上下文档:输入与缓存 2 倍、输出 1.5 倍。先数 token,接近阈值就压缩或拆分。
从 GPT-5.6 迁移要改什么?
temperature 和 top_p,把 none 映射到 low,并将工具调用迁移到 Responses。OpenAI 还调整了缓存选项。EvoLink 的 endpoint 和 Key 保持一致;缓存选项及高级功能需在迁移前逐项验证。中转站的 GPT-6 Astra 怎么验真假?
temperature 看是否 400、reasoning_effort 设 none 看是否被拒、看返回体的 model 字段和 reasoning token 计数。三个都过才是 Astra。GPT-6 Astra 上 Amazon Bedrock 了吗?
EvoLink 上 GPT-6 Astra 的价格在哪看?
来源
- OpenAI:GPT-6 Astra 模型文档
- OpenAI:GPT-6 Astra 模型指南(迁移、不支持的参数、工具调用仅 Responses)
- OpenAI:推理指南
- OpenAI:提示词缓存指南
- OpenAI:Fast 模式指南
- OpenAI:限速指南
- OpenAI API 价格
- OpenAI:GPT-6 Astra 发布说明
- AWS:Amazon Bedrock 的 OpenAI 模型卡
- Shinsuke Kagawa:从 GPT-5.6 Sol 切到 GPT-6 Astra,从 medium 档开始


