Seedance 2.5 已上线 EvoLink立即体验
概念插画:代码面板通过 API 网关连接发光的 AI 核心
guide

GPT-6 Astra API 接入指南:首次调用、档位选择、从 GPT-5.6 迁移与算清账

EvoLink Team
EvoLink Team
Product Team
2026年9月5日
21 分钟阅读
GPT-6 Astra 是 OpenAI 当前面向复杂编程、Computer Use、研究和 Agent 任务的旗舰模型。在 EvoLink 上 model ID 是 gpt-6-astra,与 GPT-5.6 共用同一个 OpenAI 兼容端点和 API Key,价格比 OpenAI 官方低 10%。
这篇是接入参考,不是发布新闻。内容包括:三种语言的首次请求、Chat Completions 与 Responses 在这个模型上的功能差异、推理档位怎么选、从 GPT-5.6 迁移要改哪几处、决定 Astra 比 Sol 贵还是便宜的三条计费规则,以及中文用户最常问的两件事:订阅额度和 API 按量哪个划算,怎么验中转站跑的是不是真 Astra。当前 EvoLink 价格、模型卡和成本计算器在 GPT-6 Astra API 页面
厂商与网关的能力范围。 下文模型能力依据 OpenAI 文档。EvoLink 使用此处列出的 endpoint,但文本请求成功不能证明图片输入、Batch/Flex/Fast、WebSocket 中途引导、异步工具、Pro 模式、configuration_update30m 缓存选项可用。这些功能在 EvoLink 上均需单独验证对应路由后再使用。

速查卡

项目
Model IDgpt-6-astra(OpenAI 和 EvoLink 都没有 gpt-6 别名)
端点https://api.evolink.ai/v1(OpenAI 兼容)
API 表面(OpenAI)Responses、Chat Completions(不支持工具调用)、Batch;EvoLink 的功能支持需单独验证
上下文1,050,000 Token,输入输出共用;最大输入 922,000;最大输出 128,000
模态文本、图片输入;文本输出
知识截止2026 年 4 月 30 日
推理档位lowmediumhighxhighmaxnoneminimal 返回 400
已移除参数temperaturetop_plogprobs
提示词缓存支持;缓存写入按输入价 1.25 倍;TTL 选项为 30m
OpenAI 标价(输入 ≤ 272K)每百万 Token:输入 $10 / 缓存读取 $1 / 缓存写入 $12.50 / 输出 $50
长上下文档(输入 > 272K)整单按输入与缓存 2 倍、输出 1.5 倍计
EvoLink 价格比官方价低 10%;当前数字见 API 页面
不支持微调、Realtime、Assistants、Embeddings、图像或音频生成

准备与首次请求

控制台 → Keys 创建。同一个 Key 可以调 GPT-5.6、Claude、Gemini 和 GPT-6 Astra。

第二步:装 OpenAI SDK

pip install openai        # Python
npm install openai        # Node.js

第三步:发第一个请求

先发送一个基础 Responses 请求。OpenAI 要求工具调用使用 Responses;高级 Responses 功能需在 EvoLink 对应路由上单独验证。

cURL:
curl https://api.evolink.ai/v1/responses \
  -H "Authorization: Bearer $EVOLINK_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gpt-6-astra",
    "input": "用一段话解释缓存读取和缓存写入的区别。",
    "reasoning": {"effort": "medium"}
  }'
Python:
from openai import OpenAI

client = OpenAI(
    api_key="your-evolink-api-key",
    base_url="https://api.evolink.ai/v1",
)

response = client.responses.create(
    model="gpt-6-astra",
    input="用一段话解释缓存读取和缓存写入的区别。",
    reasoning={"effort": "medium"},
)

print(response.output_text)
print(response.model, response.usage)
Node.js:
import OpenAI from "openai";

const client = new OpenAI({
  apiKey: "your-evolink-api-key",
  baseURL: "https://api.evolink.ai/v1",
});

const response = await client.responses.create({
  model: "gpt-6-astra",
  input: "用一段话解释缓存读取和缓存写入的区别。",
  reasoning: { effort: "medium" },
});

console.log(response.output_text);
console.log(response.model, response.usage);
第一次调用把 response.modelresponse.usage 打出来。返回的模型字符串应该是 gpt-6-astra,usage 里有输入、缓存、推理和输出四项 token 数,对账要靠它。

Chat Completions 上的纯文本请求

Chat Completions 可以跑纯文本。不要传 temperaturetop_ptools
response = client.chat.completions.create(
    model="gpt-6-astra",
    messages=[{"role": "user", "content": "把这份更新日志压缩成三条要点:..."}],
    reasoning_effort="low",
)
print(response.choices[0].message.content)

Chat Completions 与 Responses 的区别

本表描述 OpenAI API 的能力,包括文本和图片输入,并非 EvoLink 的功能支持表。图片输入及各项可选功能需在实际使用的路由上验证。该模型的 Chat Completions 不支持工具调用。
功能Chat CompletionsResponses API
文本进、文本出支持支持
图片输入支持支持
流式支持支持
结构化输出支持支持
提示词缓存支持支持
函数 / 工具调用不支持支持
异步工具调用不支持支持
中途引导(WebSocket response.steer不支持支持
对话中途改档位且保留缓存(configuration_update不支持支持
reasoning.mode: "pro"不支持支持
temperaturetop_plogprobs拒绝拒绝

如果你的 Agent 循环今天跑在 Chat Completions 上,要么迁到 Responses,要么留在 GPT-5.6:这条限制只针对 Astra,GPT-5.6 的工具调用在两个表面都能用。

一个 Responses 特有的坑:开了 Zero Data Retention 的组织不能用 previous_response_id,对话历史要显式放进 input

推理档位怎么选

Astra 有五档。OpenAI 官方只说了一句:之前用 noneminimal 的,从 low 起步再对比。发布后头几天公开迁移记录的开发者,编码任务上普遍从 medium 起步;中文社区的说法是"medium 就是甜点,max 消耗巨大"。这些是社区经验,不是 EvoLink 实测。
档位适合什么注意什么
low抽取、分类、短改写,以及原来在 GPT-5.6 上跑 none 的任务仍有推理 token,不是免费档
medium编码任务、多步工具调用、文档工作的默认起点第三方数据显示比 low 质量提升明显、成本增量温和
high仓库级改动、长研究链首 token 延迟和 token 消耗急剧上升
xhighhigh 过不了验收的高难 Agent 任务贵;用你自己的评测集确认
max不设限的推理预算第三方测得首 token 延迟以分钟计;离线 Batch 之外很少划算

OpenAI 还提供以下两项控制能力。EvoLink 对各项的支持尚未验证,以下作为上游文档参考:

  • configuration_update 让一段 Responses 对话在轮次之间改档位而不作废缓存。从 medium 起步,只把失败的轮次升档。
  • reasoning.mode: "pro" 是 Responses 上单独的质量模式,当作一个独立的评测候选,不要当第六档。

按请求设档位:

response = client.responses.create(
    model="gpt-6-astra",
    input=[{"role": "user", "content": "重构这个模块,并逐条解释改动。"}],
    reasoning={"effort": "high"},
    max_output_tokens=8000,
)

在 Responses 上调工具

函数工具用 Responses 的扁平格式。模型可能返回一个 function_call 项,执行后以 function_call_output 回传。
tools = [{
    "type": "function",
    "name": "get_build_status",
    "description": "返回某分支最近一次 CI 构建的状态。",
    "parameters": {
        "type": "object",
        "properties": {"branch": {"type": "string"}},
        "required": ["branch"],
    },
}]

first = client.responses.create(
    model="gpt-6-astra",
    input=[{"role": "user", "content": "main 分支绿了吗?没绿的话总结失败原因。"}],
    tools=tools,
    reasoning={"effort": "medium"},
)

calls = [item for item in first.output if item.type == "function_call"]
outputs = []
for call in calls:
    # 在这里执行你的工具
    outputs.append({
        "type": "function_call_output",
        "call_id": call.call_id,
        "output": '{"status": "failed", "step": "unit-tests", "log_url": "https://ci.example/123"}',
    })

second = client.responses.create(
    model="gpt-6-astra",
    input=[{"role": "user", "content": "main 分支绿了吗?没绿的话总结失败原因。"}]
          + list(first.output) + outputs,
    tools=tools,
    reasoning={"effort": "medium"},
)
print(second.output_text)
OpenAI 还文档化了异步工具调用:给函数工具加 "async": true,模型可在工具运行时继续推理。EvoLink 对此尚未验证;同步循环成功不能证明异步调用可用。

结构化输出与流式

结构化输出两个表面都支持。Responses 上通过 text.format 传 JSON Schema:
response = client.responses.create(
    model="gpt-6-astra",
    input="从这段文字里抽出 model ID、上下文窗口和最大输出:...",
    text={
        "format": {
            "type": "json_schema",
            "name": "model_spec",
            "schema": {
                "type": "object",
                "properties": {
                    "model_id": {"type": "string"},
                    "context_tokens": {"type": "integer"},
                    "max_output_tokens": {"type": "integer"},
                },
                "required": ["model_id", "context_tokens", "max_output_tokens"],
                "additionalProperties": False,
            },
            "strict": True,
        }
    },
    reasoning={"effort": "low"},
)
print(response.output_text)
流式在两个表面上都是 stream=True。高档位下首 token 可能要等几十秒,交互路径一律用流式并显示推理进度。

从 GPT-5.6 迁移

下表列出 OpenAI 的迁移要求。在 EvoLink 上切换流量前,需逐项验证请求字段和可选功能,不能仅凭更换模型 ID 判断兼容性。

改动GPT-5.6GPT-6 Astra
Model IDgpt-5.6-solgpt-5.6-terragpt-5.6-lunagpt-6-astra
采样参数接受 temperaturetop_p删掉,否则 400
推理档位 none / minimal接受改成 low
工具调用表面Chat Completions 或 Responses仅 Responses
缓存选项prompt_cache_retentionprompt_cache_options: {"ttl": "30m"}
ZDR 下的对话状态previous_response_id把历史放进 input
Codex CLI近期版本均可0.153.0 以上

一个典型 Chat Completions 调用的 diff:

 response = client.chat.completions.create(
-    model="gpt-5.6-sol",
+    model="gpt-6-astra",
     messages=messages,
-    temperature=0.2,
-    reasoning_effort="none",
+    reasoning_effort="low",
 )
行为也会变。OpenAI 的指南说 Astra 在多步任务上保持连贯的时间更长、更常反问澄清、对 AGENTS.md 这类文件里的指令跟得更死、偏好列表和表格。早期用户也报告了反向问题:一个小需求改出两万多行。系统提示里把"最小改动"写明确,并保留 GPT-5.6 路由随时回退。
切流量前在两个模型上跑同一批固定任务。GPT-6 Astra vs GPT-5.6 对比里有每个合格任务成本的公式和一套可起步的路由规则。

三条计费规则:272K、缓存、Batch 与 Flex

Astra 在某个负载上比 Sol 贵还是便宜,由三条规则决定。下面按 OpenAI 标价算,EvoLink 价格再低 10%,见 API 页面

规则一:输入超过 272K,整单重新计价

输入与缓存费率翻倍,输出费率 1.5 倍,按整个请求计,不是只算超出的部分。

请求输入费用输出费用(20K token)合计
272,000 输入 token272K × $10 = $2.7220K × $50 = $1.00$3.72
280,000 输入 token280K × $20 = $5.6020K × $75 = $1.50$7.10

多出 8,000 个 token,账单接近翻倍。发送前先数 token,接近阈值就压缩上下文,或者把请求路由到 GPT-5.6 Sol,它的长上下文费率是 $8 / $30。

规则二:缓存从第一次复用就划算

缓存写入每百万 $12.50(输入价 1.25 倍),缓存读取每百万 $1.00。一段共享前缀再发送 k 次:
  • 不缓存:每百万前缀 token 10 × (k + 1) 美元
  • 缓存:12.50 + 1 × k
k = 1 时是 $20 对 $13.50,第一次复用就赚回来,之后差距越拉越大。把稳定内容(系统提示、工具 schema、参考文档)放在输入最前面,并注意 30 分钟 TTL:会话空闲更久要再付一次写入。

规则三:Batch 和 Flex 半价

OpenAI 的 Batch 和 Flex 按 Standard 的 50% 计价,可用于评估离线测试、夜间处理和数据回填。Fast 模式为 2 倍价,Astra 没有延迟 SLA,且不适用于欧盟数据驻留。EvoLink 对这些模式的支持和计费尚未验证,不能直接把上游折扣用于 EvoLink 成本估算。

三条规则合起来

下表是基于 OpenAI 能力的评估候选配置。通过 EvoLink 使用 Batch 或 configuration_update 前,须先验证对应路由是否支持。
负载最省钱的安全配置
交互式编码 Agent,上下文 50K–150KResponses,medium,开缓存,上下文控制在 272K 以下
夜间仓库分析Batch,high,分块在 272K 以下
大规模短抽取Chat Completions,low;质量允许的话用 GPT-5.6 Terra / Luna
带重试的长研究链Responses,medium 起步用 configuration_update 升档,回退到 Sol

订阅额度还是 API 按量

发布后中文社区讨论最多的不是 API,是 Codex 和 ChatGPT 订阅里的额度:Astra 在 Codex 订阅中的消耗是 Sol 的 2.5 倍,有人 Plus 一小时烧掉一周额度,有人 Pro 20x 开 xhigh 一轮消耗 4%。这类账和 API 账的算法不一样:

  • 订阅额度按套餐周期重置,用完就等;超过重置周期的工作只能升套餐或拆到多个账号。
  • API 按量按 token 计,没有周上限,但每一个 token 都在账单上。

对"每天都要跑 Agent"的团队,用 API 按量把大任务放到 Batch、把重复上下文放进缓存,通常比多买几个订阅可控。对"偶尔用、不想算账"的个人,订阅仍然简单。两边都要看的是同一个数字:每个合格任务花了多少钱。上一节的三条规则决定了 API 侧这个数字的下限。

怎么验中转站跑的是不是真 Astra

发布 48 小时内,中文社区同时出现了大量"中转站已上架 GPT-6 Astra"和"疑似降智""其实是 4o"的帖子,倍率从官方价 0.1 倍到 2.9 倍都有。0.1 倍的价格低于 OpenAI 的 Batch 半价,自己就说明问题。不猜的验法有三个,都是 Astra 独有的行为:

  1. temperature 真 Astra 返回 400,旧模型照常返回。
  2. reasoning_effort 设成 none 真 Astra 拒绝,GPT-5.6 接受。
  3. 看返回体。 model 字段是不是 gpt-6-astrausage 里有没有 reasoning token 计数。没有推理 token 的不是 Astra。

第四个办法更稳但要花钱:问一个知识截止日期附近(2026 年 4 月)的事实,Astra 的截止日期是 4 月 30 日,GPT-5.6 Sol 是 2 月 16 日。

EvoLink 的路由在开放前完成了返回身份、价格、账单和请求行为核验,价格公开在产品页,不做倍率游戏。

限速与回退

OpenAI 按使用层级公布了 Astra 的限速。这些数字重要,因为一个满上下文的请求就可能超过每分钟的 token 预算。

OpenAI 层级每分钟请求数每分钟 token 数
Tier 1500500,000
Tier 25,0001,000,000
Tier 35,0002,000,000
Tier 410,0004,000,000
Tier 515,00040,000,000

EvoLink 的限额按账号设置,压测前先看控制台。三类失败要单独处理:

  1. 请求形状导致的 400。 temperaturetop_pnone 档,或在 Chat Completions 上带 tools。改请求,不要重试。
  2. 429 或 5xx。 退避重试,然后同一个 Key 回退到 gpt-5.6-sol超时、重试与回退指南讲了这套模式。
  3. 被 OpenAI 安全监控停掉的任务。 Astra 运行时有异步错位监控,触发后 API 任务直接停止。记日志、通知操作员、把任务路由到回退模型,不要循环重试。
def call_with_fallback(**kwargs):
    for model in ("gpt-6-astra", "gpt-5.6-sol"):
        try:
            return client.responses.create(model=model, **kwargs)
        except Exception as err:  # 生产环境收窄到 429/5xx
            last = err
    raise last

常见问题

GPT-6 的 model ID 是什么?

gpt-6-astra。OpenAI 和 EvoLink 都没有 gpt-6 通用别名,Chat Completions 和 Responses 用同一个字符串。

GPT-6 Astra 在 Chat Completions 上能调工具吗?

不能。OpenAI 文档规定该模型的工具调用仅支持 Responses;Chat Completions 可接收文本和图片输入。通过 EvoLink 发送图片仍需验证对应路由。

推理档位从哪一档起步?

编码和 Agent 任务从 medium 起步,原先使用 noneminimal 的任务从 low 起步。OpenAI 提供 configuration_update 按任务升档;通过 EvoLink 使用前须验证对应路由。

GPT-6 Astra 接受 temperature 参数吗?

不接受。temperaturetop_plogprobs 都返回 400,从请求里删掉。

输入超过 272K 的请求怎么计费?

整个请求进入长上下文档:输入与缓存 2 倍、输出 1.5 倍。先数 token,接近阈值就压缩或拆分。

从 GPT-5.6 迁移要改什么?

更换模型 ID,移除 temperaturetop_p,把 none 映射到 low,并将工具调用迁移到 Responses。OpenAI 还调整了缓存选项。EvoLink 的 endpoint 和 Key 保持一致;缓存选项及高级功能需在迁移前逐项验证。

中转站的 GPT-6 Astra 怎么验真假?

temperature 看是否 400、reasoning_effortnone 看是否被拒、看返回体的 model 字段和 reasoning token 计数。三个都过才是 Astra。

GPT-6 Astra 上 Amazon Bedrock 了吗?

截至 2026 年 9 月 5 日没有。OpenAI 点名了 Bedrock,但 AWS 的 OpenAI 模型卡仍止于 GPT-5.6。Azure Foundry 已 GA。发布追踪会在状态变化时更新。
GPT-6 Astra API 页面,列出比 OpenAI 官方低 10% 的默认组价格、长上下文档位和计算器。
在 EvoLink 调用 GPT-6 Astra

来源

证据最后核验于 2026 年 9 月 5 日。厂商事实来自 OpenAI 文档;社区的档位经验和额度反馈均注明来源,不是 EvoLink 实测。当前 EvoLink 价格以 API 页面为准。

准备好把 AI 成本降低 89% 吗?

现在就开始使用 EvoLink,体验智能 API 路由的强大能力。