GPT Image 2.5 Flare 与 Sunburst 已上线 EvoLink立即体验

Grok 4.6 API

通过 EvoLink 统一对话 API 接入 xAI 的 Grok 4.6(也常被搜索为 grok-4-6)。集成前可先测试推理、工具调用、服务端工具。

xAI文本生成可用
$1.700 / 百万输入 Token 起$2.000 官方价-15%
API 文档
长上下文推理可配置推理服务端工具Chat + Responses
生产路由已上线
上下文
500K 上下文 · 最大输出 450K
适用场景
高难推理、带服务端工具的研究、长上下文分析
可输入
文本 + 图像
输出形态
文本 · JSON(结构化输出)· 工具调用

选择 Grok 4.6

用于评估复杂推理、长上下文分析、研究,以及文本生成与 xAI 服务端工具的组合工作流。

Grok 4.6

xAI 推理与工具调用模型

已选择
模型 ID
grok-4.6
适合

联网与 X 搜索研究、代码辅助分析、文档与集合检索、复杂推理,以及需要跨提供方回退的生产流量。

< 200K
输入
$1.700 / 1M-15%
115.6 cr / 1M$2.000官方价
缓存读取
$0.425 / 1M-15%
28.9 cr / 1M$0.500官方价
输出
$5.100 / 1M-15%
346.8 cr / 1M$6.000官方价
≥ 200K
输入
$3.400 / 1M-15%
231.2 cr / 1M$4.000官方价
缓存读取
$0.850 / 1M-15%
57.8 cr / 1M$1.000官方价
输出
$10.200 / 1M-15%
693.6 cr / 1M$12.000官方价

所有费率按每百万 Token 计,同时显示美元与 Credits,以你账户当前的价格为准。 提示 Token 超过 200K 后进入长上下文档位,所有 Token 角色按 ×2 计费。

Grok 4.6 价格

集成前先估算一次 Grok 4.6 请求的费用。计算器按你账户的当前费率计算,官方价格仅作对照。

请求费用计算器

输入一次请求的 Token 组合和成功的工具调用次数。

单次请求预估

Grok 4.6
短上下文费率
USD$0.0034
Credits0.2255

官方价预估 $0.0039 · 省 $0.0006(15%)

输入 Token0.1156 cr
缓存读取 Token0.0058 cr
输出 Token0.1041 cr

最低计费:每次请求 0.01 Credits。 提示 Token 达到 200K 时,所有 Token 角色按 ×2 计费;工具调用不乘倍率。

预算指南

按当前 Token 组合估算可发起的请求数。
充值 Credits
$10
约 3015 次请求

快速测试

$50
约 15077 次请求

日常开发

$100
约 30155 次请求

生产评估

服务端工具费率

只有成功的服务端调用按次计费;失败的尝试不收工具费,但 Token 照常计费。
  • 网页搜索$0.0050/ 次0.34 cr / 次
  • X 搜索$0.0050/ 次0.34 cr / 次
  • 代码执行$0.0050/ 次0.34 cr / 次
  • 附件搜索$0.010/ 次0.68 cr / 次
  • 集合搜索$0.0025/ 次0.17 cr / 次

Grok 4.6 API 是什么?

Grok 4.6 是 xAI 面向编程 Agent、联网研究、长文档分析和工具工作流的推理模型。页面 URL 使用 grok-4-6,实际请求模型 ID 为 grok-4.6。Grok 4.6 已在 EvoLink 生产路由正式可用;可在下方 Pricing 与 API 区查看价格边界、支持方式和模型配置。

Grok 4.6 在 EvoLink 上以模型 ID grok-4.6 提供,支持 Chat Completions · Responses,和其他模型共用同一把 API 密钥与余额。它提供 500K 上下文窗口,最大输出 450K Token,并支持推理、工具调用、服务端工具。

Grok 4.6

Grok 4.6 规格与能力

数字取自 EvoLink 路由配置;能力以 API 当前实际提供为准。

上下文窗口
500K Token
最大输出
450K Token
输入
文本 + 图像
输出
文本 · JSON(结构化输出)· 工具调用
推理
可配置推理强度
工具调用
函数调用,支持多步工具序列
提示缓存
自动缓存读取,享较低费率
服务端工具
网页搜索、X 搜索、代码执行、附件搜索、集合搜索,按成功调用次数计费
长上下文档位
提示 Token 超过 200K 后按 ×2 计费
协议
Chat Completions · Responses
模型 ID
grok-4.6

grok-4-6 是页面 URL 写法;Chat Completions 与 Responses 请求必须使用这里展示的真实模型 ID。

Grok 4.6 API 适合哪些任务?

Grok 4.6 的 50 万 Token 上下文、可配置推理、图片输入和工具能力,主要服务于需要持续保留证据、调用外部工具并交付可验证结果的任务。下面按工作负载说明它可能带来的价值,以及接入前应确认的边界。

仓库级编程与代码审查

把相关源码、Issue、测试结果和历史修改放进同一任务,适合跨文件定位问题、生成修改计划和审查变更。上线前应使用固定仓库任务检查测试通过率、未完成步骤、结构化结果和人工修正量,不能只凭一次演示判断编程能力。

长文档与多来源分析

50 万 Token 上下文可以同时容纳长报告、合同、知识库片段、历史消息和检索结果。更大的上下文不一定带来更好的答案;应检查关键证据是否被保留,并结合 Pricing 区的长上下文档位与缓存输入价格评估每个可接受结果的成本。

联网研究与工具工作流

Grok 4.6 可用于组合 Web 搜索、X 搜索、代码执行、附件搜索和集合搜索,形成带来源的研究结果。通过 EvoLink 使用时,可以结合页面的 API 与 Pricing 信息了解工具支持、Token 用量和按次费用,再按实际研究流程测试引用与结果质量。

结构化输出与 Agent 编排

文本与图片输入可以进入 JSON Schema、函数调用和多步骤 Agent 流程,用于抽取、审查和下游自动化。生产接入前应测试 Schema 有效率、函数参数、流式结束事件,以及工具失败后是否能够安全恢复。

通过不同平台使用 Grok 4.6,有哪些差别?

即使使用同一个模型,不同接入平台提供的上下文配置、工具支持、用量展示和计费方式也可能不同。通过 EvoLink 接入时,可以在统一 API 下查看模型配置与用量,并让后续模型切换保持简单。

使用正确的 API 模型 ID

grok-4-6 是页面 URL 与常见搜索写法,API 请求使用的模型 ID 是 grok-4.6。现有 Chat Completions 或 Responses 应用只需在模型配置中使用正确 ID,具体字段可继续查看页面 API 区。

以当前 API 通道的配置为准

xAI 记录的模型窗口为 50 万 Token,但不同平台可能提供不同的上下文配置、工具集合和限流方式。通过 EvoLink 使用时,以当前页面展示的模型配置、可用功能和实际 usage 为准。

按工作流选择 Chat 或 Responses

普通聊天、流式输出和客户端函数可以从 Chat Completions 开始;需要研究 Agent、服务端搜索或代码执行时,再选择 Responses。这样可以沿用熟悉的 OpenAI 风格接入,同时避免加入暂时不需要的复杂度。

在统一网关中保留模型选择空间

通过 EvoLink 使用同一套账号、余额和 API 方式接入 Grok、GPT、Claude 与 Kimi。模型选择保持在配置层后,可以根据任务质量、成本和可用性调整路由,而不必为每个供应商重复改造业务代码。

如何更准确地控制 Grok 4.6 API 成本?

现有 Pricing 区负责展示实时 Token 与工具价格。实际使用时,还可以通过缓存、上下文管理、推理设置和模型路由减少不必要的消耗,让成本与完成的业务任务对应起来。

让重复上下文更容易使用缓存

稳定的系统提示、工具 Schema 和共享上下文更适合复用缓存。按所选协议配置支持的缓存或会话标识,并从 usage 中查看 cached tokens,可以更准确地判断重复请求是否获得了缓存收益。

只发送当前任务真正需要的上下文

50 万 Token 窗口适合大型代码库和长文档,但并不意味着每次请求都要填满。优先选择与当前任务相关的文件、对话和检索结果,可以减少输入成本,也更容易让模型聚焦关键证据。

按任务调整推理、输出与工具调用

简单任务可以从较低 reasoning effort 和较短输出开始,复杂分析再逐步增加推理预算。研究与 Agent 工作流还应关注工具调用次数,避免重复搜索、重复执行或无效循环带来额外消耗。

按完成任务的总成本比较模型

将 Token、缓存输入、服务端工具和必要重试放到同一个任务中评估。EvoLink 集中展示模型与用量,便于团队比较 Grok 4.6 与其他路由完成相同工作所需的总费用。

两种方式使用 Grok 4.6:EvoLink API 或 Agent

产品后端与批量任务走 EvoLink API;编码与分析类工作可直接在 Codex、Claude、Gemini 里调用 Grok 4.6。两条路径共用同一把 EvoLink API 密钥、余额、模型 ID 与请求记录。

方式一

用 EvoLink API 接入

适合:产品后端、批量任务、自动化流水线

向 EvoLink 发送 OpenAI 兼容的 Chat Completions(或 Anthropic Messages)请求,自行控制模型 ID、系统提示、输出预算、工具与结构化输出。

  1. 1在控制台创建 EvoLink API 密钥
  2. 2把 OpenAI 或 Anthropic SDK 的 base URL 指向 EvoLink,并选择上方显示的模型 ID
  3. 3先发一条有代表性的请求,从 usage 字段读取输入、缓存与输出 token
  4. 4按任务设置 max_tokens 与重试;多轮时保留 tool-call ID 与工具结果
方式二

用 Agent 调用

适合:在 Codex、Claude、Gemini 里做编码、评审与分析

把任务、要带入的材料和验收标准交给 Agent,由它组装请求、通过 EvoLink 调用 Grok 4.6,并把回答连同 token 用量一起返回。

  1. 1在本地环境变量里配置 EVOLINK_API_KEY,不要写进代码或提示词
  2. 2描述任务、要带入的材料和期望的输出格式
  3. 3让 Agent 通过 EvoLink 调用 Grok 4.6,并在发送前先展示请求
  4. 4让 Agent 汇报回答、token 用量和任何错误信息

Grok 4.6 API 代码示例与错误处理

这个示例是最短可运行的请求:一条 OpenAI 兼容的 Chat Completions 调用,带系统提示、用户消息和输出预算。完整参数与响应说明见 API 标签页。

查看完整 API 文档
cURL
curl -X POST https://api.evolink.ai/v1/chat/completions \
  -H "Authorization: Bearer $EVOLINK_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "grok-4.6",
    "messages": [
      { "role": "system", "content": "You are a research assistant. Cite sources." },
      { "role": "user", "content": "Summarize the three most important changes in <topic> this month." }
    ],
    "max_tokens": 2048,
    "temperature": 0.2
  }'

# Server-side tools (web search, X search, code execution, attachment /
# collections search)
# run on /v1/responses with the same model ID and are billed per successful
# call.
# The response includes choices[0].message and a usage object (prompt,
# cached, and completion tokens).

请求无效或参数不支持

对照 API 文档检查模型 ID、messages 数组和参数范围,去掉该路由不支持的字段。

鉴权或余额问题

检查 Authorization bearer token,并在控制台确认可用余额。

超出上下文长度

提示词 token 超过了 Grok 4.6 的上下文窗口。裁剪或只检索相关材料,并复用缓存前缀。

触发限流(429)

退避并带抖动重试;用批处理或队列代替并发突发。

内容或工具调用被拒

重试前检查敏感内容、格式错误的 tool-call 参数和 JSON schema 不匹配。

Grok 4.6 的 Chat Completions、Responses 与生产流量怎么选?

两种协议服务于不同工作流。这里给出选型摘要;具体请求字段继续以页面 API 区和 EvoLink 文档为准,价格与工具调用费用继续以现有 Pricing 区为准。

01

普通对话与客户端函数:Chat Completions

已有 OpenAI 兼容聊天、流式响应或客户端 function calling 流程时,优先从 Chat Completions 开始。重点确认消息格式、流式结束、函数参数和 usage 是否与现有客户端预期一致。

对话与客户端函数
02

研究 Agent 与服务端工具:Responses

需要 Web/X 搜索、代码执行、附件或集合搜索,以及更长的多步骤 Agent 流程时,再评估 Responses。接入前应确认工具可用性、调用费用、引用结果、失败状态和重试边界。

服务端工具
03

大上下文任务:同时观察缓存与总费用

长文档、代码库和长会话不应默认把全部内容塞进一次请求。比较代表性上下文长度、缓存命中与未命中、输出长度和重试次数,再用最终账单核算成功任务成本。

上下文成本
04

生产流量:从小规模开始并保留回退

先让一小部分可观察的任务使用 Grok 4.6,并保留已经稳定运行的 GPT、Claude 或 Kimi 路由。EvoLink 统一 API 可以集中管理模型选择、用量和余额,并在限流、超时、Schema 或工具失败时切换路由。

逐步扩量

缓存输入按单独的更低费率计费

系统提示、工具定义、共享上下文这类稳定前缀会在重复请求时自动命中缓存,按缓存读取而不是新输入计费。保持各轮前缀完全一致,并在 usage 里核对缓存 Token 数,确认确实省到了。

500K Token 上下文,提示达到 200K Token 进入长上下文档位

只在任务确实需要时才填满窗口。提示 Token 一旦达到 200K,所有 Token 角色都按长上下文档位计费,所以扩量前先裁剪检索段落和历史消息,做预算时留意估算卡上的档位标记。

Grok 4.6 与 GPT-5.6、Claude Opus 5 对比

EvoLink

对照输入输出费率、上下文、缓存和适用任务。先用同一批请求实测再选路由;下表采用你账户当前的费率。

Grok 4.6
输入 / 输出$1.7 / $5.1
上下文500K
缓存自动缓存读取
最适合联网与 X 搜索研究、代码辅助分析、文档与集合检索、复杂推理,以及需要跨提供方回退的生产流量。
GPT-5.6
输入 / 输出$0.181 / $1.081
上下文1.05M
缓存缓存读取 / 写入
最适合编程、生产级 Agent、复杂推理
Claude Opus 5
输入 / 输出$4.75 / $23.75
上下文1M
缓存缓存读取 / 写入
最适合仓库级编程、长周期 Agent、高风险代码审查

将 Grok 4.6 用于生产环境前,建议确认什么?

从小规模真实工作负载开始,可以更快确认模型是否符合团队对质量、延迟、成本和稳定性的要求,再决定哪些流量适合逐步迁移。

接入与用量信息清晰

确认应用使用正确的 grok-4.6 模型 ID 和目标协议,并能正常获得所需的响应、usage 与缓存信息。清晰的用量数据便于后续分析成本,也能让 Chat 与 Responses 工作流保持一致的观测方式。

输出满足实际业务要求

使用代码修改、长文档分析、研究或结构化抽取等真实任务检查结果。除了回答质量,还应关注测试是否通过、引用是否可靠、函数参数是否正确,以及 JSON Schema 能否被下游系统直接使用。

延迟与异常处理符合预期

在常见请求量下观察响应时间,并为限流、超时、无效结构化输出和工具失败准备重试方式。通过 EvoLink 保持模型选择可配置,可以在某条路由暂时不可用时切换到已经验证的替代模型。

成本与模型选择保持可控

结合 Pricing、usage 和最终费用评估同一类任务的总成本,再决定 Grok 4.6 适合默认路由、特定高难度任务还是备用模型。统一网关让团队可以按质量与预算调整模型,而不必重新建设接入层。

建议先将 Grok 4.6 用于一小部分可观察、可回退的任务,确认质量、延迟和成本符合预期后再逐步扩大。通过 EvoLink 统一 API 保留多模型选择,可以让后续扩量、切换和成本优化更加简单。

Grok 模型家族

同一把 API 密钥、同一份余额,换档位不用改接入。

Grok 4.6

Grok 4.6

当前模型

xAI 推理与工具调用模型

Grok 4.5

Grok 4.5

xAI 推理与工具调用模型

查看模型

Grok 4.6 之外的其他文本模型

GPT-5.6

GPT-5.6

需要在同一 OpenAI 模型家族中按能力、延迟和成本分层路由时,可与 Grok 4.6 使用相同任务做配对测试。

查看模型
Claude Opus 5

Claude Opus 5

需要长时间 Agent、复杂代码审查和工具可靠性时,可作为 Grok 4.6 的高端对照与生产回退。

查看模型
Kimi K3

Kimi K3

长上下文任务高度关注缓存输入价格和总 Token 成本时,可与 Grok 4.6 比较成功任务成本。

查看模型
DeepSeek V4 Flash

DeepSeek V4 Flash

大批量编程、推理和 Agent 流量优先考虑成本时,可作为 Grok 4.6 的低价对照与回退路由。

查看模型

Grok 4.6 延伸阅读

Grok 4.6 vs Grok 4.5

Grok 4.6 vs Grok 4.5

对比基准测试、缓存输入成本、推理档位,以及安全的生产升级方案。

阅读指南
Grok 4.6 vs Kimi K3

Grok 4.6 vs Kimi K3

按编码任务、上下文、开放权重、成本与回退需求选择路由。

阅读指南

Grok 4.6 API 常见问题

现在可以通过 EvoLink 使用 Grok 4.6 API 吗?

可以。Grok 4.6 已在 EvoLink 生产路由上线,使用模型 ID grok-4.6 通过 Chat Completions 或 Responses 直接调用;扩量前建议先在本页确认模型 ID、价格、上下文和支持方式。

grok-4-6 是 Grok 4.6 的 API 模型 ID 吗?

不是。grok-4-6 是页面 URL 与搜索写法,实际请求模型 ID 是 grok-4.6。

Grok 4.6 的上下文窗口和长上下文价格边界是什么?

xAI 记录的上下文窗口是 500,000 Token。达到页面 Pricing 区所示 Prompt Token 阈值后,请求进入长上下文价格档;应同时测试上下文长度和缓存输入,而不是默认使用完整窗口。

Grok 4.6 支持哪些输入和输出?

上游文档列出文本和图片输入、文本输出。图片输入用于视觉理解,不代表 Grok 4.6 可以生成图片;通过 EvoLink 使用时,以页面 API 区展示的当前支持方式为准。

Chat Completions 和 Responses API 应该怎么选?

普通聊天、流式响应和客户端函数优先评估 Chat Completions;长时间 Agent 与 xAI 服务端工具优先评估 Responses。精确字段以页面 API 区和 EvoLink 文档为准。

Grok 4.6 的 reasoning effort 应该怎么选?

可以从满足当前任务质量要求的最低档开始,再在相同任务上比较 medium 和 high 的质量、延迟、推理用量和总费用。复杂任务适合增加推理预算,简单任务则可以优先控制响应时间与成本。

缓存输入会怎样影响 Grok 4.6 API 价格?

缓存输入可以降低重复上下文成本,但缓存未命中、长输出、重试和反复工具步骤仍会增加总费用。应以 Pricing 区和最终请求账单计算成功任务成本。

服务端工具与客户端函数有什么区别?

客户端函数由你的应用执行;Web/X 搜索、代码执行、附件搜索和集合搜索属于 xAI 服务端工具。两者的执行位置、失败处理和计费方式不同,当前支持范围与费用可在页面 API 和 Pricing 区查看。

怎样比较 Grok 4.6、GPT、Claude 与 Kimi?

可以让不同模型完成相同的真实任务,并使用一致的上下文、工具和推理设置。结合结果质量、响应时间、Token 构成、工具表现和总费用,更容易判断每类流量适合哪条 EvoLink 路由。

上线 Grok 4.6 时应该保留什么回退模型?

建议保留一个已经稳定运行、能够完成同类任务的模型,并让路由选择保持可配置。发生限流、超时或无效输出时,可以通过 EvoLink 切换到 GPT、Claude、Kimi 或其他合适的替代路由。