Grok 4.5 API
选择 Grok 4.5
用于评估复杂推理、长上下文分析、研究,以及文本生成与 xAI 服务端工具的组合工作流。
Grok 4.5
xAI 推理与工具调用模型
grok-4.5联网与 X 搜索研究、代码辅助分析、文档与集合检索、复杂推理,以及需要跨提供方回退的生产流量。
Grok 4.5 价格
同时估算 Token 与成功的服务端工具调用。登录后优先使用当前用户组实时价格,契约价格仅作兜底。
请求费用计算器
输入非缓存输入、缓存输入、输出以及成功工具调用次数。单次请求预估
Grok 4.5Prompt Token(非缓存输入 + 缓存输入)达到 200,000 后,三类 Token 均按 2 倍计费;每次请求最低总费用 0.01 Credits;工具调用不参与倍数。
预算参考
按当前用量组合估算可调用次数。快速测试
日常开发
生产评估
Token 价格
| 模型 | Prompt Token | 非缓存输入 Token | 缓存输入 Token | 输出 Token |
|---|---|---|---|---|
Grok 4.5grok-4.5 | < 20 万 | $1.700 / 1M-15% 115.6 cr / 1M$2.000xAI 官方价 | $0.256 / 1M-15% 17.4 cr / 1M$0.300xAI 官方价 | $5.100 / 1M-15% 346.8 cr / 1M$6.000xAI 官方价 |
Grok 4.5grok-4.5 | ≥ 20 万 | $3.400 / 1M-15% 231.2 cr / 1M$4.000xAI 官方价 | $0.512 / 1M-15% 34.8 cr / 1M$0.600xAI 官方价 | $10.200 / 1M-15% 693.6 cr / 1M$12.000xAI 官方价 |
美元与 Credits 均按每百万 Token 展示。Prompt Token 达到 200,000 时进入长上下文档,输入、缓存输入与输出全部按 2 倍。
Responses 服务端工具价格
只有 /v1/responses 中成功执行的服务端调用按次收费。普通客户端函数调用和失败尝试不收服务端工具费,相关 Token 仍正常计费。
Grok 4.5 API 是什么?
Grok 4.5 是 xAI 面向编程 Agent、联网研究、长文档分析和工具工作流的推理模型。页面 URL 使用 grok-4-5,实际请求模型 ID 为 grok-4.5。Grok 4.5 已在 EvoLink 生产路由正式可用;可在下方 Pricing 与 API 区查看价格边界、支持方式和模型配置。
Grok 4.5 API 适合哪些任务?
Grok 4.5 的 50 万 Token 上下文、可配置推理、图片输入和工具能力,主要服务于需要持续保留证据、调用外部工具并交付可验证结果的任务。下面按工作负载说明它可能带来的价值,以及接入前应确认的边界。
仓库级编程与代码审查
把相关源码、Issue、测试结果和历史修改放进同一任务,适合跨文件定位问题、生成修改计划和审查变更。上线前应使用固定仓库任务检查测试通过率、未完成步骤、结构化结果和人工修正量,不能只凭一次演示判断编程能力。
长文档与多来源分析
50 万 Token 上下文可以同时容纳长报告、合同、知识库片段、历史消息和检索结果。更大的上下文不一定带来更好的答案;应检查关键证据是否被保留,并结合 Pricing 区的长上下文档位与缓存输入价格评估每个可接受结果的成本。
联网研究与工具工作流
Grok 4.5 可用于组合 Web 搜索、X 搜索、代码执行、附件搜索和集合搜索,形成带来源的研究结果。通过 EvoLink 使用时,可以结合页面的 API 与 Pricing 信息了解工具支持、Token 用量和按次费用,再按实际研究流程测试引用与结果质量。
结构化输出与 Agent 编排
文本与图片输入可以进入 JSON Schema、函数调用和多步骤 Agent 流程,用于抽取、审查和下游自动化。生产接入前应测试 Schema 有效率、函数参数、流式结束事件,以及工具失败后是否能够安全恢复。
通过不同平台使用 Grok 4.5,有哪些差别?
即使使用同一个模型,不同接入平台提供的上下文配置、工具支持、用量展示和计费方式也可能不同。通过 EvoLink 接入时,可以在统一 API 下查看模型配置与用量,并让后续模型切换保持简单。
使用正确的 API 模型 ID
grok-4-5 是页面 URL 与常见搜索写法,API 请求使用的模型 ID 是 grok-4.5。现有 Chat Completions 或 Responses 应用只需在模型配置中使用正确 ID,具体字段可继续查看页面 API 区。
以当前 API 通道的配置为准
xAI 记录的模型窗口为 50 万 Token,但不同平台可能提供不同的上下文配置、工具集合和限流方式。通过 EvoLink 使用时,以当前页面展示的模型配置、可用功能和实际 usage 为准。
按工作流选择 Chat 或 Responses
普通聊天、流式输出和客户端函数可以从 Chat Completions 开始;需要研究 Agent、服务端搜索或代码执行时,再选择 Responses。这样可以沿用熟悉的 OpenAI 风格接入,同时避免加入暂时不需要的复杂度。
在统一网关中保留模型选择空间
通过 EvoLink 使用同一套账号、余额和 API 方式接入 Grok、GPT、Claude 与 Kimi。模型选择保持在配置层后,可以根据任务质量、成本和可用性调整路由,而不必为每个供应商重复改造业务代码。
如何更准确地控制 Grok 4.5 API 成本?
现有 Pricing 区负责展示实时 Token 与工具价格。实际使用时,还可以通过缓存、上下文管理、推理设置和模型路由减少不必要的消耗,让成本与完成的业务任务对应起来。
让重复上下文更容易使用缓存
稳定的系统提示、工具 Schema 和共享上下文更适合复用缓存。按所选协议配置支持的缓存或会话标识,并从 usage 中查看 cached tokens,可以更准确地判断重复请求是否获得了缓存收益。
只发送当前任务真正需要的上下文
50 万 Token 窗口适合大型代码库和长文档,但并不意味着每次请求都要填满。优先选择与当前任务相关的文件、对话和检索结果,可以减少输入成本,也更容易让模型聚焦关键证据。
按任务调整推理、输出与工具调用
简单任务可以从较低 reasoning effort 和较短输出开始,复杂分析再逐步增加推理预算。研究与 Agent 工作流还应关注工具调用次数,避免重复搜索、重复执行或无效循环带来额外消耗。
按完成任务的总成本比较模型
将 Token、缓存输入、服务端工具和必要重试放到同一个任务中评估。EvoLink 集中展示模型与用量,便于团队比较 Grok 4.5 与其他路由完成相同工作所需的总费用。
Chat Completions、Responses 与生产流量怎么选?
两种协议服务于不同工作流。这里给出选型摘要;具体请求字段继续以页面 API 区和 EvoLink 文档为准,价格与工具调用费用继续以现有 Pricing 区为准。
普通对话与客户端函数:Chat Completions
已有 OpenAI 兼容聊天、流式响应或客户端 function calling 流程时,优先从 Chat Completions 开始。重点确认消息格式、流式结束、函数参数和 usage 是否与现有客户端预期一致。
研究 Agent 与服务端工具:Responses
需要 Web/X 搜索、代码执行、附件或集合搜索,以及更长的多步骤 Agent 流程时,再评估 Responses。接入前应确认工具可用性、调用费用、引用结果、失败状态和重试边界。
大上下文任务:同时观察缓存与总费用
长文档、代码库和长会话不应默认把全部内容塞进一次请求。比较代表性上下文长度、缓存命中与未命中、输出长度和重试次数,再用最终账单核算成功任务成本。
生产流量:从小规模开始并保留回退
先让一小部分可观察的任务使用 Grok 4.5,并保留已经稳定运行的 GPT、Claude 或 Kimi 路由。EvoLink 统一 API 可以集中管理模型选择、用量和余额,并在限流、超时、Schema 或工具失败时切换路由。
将 Grok 4.5 用于生产环境前,建议确认什么?
从小规模真实工作负载开始,可以更快确认模型是否符合团队对质量、延迟、成本和稳定性的要求,再决定哪些流量适合逐步迁移。
接入与用量信息清晰
确认应用使用正确的 grok-4.5 模型 ID 和目标协议,并能正常获得所需的响应、usage 与缓存信息。清晰的用量数据便于后续分析成本,也能让 Chat 与 Responses 工作流保持一致的观测方式。
输出满足实际业务要求
使用代码修改、长文档分析、研究或结构化抽取等真实任务检查结果。除了回答质量,还应关注测试是否通过、引用是否可靠、函数参数是否正确,以及 JSON Schema 能否被下游系统直接使用。
延迟与异常处理符合预期
在常见请求量下观察响应时间,并为限流、超时、无效结构化输出和工具失败准备重试方式。通过 EvoLink 保持模型选择可配置,可以在某条路由暂时不可用时切换到已经验证的替代模型。
成本与模型选择保持可控
结合 Pricing、usage 和最终费用评估同一类任务的总成本,再决定 Grok 4.5 适合默认路由、特定高难度任务还是备用模型。统一网关让团队可以按质量与预算调整模型,而不必重新建设接入层。
建议先将 Grok 4.5 用于一小部分可观察、可回退的任务,确认质量、延迟和成本符合预期后再逐步扩大。通过 EvoLink 统一 API 保留多模型选择,可以让后续扩量、切换和成本优化更加简单。
API 模型 ID
grok-4.5grok-4-5 是页面 URL 写法;Chat Completions 与 Responses 请求必须使用这里展示的真实模型 ID。
相关模型




Grok 4.5 相关指南与升级阅读


Grok 4.5 API 常见问题
现在可以通过 EvoLink 使用 Grok 4.5 API 吗?
可以。Grok 4.5 已在 EvoLink 生产路由上线,使用模型 ID grok-4.5 通过 Chat Completions 或 Responses 直接调用;扩量前建议先在本页确认模型 ID、价格、上下文和支持方式。
grok-4-5 是 Grok 4.5 的 API 模型 ID 吗?
不是。grok-4-5 是页面 URL 与搜索写法,实际请求模型 ID 是 grok-4.5。
Grok 4.5 的上下文窗口和长上下文价格边界是什么?
xAI 记录的上下文窗口是 500,000 Token。达到页面 Pricing 区所示 Prompt Token 阈值后,请求进入长上下文价格档;应同时测试上下文长度和缓存输入,而不是默认使用完整窗口。
Grok 4.5 支持哪些输入和输出?
上游文档列出文本和图片输入、文本输出。图片输入用于视觉理解,不代表 Grok 4.5 可以生成图片;通过 EvoLink 使用时,以页面 API 区展示的当前支持方式为准。
Chat Completions 和 Responses API 应该怎么选?
普通聊天、流式响应和客户端函数优先评估 Chat Completions;长时间 Agent 与 xAI 服务端工具优先评估 Responses。精确字段以页面 API 区和 EvoLink 文档为准。
Grok 4.5 的 reasoning effort 应该怎么选?
可以从满足当前任务质量要求的最低档开始,再在相同任务上比较 medium 和 high 的质量、延迟、推理用量和总费用。复杂任务适合增加推理预算,简单任务则可以优先控制响应时间与成本。
缓存输入会怎样影响 Grok 4.5 API 价格?
缓存输入可以降低重复上下文成本,但缓存未命中、长输出、重试和反复工具步骤仍会增加总费用。应以 Pricing 区和最终请求账单计算成功任务成本。
服务端工具与客户端函数有什么区别?
客户端函数由你的应用执行;Web/X 搜索、代码执行、附件搜索和集合搜索属于 xAI 服务端工具。两者的执行位置、失败处理和计费方式不同,当前支持范围与费用可在页面 API 和 Pricing 区查看。
怎样比较 Grok 4.5、GPT、Claude 与 Kimi?
可以让不同模型完成相同的真实任务,并使用一致的上下文、工具和推理设置。结合结果质量、响应时间、Token 构成、工具表现和总费用,更容易判断每类流量适合哪条 EvoLink 路由。
上线 Grok 4.5 时应该保留什么回退模型?
建议保留一个已经稳定运行、能够完成同类任务的模型,并让路由选择保持可配置。发生限流、超时或无效输出时,可以通过 EvoLink 切换到 GPT、Claude、Kimi 或其他合适的替代路由。