
Grok Imagine Video 1.5 评测:真实样片与适用场景

但它不是“上传一张图,就能稳定交付成片”的工具。产品细节、人物口型、肢体结构、声音强弱和镜头连续性仍然需要人工检查。它更适合生成广告候选、社交短视频和影视预演,而不是未经审核就直接投放。
本文不做抽象的参数罗列,而是回答三个更实际的问题:
- 真实生成效果怎么样?
- 哪些场景值得用,哪些场景暂时不适合?
- 如何把一次好看的演示,变成成本可控的生产流程?
先说结论:它适合有明确首帧的短视频任务
| 决策问题 | 我们的结论 | 使用建议 |
|---|---|---|
| 画面是否稳定? | 慢速、单镜头场景表现较稳;快速动作和复杂肢体仍有风险 | 先固定主体,再描述一项主要动作和一种运镜 |
| 人物能否开口说话? | 可以生成英文对白和环境声,但口型与发音必须逐条验收 | 台词尽量短,明确语言、口音和禁止字幕 |
| 适合做商品广告吗? | 适合做氛围型产品短片,不适合要求包装文字绝对准确的成片 | 避免让模型重绘标签、Logo 和细小结构 |
| 能否直接文生视频? | 不能。EvoLink 当前路由必须上传且只能上传 1 张图片 | 先准备好首帧,再描述动作、镜头和声音 |
| 能否直接用于生产? | 可以进入生产流程,但需要异步任务、结果存储、审核和失败处理 | 用小样测试通过率,再决定是否扩大调用量 |
三条 EvoLink 实测样片
grok-imagine-video-1.5-preview 路由生成。为了便于横向判断,我们统一使用单张参考图、6 秒和 720p,并尽量把 Prompt 限制为一个连续镜头。这不是大规模基准测试。三条样片足以展示模型的能力边界和写法,但不能代表所有题材、人物与输入图片都能得到同样结果。
1. 商品广告:适合做光影和材质氛围

这条样片的目标不是让产品大幅运动,而是验证三个容易翻车的点:瓶身能否保持不变、镜头环绕是否自然、玻璃与水滴音效能否同时出现。
成片里,瓶身主体和整体构图保持得不错,慢速环绕与暖色扫光也比较克制。需要注意的是,模型对“轻微、安静”的音效指令执行得很保守,声音存在感偏弱。如果短片需要明显的声音记忆点,后期补音通常比反复生成更可控。
A restrained premium product shot in one continuous take. The camera performs a very slow 15-degree orbit from left to right while keeping the product centered and structurally unchanged. A warm golden light sweep travels gently across the glass. One condensation droplet slides down the front surface and the low mist drifts around the base. Add a delicate crystal-glass chime, a soft water droplet sound, and quiet studio ambience. No speech, music, cuts, zoom, added objects, labels, text, logo, or morphing.2. 英文人物口播:能直接出声,但要逐条验收

这条样片面向海外用户,所以我们让人物用自然的美式英语说出一句短台词。成片能够同时完成轻微推镜、眨眼、头部小动作和英文发声,人物身份与背景也没有明显漂移。
它说明模型可以承担社交短视频、产品介绍开场和数字人口播的快速试做。但“能说话”不等于“每次都能直接发布”。正式使用时仍要检查发音、口型、语气、面部细节和声音底噪,尤其不要把长段文案一次塞进 6 秒视频。
One continuous realistic direct-to-camera shot with an almost imperceptible slow push-in. The woman breathes naturally, blinks once, makes a tiny friendly head movement, and clearly says in natural American English: "Turn one image into a complete video with sound." Keep her identity, facial proportions, hair, clothing, lighting, and background unchanged. Add quiet nighttime room tone under the clear voice. No subtitles, on-screen text, music, camera shake, cuts, extra people, visible hands, exaggerated motion, or morphing.3. 影视分镜:气氛强,适合预演而非直接交付

这条样片主要测试风、沙尘、闪电、远处雷声与慢速推进能否同时成立。结果的电影感和氛围营造较强,适合用来快速确认镜头方向、情绪和节奏。
风险也很典型:风吹动围巾、衣摆和头发时,模型需要同时维持角色结构,局部细节更容易出现不自然变化。对于影视制作,它更像动态分镜或概念预演,最终镜头仍需要更严格的生成、筛选和后期流程。
A single cinematic shot with a slow controlled push toward the lone courier. The character stays planted at the cliff edge and keeps the same face, anatomy, coat, and backpack. Strong wind moves only the scarf, coat hem, and small strands of hair while fine sand streams horizontally across the foreground. One distant lightning flash briefly illuminates the storm clouds and canyon, followed by restrained distant thunder. Add layered desert wind and low storm ambience. No dialogue, music, cuts, running, camera shake, new objects, additional people, morphing, text, or logo.从三组样片看,模型真正的优势是什么?
优势一:能把画面和声音放在同一次生成里
Grok Imagine Video 1.5 可以在生成画面的同时处理对白、动作音效和环境声。对创作者来说,这意味着第一次拿到的不是完全静音的视觉草稿,而是一条更接近成片节奏的候选视频。
原生音频最大的价值不只是少一步配音,而是帮助团队更早判断镜头是否成立。例如,人物停顿是否自然、雷声是否抢戏、产品音效是否足以支撑广告氛围,都能在筛选阶段一起判断。
优势二:对“单主体 + 单镜头 + 小动作”比较友好
三条样片都遵循同一个原则:不让主体做复杂位移,不频繁切镜,只安排一个主要镜头动作。这样的 Prompt 更容易让模型把算力用于维持人物、商品或角色的一致性。
如果你的输入图已经决定了人物、产品和构图,只需要让画面“动起来”,这个模型比从零构建整个场景更容易得到可用结果。
优势三:短片参数灵活,适合按渠道试做
EvoLink 当前支持 1–15 秒以及 480p 或 720p。当前接口不提供画幅比例参数;团队应按最终发布构图准备横版、竖版或方形输入图片。
它的局限也很明确
| 局限 | 会带来什么问题 | 建议 |
|---|---|---|
| 只支持单图图生视频 | 不能只写 Prompt,也不能用多张图锁定首尾状态 | 先生成或设计一张信息完整的首帧 |
| 复杂动作稳定性有限 | 手部、衣物、人物结构可能在运动中变化 | 降低动作幅度,把复杂镜头拆成多条短片 |
| 商品细节不能保证绝对准确 | 标签、Logo、文字和结构可能被重绘 | 生成阶段避免突出小字,交付前逐帧检查 |
| 原生音频不总是符合预期 | 可能音量偏低、发音不准或环境声过强 | Prompt 明确声音层级,必要时后期替换音轨 |
| 当前最高为 720p | 不适合直接承担所有高清交付 | 将它用于测试、社交素材或后续放大流程 |
| 结果链接只保留 24 小时 | 未及时保存会导致素材丢失 | 任务成功后立即下载到自己的对象存储 |
哪些人应该用,哪些人可以先等等?
| 用户或任务 | 建议 | 原因 |
|---|---|---|
| 海外社交内容团队 | 推荐测试 | 英文短口播、竖版素材和快速变体都有明确价值 |
| 电商与品牌营销团队 | 推荐小规模测试 | 适合产品氛围片,但必须保护包装、Logo 与商品结构 |
| 独立开发者和 AI 应用团队 | 推荐接入 | 统一异步任务和鉴权后,可与其他视频模型按场景切换 |
| 影视概念与分镜团队 | 推荐作为预演工具 | 氛围和运镜出片快,但不应把它当最终镜头 |
| 需要多角色复杂表演的团队 | 建议先等等或对比其他模型 | 单张首帧难以约束长时间复杂动作 |
| 需要首尾帧、多参考图或 1080p 的任务 | 当前不适合 | EvoLink 这条路由暂不提供这些控制方式 |
| 要求生成后自动发布的品牌项目 | 不建议直接使用 | 仍需人工验收内容安全、产品准确性和音画质量 |
Prompt 怎么写,出片会更稳?
我们建议把 Prompt 固定成以下顺序:
镜头形式 → 主体动作 → 必须保持不变的内容 → 声音 → 禁止项
例如,不要只写“让这个女人介绍产品”。更稳妥的写法是:
One continuous direct-to-camera shot. The woman makes one small head movement and clearly says in natural American English: "[short line]". Keep her identity, clothing, lighting, and background unchanged. Add quiet room tone. No subtitles, music, cuts, extra people, visible hands, exaggerated motion, or morphing.几个实用原则:
- 一条 6 秒视频只安排一个主要动作,口播尽量控制在一句短话。
- 用
keep ... unchanged明确哪些内容不能变化。 - 用
No ...列出最不能接受的问题,但不要堆几十个否定词。 - 声音要写清楚类型和强弱,例如
clear voice、quiet room tone、restrained thunder。 - 按最终发布构图准备输入图,并避免主体贴近画面边缘。
- 如果要面向海外用户,直接用英文写 Prompt 和台词,减少二次翻译造成的语义损失。
上游模型和 EvoLink 调用 ID 为什么不一样?
这是最容易混淆的地方。
grok-imagine-video-1.5,并保留 grok-imagine-video-1.5-preview 作为兼容别名。EvoLink 当前公开路由使用的是:grok-imagine-video-1.5-preview| 项目 | xAI 上游 | EvoLink 当前路由 |
|---|---|---|
| 使用的模型 ID | grok-imagine-video-1.5 | grok-imagine-video-1.5-preview |
| 当前生成方式 | 图生视频 | 单图图生视频 |
| 输入图片 | 上游规则以 xAI 文档为准 | 必须且只能上传 1 张 |
| EvoLink 支持的时长 | 不适用 | 1–15 秒 |
| EvoLink 支持的清晰度 | 不适用 | 480p、720p |
| 结果获取 | 上游接口规则 | 异步任务,支持轮询或回调 |
| 结果保存 | 按上游规则处理 | 返回链接有效期为 24 小时 |
成本应该怎么算?
价格信息最容易过期,因此这里把“上游公开价”和“EvoLink 实际调用价”分开。
xAI 官方定价页目前列出的图生视频输出价格为:480p 每秒 0.08 美元、720p 每秒 0.14 美元、1080p 每秒 0.25 美元,另收每张输入图片 0.01 美元。EvoLink 当前没有开放 1080p,且通过统一积分体系计费。
EvoLink 页面当前的公开基准为:
| 费用项 | 当前基准 |
|---|---|
| 480p 输出 | 4.352 积分/秒,约 0.064 美元/秒 |
| 720p 输出 | 7.616 积分/秒,约 0.112 美元/秒 |
| 单张输入图 | 0.544 积分,约 0.008 美元 |
| 6 秒 480p 示例 | 26.656 积分,约 0.39 美元 |
| 6 秒 720p 示例 | 46.24 积分,约 0.68 美元 |
单条可用视频成本 = 全部生成与重试费用 ÷ 最终被接受的视频数量如果团队生成 5 条只留下 1 条,那么真实成本不是一次调用的价格,而是 5 次生成、存储、审核和后期处理的总和。
接入生产前,需要补齐哪些环节?
视频生成是异步任务,不应该按照一次普通文本请求来设计。
- 在提交前检查图片格式、大小、Prompt、时长、清晰度和用户余额。
- 调用
POST /v1/videos/generations创建任务,并保存返回的任务 ID。 - 通过
GET /v1/tasks/{task_id}轮询状态,或使用 HTTPS 回调地址接收结果。 - 区分参数错误、内容审核、上游失败和超时,不要对所有失败自动重试。
- 任务成功后立刻把视频保存到自己的对象存储,避免 24 小时后链接失效。
- 在对客展示或发布前,检查主体一致性、文字、Logo、肢体、口型、音量与内容安全。
- 记录每个场景的成功率、平均时长、重试率和可用视频成本。
- 为不适合单图图生视频的任务保留其他模型,避免把业务锁死在一条路由上。
EvoLink 的接入价值在于:团队可以使用统一的 API 鉴权、余额和异步任务方式调用多个模型,再按输入方式、质量、成本与可用性选择更合适的模型,而不需要为每家提供商重复建设整套调用流程。
上线前检查清单
- 输入图片为 JPEG、PNG 或 WebP,且不超过 10 MB
- 每次只上传 1 张图片
- Prompt 非空,且不超过 2,000 tokens
- 图片构图符合最终发布需求
- 时长控制在 1–15 秒
- 已根据试做或交付选择 480p/720p
- 已向用户展示预计费用
- 已设计任务等待、失败和重试状态
- 已设置成功视频的自动保存
- 已增加画面、声音与内容安全审核
- 已准备不适用场景下的替代模型
常见问题
Grok Imagine Video 1.5 是图片模型还是视频模型?
它是视频生成模型。当前 EvoLink 路由接收一张图片和一段 Prompt,再输出一条带声音的短视频。图片决定主体与起始构图,Prompt 用于描述动作、运镜、声音和禁止项。
Grok Imagine Video 1.5 支持文生视频吗?
grok-imagine-video-1.5-preview 路由不支持只输入 Prompt 的文生视频。每次请求必须上传且只能上传 1 张图片。为什么模型 ID 里还有 Preview?
grok-imagine-video-1.5,grok-imagine-video-1.5-preview 是保留的兼容别名。EvoLink 当前使用后者作为公开调用 ID,因此请按 EvoLink 文档填写。可以上传多张图片或设置首尾帧吗?
支持多长的视频和哪些清晰度?
EvoLink 当前支持 1–15 秒,以及 480p、720p 两档清晰度。页面暂未开放 1080p。
Grok Imagine Video 1.5 能生成英文口播吗?
可以。我们的实测样片能够生成美式英语短句及环境底噪。不过正式发布前仍需人工检查发音、口型、语气和音量。短句通常比长段口播更容易控制。
它会自动生成背景音乐和音效吗?
模型可以按 Prompt 生成对白、环境声与动作音效。是否加入音乐、声音强弱以及同步效果会随场景变化。建议明确写出需要和不需要的声音,并为重要项目保留后期处理。
哪种输入图片更容易得到稳定结果?
主体清晰、构图完整、遮挡较少、构图符合最终输出需求的图片更容易控制。人物手部、商品小字和画面边缘的复杂结构更容易在运动中变化。
生成一次需要多少钱?
费用由输出秒数、清晰度和一张输入图共同决定。以当前公开基准计算,6 秒 480p 约 0.39 美元,6 秒 720p 约 0.68 美元。请以模型页实时估价为准。
生成完成后,视频能保存多久?
EvoLink 返回的结果链接有效期为 24 小时。生产环境应在任务成功后自动下载视频,并保存到自己的对象存储或 CDN。
如何开始第一次测试?
最终建议
Grok Imagine Video 1.5 最有价值的地方,是把一张已经确定方向的图片快速变成一条有动作、有运镜、有声音的短视频。它适合商品广告试做、海外人物口播和影视分镜预演,也适合作为 AI 视频产品中的一条可选模型路由。
如果你的目标是快速获得候选镜头,它值得现在就测试;如果你要求多图控制、首尾帧、1080p、复杂表演或完全无人审核的稳定交付,它暂时不是唯一答案。
资料来源
- EvoLink:Grok Imagine Video 1.5 Preview 中文接口文档
- EvoLink:Grok Imagine Video 1.5 模型页
- xAI:Grok Imagine Video 1.5 模型文档
- xAI:模型价格
- xAI:视频生成能力说明


