
Grok Imagine Video 1.5レビュー:実例で見る音声・画質・用途

ただし、静止画を入れればそのまま完成品が出てくるわけではありません。商品の細部、リップシンク、人体、音量バランス、ショットの連続性は人が確認する必要があります。無人で公開する仕組みより、広告案、SNS向け短尺動画、映画のプリビジュアライゼーションに向いています。
この記事では、次の3点を実例で確認します。
- 実際の出力はどう見え、どう聞こえるか
- どの用途に向き、どの用途には向かないか
- 見栄えのよいデモを、管理できる制作フローにどう組み込むか
先に結論:強い1枚絵を起点にした短いワンショット向け
| 判断したいこと | テスト結果 | おすすめの使い方 |
|---|---|---|
| 画面は安定するか | ゆっくりしたワンショットは比較的安定。速い動きや複雑な人体はリスクが残る | 被写体を固定し、主動作とカメラワークを1つずつ指定する |
| 人物に話させられるか | 英語のセリフと環境音を生成できるが、発音と口元は要確認 | セリフを短くし、言語、アクセント、字幕不要を明記する |
| 商品広告に使えるか | 雰囲気を見せる商品動画には有効。パッケージの小さな文字を正確に保つ用途には不向き | ラベル、ロゴ、細かな形状の再描画を避ける |
| テキストだけで動画にできるか | できない。現在のEvoLinkルートでは入力画像が1枚必要 | 先に開始フレームを用意し、動き、カメラ、音を記述する |
| 実運用に入れられるか | 可能。ただし非同期処理、保存、検品、失敗処理が必要 | 自社素材で採用率を測ってから利用量を増やす |
EvoLinkで実際に生成した3本
grok-imagine-video-1.5-previewで生成しました。条件は入力画像1枚、6秒、720pで統一し、各プロンプトも1つの連続ショットに絞っています。これは大規模なベンチマークではありません。3本から挙動や失敗パターンは確認できますが、あらゆる被写体や入力画像で同じ結果になる保証はありません。
1. 商品広告:光、質感、空気感をつくりやすい

このテストでは、ボトルの形を維持できるか、ゆっくりした周回カメラが自然か、ガラスと水滴の音が映像を邪魔せず入るかを確認しました。
ボトルと全体構図はよく保たれ、カメラの周回と暖色の光も控えめです。一方、「繊細」「静か」という音の指示はかなり弱く解釈され、存在感は小さめでした。印象的な効果音が必要なら、再生成を重ねるよりポストプロダクションで補強する方が安定します。
A restrained premium product shot in one continuous take. The camera performs a very slow 15-degree orbit from left to right while keeping the product centered and structurally unchanged. A warm golden light sweep travels gently across the glass. One condensation droplet slides down the front surface and the low mist drifts around the base. Add a delicate crystal-glass chime, a soft water droplet sound, and quiet studio ambience. No speech, music, cuts, zoom, added objects, labels, text, logo, or morphing.2. 英語トーキングヘッド:発話できるが、毎回の検品が必要

海外向けの用途を想定し、人物に自然なアメリカ英語で短い1文を話させました。わずかな寄り、まばたき、小さな頭の動き、発話、夜の室内音が同時に生成され、顔や背景の大きな変化もありません。
SNS動画、商品紹介の冒頭、デジタルプレゼンターの試作には有効です。ただし「話せる」と「そのまま公開できる」は別です。発音、口元、声の調子、顔の細部、ノイズを毎回確認し、6秒に長い原稿を詰め込まないでください。
One continuous realistic direct-to-camera shot with an almost imperceptible slow push-in. The woman breathes naturally, blinks once, makes a tiny friendly head movement, and clearly says in natural American English: "Turn one image into a complete video with sound." Keep her identity, facial proportions, hair, clothing, lighting, and background unchanged. Add quiet nighttime room tone under the clear voice. No subtitles, on-screen text, music, camera shake, cuts, extra people, visible hands, exaggerated motion, or morphing.3. 映画絵コンテ:雰囲気は強いが、完成ショットよりプリビズ向け

3本目では、風、砂、稲妻、遠雷、人物へのゆっくりした寄りを同時に指定しました。シネマティックな雰囲気が強く、ショットの方向、テンポ、感情を早い段階で確認できます。
弱点も分かりやすく出ます。マフラー、コート、髪を風で動かしながら人物の構造を維持する必要があるため、部分的な変形が起きやすくなります。映画制作では、動くコンセプトアートやプリビズとして扱い、完成ショットとは分けて考えるべきです。
A single cinematic shot with a slow controlled push toward the lone courier. The character stays planted at the cliff edge and keeps the same face, anatomy, coat, and backpack. Strong wind moves only the scarf, coat hem, and small strands of hair while fine sand streams horizontally across the foreground. One distant lightning flash briefly illuminates the storm clouds and canyon, followed by restrained distant thunder. Add layered desert wind and low storm ambience. No dialogue, music, cuts, running, camera shake, new objects, additional people, morphing, text, or logo.実際に感じた3つの強み
映像と音を同時に生成できる
Grok Imagine Video 1.5は、セリフ、動作音、環境音を映像と一緒に生成できます。最初から無音の映像素材ではなく、音を含むラフが手に入ります。
ネイティブ音声の価値は、音声制作を1工程減らすことだけではありません。間の取り方、雷、商品音、セリフをショット選定の段階でまとめて判断できます。最終的に音を差し替える場合でも、テンポの検証には役立ちます。
1被写体、1ショット、小さな動きと相性がよい
3本とも、複雑な移動やカットを避け、主なカメラワークを1つに限定しています。その分、人物、商品、キャラクターの維持に処理を使いやすくなります。
入力画像で被写体と構図がすでに決まり、それを「動かす」仕事なら、シーン全体をゼロから作らせるより制御しやすいです。
短尺向けの設定が複数の配信先に対応する
EvoLinkでは現在、1〜15秒、480pまたは720pに対応しています。このルートにはアスペクト比パラメータがないため、希望する最終構図に合わせて入力画像を用意してください。
制限も理解しておく必要がある
| 制限 | 実運用への影響 | 対応策 |
|---|---|---|
| 1枚画像からの動画生成のみ | テキストだけ、複数参照、開始・終了フレーム指定は不可 | 情報が揃った開始画像を先に作る |
| 複雑な動きは不安定 | 手、衣服、人体が動きの中で変化することがある | 動きを小さくし、複雑な案を複数の短いショットに分ける |
| 商品の細部は保証されない | ラベル、ロゴ、文字、形状が描き直されることがある | 小さな文字に依存せず、納品前にフレームを確認する |
| ネイティブ音声にばらつきがある | 音が小さい、発音が違う、環境音が強い場合がある | 音の優先順位を明記し、必要なら後で差し替える |
| EvoLinkでは現在720pまで | 高解像度のマスター要件をすべて満たさない | ラフ、SNS素材、アップスケール工程に使う |
| 結果URLは24時間で失効 | 採用素材でも未保存なら失われる | 完了後すぐ自社オブジェクトストレージへ保存する |
向いている人、まだ待った方がよい人
| ユーザー/用途 | 判断 | 理由 |
|---|---|---|
| 海外向けSNSコンテンツチーム | 今すぐテスト | 短い英語音声、縦型素材、バリエーション制作に価値がある |
| EC・ブランドチーム | 小規模テスト | 商品の雰囲気は作れるが、パッケージ、ロゴ、形状の検品が必要 |
| 個人開発者・AIプロダクト | 選択肢として導入 | 共通認証と非同期タスクで、他の動画モデルにも切り替えやすい |
| 映画企画・絵コンテ制作 | プリビズに利用 | 雰囲気と動きは早いが、完成ショットは保証されない |
| 複数人物の複雑な演技 | 待つか他モデルと比較 | 1枚画像では長く複雑な動作を十分に制御しにくい |
| 開始・終了フレーム、複数参照、1080p | 現行ルートには不向き | EvoLinkでは現在これらの制御を提供していない |
| 自動公開するブランド案件 | 検品なしでは非推奨 | 安全性、商品精度、映像と音の品質確認が必要 |
安定しやすいプロンプトの書き方
次の順序がおすすめです。
ショット形式 → 被写体の動き → 変えてはいけない要素 → 音 → 禁止事項
「この女性に商品を紹介させる」だけではなく、次のように制御します。
One continuous direct-to-camera shot. The woman makes one small head movement and clearly says in natural American English: "[short line]". Keep her identity, clothing, lighting, and background unchanged. Add quiet room tone. No subtitles, music, cuts, extra people, visible hands, exaggerated motion, or morphing.実践ルール:
- 6秒には主動作を1つ、セリフを短い1文だけ入れる。
keep ... unchangedで維持すべきものを指定する。No ...は致命的な失敗だけに絞り、否定語を増やしすぎない。clear voice、quiet room tone、restrained thunderのように音の種類と強さを書く。- 被写体を画面端から離し、最終出力を想定して入力画像を構図化する。
- 海外向けでは、プロンプトとセリフを直接英語で書く。
xAIとEvoLinkでモデルIDが違う理由
grok-imagine-video-1.5を安定版モデルとして掲載し、grok-imagine-video-1.5-previewを互換エイリアスとして残しています。EvoLinkの公開ルートでは現在、次を使用します。grok-imagine-video-1.5-preview| 項目 | xAI直接 | 現在のEvoLinkルート |
|---|---|---|
| モデルID | grok-imagine-video-1.5 | grok-imagine-video-1.5-preview |
| 生成方式 | 画像から動画 | 1枚画像から動画 |
| 入力画像 | xAIの現行ドキュメントを確認 | 必須、かつ1枚のみ |
| EvoLinkでの長さ | 該当なし | 1〜15秒 |
| EvoLinkでの解像度 | 該当なし | 480pまたは720p |
| 結果取得 | xAI API仕様に従う | 非同期タスク、ポーリングまたはコールバック |
| 結果保持 | xAI API仕様に従う | 返却URLは24時間有効 |
料金はいくらか
価格は変わるため、xAIの公開価格とEvoLinkルートの価格を分けて考える必要があります。
xAIの現行価格は、画像から動画の出力が480pで1秒0.08ドル、720pで0.14ドル、1080pで0.25ドル、入力画像が1枚0.01ドルです。EvoLinkの現行ルートは1080pを提供しておらず、共通クレジット残高で決済します。
現在公開されているEvoLinkの基準:
| 課金項目 | 現在の基準 |
|---|---|
| 480p出力 | 4.352クレジット/秒、約0.064ドル/秒 |
| 720p出力 | 7.616クレジット/秒、約0.112ドル/秒 |
| 入力画像1枚 | 0.544クレジット、約0.008ドル |
| 6秒・480pの例 | 26.656クレジット、約0.39ドル |
| 6秒・720pの例 | 46.24クレジット、約0.68ドル |
採用動画1本あたりのコスト = 生成と再試行の総費用 / 採用された出力数5本生成して1本だけ残すなら、実質コストには5回分の生成、保存、検品、仕上げが含まれます。
実運用の組み込みに必要なもの
動画生成は非同期です。通常のテキスト応答と同じ設計にはできません。
- 送信前に画像形式、サイズ、プロンプト、長さ、画質、残高を検証する。
POST /v1/videos/generationsでタスクを作り、返されたタスクIDを保存する。GET /v1/tasks/{task_id}をポーリングするか、HTTPSコールバックを使う。- 入力エラー、モデレーション、提供元障害、タイムアウトを区別し、すべてを自動再試行しない。
- 成功した動画を24時間以内に自社ストレージへコピーする。
- 被写体、文字、ロゴ、人体、口元、音量、コンテンツ安全性を確認する。
- 用途別に成功率、待ち時間、再試行率、採用動画コストを記録する。
- 1枚画像では対応できない仕事向けに他の動画モデルを用意する。
EvoLinkは、認証、残高、非同期タスク、複数モデルを1つのAPIゲートウェイで扱えます。入力方式、品質、コスト、可用性に応じてモデルを選び、提供元ごとに同じ仕組みを作り直す必要を減らせます。
公開前チェックリスト
- 入力画像はJPEG、PNG、WebPのいずれかで10MB以下
- 入力画像はちょうど1枚
- プロンプトは空でなく2,000トークン以内
- 入力画像の構図が最終出力に適している
- 長さは1〜15秒
- ラフ/納品目的に合わせて480pまたは720pを選択
- 送信前に見積もりを表示
- 待機、失敗、再試行の状態を設計
- 完了動画を恒久ストレージへ保存
- 映像、音声、安全性の確認工程を用意
- 非対応用途向けの代替モデルを用意
よくある質問
Grok Imagine Video 1.5は画像モデルですか、動画モデルですか?
動画生成モデルです。EvoLinkの現行ルートは画像1枚とプロンプトを受け取り、音声付きの短い動画を出力します。画像が被写体と開始構図を決め、プロンプトが動き、カメラ、音、制約を指示します。
テキストだけから動画を生成できますか?
grok-imagine-video-1.5-previewではできません。各リクエストに入力画像が1枚必要です。EvoLinkのモデルIDにPreviewが残っているのはなぜですか?
grok-imagine-video-1.5で、grok-imagine-video-1.5-previewは互換エイリアスです。EvoLinkは現在そのエイリアスを公開IDとして使うため、EvoLinkドキュメントの値を指定してください。複数の参照画像や開始・終了フレームを使えますか?
対応する長さと解像度は?
EvoLinkでは現在、1〜15秒、480pまたは720pに対応しています。1080pはこのルートでは提供していません。
英語のセリフを生成できますか?
できます。今回のテストでは、アメリカ英語の短い1文と室内音を生成できました。公開前に発音、口元、声の調子、音量を確認してください。長文より短いセリフの方が制御しやすいです。
音楽や効果音も自動で生成しますか?
プロンプトに応じてセリフ、環境音、動作音を生成できます。音の種類、強さ、同期にはばらつきがあります。必要な音と不要な音を明記し、重要案件では後処理も用意してください。
どのような入力画像が安定しますか?
主役が明確で、構図が読みやすく、遮蔽が少なく、最終出力に適した構図の画像です。手、小さな商品文字、画面端の複雑な形は動きの中で変わりやすくなります。
1回の生成料金はいくらですか?
長さ、解像度、入力画像1枚の料金で決まります。現在の公開基準では、6秒は480pで約0.39ドル、720pで約0.68ドルです。送信前にライブ見積もりを確認してください。
完了した動画URLはいつまで有効ですか?
EvoLinkの結果URLは24時間有効です。実運用では完了後に自動ダウンロードし、自社オブジェクトストレージやCDNに保存してください。
最初のテストはどう始めますか?
最終評価
Grok Imagine Video 1.5は、静止画でクリエイティブの方向がすでに決まっており、それを動き、カメラ、音のある短いショットにしたい場合に最も役立ちます。商品広告の試作、海外向けトーキングヘッド、映画プリビズ、追加の動画ルートが必要なAIプロダクトに向いています。
音付きのショット候補を早く必要とするなら、今すぐテストする価値があります。複数参照、開始・終了フレーム、1080p、複雑な演技、無検品の最終納品が必要なら、これだけを唯一の選択肢にはしないでください。
参考資料
- EvoLink:Grok Imagine Video 1.5 Preview APIドキュメント
- EvoLink:Grok Imagine Video 1.5モデルページ
- xAI:Grok Imagine Video 1.5モデルドキュメント
- xAI:モデル料金
- xAI:動画生成機能


