
Grok Imagine Video 1.5 : test, exemples réels et cas d’usage

Ce n’est pas pour autant un passage automatique de l’image fixe à une vidéo prête à publier. Les détails produit, la synchronisation labiale, l’anatomie, l’équilibre sonore et la continuité doivent toujours être contrôlés. Le modèle convient mieux aux variantes publicitaires, aux formats sociaux et à la prévisualisation qu’à une publication sans validation.
Ce test répond à trois questions concrètes :
- À quoi ressemblent et comment sonnent les résultats réels ?
- Quels usages sont adaptés, et lesquels ne le sont pas ?
- Comment intégrer une bonne démonstration dans un processus de production maîtrisé ?
Verdict rapide : idéal pour un plan court ancré dans une bonne image de départ
| Question de décision | Notre constat | Recommandation |
|---|---|---|
| L’image reste-t-elle stable ? | Les plans uniques et lents sont assez stables ; les mouvements rapides et l’anatomie complexe restent risqués | Verrouiller d’abord le sujet, puis décrire une action principale et un mouvement de caméra |
| Un personnage peut-il parler ? | Le modèle génère une voix anglaise et une ambiance, mais prononciation et lèvres doivent être vérifiées | Garder une phrase courte ; préciser langue, accent et absence de sous-titres |
| Est-il adapté à une publicité produit ? | Oui pour un film d’ambiance, moins pour un emballage dont les petits textes doivent rester exacts | Ne pas lui demander de redessiner étiquette, logo ou géométrie fine |
| Peut-il générer depuis un texte seul ? | Non. La route EvoLink actuelle exige exactement une image | Préparer une bonne première image, puis décrire mouvement, caméra et son |
| Peut-il entrer en production ? | Oui, avec tâches asynchrones, stockage, validation et gestion des erreurs | Mesurer le taux de vidéos acceptées sur vos propres contenus avant de monter en charge |
Trois vidéos réellement générées via EvoLink
grok-imagine-video-1.5-preview. Nous avons utilisé une image, une durée de 6 secondes et une définition de 720p. Chaque prompt décrit un seul plan continu.Il ne s’agit pas d’un benchmark à grande échelle. Trois exemples permettent d’observer des comportements et des risques, mais ne garantissent pas le même résultat avec chaque sujet ou image source.
1. Publicité produit : convaincante sur la lumière, la matière et l’ambiance

Ce clip vérifie trois points où les modèles échouent souvent : la structure du flacon reste-t-elle intacte, le mouvement orbital est-il maîtrisé, et les sons de verre et d’eau apparaissent-ils sans dominer la scène ?
Le flacon et la composition restent convaincants. L’orbite lente et le balayage lumineux sont eux aussi contenus. En revanche, le modèle interprète les consignes « délicat » et « calme » de façon très prudente : le son manque de présence. Pour une signature sonore marquée, un travail en postproduction est souvent plus prévisible que plusieurs nouvelles générations.
A restrained premium product shot in one continuous take. The camera performs a very slow 15-degree orbit from left to right while keeping the product centered and structurally unchanged. A warm golden light sweep travels gently across the glass. One condensation droplet slides down the front surface and the low mist drifts around the base. Add a delicate crystal-glass chime, a soft water droplet sound, and quiet studio ambience. No speech, music, cuts, zoom, added objects, labels, text, logo, or morphing.2. Présentation en anglais : la voix fonctionne, chaque prise doit être vérifiée

Ce test vise un public international : le personnage prononce une phrase courte en anglais américain naturel. Un léger travelling avant, un clignement des yeux, un petit mouvement de tête, la voix et l’ambiance nocturne sont générés ensemble, sans dérive manifeste du visage ou du décor.
Le modèle peut donc accélérer la conception de vidéos sociales, d’introductions produit ou de présentateurs virtuels. « Savoir parler » ne signifie pas « pouvoir publier sans contrôle ». Il faut vérifier la prononciation, les lèvres, le ton, le visage et le bruit sur chaque résultat, et éviter de faire tenir un long texte dans six secondes.
One continuous realistic direct-to-camera shot with an almost imperceptible slow push-in. The woman breathes naturally, blinks once, makes a tiny friendly head movement, and clearly says in natural American English: "Turn one image into a complete video with sound." Keep her identity, facial proportions, hair, clothing, lighting, and background unchanged. Add quiet nighttime room tone under the clear voice. No subtitles, on-screen text, music, camera shake, cuts, extra people, visible hands, exaggerated motion, or morphing.3. Storyboard cinéma : une forte ambiance, utile en prévisualisation

Le troisième essai combine vent, sable, éclair, tonnerre lointain et travelling lent vers un personnage. L’ambiance cinématographique est forte et permet de valider rapidement une direction de plan, un rythme ou une intention.
La limite apparaît en même temps : quand l’écharpe, le manteau et les cheveux bougent, le modèle doit préserver la structure du personnage sous le mouvement. Les déformations locales deviennent plus probables. Pour le cinéma, il s’agit d’un concept animé ou d’une prévisualisation, pas d’un plan final garanti.
A single cinematic shot with a slow controlled push toward the lone courier. The character stays planted at the cliff edge and keeps the same face, anatomy, coat, and backpack. Strong wind moves only the scarf, coat hem, and small strands of hair while fine sand streams horizontally across the foreground. One distant lightning flash briefly illuminates the storm clouds and canyon, followed by restrained distant thunder. Add layered desert wind and low storm ambience. No dialogue, music, cuts, running, camera shake, new objects, additional people, morphing, text, or logo.Quels sont les véritables points forts du modèle ?
L’image et le son sont générés ensemble
Grok Imagine Video 1.5 peut créer dialogue, bruitages et ambiance avec l’image. Le premier résultat est donc déjà un brouillon audiovisuel, et non une animation muette.
L’audio natif permet de juger le plan plus tôt : pauses, tonnerre, sons produit et parole peuvent être évalués dès la sélection, même si la bande-son finale sera ensuite mixée ou remplacée.
Un sujet, un plan et des mouvements mesurés lui conviennent bien
Nos trois tests suivent le même principe : pas de déplacement complexe, pas de coupe et un seul mouvement de caméra principal. Le modèle peut alors consacrer davantage de capacité au maintien de la personne, du produit ou du personnage.
Lorsque l’image source fixe déjà le sujet et la composition et qu’il suffit de l’animer, le résultat est plus contrôlable que si le modèle doit inventer toute la scène.
Les paramètres courts s’adaptent à plusieurs canaux
EvoLink prend actuellement en charge 1 à 15 secondes ainsi que 480p ou 720p. La route n’expose pas de paramètre de ratio ; préparez donc l’image source avec le cadrage final souhaité.
Les limites sont tout aussi importantes
| Limite | Conséquence | Réponse pratique |
|---|---|---|
| Image vers vidéo avec une seule image | Pas de génération depuis le texte seul, de références multiples ni de contrôle première/dernière image | Concevoir d’abord une image d’ouverture riche en informations |
| Mouvement complexe encore instable | Mains, vêtements et anatomie peuvent changer | Réduire l’amplitude et répartir les idées complexes entre plusieurs plans courts |
| Détails produit non garantis | Étiquettes, logos, textes et géométrie peuvent être redessinés | Éviter de dépendre de petits textes et contrôler les images finales |
| Audio natif variable | Son parfois faible, mal prononcé ou trop dominant | Préciser la hiérarchie sonore et remplacer la piste si nécessaire |
| 720p maximum sur EvoLink | Ne répond pas à tous les besoins de master haute définition | Utiliser pour brouillons, réseaux sociaux ou processus d’upscaling |
| URL de résultat valable 24 heures | Un fichier accepté peut disparaître | Copier immédiatement la vidéo vers votre propre stockage objet |
Qui devrait l’utiliser, et qui peut attendre ?
| Public ou tâche | Recommandation | Pourquoi |
|---|---|---|
| Équipes internationales de contenu social | Tester maintenant | La voix anglaise courte, les formats verticaux et les variantes rapides ont une valeur claire |
| E-commerce et marques | Lancer un pilote contrôlé | L’ambiance produit fonctionne, mais emballage, logo et géométrie doivent être protégés |
| Développeurs indépendants et produits IA | L’intégrer comme option | Une authentification et des tâches asynchrones communes facilitent le recours à d’autres modèles |
| Équipes de concept et storyboard | L’utiliser en prévisualisation | Ambiance et mouvement arrivent vite, sans garantir un plan final |
| Scènes complexes à plusieurs personnages | Attendre ou comparer | Une seule image contrôle mal un mouvement long et complexe |
| Première/dernière image, multi-référence ou 1080p | Pas adapté sur cette route | EvoLink n’expose pas actuellement ces contrôles |
| Publication automatique de contenus de marque | Ne pas utiliser sans validation | Sécurité, exactitude produit et qualité audiovisuelle doivent être approuvées |
Comment écrire un prompt Grok Imagine Video 1.5 plus fiable
Utilisez cet ordre :
Type de plan → mouvement du sujet → éléments à préserver → son → interdictions
Au lieu de « fais présenter le produit par cette femme », partez d’un modèle contrôlé :
One continuous direct-to-camera shot. The woman makes one small head movement and clearly says in natural American English: "[short line]". Keep her identity, clothing, lighting, and background unchanged. Add quiet room tone. No subtitles, music, cuts, extra people, visible hands, exaggerated motion, or morphing.Règles pratiques :
- Une action principale et une phrase courte pour six secondes.
- Utiliser
keep ... unchangedpour définir ce qui doit rester stable. - Réserver
No ...aux échecs les plus graves, sans empiler les négations. - Décrire le type et le niveau sonore :
clear voice,quiet room tone,restrained thunder. - Éloigner le sujet du bord et composer l’image source pour le rendu final souhaité.
- Pour un public international, écrire directement le prompt et le dialogue en anglais.
Pourquoi les identifiants xAI et EvoLink diffèrent-ils ?
grok-imagine-video-1.5 comme modèle stable et conserve grok-imagine-video-1.5-preview comme alias compatible. La route publique EvoLink utilise actuellement :grok-imagine-video-1.5-preview| Élément | xAI en direct | Route EvoLink actuelle |
|---|---|---|
| Identifiant | grok-imagine-video-1.5 | grok-imagine-video-1.5-preview |
| Mode | Image vers vidéo | Image vers vidéo avec une seule image |
| Image source | Suivre la documentation xAI | Exactement une image obligatoire |
| Durée sur EvoLink | Sans objet | 1 à 15 secondes |
| Définition sur EvoLink | Sans objet | 480p ou 720p |
| Récupération | Selon l’API xAI | Tâche asynchrone, polling ou callback |
| Conservation | Selon l’API xAI | URL renvoyée valable 24 heures |
Combien coûte une génération ?
Les prix évoluent. Il faut donc distinguer le tarif public xAI du tarif de la route EvoLink.
xAI affiche actuellement 0,08 $/s en 480p, 0,14 $/s en 720p et 0,25 $/s en 1080p pour la sortie image vers vidéo, plus 0,01 $ par image source. EvoLink n’expose pas encore le 1080p sur cette route et facture via son solde de crédits commun.
Base publique EvoLink actuelle :
| Poste | Base actuelle |
|---|---|
| Sortie 480p | 4,352 crédits/s, environ 0,064 $/s |
| Sortie 720p | 7,616 crédits/s, environ 0,112 $/s |
| Une image source | 0,544 crédit, environ 0,008 $ |
| Exemple 6 s en 480p | 26,656 crédits, environ 0,39 $ |
| Exemple 6 s en 720p | 46,24 crédits, environ 0,68 $ |
Coût par vidéo acceptée = coût total des générations et relances / sorties acceptéesSi cinq clips sont générés et qu’un seul est conservé, le coût réel inclut les cinq essais, le stockage, la validation et la postproduction.
Que faut-il prévoir pour une intégration en production ?
La génération vidéo est asynchrone et ne doit pas être traitée comme une simple réponse texte.
- Valider format, taille, prompt, durée, qualité et solde avant l’envoi.
- Appeler
POST /v1/videos/generationset enregistrer l’identifiant de tâche. - Interroger
GET /v1/tasks/{task_id}ou utiliser un callback HTTPS. - Distinguer validation, modération, fournisseur et timeout ; ne pas tout relancer automatiquement.
- Copier toute vidéo réussie dans votre stockage avant l’expiration de l’URL à 24 heures.
- Vérifier sujet, textes, logos, anatomie, lèvres, volume et sécurité du contenu.
- Mesurer taux de réussite, latence, relances et coût par résultat accepté pour chaque usage.
- Garder d’autres modèles vidéo pour les tâches inadaptées à une seule image.
EvoLink fournit une passerelle API unifiée pour l’authentification, le solde, les tâches asynchrones et plusieurs modèles. Une équipe peut choisir selon l’entrée, la qualité, le coût et la disponibilité sans reconstruire chaque intégration fournisseur.
Checklist avant lancement
- Image JPEG, PNG ou WebP de 10 Mo maximum
- Exactement une image source
- Prompt non vide de 2 000 tokens maximum
- Ratio source proche du format final
- Durée comprise entre 1 et 15 secondes
- 480p ou 720p choisi selon brouillon ou livraison
- Coût estimé visible avant l’envoi
- États d’attente, d’échec et de relance définis
- Vidéos terminées copiées vers un stockage permanent
- Contrôle visuel, sonore et de sécurité en place
- Modèle alternatif prévu pour les tâches non prises en charge
Questions fréquentes
Grok Imagine Video 1.5 est-il un modèle d’image ou de vidéo ?
C’est un modèle de génération vidéo. La route EvoLink accepte une image et un prompt, puis produit une courte vidéo avec son. L’image fixe le sujet et la composition initiale ; le prompt dirige mouvement, caméra, audio et contraintes.
Grok Imagine Video 1.5 prend-il en charge le text-to-video ?
grok-imagine-video-1.5-preview. Chaque requête doit contenir exactement une image source.Pourquoi l’identifiant EvoLink contient-il encore Preview ?
grok-imagine-video-1.5, et grok-imagine-video-1.5-preview reste un alias compatible. EvoLink expose actuellement cet alias : utilisez donc la valeur de sa documentation.Puis-je utiliser plusieurs références ou une première et une dernière image ?
Quelles durées et définitions sont disponibles ?
EvoLink prend actuellement en charge 1 à 15 secondes en 480p ou 720p. Le 1080p n’est pas encore exposé sur cette route.
Le modèle peut-il générer une voix anglaise ?
Oui. Notre essai a produit une phrase courte en anglais américain avec une ambiance de pièce. Prononciation, lèvres, ton et volume doivent être vérifiés avant publication ; une phrase courte reste plus contrôlable.
Génère-t-il automatiquement musique et bruitages ?
Le modèle peut créer dialogue, ambiance et bruitages à partir du prompt. Le choix, le niveau et la synchronisation varient. Indiquez les sons souhaités et interdits, et prévoyez une postproduction pour les projets importants.
Quelles images sources sont les plus fiables ?
Privilégiez un sujet clair, une composition lisible, peu d’occlusions et un cadrage adapté à la sortie. Les mains, les petits textes produit et les détails complexes au bord de l’image changent plus facilement.
Combien coûte une génération ?
Le prix dépend de la durée, de la définition et de l’image source. À la base publique actuelle, six secondes coûtent environ 0,39 $ en 480p ou 0,68 $ en 720p. Vérifiez l’estimation en direct avant l’envoi.
Combien de temps l’URL de la vidéo reste-t-elle disponible ?
Les URL de résultat EvoLink restent valables 24 heures. Un système de production doit télécharger automatiquement les vidéos et les conserver dans son stockage objet ou son CDN.
Comment lancer un premier test ?
Recommandation finale
Grok Imagine Video 1.5 est surtout utile lorsqu’une image fixe définit déjà la direction créative et doit devenir un plan court avec mouvement, caméra et son. Il convient aux essais publicitaires, aux présentateurs pour un public international, à la prévisualisation cinéma et aux produits IA qui souhaitent une route vidéo supplémentaire.
Testez-le maintenant si vous avez besoin rapidement de plans audiovisuels candidats. Ne le considérez pas comme l’unique solution si vous exigez plusieurs références, une première et une dernière image, du 1080p, des performances complexes ou une livraison finale sans contrôle.
Sources
- EvoLink : documentation API de Grok Imagine Video 1.5 Preview
- EvoLink : page Grok Imagine Video 1.5
- xAI : documentation de Grok Imagine Video 1.5
- xAI : tarifs des modèles
- xAI : fonctions de génération vidéo


