Seedance 2.5 est disponible sur EvoLinkEssayer Seedance 2.5
Grok Imagine Video 1.5 : test, exemples réels et cas d’usage
Review

Grok Imagine Video 1.5 : test, exemples réels et cas d’usage

EvoLink Team
EvoLink Team
Product Team
1 juin 2026
Mis à jour le 30 juillet 2026
17 min de lecture
Si vous disposez déjà d’une photo de produit, d’un portrait ou d’une image de storyboard bien composée et souhaitez la transformer en courte vidéo avec du son, Grok Imagine Video 1.5 mérite un test. Dans nos trois essais, le sujet principal, les mouvements de caméra lents et l’atmosphère sont restés relativement stables. Le test face caméra a également produit une phrase anglaise exploitable.

Ce n’est pas pour autant un passage automatique de l’image fixe à une vidéo prête à publier. Les détails produit, la synchronisation labiale, l’anatomie, l’équilibre sonore et la continuité doivent toujours être contrôlés. Le modèle convient mieux aux variantes publicitaires, aux formats sociaux et à la prévisualisation qu’à une publication sans validation.

Ce test répond à trois questions concrètes :

Pour suivre plutôt la feuille de route des modèles texte de xAI, consultez le suivi de la sortie de Grok 4.6, puis le comparatif Grok 4.6 vs Grok 4.5 pour décider d’une éventuelle migration.
  1. À quoi ressemblent et comment sonnent les résultats réels ?
  2. Quels usages sont adaptés, et lesquels ne le sont pas ?
  3. Comment intégrer une bonne démonstration dans un processus de production maîtrisé ?

Verdict rapide : idéal pour un plan court ancré dans une bonne image de départ

Question de décisionNotre constatRecommandation
L’image reste-t-elle stable ?Les plans uniques et lents sont assez stables ; les mouvements rapides et l’anatomie complexe restent risquésVerrouiller d’abord le sujet, puis décrire une action principale et un mouvement de caméra
Un personnage peut-il parler ?Le modèle génère une voix anglaise et une ambiance, mais prononciation et lèvres doivent être vérifiéesGarder une phrase courte ; préciser langue, accent et absence de sous-titres
Est-il adapté à une publicité produit ?Oui pour un film d’ambiance, moins pour un emballage dont les petits textes doivent rester exactsNe pas lui demander de redessiner étiquette, logo ou géométrie fine
Peut-il générer depuis un texte seul ?Non. La route EvoLink actuelle exige exactement une imagePréparer une bonne première image, puis décrire mouvement, caméra et son
Peut-il entrer en production ?Oui, avec tâches asynchrones, stockage, validation et gestion des erreursMesurer le taux de vidéos acceptées sur vos propres contenus avant de monter en charge
Pour reproduire les essais, ouvrez la page Grok Imagine Video 1.5, choisissez l’un des trois cas d’usage et envoyez la même image, le même prompt et les mêmes paramètres dans le Playground.
Les trois vidéos ci-dessous ont été créées avec la route EvoLink grok-imagine-video-1.5-preview. Nous avons utilisé une image, une durée de 6 secondes et une définition de 720p. Chaque prompt décrit un seul plan continu.

Il ne s’agit pas d’un benchmark à grande échelle. Trois exemples permettent d’observer des comportements et des risques, mais ne garantissent pas le même résultat avec chaque sujet ou image source.

1. Publicité produit : convaincante sur la lumière, la matière et l’ambiance

Image source du flacon utilisée pour le test publicitaire de Grok Imagine Video 1.5
Image source du flacon utilisée pour le test publicitaire de Grok Imagine Video 1.5

Ce clip vérifie trois points où les modèles échouent souvent : la structure du flacon reste-t-elle intacte, le mouvement orbital est-il maîtrisé, et les sons de verre et d’eau apparaissent-ils sans dominer la scène ?

Le flacon et la composition restent convaincants. L’orbite lente et le balayage lumineux sont eux aussi contenus. En revanche, le modèle interprète les consignes « délicat » et « calme » de façon très prudente : le son manque de présence. Pour une signature sonore marquée, un travail en postproduction est souvent plus prévisible que plusieurs nouvelles générations.

Prompt reproductible :
A restrained premium product shot in one continuous take. The camera performs a very slow 15-degree orbit from left to right while keeping the product centered and structurally unchanged. A warm golden light sweep travels gently across the glass. One condensation droplet slides down the front surface and the low mist drifts around the base. Add a delicate crystal-glass chime, a soft water droplet sound, and quiet studio ambience. No speech, music, cuts, zoom, added objects, labels, text, logo, or morphing.

2. Présentation en anglais : la voix fonctionne, chaque prise doit être vérifiée

Portrait source utilisé pour le test de présentation en anglais de Grok Imagine Video 1.5
Portrait source utilisé pour le test de présentation en anglais de Grok Imagine Video 1.5

Ce test vise un public international : le personnage prononce une phrase courte en anglais américain naturel. Un léger travelling avant, un clignement des yeux, un petit mouvement de tête, la voix et l’ambiance nocturne sont générés ensemble, sans dérive manifeste du visage ou du décor.

Le modèle peut donc accélérer la conception de vidéos sociales, d’introductions produit ou de présentateurs virtuels. « Savoir parler » ne signifie pas « pouvoir publier sans contrôle ». Il faut vérifier la prononciation, les lèvres, le ton, le visage et le bruit sur chaque résultat, et éviter de faire tenir un long texte dans six secondes.

Prompt reproductible :
One continuous realistic direct-to-camera shot with an almost imperceptible slow push-in. The woman breathes naturally, blinks once, makes a tiny friendly head movement, and clearly says in natural American English: "Turn one image into a complete video with sound." Keep her identity, facial proportions, hair, clothing, lighting, and background unchanged. Add quiet nighttime room tone under the clear voice. No subtitles, on-screen text, music, camera shake, cuts, extra people, visible hands, exaggerated motion, or morphing.

3. Storyboard cinéma : une forte ambiance, utile en prévisualisation

Image source du personnage dans le désert utilisée pour le test storyboard de Grok Imagine Video 1.5
Image source du personnage dans le désert utilisée pour le test storyboard de Grok Imagine Video 1.5

Le troisième essai combine vent, sable, éclair, tonnerre lointain et travelling lent vers un personnage. L’ambiance cinématographique est forte et permet de valider rapidement une direction de plan, un rythme ou une intention.

La limite apparaît en même temps : quand l’écharpe, le manteau et les cheveux bougent, le modèle doit préserver la structure du personnage sous le mouvement. Les déformations locales deviennent plus probables. Pour le cinéma, il s’agit d’un concept animé ou d’une prévisualisation, pas d’un plan final garanti.

Prompt reproductible :
A single cinematic shot with a slow controlled push toward the lone courier. The character stays planted at the cliff edge and keeps the same face, anatomy, coat, and backpack. Strong wind moves only the scarf, coat hem, and small strands of hair while fine sand streams horizontally across the foreground. One distant lightning flash briefly illuminates the storm clouds and canyon, followed by restrained distant thunder. Add layered desert wind and low storm ambience. No dialogue, music, cuts, running, camera shake, new objects, additional people, morphing, text, or logo.

Quels sont les véritables points forts du modèle ?

L’image et le son sont générés ensemble

Grok Imagine Video 1.5 peut créer dialogue, bruitages et ambiance avec l’image. Le premier résultat est donc déjà un brouillon audiovisuel, et non une animation muette.

L’audio natif permet de juger le plan plus tôt : pauses, tonnerre, sons produit et parole peuvent être évalués dès la sélection, même si la bande-son finale sera ensuite mixée ou remplacée.

Un sujet, un plan et des mouvements mesurés lui conviennent bien

Nos trois tests suivent le même principe : pas de déplacement complexe, pas de coupe et un seul mouvement de caméra principal. Le modèle peut alors consacrer davantage de capacité au maintien de la personne, du produit ou du personnage.

Lorsque l’image source fixe déjà le sujet et la composition et qu’il suffit de l’animer, le résultat est plus contrôlable que si le modèle doit inventer toute la scène.

Les paramètres courts s’adaptent à plusieurs canaux

EvoLink prend actuellement en charge 1 à 15 secondes ainsi que 480p ou 720p. La route n’expose pas de paramètre de ratio ; préparez donc l’image source avec le cadrage final souhaité.

Les limites sont tout aussi importantes

LimiteConséquenceRéponse pratique
Image vers vidéo avec une seule imagePas de génération depuis le texte seul, de références multiples ni de contrôle première/dernière imageConcevoir d’abord une image d’ouverture riche en informations
Mouvement complexe encore instableMains, vêtements et anatomie peuvent changerRéduire l’amplitude et répartir les idées complexes entre plusieurs plans courts
Détails produit non garantisÉtiquettes, logos, textes et géométrie peuvent être redessinésÉviter de dépendre de petits textes et contrôler les images finales
Audio natif variableSon parfois faible, mal prononcé ou trop dominantPréciser la hiérarchie sonore et remplacer la piste si nécessaire
720p maximum sur EvoLinkNe répond pas à tous les besoins de master haute définitionUtiliser pour brouillons, réseaux sociaux ou processus d’upscaling
URL de résultat valable 24 heuresUn fichier accepté peut disparaîtreCopier immédiatement la vidéo vers votre propre stockage objet
Le bon positionnement n’est pas « production automatique d’une vidéo finale », mais création plus rapide de plans audiovisuels candidats. Le modèle accélère la validation et l’itération ; il ne supprime pas la validation, le montage ni la postproduction.

Qui devrait l’utiliser, et qui peut attendre ?

Public ou tâcheRecommandationPourquoi
Équipes internationales de contenu socialTester maintenantLa voix anglaise courte, les formats verticaux et les variantes rapides ont une valeur claire
E-commerce et marquesLancer un pilote contrôléL’ambiance produit fonctionne, mais emballage, logo et géométrie doivent être protégés
Développeurs indépendants et produits IAL’intégrer comme optionUne authentification et des tâches asynchrones communes facilitent le recours à d’autres modèles
Équipes de concept et storyboardL’utiliser en prévisualisationAmbiance et mouvement arrivent vite, sans garantir un plan final
Scènes complexes à plusieurs personnagesAttendre ou comparerUne seule image contrôle mal un mouvement long et complexe
Première/dernière image, multi-référence ou 1080pPas adapté sur cette routeEvoLink n’expose pas actuellement ces contrôles
Publication automatique de contenus de marqueNe pas utiliser sans validationSécurité, exactitude produit et qualité audiovisuelle doivent être approuvées

Comment écrire un prompt Grok Imagine Video 1.5 plus fiable

Utilisez cet ordre :

Type de plan → mouvement du sujet → éléments à préserver → son → interdictions

Au lieu de « fais présenter le produit par cette femme », partez d’un modèle contrôlé :

One continuous direct-to-camera shot. The woman makes one small head movement and clearly says in natural American English: "[short line]". Keep her identity, clothing, lighting, and background unchanged. Add quiet room tone. No subtitles, music, cuts, extra people, visible hands, exaggerated motion, or morphing.

Règles pratiques :

  • Une action principale et une phrase courte pour six secondes.
  • Utiliser keep ... unchanged pour définir ce qui doit rester stable.
  • Réserver No ... aux échecs les plus graves, sans empiler les négations.
  • Décrire le type et le niveau sonore : clear voice, quiet room tone, restrained thunder.
  • Éloigner le sujet du bord et composer l’image source pour le rendu final souhaité.
  • Pour un public international, écrire directement le prompt et le dialogue en anglais.
xAI répertorie grok-imagine-video-1.5 comme modèle stable et conserve grok-imagine-video-1.5-preview comme alias compatible. La route publique EvoLink utilise actuellement :
grok-imagine-video-1.5-preview
Cela ne signifie pas que xAI classe toujours la version 1.5 comme Preview. Les identifiants varient selon le canal d’accès. Pour un appel via EvoLink, suivez la documentation API EvoLink et les exemples de la page modèle.
ÉlémentxAI en directRoute EvoLink actuelle
Identifiantgrok-imagine-video-1.5grok-imagine-video-1.5-preview
ModeImage vers vidéoImage vers vidéo avec une seule image
Image sourceSuivre la documentation xAIExactement une image obligatoire
Durée sur EvoLinkSans objet1 à 15 secondes
Définition sur EvoLinkSans objet480p ou 720p
RécupérationSelon l’API xAITâche asynchrone, polling ou callback
ConservationSelon l’API xAIURL renvoyée valable 24 heures

Combien coûte une génération ?

Les prix évoluent. Il faut donc distinguer le tarif public xAI du tarif de la route EvoLink.

xAI affiche actuellement 0,08 $/s en 480p, 0,14 $/s en 720p et 0,25 $/s en 1080p pour la sortie image vers vidéo, plus 0,01 $ par image source. EvoLink n’expose pas encore le 1080p sur cette route et facture via son solde de crédits commun.

Base publique EvoLink actuelle :

PosteBase actuelle
Sortie 480p4,352 crédits/s, environ 0,064 $/s
Sortie 720p7,616 crédits/s, environ 0,112 $/s
Une image source0,544 crédit, environ 0,008 $
Exemple 6 s en 480p26,656 crédits, environ 0,39 $
Exemple 6 s en 720p46,24 crédits, environ 0,68 $
La référence reste la section Prix et l’estimation du Playground. Le prix d’un compte connecté peut dépendre de son groupe et de la configuration SKU ; ne codez pas en dur les chiffres d’un article.
La mesure la plus utile est le coût par vidéo acceptée :
Coût par vidéo acceptée = coût total des générations et relances / sorties acceptées

Si cinq clips sont générés et qu’un seul est conservé, le coût réel inclut les cinq essais, le stockage, la validation et la postproduction.

Que faut-il prévoir pour une intégration en production ?

La génération vidéo est asynchrone et ne doit pas être traitée comme une simple réponse texte.

  1. Valider format, taille, prompt, durée, qualité et solde avant l’envoi.
  2. Appeler POST /v1/videos/generations et enregistrer l’identifiant de tâche.
  3. Interroger GET /v1/tasks/{task_id} ou utiliser un callback HTTPS.
  4. Distinguer validation, modération, fournisseur et timeout ; ne pas tout relancer automatiquement.
  5. Copier toute vidéo réussie dans votre stockage avant l’expiration de l’URL à 24 heures.
  6. Vérifier sujet, textes, logos, anatomie, lèvres, volume et sécurité du contenu.
  7. Mesurer taux de réussite, latence, relances et coût par résultat accepté pour chaque usage.
  8. Garder d’autres modèles vidéo pour les tâches inadaptées à une seule image.

EvoLink fournit une passerelle API unifiée pour l’authentification, le solde, les tâches asynchrones et plusieurs modèles. Une équipe peut choisir selon l’entrée, la qualité, le coût et la disponibilité sans reconstruire chaque intégration fournisseur.

Checklist avant lancement

  • Image JPEG, PNG ou WebP de 10 Mo maximum
  • Exactement une image source
  • Prompt non vide de 2 000 tokens maximum
  • Ratio source proche du format final
  • Durée comprise entre 1 et 15 secondes
  • 480p ou 720p choisi selon brouillon ou livraison
  • Coût estimé visible avant l’envoi
  • États d’attente, d’échec et de relance définis
  • Vidéos terminées copiées vers un stockage permanent
  • Contrôle visuel, sonore et de sécurité en place
  • Modèle alternatif prévu pour les tâches non prises en charge

Questions fréquentes

Grok Imagine Video 1.5 est-il un modèle d’image ou de vidéo ?

C’est un modèle de génération vidéo. La route EvoLink accepte une image et un prompt, puis produit une courte vidéo avec son. L’image fixe le sujet et la composition initiale ; le prompt dirige mouvement, caméra, audio et contraintes.

Grok Imagine Video 1.5 prend-il en charge le text-to-video ?

Pas sur la route EvoLink grok-imagine-video-1.5-preview. Chaque requête doit contenir exactement une image source.
L’identifiant stable xAI est grok-imagine-video-1.5, et grok-imagine-video-1.5-preview reste un alias compatible. EvoLink expose actuellement cet alias : utilisez donc la valeur de sa documentation.

Puis-je utiliser plusieurs références ou une première et une dernière image ?

Non. La route ne prend en charge qu’une image, sans multi-référence ni contrôle de première/dernière image. Consultez le catalogue de modèles EvoLink si ces fonctions sont indispensables.

Quelles durées et définitions sont disponibles ?

EvoLink prend actuellement en charge 1 à 15 secondes en 480p ou 720p. Le 1080p n’est pas encore exposé sur cette route.

Le modèle peut-il générer une voix anglaise ?

Oui. Notre essai a produit une phrase courte en anglais américain avec une ambiance de pièce. Prononciation, lèvres, ton et volume doivent être vérifiés avant publication ; une phrase courte reste plus contrôlable.

Génère-t-il automatiquement musique et bruitages ?

Le modèle peut créer dialogue, ambiance et bruitages à partir du prompt. Le choix, le niveau et la synchronisation varient. Indiquez les sons souhaités et interdits, et prévoyez une postproduction pour les projets importants.

Quelles images sources sont les plus fiables ?

Privilégiez un sujet clair, une composition lisible, peu d’occlusions et un cadrage adapté à la sortie. Les mains, les petits textes produit et les détails complexes au bord de l’image changent plus facilement.

Combien coûte une génération ?

Le prix dépend de la durée, de la définition et de l’image source. À la base publique actuelle, six secondes coûtent environ 0,39 $ en 480p ou 0,68 $ en 720p. Vérifiez l’estimation en direct avant l’envoi.

Combien de temps l’URL de la vidéo reste-t-elle disponible ?

Les URL de résultat EvoLink restent valables 24 heures. Un système de production doit télécharger automatiquement les vidéos et les conserver dans son stockage objet ou son CDN.

Comment lancer un premier test ?

Ouvrez la page Grok Imagine Video 1.5, choisissez l’une des trois scènes et cliquez sur « Tester cette scène ». L’image, le prompt anglais, 6 secondes et 720p sont chargés dans le Playground. Vérifiez le coût, puis lancez la génération.

Recommandation finale

Grok Imagine Video 1.5 est surtout utile lorsqu’une image fixe définit déjà la direction créative et doit devenir un plan court avec mouvement, caméra et son. Il convient aux essais publicitaires, aux présentateurs pour un public international, à la prévisualisation cinéma et aux produits IA qui souhaitent une route vidéo supplémentaire.

Testez-le maintenant si vous avez besoin rapidement de plans audiovisuels candidats. Ne le considérez pas comme l’unique solution si vous exigez plusieurs références, une première et une dernière image, du 1080p, des performances complexes ou une livraison finale sans contrôle.

La meilleure étape suivante n’est pas une autre démonstration sélectionnée. Prenez une image de votre activité et lancez un essai économique de six secondes en 480p dans le Playground EvoLink. Vérifiez d’abord la stabilité du sujet et du mouvement, puis décidez si le 720p et l’intégration en production sont justifiés.

Sources

Dernière mise à jour : 26 juillet 2026. Les fonctions, paramètres et prix peuvent changer. Consultez la page modèle, la documentation API et le tableau de bord EvoLink avant tout usage en production.

Prêt à réduire vos coûts IA de 89 % ?

Commencez avec EvoLink dès aujourd'hui et découvrez la puissance du routage intelligent des API.