GPT Image 2.5 Flare & Sunburst sont disponibles sur EvoLinkEssayer GPT Image 2.5

Prompts MiniMax H3 et exemples vidéo

Parcourez 40 prompts vérifiés avec résultats MiniMax H3 réels, entrées requises et variables réutilisables. Copiez un modèle ou envoyez-le au Playground EvoLink.

MiniMax H3 est aussi appelé Hailuo 3, Hailuo 3.0 ou Hailuo 03.

Mode de génération

Cas d’usage

40 prompts sur 40

Prompts MiniMax H3 : Marque & publicité produit

Publicité verticale pour des lunettes générée avec MiniMax H3 : deux mannequins dans un studio blanc sans raccord portant des lunettes enveloppantes futuristesRÉFÉRENCE MULTIMODALE
15s9:163 médias de référence

Marque & publicité produit

Campagne de lunettes futuristes

Publicité mode à trois images, chacune responsable du visuel principal, des visages ou du design produit.

Voir les détails

Prompt complet (original anglais vérifié)

Generate a vertical screen 9:16 high-end fashion glasses commercial, taking overall reference to the storyboard rhythm, editing speed, white studio texture and cool fashion atmosphere of the given video. The picture is a minimalist white booth, a seamless white background, a strong sense of high-end advertising, and a clean, simple, handsome, avant-garde, international first-line fashion blockbuster texture. Key visual character reference picture 1, two full-body female models, one black female model and one European and American model, maintain their high-end clothing, body posture, white studio light and shadow, fashion show temperament and overall cool attitude. Both of them wear futuristic high-end glasses. The design of the glasses refers to Figure 3, emphasizing the covered curved surface, sharp geometric cat-eye/goggle hybrid outline, mirror reflection, streamlined temples, and the texture of high-end fashion accessories. Please refer to Figure 2 for the appearance details of the two characters.

Éléments à fournir

  • Image 1 : le visuel clé — mannequins en pied, garde-robe, lumière de studio et attitude.
  • Image 2 : le détail des visages, pour que les deux personnages restent identiques d’un plan à l’autre.
  • Image 3 : le produit, photographié assez nettement pour que sa silhouette et ses matières survivent à un montage rapide.
  • Un fond de studio sans raccord que vous acceptez de garder sur tout le clip.

Pourquoi il fonctionne

  • Trois références avec trois fonctions explicites : c’est exactement le schéma pour lequel la route de référence est conçue ; l’ambiguïté est ce qui fait échouer les prompts multi-images.
  • Le produit est décrit par sa géométrie — courbure enveloppante, contour hybride cat-eye/masque, surface miroir, branches profilées — et pas seulement par son nom.
  • Un studio blanc uni retire toute variance du fond, pour que le budget aille au produit et aux mannequins.

Variables à remplacer

  • catégorie de produit
  • casting des mannequins
  • couleur du studio
  • rythme de montage
  • garde-robe

Contraintes

  • Le prompt publié demande aussi le rythme d’une vidéo donnée. Le jeu d’assets diffusé pour ce cas contient trois images : traitez cette ligne comme une consigne de style, ou joignez votre propre clip en Video 1.
  • Jusqu’à 9 images, 3 vidéos et 3 clips audio par requête de référence, dans la limite de 12 fichiers au total ; l’audio ne peut jamais être le seul type de référence.

Réglages

Référence multimodale · 15s · 9:16 · 3 médias de référence

Film produit généré avec MiniMax H3 : un casque circum-aural haut de gamme tourne au-dessus d’un socle réfléchissant dans un studio noirTEXTE VERS VIDÉO
15s16:9Aucun média de référence

Marque & publicité produit

Présentation d’un casque haut de gamme

Film produit de 15 secondes en quatre blocs chronométrés, chacun avec son mouvement de caméra et son objectif.

Voir les détails

Prompt complet (original anglais vérifié)

Create a 15-second luxury cinematic product showcase for premium wireless over-ear headphones. 0–4s: Begin with an extreme macro tracking shot moving across the soft memory-foam ear cushion, fine fabric texture, brushed-metal hinge and precision-machined controls. A narrow light band travels across the surface, revealing realistic materials against a deep black studio background. 4–8s: Pull back into a three-quarter hero view. The headphones rotate slowly above a glossy reflective pedestal. The ear cups pivot naturally while the adjustable headband extends slightly, demonstrating flexible construction and comfort. Maintain exact symmetry, stable geometry and consistent proportions. 8–12s: Transition into an elegant exploded-view reveal. The ear cushion, acoustic driver, internal sound chamber, control ring and outer shell separate smoothly in perfect alignment. Subtle luminous sound waves pulse outward from the driver while the camera performs a restrained side orbit. 12–15s: Every component reconnects seamlessly. The headphones settle into a centered front-facing hero composition as soft rim lighting defines the silhouette. Complete a gentle dolly-in toward the ear cups. Premium technology-commercial finish, controlled reflections, realistic shadows, shallow depth of field, crisp surface detail, stable product shape, no hands, no distortion, no onscreen text.

Éléments à fournir

  • Rien à téléverser — le texte vers vidéo ne prend que le prompt.
  • Un produit que vous savez décrire par ses matières et son mécanisme, pas seulement par son nom.

Pourquoi il fonctionne

  • Le temps est découpé en 0–4 s, 4–8 s, 8–12 s et 12–15 s : le modèle reçoit une liste de plans plutôt qu’une liste de souhaits.
  • Chaque bloc bouge la caméra différemment — travelling macro, recul, orbite latérale, avancée — et c’est ce qui fait lire le clip comme monté plutôt que flottant.
  • La dernière ligne est une liste d’interdits (pas de mains, pas de déformation, pas de texte à l’écran) qui couvre les trois échecs habituels des rendus produit.

Variables à remplacer

  • produit
  • matières et finition
  • durée de chaque bloc
  • fond et éclairage
  • présence ou non de la vue éclatée

Contraintes

  • La durée est un entier de 4 à 15 secondes défini dans la requête ; la somme des blocs du prompt doit y correspondre.
  • Les blocs chronométrés sont une direction, pas une timeline stricte. Pas plus de quatre pour un clip de 15 secondes.
  • Ce clip a été publié par son auteur en 720p ; les routes H3 sur EvoLink produisent du 2K.

Réglages

Texte vers vidéo · 15s · 16:9 · Aucun média de référence

Publicité boisson MiniMax H3 : un marcheur épuisé par la chaleur boit un jus glacé et la rue fleurit en verdure luxuriante autour de la bouteilleTEXTE VERS VIDÉO
15s16:9Aucun média de référence

Marque & publicité produit

Publicité boisson anti-canicule

Un spot boisson classique problème-soulagement : un sujet écrasé de chaleur, une gorgée, et tout l’environnement se métamorphose — jusqu’au plan héroïque final du produit couvert de gouttelettes.

Voir les détails

Prompt complet (original anglais vérifié)

A young person walks under the blazing summer sun, looking exhausted and sweating heavily. The road shimmers with heat waves, and everything appears dry and dull. Suddenly, they grab a chilled bottle of premium fruit juice from a cooler and take a refreshing sip. Instantly, the environment transforms—lush green trees bloom, vibrant flowers appear, a cool breeze flows, water splashes through the air, and glowing particles surround the scene. Ice cubes and fresh fruit slices (orange, mango, or according to the flavour) swirl around the bottle in cinematic slow motion. End with a stunning close-up of the juice bottle covered in cold water droplets against a bright, refreshing background. Ultra-realistic, premium commercial, 4K, cinematic lighting, high-detail, smooth camera movements, vibrant colours, luxury beverage advertisement. Tagline ideas: Beat the Heat. Taste the Freshness. Every Sip Brings Life. Refresh Your Day, Naturally. Stay Cool. Stay Fresh.

Éléments à fournir

  • Rien à téléverser — cette route ne prend que le prompt.

Pourquoi il fonctionne

  • La publicité est construite comme un changement d’état avant/après — chaleur aride contre fraîcheur luxuriante — ce qui donne au modèle une seule transformation claire à exécuter plutôt qu’une liste d’ambiances.
  • Le produit entre tard et clôt le clip en gros plan héroïque, l’ordre de beats standard des publicités de boisson que le modèle sait reconnaître.
  • Les éléments de saveur (glaçons, tranches de fruits) sont mis en scène comme des objets physiques tourbillonnant au ralenti, pas comme des adjectifs abstraits.

Variables à remplacer

  • type de boisson et indices de saveur
  • décor du sujet épuisé par la chaleur
  • environnement de la transformation
  • texte des slogans

Contraintes

  • La liste de slogans en fin de prompt est une inspiration de copywriting, pas du texte incrusté — déplacez un slogan dans la direction visuelle si vous voulez le voir rendu à l’écran.
  • Une seule transformation tient dans le budget ; ajouter un second produit ou un second changement de scène surchargerait la fenêtre de 15 secondes.

Réglages

Texte vers vidéo · 15s · 16:9 · Aucun média de référence

Prompts MiniMax H3 : UGC & pubs créateurs

Ouverture de stream MiniMax H3 à partir de cinq références : une streameuse au style anime lit sa colonne de chat sur une interface façon Twitch avec badge LIVE et bannière de nouvel abonnéRÉFÉRENCE MULTIMODALE
15s16:95 médias de référence

UGC & pubs créateurs

Ouverture de stream VTuber

Une production à cinq assets : quatre images répartissent identité, habillage de plateforme, pièce et carton d’ouverture en tâches séparées, tandis qu’une référence audio pilote une vraie performance de streameuse en synchronisation labiale — y compris son amorce silencieuse.

Voir les détails

Prompt complet (original anglais vérifié)

Use @Image4as the opening card only: circular Luna avatar, black background, cream “LUNALIVE”, rose “STREAM STARTING”, warm circles, tiny mint accent. Static, chime. Use @Image1 for Luna’s identity only: same face, long center-parted black hair, blue-gray eyes, pink anime hoodie, white headphones around neck, delicate necklace, pale nails. Do not copy the drink, pose, or background from @Image1 . Use @Image2 only for Twitch-like platform chrome: dark top bar with “LUNALIVE”, red “LIVE” badge, “2.4K viewers”, right “STREAM CHAT” rail, bottom title area, rounded “FOLLOW” and pink “SUBSCRIBE” buttons. Do not copy Luna, pose, drink, or room from @Image2 Use @Image3 only for the cozy room behind Luna inside the video area: desk, monitor, white PC, plush shelves, curtain fairy lights, soft pink/purple light. No empty-room showcase shot. Use @Audio1as Luna’s actual vocal performance and behavior reference. @Audio1has a silent lead-in: 0.0–2.4s must be treated as no speech. Preserve her voice identity, cadence, tone, breaths, pauses, emphasis, warmth, and streamer mannerisms. Do not replace the voice, do not generate a different influencer voice, and do not add extra spoken lines beyond @Audio1 Lip sync, mouth shapes, jaw movement, smiles, glances, nods, and small hand movements must follow the audio waveform after 2.4s. Create a 15-second 16:9 Twitch-like stream opening. Important performance direction: Luna is reading chat, not delivering a camera monologue. Place Luna slightly left of center in the video area with the right “STREAM CHAT” rail clearly visible. Whenever she speaks, her eyes angle screen-right toward the chat rail as if she is reading the messages out loud. She returns to camera only for brief reactions. Add constant small movement: eye darts to chat, eyebrow lifts, tiny nods, head tilts, shoulders shifting, one subtle hand gesture near the desk. No stiff talking-head pose. One cursor only, no cursor trail, no duplicate panels, no duplicate buttons. Render only large UI text cleanly. Chat feels alive with typing dots and soft short blurred lines, but only these chat lines are readable: “hi Luna”, “welcome back”, “so cozy”, “gugugaga?”, “RAID INCOMING!”. Do not invent usernames. Chat pops stay quieter than Luna’s voice. [0–2 seconds] Open on @Image4 “LUNALIVE / STREAM STARTING”. Absolute no-speech zone: @Audio1is silent here, Luna is not shown, no mouth movement, no voice on the card. One soft chime only. No movement. [2–7.4 seconds] Hard cut to Luna live at 2.0s, slightly left of center in the cozy room from @Image3 with @Image2 chrome active: “LUNALIVE”, red “LIVE”, “2.4K viewers”, right “STREAM CHAT” rail, bottom title “COZY NEON” and “Just Chatting”. She settles for a beat, eyes already moving toward the chat rail. At about 2.4s when speech begins in @Audio1 , match lip sync exactly while she reads toward the chat rail, not into camera. Chat shows typing dots and soft blurred lines. [7.4–7.9 seconds] First audio pause = chat beat. Typing dots, then readable messages pop in: “hi Luna”, “welcome back”. Luna’s eyes track the new messages on the right rail; small nod and smile follow the audio pause. [7.9–12.5 seconds] Continue matching @Audio1Keep her gaze mostly on the chat rail while speaking, like she is reading and reacting. Add one more readable message: “so cozy”. During any softer phrase, she leans slightly forward as if reading; during brighter phrases, eyebrows lift and shoulders react. No frozen face. [12.5–13.9 seconds] Bigger audio pause = bigger chat beat. “gugugaga?” appears, then “RAID INCOMING!”, and a clean “NEW FOLLOWER” banner slides in with a gentle pop. Luna reads the raid message from the chat rail, then reacts brighter as the audio resumes. [13.9–14.8 seconds] Finish @Audio1 with accurate lip sync. If the audio winds down, Luna stops talking, gives a small wave toward chat, and settles into a warm listening pose. End on the stable live frame: Luna slightly left of center, eyes toward the right chat rail, red “LIVE”, “2.4K viewers”, no end card. Audio mix: 0–2s card is silent except one soft chime. @Audio1voice begins only after the cut to Luna and remains primary. Tiny chat pops under the voice. Warm low room tone. No crowd noise, no music lyrics, no rain, no traffic.

Éléments à fournir

  • Image 1 : l’identité de la streameuse uniquement — visage, cheveux, hoodie ; la pose et l’arrière-plan sont explicitement exclus de la copie.
  • Image 2 : l’habillage de la plateforme de stream — colonne de chat, badge LIVE, boutons.
  • Image 3 : la pièce cosy derrière elle.
  • Image 4 : le carton d’ouverture statique « stream starting ».
  • Audio 1 : sa vraie prise vocale ; notez que le silence de 0–2,4 s est scénarisé comme zone sans parole.

Pourquoi il fonctionne

  • Chaque référence reçoit une seule tâche et deux exclusions explicites « do not copy » — l’attribution de rôles par asset la plus propre de la bibliothèque.
  • La note de jeu — « she is reading chat, not delivering a monologue » — redirige le regard et les micro-gestes, ce qui donne au clip sa sensation de direct.
  • Les messages de chat lisibles sont limités à cinq chaînes exactes et tout le reste demeure flou, si bien que le texte d’interface se rend proprement.

Variables à remplacer

  • planche d’identité de la streameuse
  • style de l’habillage de plateforme
  • les lignes de chat en liste blanche
  • prise audio et ses pauses

Contraintes

  • Le post original écrit @Image1…@Audio1 ; sur EvoLink, désignez les assets par leur position dans le tableau et gardez au moins une image aux côtés de l’audio — l’audio ne voyage jamais seul.
  • La route accepte jusqu’à 9 images, 3 vidéos et 3 clips audio, plafonnés à 12 fichiers au total.

Réglages

Référence multimodale · 15s · 16:9 · 5 médias de référence

Publicité UGC MiniMax H3 : une femme se filme en train d’appliquer un sérum capillaire au compte-gouttes dans une chambre lumineuse, cadrage façon smartphoneRÉFÉRENCE MULTIMODALE
15s3:41 média de référence

UGC & pubs créateurs

Publicité UGC pour sérum capillaire

Un témoignage sérum façon TikTok en quatre scènes avec une seule référence produit : intro selfie, gros plan d’application, résultat au miroir, plan produit sur le comptoir — l’imperfection est le style.

Voir les détails

Prompt complet (original anglais vérifié)

Create a 15-second authentic UGC-style hair growth serum ad using the provided product image as the exact product reference. SCENE 1 — 0–3s A young woman films herself in a bright bedroom using a smartphone front camera. Natural lighting, handheld movement, casual appearance. She looks at the camera and says: “I’ve been trying this hair growth serum lately…” SCENE 2 — 3–7s Cut to a close handheld shot of the woman holding the serum bottle. She removes the dropper, applies a few drops directly to her scalp, and gently massages it in. Keep the movement natural and slightly imperfect like real UGC content. SCENE 3 — 7–11s Mirror selfie shot. She runs her fingers through her hair, showing healthy-looking, fuller hair while casually talking to the camera: “And honestly, I love how easy it is to add to my routine.” SCENE 4 — 11–15s Close-up product shot on her bathroom counter. She picks up the bottle and smiles toward the camera. End with natural on-screen text: “Simple hair care. Every day.” Style: authentic TikTok/Reels UGC, smartphone camera, realistic skin texture, natural expressions, subtle handheld motion, imperfect framing, casual home environment, soft daylight, realistic audio, no cinematic commercial look, no excessive beauty filters. Preserve the exact product packaging, label, bottle shape, and branding from the reference image.

Éléments à fournir

  • Image 1 : votre packshot — packaging, étiquette et forme du flacon sont verrouillés depuis cette planche sur les quatre scènes.

Pourquoi il fonctionne

  • L’ordre des scènes reflète le contenu organique des créateurs (accroche → démo → résultat → produit), si bien que la publicité paraît native dans un feed.
  • « Slightly imperfect like real UGC » plus la liste négative anti-cinéma est ce qui déjoue le look de publicité léchée que les acheteurs font défiler sans s’arrêter.
  • Les répliques sont courtes, citées et conversationnelles — l’audio natif les délivre comme une parole de témoignage naturelle.

Variables à remplacer

  • planche produit
  • les deux répliques parlées
  • décors chambre et salle de bain
  • texte final à l’écran

Contraintes

  • L’identité du produit vit entièrement dans l’image de référence ; décrire aussi l’étiquette dans le texte invite au conflit.
  • Le clip publié mesure 2:3, un format que l’API n’accepte pas — demandez 3:4 ou 9:16 pour un vertical natif du feed.

Réglages

Référence multimodale · 15s · 3:4 · 1 média de référence

Vlog food MiniMax H3 : une jeune femme lève un cheeseburger gourmet vers la caméra de son téléphone en riant entre des jump cuts rapidesRÉFÉRENCE MULTIMODALE
15s21:91 média de référence

UGC & pubs créateurs

Vlog UGC soirée burger

Un gabarit de vlog food en huit plans avec un burger de référence verrouillé : accroche selfie, ouverture de la boîte, zoom coup de poing, fromage filant, réaction à la bouchée — les jump cuts assurent tout le travail de rythme.

Voir les détails

Prompt complet (original anglais vérifié)

Duration: 15 seconds | Aspect Ratio: 16:9 | Style: Authentic UGC / iPhone selfie-vlog, handheld, natural light, TikTok/Reels aesthetic. Product Reference: Use the uploaded gourmet burger image as the only product reference. Preserve the bun shape, patty thickness, cheese melt, lettuce, tomato, sauces, and proportions exactly in every shot. Character Description Name: Hana A young Japanese woman in her early 20s with natural beauty, long dark hair in a loose ponytail, oversized cream sweatshirt, minimal makeup, bright smile, friendly lifestyle-vlogger personality. Shot Breakdown SHOT 1 (0–2s) — Selfie showing the burger box. Dialogue: "Burger night!" SHOT 2 (2–4s) — Opens the box. SHOT 3 (4–6s) — Quick zoom on the burger. SHOT 4 (6–8s) — Hands lifting the burger with cheese stretching naturally. SHOT 5 (8–10s) — Bite reaction. Dialogue: "Okay... that's incredible." SHOT 6 (10–12s) — Casual close-up b-roll while reaching for fries. SHOT 7 (12–14s) — Toasting the burger toward the camera. Dialogue: "You need this." SHOT 8 (14–15s) — Freeze frame with overlay: "burger cravings = solved 🍔" Look & Feel Warm apartment lighting, genuine phone footage, slight grain, natural autofocus breathing, handheld imperfections, fast jump cuts. Negative Prompt cinematic grading, commercial production, CGI burger, fake cheese, distorted hands, warped food, perfect stabilization, studio lighting, text glitches, logo distortion.

Éléments à fournir

  • Image 1 : le plan héroïque du plat — pain, steak, fondant du fromage et proportions restent identiques à chaque coupe.

Pourquoi il fonctionne

  • Huit micro-plans d’environ 2 secondes chacun correspondent à la façon dont les vrais créateurs food montent réellement — l’énergie est native du format.
  • Le personnage nommé (« Hana ») avec deux courtes répliques citées donne au modèle un visage et une voix stables sans surspécifier.
  • La physique de la nourriture reçoit sa propre consigne (le fromage qui s’étire naturellement) — le plan-clé est scénarisé, pas espéré.

Variables à remplacer

  • le plat et sa planche
  • style du personnage
  • les deux répliques de dialogue
  • texte de l’arrêt sur image final

Contraintes

  • Gardez la description du plat uniquement dans l’image de référence ; la liste négative (pas de burger CGI, pas de faux fromage) protège le réalisme.

Réglages

Référence multimodale · 15s · 21:9 · 1 média de référence

Prompts MiniMax H3 : Typographie & texte animé

Film de mode MiniMax H3 : des rubans d’aquarelle entraînent la caméra autour d’une femme en robe blanche à col montant pendant que la phrase LET SILENCE BLOOM se forme en lettres physiquesTEXTE VERS VIDÉO
15s16:9Aucun média de référence

Typographie & texte animé

Plan-séquence couture à l’aquarelle

Un film de mode avant-gardiste où des rubans d’aquarelle tirent une unique caméra continue à travers l’espace, où la typographie existe comme objet physique et où chaque mouvement retombe sur la musique.

Voir les détails

Prompt complet (original anglais vérifié)

## Concept AQUARELLE No.7 — an avant-garde haute couture film where watercolor becomes a living medium. 15-second cinematic sequence. The rhythm controls the visual world: 0–4s: restrained silence and negative space 4–8s: gradual density buildup 8s: drop moment, expanding into fluid long-form motion 12–15s: transition into a final fashion poster composition ## Character Identity Lock Maintain the exact same female character throughout the entire video. Identity: - Young woman - Long black hair - Calm and refined facial features - White high-neck pigment dress - Black wide belt - Pigment heels Strict consistency: - Same face - Same hairstyle - Same age - Same body proportions - Same garment structure Any new colors must only appear through watercolor gradually absorbing into the fabric. Core concept: Her fingertips can extract transparent watercolor ribbons from the air. These watercolor ribbons can: - Pull the camera through space - Transform the environment - Shape physical typography - Interact with depth and materials The world follows real cinematic physics: water, paper, fabric, light, shadows, and depth of field must feel physically believable. ## Camera Direction Strict one-take shot. No cuts. No teleportation. No hidden transitions. Camera journey: Macro shot of a floating water droplet → watercolor ribbon emerges → camera pulls back to reveal the woman → camera circles around her → enters a paper art gallery → passes through dimensional typography → rises into a final overhead fashion poster. ## Typography Only allow these words: LET SILENCE BLOOM AQUARELLE No.7 WEAR THE UNSEEN Typography is not a flat overlay. Letters must have: - Physical depth - Wet watercolor reflections - Paper fiber edges - Shadows - Occlusion - Material interaction ## Visual Style Avant-garde fashion editorial. Inspired by: - Museum catalog composition - Handmade ivory paper - Sculptural negative space - Elegant Didone serif typography - Translucent watercolor calligraphy Color palette: - Pale cyan - Crimson lake - Smoky violet - Ink black ## Motion Language Every movement follows the music: Kick: Camera movement and paper folding. Wooden snare: Paper structures physically fold and transform. Sub-bass: Changes the perception of spatial scale. ## Storyboard 30 beats, 0.5 seconds each. 01 0.0–0.5 Macro shot: A transparent water droplet floats in the air, reflecting a blurred silhouette of a black-haired woman. 02 0.5–1.0 The droplet stretches with the breath-like vocal, becoming a pale cyan watercolor thread. 03 1.0–1.5 Camera travels backward along the thread as paper fibers slowly emerge into focus. 04 1.5–2.0 The thread wraps around the lens. Focus shifts to her raised fingertip. 05 2.0–3.0 Camera continues pulling back, revealing her face and white high-neck dress. 06 3.0–4.0 She moves her wrist. The watercolor thread guides a smooth camera arc. 07 4.0–8.0 Additional watercolor colors emerge from her movement. Paper folds, typography begins forming, and the phrase "LET SILENCE BLOOM" appears as a physical object. 08 8.0–12.0 The camera passes through a transparent paper flower structure. The environment expands into an endless ivory paper gallery. Her dress absorbs watercolor naturally. The ribbons create sculptural forms around her body. 09 12.0–15.0 Camera cranes upward. The composition transforms into a luxury fashion advertisement poster. Typography appears: AQUARELLE No.7 WEAR THE UNSEEN Final frame: A museum-level fashion editorial poster. The woman remains centered, calm, and elegant. A final watercolor droplet remains suspended in the air. ## Negative Prompt No: - Cuts - Scene changes - Identity change - Face swap - Extra limbs - Deformed hands - Random costume changes - Explosive paint effects without physical cause - Incorrect typography - Chinese characters - Extra subtitles - Extra logos - Watermarks

Éléments à fournir

  • Rien à téléverser — cette route ne prend que le prompt.

Pourquoi il fonctionne

  • Le trajet de caméra est écrit comme une chaîne continue (goutte → ruban → révélation → galerie → poster en plongée) avec « no cuts » posé en règle dure.
  • La typographie est sur liste blanche — seules trois phrases peuvent apparaître — et dotée de propriétés matérielles (bords en fibre de papier, reflets humides, occlusion), raison pour laquelle les mots se rendent proprement.
  • Un storyboard de 30 beats à 0,5 s par beat mappe le son sur l’espace : le kick plie le papier, la snare transforme les structures, les sub-basses changent l’échelle.

Variables à remplacer

  • les trois phrases autorisées
  • palette de pigments
  • structure du vêtement
  • environnement de la galerie

Contraintes

  • La liste blanche de phrases est le mécanisme de qualité typographique — ajouter du texte réintroduit la dérive d’orthographe que le prompt est construit pour éviter.
  • Les prompts en plan-séquence échouent bruyamment : si un seul beat implique une coupe, toute la chaîne spatiale se brise.

Réglages

Texte vers vidéo · 15s · 16:9 · Aucun média de référence

Animation éducative MiniMax H3 : une lettre A arrondie se gonfle en pomme rouge souriante à côté du mot APPLE dans une douce scène pastelTEXTE VERS VIDÉO
15s16:9Aucun média de référence

Typographie & texte animé

Animation d’apprentissage A-B-C-D

Une animation de phonétique pour enfants avec une boucle pédagogique fixe — lettre, son, objet, action, mot — où chaque lettre se métamorphose physiquement en son objet et où la narration est scénarisée à la seconde.

Voir les détails

Prompt complet (original anglais vérifié)

Create a 15-second animated educational video that teaches young children the letters A, B, C, and D. The learning pattern for every letter must be: LETTER → SOUND → OBJECT → PLAYFUL ACTION → OBJECT NAME Target audience: children ages 3 to 6. Visual style: Use adorable rounded 3D characters, soft pastel colors, gentle facial expressions, and simple recognizable objects. Combine this with a premium minimalist technology aesthetic featuring clean white space, elegant composition, soft studio lighting, subtle reflections, smooth gradients, rounded geometry, crisp typography, and extremely polished transitions. The animation should feel playful and child-friendly while remaining calm, uncluttered, and beautifully designed. Use a clean off-white background with a different soft color glow behind each letter. 0:00–0:01 | Introduction A small smiling star mascot bounces into the center of the screen. Colorful letters briefly float around it. Display the text: “Let’s learn!” The mascot taps the screen, creating a soft ripple that reveals the first letter. 0:01–0:04 | A is for Apple Show a large uppercase “A” and smaller lowercase “a” beside it. Use thick, rounded, highly readable typography. The narrator says: “A. A says ah. A is for Apple.” The uppercase A gently inflates and transforms into a shiny red apple. Its top point becomes the apple stem, and a small green leaf unfolds from the side. The apple gains a cute smiling face and performs one soft bounce. Display the word: “APPLE” Highlight the first letter A in red. Add a soft pop and a tiny crunchy sound. 0:04–0:07 | B is for Ball The apple rolls across the screen and leaves behind a curved red trail. The trail loops twice and forms a large uppercase “B,” with a lowercase “b” appearing beside it. The narrator says: “B. B says buh. B is for Ball.” The two rounded sections of the B expand and merge into a colorful striped ball. The ball bounces twice with playful squash-and-stretch animation. Display the word: “BALL” Highlight the first letter B in blue. Synchronize each bounce with a soft musical note. 0:07–0:10 | C is for Cat On its final bounce, the ball stretches into a curved shape and becomes a large uppercase “C.” A lowercase “c” slides gently into place beside it. The narrator says: “C. C says kuh. C is for Cat.” The C rotates and becomes the curled tail of a cute orange cat. The rest of the cat forms from soft rounded shapes. The cat stretches, blinks, and gives one gentle wave with its paw. Display the word: “CAT” Highlight the first letter C in orange. Add a quiet and friendly “meow.” 0:10–0:13 | D is for Duck The cat’s tail uncurls and transforms into the curved side of a large uppercase “D.” A lowercase “d” pops up beside it. The narrator says: “D. D says duh. D is for Duck.” The straight line of the D becomes the duck’s neck. The curved section becomes its round yellow body. A small orange beak and two tiny wings pop into place. The duck waddles forward, flaps its wings, and gives one cheerful quack. Display the word: “DUCK” Highlight the first letter D in yellow. Add tiny water ripples beneath its feet. 0:13–0:15 | Recap The apple, ball, cat, and duck slide into four clean rounded tiles. Place their letters above them: “A B C D” The mascot returns and points to each object as they bounce once in sequence. Narrator: “A, B, C, D. Great job!” Finish with the text: “Great job!” Use a small sparkle animation and a warm musical chime. Animation requirements: Keep each letter fully visible for a moment before it transforms. Show uppercase and lowercase versions clearly. Make every object instantly recognizable. Use smooth shape morphing so children can visually understand how the letter becomes the object. Maintain stable spelling, clean letterforms, accurate object shapes, and consistent character design. Use gentle squash-and-stretch, soft motion blur, subtle shadows, polished lighting, and precisely synchronized sound effects. Avoid fast camera movement, cluttered backgrounds, harsh colors, tiny text, warped letters, random symbols, duplicated objects, scary expressions, or overly complex transformations. The final video should feel cute, educational, memorable, calming, and exceptionally polished.

Éléments à fournir

  • Rien à téléverser — cette route ne prend que le prompt.

Pourquoi il fonctionne

  • La boucle LETTER → SOUND → OBJECT → ACTION → NAME se répète quatre fois avec une structure identique, et la répétition est le plus puissant stabilisateur dont dispose H3.
  • Chaque morphing est une explication géométrique (la pointe du A devient la tige de la pomme, les panses du B deviennent le ballon), si bien que les formes des lettres survivent à la transformation.
  • Les lignes de narration sont citées exactement avec des horodatages par segment, pilotant l’audio natif et gardant le texte affiché synchronisé.

Variables à remplacer

  • les quatre lettres et leurs objets
  • design de la mascotte
  • halo coloré par lettre
  • voix de narration

Contraintes

  • La stabilité de l’orthographe dépend de la règle « keep each letter fully visible before it transforms » — la couper réintroduit des glyphes déformés.

Réglages

Texte vers vidéo · 15s · 16:9 · Aucun média de référence

Typographie cinétique MiniMax H3 : les mots Every great change émergent de l’obscurité en fines lettres serif parmi des particules dorées en dériveTEXTE VERS VIDÉO
15s16:9Aucun média de référence

Typographie & texte animé

Typographie cinétique de citation

De la typographie cinétique pure : une citation révélée segment par segment, chaque segment changeant l’atmosphère, le langage du mouvement et la palette de la scène jusqu’au verrouillage de la phrase complète sur un carton final blanc cassé.

Voir les détails

Prompt complet (original anglais vérifié)

Create a 15-second cinematic text-animation video built around the quote: “Every great change begins quietly, grows through courage, and becomes impossible to ignore.” The quote should appear gradually as a visual story. Each new phrase must transform the design, atmosphere, movement, and emotional intensity of the scene. Use elegant typography, accurate spelling, cinematic lighting, smooth transitions, and perfectly readable text. 0:00–0:03 | “Every great change” Begin with a completely black screen. A tiny point of warm light slowly appears in the center, like the first spark of an idea. The words “Every great change” emerge softly from the darkness, one word at a time. Use thin, elegant serif typography with wide letter spacing. “Every” fades in gently. “Great” grows slightly larger. “Change” forms from small drifting particles that gather into solid letters. Keep the scene quiet, minimal, and mysterious. 0:03–0:06 | “begins quietly,” The camera slowly moves closer to the text. The previous words shrink and reposition toward the upper-left corner as the phrase “begins quietly,” appears in delicate lowercase letters. Animate the phrase as though it is being written by an invisible hand. Each letter should create a subtle ripple in the darkness. Introduce faint textures, soft shadows, floating dust, and gentle light rays. The comma should appear last and create a small circular pulse. 0:06–0:09 | “grows through courage,” The pulse expands and transforms the scene from darkness into a rich sunrise gradient with deep orange, red, and golden tones. The words “grows through courage” rise upward from the bottom of the frame. Animate “grows” by gradually increasing its size and weight. Animate “through” along a curved path. Animate “courage” in bold uppercase letters that push through a translucent barrier, causing it to crack into geometric fragments. The movement should feel powerful but controlled. 0:09–0:12 | “and becomes” The fragments rotate in slow motion and reorganize into a clean editorial grid. The phrase “AND BECOMES” appears across the frame in condensed sans-serif typography. Animate the letters with fast tracking changes, vertical stretching, masking, and perspective movement. The camera accelerates forward through the center of the word “BECOMES.” The sound and visual energy should steadily build. 0:12–0:14 | “impossible to ignore.” Reveal a vast bright space filled with light, moving shapes, and large-scale typography. The words “IMPOSSIBLE TO IGNORE” appear one after another. “IMPOSSIBLE” expands beyond the edges of the screen. “TO” remains small and perfectly centered. “IGNORE” slams into place with strong visual impact, briefly shaking the surrounding grid and shapes. Use bold contrast, dramatic scale, sharp shadows, and synchronized motion. 0:14–0:15 | Final quote All movement stops instantly. The complete quote appears centered on a clean off-white background: “Every great change begins quietly, grows through courage, and becomes impossible to ignore.” Use refined black typography with “change,” “courage,” and “impossible” highlighted in deep red. Hold the final composition clearly for the last second. Maintain one continuous visual journey from darkness to light, silence to impact, and simplicity to complexity. Keep every phrase connected through visual transformations rather than hard cuts. Use realistic motion blur, precise kerning, clean masks, stable letterforms, smooth camera movement, subtle film grain, cinematic sound design, rising ambient music, soft particles, controlled color transitions, and a final deep impact sound. Avoid misspelled words, warped letters, duplicated characters, unreadable text, random symbols, excessive flickering, chaotic layouts, inconsistent fonts.

Éléments à fournir

  • Rien à téléverser — cette route ne prend que le prompt.

Pourquoi il fonctionne

  • Chaque segment possède un bloc de 3 secondes avec son propre verbe d’animation (émerger, s’écrire à la main, monter, claquer), si bien que la montée d’énergie est structurelle, pas adjectivale.
  • L’arc émotionnel est mappé sur le langage graphique — de l’obscurité au dégradé d’aube puis à la grille éditoriale — donnant au modèle un script de palette, pas seulement des mots.
  • Un arrêt net (« all movement stops instantly ») plus un carton final tenu garantit une dernière image lisible pour les miniatures.

Variables à remplacer

  • la citation et son découpage en segments
  • mots mis en évidence et couleur d’accent
  • verbes d’animation par segment
  • style du carton final

Contraintes

  • Gardez des segments d’environ 6 mots maximum ; H3 rend le texte d’affichage court bien plus fiablement que des lignes longues comme des phrases.

Réglages

Texte vers vidéo · 15s · 16:9 · Aucun média de référence

Prompts MiniMax H3 : Mini-série & narration

Bande-annonce verticale générée avec MiniMax H3 : un vampire et une héroïne humaine dans un intérieur de château éclairé à la bougieRÉFÉRENCE MULTIMODALE
15s9:162 médias de référence

Mini-série & narration

Mini-série romantique de vampires

Accroche verticale : une image verrouille les deux rôles, une autre le lieu, et le prompt se concentre sur la relation, le rythme et les cadrages.

Voir les détails

Prompt complet (original anglais vérifié)

Generate a 15-second, 9:16 vertical trailer segment for an international live-action vampire romance short drama. Use Figure 1 as the appearance reference for the male and female leads, and Figure 2 as the scene reference. Keep both leads' identities consistent, with a realistic live-action look and premium short-drama production quality. Story: an innocent human heroine accidentally enters a forbidden area of an old castle and awakens a sleeping aristocratic vampire. He discovers that she carries an aura connected to an ancient war, which sparks a powerful urge to control her and a dangerous fascination with her. She fears him but does not completely submit, resisting his pressure. Overall style: an international ReelShort / DramaBox vampire-romance trailer. Dark romance, dangerous attraction, fate, intense control, brooding oppression, and a striking reversal. Keep the visuals premium, restrained, and tightly paced, like the opening 15-second hook of a hit short drama. No gore, cheap horror, Halloween aesthetic, or modern street feel. Format: 9:16 vertical composition for TikTok / ReelShort / DramaBox. Use primarily medium close-ups, close-ups, and extreme close-ups, emphasizing faces, eye contact, pressure, and relationship tension within the vertical frame.

Éléments à fournir

  • Image 1 : les deux rôles principaux ensemble, pour que le modèle les lise comme un casting cohérent.
  • Image 2 : le décor — l’intérieur du château, sa lumière et ses matières.
  • Une prémisse en une phrase et un retournement émotionnel explicite ; une accroche de 15 secondes porte un retournement, pas un épisode entier.

Pourquoi il fonctionne

  • Nommer la référence de genre (bande-annonce ReelShort / DramaBox) transmet rythme, étalonnage et conventions de cadrage en quelques mots.
  • Le vocabulaire de cadrage est fixé — plan taille, gros plan, très gros plan — et c’est ce qui rend un format vertical haut de gamme plutôt qu’à l’étroit.
  • La liste d’exclusions (pas de gore, pas d’horreur bon marché, pas d’esthétique Halloween, pas d’ambiance rue contemporaine) écarte les quatre dérives habituelles du genre.

Variables à remplacer

  • références d’apparence des rôles principaux
  • lieu
  • prémisse et retournement
  • look de la plateforme visée
  • combinaison des cadrages

Contraintes

  • Le format vertical se demande via aspect_ratio sur la route de référence, pas en écrivant « 9:16 » dans le prompt.
  • L’identité tient bien mieux quand les deux rôles arrivent sur une seule image plutôt que sur deux portraits recadrés séparément.

Réglages

Référence multimodale · 15s · 9:16 · 2 médias de référence

Transition d’interface de visual novel générée avec MiniMax H3 entre une image d’ouverture et une image de fin fixéesPREMIÈRE / DERNIÈRE IMAGE
15s16:92 médias de référence

Mini-série & narration

Transition de visual novel otome

Les première et dernière images fixent les extrémités ; le texte ne décrit que la transition et l’évolution émotionnelle.

Voir les détails

Prompt complet (original anglais vérifié)

Use the first image as the opening frame and the second image as the exact final frame to generate an otome visual-novel interface transition. Overall feel: a premium Chinese otome romance-interaction interface capturing an intimate moment before and after a performance. Transition naturally from "choose to watch his performance" to "Han Xu is drawn in by the heroine's words and reacts with intrigued interest." UI text, choices, and dialogue boxes should appear with refined otome-game presentation. Keep the transition silky smooth and the emotion suggestive yet restrained.

Éléments à fournir

  • Image 1 : l’image d’ouverture, avec l’état de son interface.
  • Image 2 : exactement l’image de fin sur laquelle vous voulez atterrir.
  • Une phrase décrivant le changement émotionnel entre les deux états.

Pourquoi il fonctionne

  • Les deux extrémités sont verrouillées : le modèle résout une interpolation au lieu d’une composition, la voie la plus fiable vers un plan prévisible.
  • Le prompt nomme la transition émotionnelle (« choisir de regarder sa performance » → « happée et intriguée ») au lieu d’énumérer des images, si bien que le jeu porte le raccord.
  • Demander que les éléments d’interface s’animent dans le langage du genre évite que l’UI soit redessinée.

Variables à remplacer

  • images d’ouverture et de fin
  • arc émotionnel entre les deux
  • style de présentation de l’interface
  • vitesse de transition

Contraintes

  • Envoyez les deux images en image_start et image_end sur la route image-vers-vidéo ; la route de référence n’accepte pas ces champs.
  • Plus les deux images se ressemblent en cadrage et en lumière, plus l’interpolation est douce. Deux compositions sans rapport produisent une coupe, pas une transition.

Réglages

Première / dernière image · 15s · 16:9 · 2 médias de référence

Séquence d’époque MiniMax H3 : des soldats en uniformes des années 1940 s’abritent derrière des voitures anciennes dans une rue rurale américaine enfumée, filmée comme des archivesTEXTE VERS VIDÉO
15s16:9Aucun média de référence

Mini-série & narration

Réalisme d’actualités de guerre années 1940

Une simulation d’actualités de 1947 fidèle à l’époque, dont le réalisme vient de trois systèmes empilés : un décor cohérent avec l’époque, un contrat de physique et une liste négative qui bannit tout objet moderne.

Voir les détails

Prompt complet (original anglais vérifié)

Create a 15-second ultra-photorealistic live-action war sequence set in the United States in 1947, designed to look like authentic historical footage captured on a 1940s film camera. The entire scene must feel grounded, documentary-like, raw, and physically realistic. Environment: A rural American town in 1947 with wooden houses, old brick buildings, telephone poles, dirt roads, vintage American cars from the 1940s, wooden fences, farmland, and period-accurate street details. Overcast afternoon light, light fog, drifting smoke, dust in the air, damaged buildings, scattered debris, and a tense wartime atmosphere. Characters: American soldiers wearing historically accurate late-1940s military uniforms, helmets, boots, and equipment. Civilians wear authentic 1940s American clothing. Natural faces, realistic skin texture, sweat, dirt, fatigue, and believable body movements. 0–3s — Establishing Shot: Wide handheld shot of a quiet rural American street suddenly filled with smoke and confusion. Vintage 1940s vehicles are parked along the road while soldiers move quickly between wooden buildings. Civilians rush toward safer areas. 3–6s — Tension: Camera moves through the street at shoulder height, following several soldiers as distant gunfire is heard. They immediately react and take cover behind a vintage vehicle and a brick wall. Their movements are cautious and realistic. 6–10s — Combat: Fast handheld tracking shot as the soldiers move between cover while distant gunfire impacts the environment. Small pieces of wood, dust, and debris fall naturally from nearby impacts. Weapon recoil, movement, and body weight must be physically accurate. Keep the violence realistic and restrained. 10–13s — Human Moment: Camera briefly focuses on a soldier helping an injured civilian move behind cover. Their breathing, facial expressions, body language, and movement should feel natural and unscripted. 13–15s — Final Shot: Camera pulls back into a wide shot of the American town as smoke slowly moves through the street. Soldiers remain behind cover while vintage vehicles and damaged buildings fill the background. The scene ends with an authentic, tense 1940s documentary feeling. Visual Style: Ultra-photorealistic live-action, authentic 1940s American environment, vintage 35mm film texture, subtle film grain, natural imperfections, realistic exposure, handheld documentary cinematography, muted historical color palette, realistic smoke and dust, natural shadows, accurate depth of field. Physics: Strictly obey real-world gravity, momentum, inertia, friction, recoil, weight, collision physics, and human biomechanics. No exaggerated explosions, impossible movements, superhero behavior, or choreographed-looking combat. Negative Prompt: modern buildings, modern cars, smartphones, modern clothing, modern weapons, futuristic technology, CGI appearance, video-game graphics, fantasy, superhero action, excessive explosions, excessive blood, gore, impossible physics, unrealistic recoil, slow-motion physics, distorted faces, extra limbs, floating objects, plastic skin, artificial-looking environments.

Éléments à fournir

  • Rien à téléverser — cette route ne prend que le prompt.

Pourquoi il fonctionne

  • L’exactitude d’époque est imposée deux fois — positivement (voitures des années 1940, uniformes, poteaux téléphoniques) et négativement (pas de smartphones, pas de bâtiments modernes) — fermant les deux directions d’échec.
  • Le paragraphe de physique (« strictly obey gravity, momentum, recoil… ») se lit comme une spécification de rendu et supprime visiblement les mouvements façon super-héros.
  • Un beat humain discret (un soldat aidant un civil) est programmé à 10–13 s, donnant à la séquence une crédibilité documentaire plutôt que de l’action ininterrompue.

Variables à remplacer

  • époque et lieu
  • le moment humain
  • rendu de la pellicule
  • intensité des beats de combat

Contraintes

  • Les clauses de retenue (« violence realistic and restrained », pas de gore) font partie de ce qui rend ce résultat utilisable — conservez-les en adaptant.

Réglages

Texte vers vidéo · 15s · 16:9 · Aucun média de référence

Prompts MiniMax H3 : Personnage & mouvement

Animation en pâte à modeler générée avec MiniMax H3 : un renard en argile franchit un canyon de lave pendant que la caméra passe sous luiPREMIÈRE / DERNIÈRE IMAGE
10s16:91 média de référence

Personnage & mouvement

Renard en argile sautant un canyon

Une image de départ devient une action unique, avec un mouvement de caméra décrit aussi précisément que le saut.

Voir les détails

Prompt complet (original anglais vérifié)

Claymation style. A sprinting fox reaches the edge of a cliff and launches without hesitation, making a dramatically tense, heroic slow-motion leap across a vast lava canyon. While the fox is airborne, the camera rushes at high speed beneath its belly in a sweeping dynamic move, fully revealing the terrifying depth of the chasm and the fox's clay body at maximum extension in midair.

Éléments à fournir

  • Une image de départ qui porte déjà le style — ici le renard en argile et sa matière.
  • Une action que vous voulez voir arriver. Pas trois.

Pourquoi il fonctionne

  • Le prompt décrit le changement, pas l’image. L’image de départ contient déjà l’apparence, donc chaque mot achète du mouvement.
  • La caméra reçoit sa propre consigne — un passage à grande vitesse sous le ventre du renard — et c’est ce qui transforme un saut en plan.
  • Nommer le moment de bascule (« extension maximale en plein vol ») donne au modèle une pose cible autour de laquelle construire le timing.

Variables à remplacer

  • personnage et style de matière
  • environnement et danger
  • trajectoire de caméra
  • accent du ralenti

Contraintes

  • La route image-vers-vidéo déduit le format de sortie de l’image d’entrée et rejette aspect_ratio.
  • Ne redécrivez pas ce que l’image de départ montre déjà : répéter l’apparence statique est la façon la plus courante de gaspiller un prompt image-vers-vidéo.

Réglages

Première / dernière image · 10s · 16:9 · 1 média de référence

Transfert de mouvement généré avec MiniMax H3 : deux personnages référencés exécutent une chorégraphie street dance copiée d’une vidéo de référenceRÉFÉRENCE MULTIMODALE
10s16:93 médias de référence

Personnage & mouvement

Transfert de mouvement street dance

Une consigne très courte transfère la chorégraphie d’une vidéo vers deux personnages fournis en images.

Voir les détails

Prompt complet (original anglais vérifié)

Have the characters perform street dance following the movements in Video 1. Use Figure 1 and Figure 2 as the character references.

Éléments à fournir

  • Image 1 et Image 2 : les deux personnages, une référence en pied nette pour chacun.
  • Video 1 : le mouvement à copier, 2 à 15 secondes, avec l’interprète entièrement dans le cadre.

Pourquoi il fonctionne

  • Le prompt est court parce que ce sont les références qui portent l’information : la vidéo possède le mouvement, les images possèdent les identités.
  • Chaque asset est désigné par sa position dans le tableau : aucune ambiguïté sur la référence qui fournit quoi.
  • Rien d’autre n’est demandé. Ni lumière, ni caméra, ni style — chaque consigne supplémentaire entrerait en concurrence avec le mouvement à copier.

Variables à remplacer

  • personnages
  • chorégraphie source
  • environnement
  • nombre d’interprètes

Contraintes

  • La durée totale des vidéos de référence doit rester sous 15 secondes, chaque clip faisant 2 à 15 secondes entre 23,976 et 60 ips.
  • Les vidéos de référence doivent être en MP4 ou MOV avec H.264 ou H.265, jusqu’à 50 Mo chacune, le corps JSON complet restant sous 64 Mo.

Réglages

Référence multimodale · 10s · 16:9 · 3 médias de référence

Introduction de personnage MiniMax H3 générée depuis une planche de référence : une guerrière aux cheveux noirs et à la queue de cheval tressée révélée des bottes à la pose héroïque en pied dans des ruines de pierreRÉFÉRENCE MULTIMODALE
15s1:11 média de référence

Personnage & mouvement

Intro héroïque sur planche de personnage

Le gabarit communautaire le plus aimé de la bibliothèque : une seule planche de référence de personnage pilote une introduction cinématographique des bottes au visage puis au corps entier, qui fonctionne pour n’importe quel design de personnage original.

Voir les détails

Prompt complet (original anglais vérifié)

Use @[char ref] as the sole character reference. Preserve the exact identity, face, body proportions, hairstyle, outfit, colors, materials and overall silhouette of the character throughout the entire video. Do not redesign, simplify or replace any defining visual features. Create a cinematic character introduction focused on presence, silhouette, attitude and controlled motion. 0–4s Begin with a close shot of a defining lower-body or detail element such as boots, shoes, feet, hands, clothing hem or an important accessory. The character enters frame or settles into position. The camera slowly tracks upward while hair, clothing and secondary elements move naturally in the wind or environment. 4–8s Reveal more of the body with a medium or medium-wide shot from the back, side or three-quarter angle. The character stands in a calm, composed way inside the environment. The camera makes a smooth orbit, arc or lateral move to gradually reveal the character’s face and silhouette. 8–12s Move into a tight cinematic portrait or upper-body shot. The character performs one subtle signature action that fits their personality, such as lifting the chin, turning the head, adjusting clothing, brushing hair aside, opening a hand, looking toward camera, or shifting posture. Keep the motion minimal and intentional. The expression should match the character’s vibe. 12–15s End with a strong full-body hero shot that clearly presents the entire design and silhouette. Use a low-angle, eye-level or slightly dramatic framing depending on the character’s personality. The character settles into a natural final pose and holds it confidently for a clean final reveal. VISUAL DIRECTION Premium cinematic presentation. Match the visual medium and rendering style of @[char ref]. Emphasize clean silhouette, elegant staging, subtle secondary motion, believable hair and cloth movement, strong composition, atmospheric depth and polished lighting. The scene should feel like a high-end anime, game or film character introduction. CAMERA Use a clear progression from detail reveal to partial reveal to face reveal to full-body hero reveal. Camera movement should be smooth, controlled and intentional. Avoid chaotic motion. ENVIRONMENT Place the character in a fitting environment that supports their identity and mood. The background should enhance the character without distracting from them.

Éléments à fournir

  • Image 1 : votre référence de personnage — une planche de design ou un rendu en pied propre ; la vidéo hérite de l’identité, de la tenue, des matières et du style de rendu de cette planche.

Pourquoi il fonctionne

  • L’échelle de révélation (détail → partiel → visage → plan héroïque en pied) est une grammaire de caméra fixe : le modèle dépense sa variance sur le personnage, pas sur le découpage.
  • « Match the visual medium and rendering style of the reference » fait fonctionner un même prompt pour des personnages anime, en rendu jeu vidéo ou photoréalistes.
  • L’unique emplacement de « signature action » du troisième bloc est là où vit la personnalité — un seul geste, délibérément petit.

Variables à remplacer

  • planche de référence du personnage
  • l’action signature
  • ambiance de l’environnement
  • cadrage de la pose finale

Contraintes

  • Le post original écrit les références sous la forme @[char ref] ; sur la route d’EvoLink, les assets sont désignés par leur position dans le tableau — dites « Image 1 » et cela correspond à image_urls[0].
  • Un personnage, un environnement : ce gabarit ne change volontairement jamais de lieu, et c’est pourquoi la silhouette reste stable.

Réglages

Référence multimodale · 15s · 1:1 · 1 média de référence

Prompts MiniMax H3 : Cinéma & VFX

Teaser de science-fiction généré avec MiniMax H3 : une silhouette isolée devant un vaste portail cosmique circulaire tandis qu’un titre émerge de l’obscuritéRÉFÉRENCE MULTIMODALE
15s16:92 médias de référence

Cinéma & VFX

Teaser mystère de science-fiction

Teaser cinématographique à deux références : une image fixe l’atmosphère, l’autre le personnage, puis le prompt pilote travelling, titre et son.

Voir les détails

Prompt complet (original anglais vérifié)

Realistic cinematic look, high-contrast lighting, and a tight pace. Use Figure 1 as the overall atmosphere and style reference, and Figure 2 as the protagonist reference. Shot 1 — Ultra-wide establishing shot. A huge circular cosmic gateway nearly fills the frame. The person is only a tiny figure seen from behind before the gateway, positioned toward the lower right. The ground is wet and reflective, and the center of the gateway is pitch black. The camera slowly pushes forward. A large title fades in from the edge of the darkness, blurred at first and then sharp: "THE STARS WERE LISTENING". Use an extremely condensed, heavy, all-caps typeface in dark red mixed with rust red, with subtle grain and misted edges. Audio: a deep low-frequency pulse, faint metallic vibrations in the distance, and a soft hit as the text becomes sharp. → Hard cut.

Éléments à fournir

  • Image 1 : la planche d’atmosphère et de style — décor, palette et étalonnage dont le plan doit hériter.
  • Image 2 : le personnage principal, cadré assez large pour que le visage et la silhouette restent lisibles quand il n’occupe qu’une petite part du cadre.
  • Un texte de titre que vous voulez réellement incruster : H3 restitue exactement ce que vous écrivez — restez court et vérifiez l’orthographe.

Pourquoi il fonctionne

  • Chaque référence a une seule fonction — l’Image 1 pour l’atmosphère, l’Image 2 pour le personnage — le modèle n’a donc jamais à deviner laquelle porte le look.
  • Le plan est décrit comme un seul travelling avant continu avec un unique événement (le titre qui devient net) : exactement ce que 15 secondes peuvent porter.
  • Le son est écrit en trois couches précises (pulsation grave, vibrations métalliques lointaines, un impact sur le titre) plutôt qu’en « musique cinématographique » vague.

Variables à remplacer

  • texte du titre et traitement typographique
  • portail ou point de repère du plan d’ensemble
  • couleur du titre
  • nappe sonore
  • comportement de la coupe finale

Contraintes

  • Désignez les assets par leur position dans le tableau — « Figure 1 », « Figure 2 » — en suivant l’ordre de image_urls. La syntaxe @image1 ne fait pas partie de ce contrat d’API.
  • Le prompt publié est volontairement un point de départ : il se termine sur une coupe franche pour que vous puissiez enchaîner votre propre second plan.

Réglages

Référence multimodale · 15s · 16:9 · 2 médias de référence

Clip texte-vers-vidéo généré avec MiniMax H3 : une cuisine au crépuscule filmée à l’épaule pendant qu’une créature lumineuse dessinée à la main se déplace entre les accessoiresTEXTE VERS VIDÉO
15s16:9Aucun média de référence

Cinéma & VFX

Créature lumineuse dans la cuisine

Modèle texte-vers-vidéo mêlant prise de vue réelle et animation dessinée, avec défauts de caméra et exclusions précises.

Voir les détails

Prompt complet (original anglais vérifié)

15-second, 16:9 landscape video. Blend live-action footage of a small kitchen at dusk with hand-drawn glowing animation. The last light of sunset lingers by the window. The lived-in kitchen contains an old wooden table, a half-washed mug, a slightly fogged glass bottle, and a hanging dishcloth. Give the footage subtle one-handed smartphone shake, hesitant close-range focusing, exposure fluctuations caused by backlight, and slightly coarse noise in the shadows. It should not look carefully arranged like an advertisement; instead, it should feel like someone hurriedly captured an unbelievable event at home. Do not show huge eyes, gaping mouths, fangs, threatening or lunging movements, sudden black frames, or jump scares. Use only kitchen room tone, cloth rubbing, the soft clink of a mug, water dripping from the faucet, the camera operator's footsteps and quiet breathing, plus gentle electronic sounds and tiny calls from the hand-drawn creature.

Éléments à fournir

  • Rien à téléverser — cette route ne prend que le prompt.
  • La durée et le format d’image se règlent dans les paramètres de la requête, pas seulement dans le texte du prompt.

Pourquoi il fonctionne

  • Les défauts de la caméra sont nommés — tremblement à une main, mise au point hésitante, variations d’exposition en contre-jour, bruit grossier dans les ombres. C’est ce qui vend « filmé à la va-vite chez soi » plutôt que « publicité ».
  • Une liste d’interdits courte et explicite (pas d’yeux immenses, pas de crocs, pas d’attaque, pas de jump scare) empêche une créature mignonne de glisser vers l’horreur.
  • La direction sonore nomme chaque source séparément : son de la pièce, tissu, tasse, robinet, pas, respiration, plus les sons de la créature.

Variables à remplacer

  • pièce et moment de la journée
  • design et comportement de la créature
  • accessoires sur la table
  • défauts de caméra visibles
  • couches sonores

Contraintes

  • Le prompt annonce sa longueur et son cadrage dans le texte ; l’API a tout de même besoin de duration et aspect_ratio comme champs de requête.
  • Les consignes négatives fonctionnent mieux en liste courte et explicite. Empiler des dizaines d’interdits consomme le budget nécessaire à l’action.

Réglages

Texte vers vidéo · 15s · 16:9 · Aucun média de référence

Course anime MiniMax H3 générée depuis une première image : deux motos volantes échangent leurs positions dans une épingle de montagne mouillée en traînant des lumières cyan et cramoisiesPREMIÈRE / DERNIÈRE IMAGE
15s16:91 média de référence

Cinéma & VFX

Course anime de motos volantes

Une course d’anime sportif pilotée par la première image avec un CRITICAL ENTITY LOCK : exactement deux pilotes nommés sur deux motos entièrement spécifiées, suivis à travers épingles chronométrées, aspirations et photo-finish.

Voir les détails

Prompt complet (original anglais vérifié)

Cinematic Anime Video Scene Generate a 15-second horizontal 16:9 original high-speed hover-bike racing anime video from the provided first frame. CRITICAL ENTITY LOCK: There must be exactly 2 racers and 2 bikes in the entire video: RENJI on VALKYRIE-01 (cyan/black drift bike) and ELENA on AERO-X (crimson/white draft bike). Do not add extra racers, drone support vehicles, spectators, or traffic. Maintain total visual consistency for both bikes, helmet visors, suit patterns, repulsor spark colors, and bike liveries throughout the sequence. Entity identity: VALKYRIE-01: Matte-black and cyan angular hover-bike, exposed repulsor pads, lateral drift brakes, blue plasma exhaust trails, ridden by Renji (cyan trim suit). AERO-X: Pearl-white and neon-crimson aerodynamic hover-bike, enclosed canopy, crimson energy draft aura, white-hot central booster, ridden by Elena (crimson/gold visor suit). Video style: High-budget modern sports anime, sakuga-level velocity animation, crisp line art, vibrant neon lighting contrast, high-speed camera tracking, hyper-realistic friction and energy particle effects. Set on a wet downhill mountain pass at dawn. Camera and pacing: Continuous forward velocity, zero slow-motion interruptions: 0.0s - 3.0s: High-speed rear-tracking shot diving into the first downhill hairpin curve; instant drift initiation. 3.0s - 7.5s: Tight side-parallel tracking shot as bikes navigate rock debris and trade positions through S-curves. 7.5s - 11.5s: Close camera lock on the draft-slingshot maneuver; high-energy particle displacement as booster ignition occurs. 11.5s - 15.0s: Low-angle front-facing camera lock on the final sprint to the finish line bridge, ending on a hyper-speed photo-finish freeze. Action timing: 0.0s - 1.5s: Sequence begins at speed. VALKYRIE-01 leads downhill; AERO-X locks onto its rear bumper. Anti-gravity repulsors spray road water and blue sparks into the frame. 1.5s - 4.0s: First sharp hairpin. VALKYRIE-01 deploys lateral drift airbrakes with a burst of blue thruster fire, sliding sideways at 300 km/h. AERO-X stays glued inside its slipstream aura. 4.0s - 7.0s: Mountain debris hazard. VALKYRIE-01 hops over a boulder using a repulsor burst. AERO-X ducks under it, scraping the neon magenta guardrail in a cloud of friction sparks. 7.0s - 10.0s: S-Curve exchange. Bikes lean side-by-side; their repulsor fields collide, creating a bright electrical shockwave. ELENA pulls the overdrive lever; AERO-X's rear fins extend. 10.0s - 13.0s: Slingshot maneuver. AERO-X bursts out of VALKYRIE-01's draft, igniting its central white plasma booster. Both bikes roar down the final straightaway side-by-side. 13.0s - 15.0s: Final sprint toward the finish light gate. Water sprays violently behind them. Both nose cones cross the finish line simultaneously in a flash of light. Final freeze frame. Motion quality: Fluid 2D animation, extreme speed-line integration, stable bike geometry, flawless vehicle reflection rendering, zero limb or body clipping, high-frame-rate kinetic realism. Environment: Wet mountain pass asphalt, sheer cliff walls, neon cyan and magenta guardrail lights, early dawn sky with pink/purple clouds, water spray, floating spark particles. Final output: 15 seconds, horizontal 16:9, original high-budget sports racing anime, exactly 2 racers, relentless kinetic pacing, dynamic cinematography, no subtitles, no watermarks, no logos.

Éléments à fournir

  • Image de départ : un plan fixe des deux pilotes et de leurs motos dans votre style graphique — toute la séquence se prolonge à partir de cette image.

Pourquoi il fonctionne

  • Le verrouillage d’entités par recensement (« exactly 2 racers and 2 bikes… no spectators, no traffic ») tue l’inflation de foule qui frappe habituellement les prompts de course.
  • Chaque machine reçoit livrée, particularités physiques et combinaison de pilote comme identités nommées : le modèle peut les distinguer à pleine vitesse.
  • Caméra et action vivent sur des timelines séparées qui se référencent mutuellement, gardant un rythme implacable sans jamais demander deux mouvements de caméra à la fois.

Variables à remplacer

  • style graphique de l’image de départ
  • identités et livrées des motos
  • dangers du tracé
  • mise en scène de l’arrivée

Contraintes

  • C’est la route première image : l’image de départ porte le style graphique, et image-to-video n’accepte aucun paramètre aspect_ratio — c’est l’image qui le définit.

Réglages

Première / dernière image · 15s · 16:9 · 1 média de référence

Prompts MiniMax H3 : Audio natif & dialogue

Remplacement de dialogue généré avec MiniMax H3 : la réplique d’un personnage a été remplacée par une nouvelle réplique issue d’un clip audio de référenceRÉFÉRENCE MULTIMODALE
10s16:92 médias de référence

Audio natif & dialogue

Remplacement du dialogue et du jeu

Remplace une réplique en citant mot pour mot l’ancienne et la nouvelle, avec une modification limitée du jeu.

Voir les détails

Prompt complet (original anglais vérifié)

Replace the girl's line in Video 1, "We can't be together. It's not that we don't love each other; we truly can't make it to the end," with the line from Audio 1: "Don't go, okay? This time, let's not let go of each other." Slightly adjust the corresponding performance.

Éléments à fournir

  • Video 1 : le clip contenant la réplique à remplacer.
  • Audio 1 : la nouvelle réplique, WAV ou MP3, jusqu’à 15 Mo et 15 secondes.
  • Les deux répliques écrites mot pour mot dans le prompt.

Pourquoi il fonctionne

  • Citer la réplique sortante indique exactement quel segment du clip traiter, au lieu de « le dialogue vers le milieu ».
  • Citer la réplique entrante donne une cible à la synchronisation labiale au lieu de la déduire du seul audio.
  • « Ajuster légèrement le jeu correspondant » accorde une permission bornée de modifier l’interprétation — bornée, pour que le reste de la prise survive.

Variables à remplacer

  • clip source
  • réplique remplacée
  • nouvelle réplique et voix
  • ampleur autorisée du changement de jeu

Contraintes

  • L’audio ne peut jamais être le seul type de référence ; il doit arriver avec une image ou une vidéo.
  • L’audio et la vidéo de référence sont chacun plafonnés à 15 secondes de durée totale par requête.
  • Dites ce qui reste fixe. Le cadrage, les costumes et l’arrière-plan dérivent si le prompt ne parle que de la réplique.

Réglages

Référence multimodale · 10s · 16:9 · 2 médias de référence

Clip de référence vocale généré avec MiniMax H3 : un personnage prononce une réplique écrite avec le timbre issu d’un clip audio de référenceRÉFÉRENCE MULTIMODALE
10s16:92 médias de référence

Audio natif & dialogue

Référence vocale « Suis le vent »

Le prompt audio minimal : la phrase exacte et un clip qui définit le timbre de la voix.

Voir les détails

Prompt complet (original anglais vérifié)

Character dialogue: "Follow the wind, live free. Leave worries behind, enjoy the moment." Use Audio 1 as the voice-timbre reference.

Éléments à fournir

  • Video 1 : le personnage qui prononcera la réplique.
  • Audio 1 : un échantillon propre de la voix cible, 2 à 15 secondes, idéalement sans musique dessous.
  • La réplique exacte, écrite intégralement.

Pourquoi il fonctionne

  • Le dialogue est cité plutôt que paraphrasé, ce qui donne au timing et à la synchronisation labiale quelque chose de concret sur quoi s’accrocher.
  • Audio 1 se voit confier une seule fonction étroite — le timbre — au lieu d’être livré comme une « bande-son » générale.
  • Rien d’autre n’est spécifié, donc le clip de référence garde le contrôle total du cadrage et du jeu.

Variables à remplacer

  • réplique
  • référence vocale
  • clip du personnage
  • débit

Contraintes

  • Une référence vocale transfère le timbre, pas l’accent, l’émotion ni le rythme ; écrivez-les dans le prompt si cela compte.
  • De la musique ou plusieurs locuteurs dans l’audio de référence dégradent le résultat — fournissez une voix isolée.

Réglages

Référence multimodale · 10s · 16:9 · 2 médias de référence

Montage MiniMax H3 à partir de références personnage et audio : un personnage cornu aux cheveux blancs découpé à travers cinq environnements en plans rapides calés sur le beatRÉFÉRENCE MULTIMODALE
15s1:12 médias de référence

Audio natif & dialogue

Montage d’environnements calé sur l’audio

Un montage à double référence où une image de personnage verrouille l’identité et où un clip audio dicte le montage : cinq environnements, six plans en rafale chacun, chaque coupe retombant sur les accents du morceau.

Voir les détails

Prompt complet (original anglais vérifié)

Use @[char ref] as the strict character reference and @[audio ref] as the timing, rhythm and editing reference. Keep the character’s exact identity, proportions, hairstyle, outfit, colors and overall style consistent throughout. Create a 15-second cinematic burst-cut video showcasing the character across 5 different environments that naturally fit their design, vibe and world. AUDIO SYNC Synchronize the entire edit to @[audio ref]. Cuts, camera accents, transitions and environment changes should land precisely on strong beats, half-beats and musical accents. Let audio1 control the pacing and intensity of the montage. STRUCTURE - 5 environments total - 3 seconds per environment - 6 burst-cut shots per environment - 30 shots total Each environment must be clearly different in atmosphere, lighting, scale and visual language. Show each environment through rapid cinematic angles: wide establishing shots, aerials, low angles, side views, tracking shots, close environmental details, medium shots and hero frames. Every cut must reveal a new angle, distance, composition or spatial relationship. Avoid repeated framing. Mix static shots, push-ins, pull-backs, tracking, orbit and crane-like movement. Keep character movement subtle and natural. The focus is environmental variety, cinematic framing and tight synchronization with audio1. Hard constraints: - exactly 5 environments - exactly 6 shots per environment - exactly 30 shots total - environment changes must follow audio1’s musical phrasing - cuts and motion accents synchronized to audio1 - no outfit changes - no character duplication - no morphing - no text or UI - no blurry unreadable frames - maintain strict character consistency

Éléments à fournir

  • Image 1 : le personnage dont chaque plan doit conserver l’identité.
  • Audio 1 : le morceau qui possède le rythme — coupes, transitions et changements d’environnement suivent ses beats.

Pourquoi il fonctionne

  • Il répartit proprement le travail entre modalités : l’image répond au « qui », l’audio au « quand » — aucun des deux ne se bat avec le texte.
  • L’arithmétique exacte (5 environnements × 6 plans = 30 coupes) est posée en contrainte dure, transformant un montage vague en structure dénombrable.
  • « Character movement stays subtle » pousse toute l’énergie dans la variété de caméra, que les montages supportent bien mieux que la variété d’action.

Variables à remplacer

  • référence du personnage
  • piste audio et son phrasé
  • les cinq environnements
  • mélange des types de plans

Contraintes

  • Le post original écrit @[char ref] et @[audio ref] ; sur EvoLink, désignez-les par leur position dans le tableau — Image 1 et Audio 1 — et rappelez-vous que l’audio ne peut jamais être le seul type de référence.
  • Les clips audio de référence doivent durer de 2 à 15 secondes sur cette route.
  • Le clip publié mesure 8:9, un format que l’API n’accepte pas — demandez 1:1 pour le même cadrage quasi carré.

Réglages

Référence multimodale · 15s · 1:1 · 2 médias de référence

Prompts MiniMax H3 : Jeu & interface

Animation d’interface MiniMax H3 à partir de neuf références : une encyclopédie de créatures minimaliste où un curseur sélectionne MEADOW CROWN, une créature cornue duveteuse, dans un champRÉFÉRENCE MULTIMODALE
15s16:99 médias de référence

Jeu & interface

Démo d’interface encyclopédie de créatures

Neuf références mappées sur des rôles explicites — une planche de layout d’interface plus huit cartes de créatures — animées en démo d’encyclopédie à caméra verrouillée où un curseur clique d’entrée en entrée et où la dernière créature l’avale.

Voir les détails

Prompt complet (original anglais vérifié)

Use Image 1 as the exact UI/layout/style reference for the creature encyclopedia screen. Use Images 2–9 as the exact creature references. Map them like this: Image 2 = card A = LUMI HARE Image 3 = card B = CLOUD WISP Image 4 = card C = EMBER FENNEC Image 5 = card D = TIDE BEHEMOTH Image 6 = card E = PETAL VULPIN Image 7 = card F = ORCHARD EYE Image 8 = card G = MEADOW CROWN Image 9 = card H = FROST GLIDER Create a 15-second 16:9 video. Keep the camera locked. Keep the interface, layout, typography, panels, icons and overall composition stable, elegant and readable. The UI should feel like a modern minimal digital creature encyclopedia, similar to a sleek pokedex. No scene cuts, no extra text, no extra buttons, no UI distortion. Sequence: 0–2.5s: Cursor clicks card A. Main creature becomes LUMI HARE. Title changes to “LUMI HARE”. Creature blinks and rotates slightly. 2.5–5s: Cursor clicks card C. Main creature becomes EMBER FENNEC. Title changes to “EMBER FENNEC”. Cursor drags to rotate it left and right. 5–7.5s: Cursor clicks card E. Main creature becomes PETAL VULPIN. Title changes to “PETAL VULPIN”. Cursor pokes it a few times. It reacts, annoyed. 7.5–10s: Cursor clicks card G. Main creature becomes MEADOW CROWN. Title changes to “MEADOW CROWN”. Cursor taps near the face/horns. It recoils slightly. 10–12s: Cursor clicks card D. Main creature becomes TIDE BEHEMOTH. Title changes to “TIDE BEHEMOTH”. Cursor keeps poking it. 12–15s: TIDE BEHEMOTH gets angry, opens its mouth very wide, lunges forward, and swallows the cursor. Then it returns to idle. Title stays “TIDE BEHEMOTH”. Rules: - When a card is selected, both the main creature and the main title must update. - Only animate cursor, selection state, title change, and the selected creature. - Only one cursor. - Keep motion subtle and clean until the final swallow. - No cuts, no camera move, no UI distortion, no extra text. Audio: soft UI click sounds, subtle hover sounds, tiny creature reaction sounds, then a sharper aggressive creature sound and one comedic swallow gulp at the end.

Éléments à fournir

  • Image 1 : le layout d’encyclopédie qui possède la typographie, les panneaux et la composition.
  • Images 2–9 : une créature par carte, chacune nommée dans la table de correspondance du prompt.

Pourquoi il fonctionne

  • La table de correspondance image-carte (Image 2 = carte A = LUMI HARE…) est l’attribution de rôles la plus littérale possible — le modèle ne devine jamais quel asset est lequel.
  • La caméra est verrouillée et seules quatre choses peuvent s’animer (curseur, sélection, titre, créature active), réduisant la surface d’échec du mouvement d’interface à presque zéro.
  • Le beat comique final (la créature avale le curseur) est programmé en dernier pour que la démo reste propre jusqu’à la chute.

Variables à remplacer

  • planche de style d’interface
  • les huit créatures et leurs noms
  • script d’interaction
  • jeu d’effets sonores

Contraintes

  • Neuf images est le maximum par type sur cette route — et le plafond total de 12 fichiers signifie que vous ne pouvez pas ajouter par-dessus trois vidéos et trois clips audio.
  • La stabilité du texte d’interface repose sur « no camera move, no UI distortion » ; libérer la caméra réintroduit des panneaux déformés.

Réglages

Référence multimodale · 15s · 16:9 · 9 médias de référence

Clip façon gameplay MiniMax H3 : une vue à la première personne derrière un fusil progresse dans une base militaire enfumée avec un HUD de FPS génériqueTEXTE VERS VIDÉO
15s16:9Aucun média de référence

Jeu & interface

Simulation de gameplay FPS

Une séquence de tir à la première personne qui se lit comme du gameplay capturé : grammaire de caméra contrôlée par le joueur, HUD générique entièrement spécifié et rythme écrit en tactique plutôt qu’en chorégraphie.

Voir les détails

Prompt complet (original anglais vérifié)

Camera: First-person perspective at eye level with authentic handheld player movement, as if recorded directly from a modern AAA military shooter. The player carries a highly detailed assault rifle with realistic animations, visible hands, tactical gloves, dynamic reload mechanics, and weapon sway. **Opening Action:** The video immediately begins with the player already aiming down a roadway inside a modern military base. Multiple enemy soldiers are visible in the distance near sandbags, barricades, and military vehicles. The player carefully tracks one target, making small aim corrections while maintaining ADS (aim down sights). Fire several controlled bursts immediately at the visible enemies, producing realistic muzzle flashes, shell casings ejecting, smoke, recoil, hit reactions, and dust impacts around the targets. Continue firing in multiple short bursts while adjusting aim between enemies, simulating authentic FPS gameplay rather than scripted animation. **Movement:** After the opening firefight, lower slightly from ADS and begin advancing cautiously along the road beside concrete barriers, Hesco walls, and parked military vehicles. Frequently check left and right corners, briefly stop to reacquire targets, then raise the weapon and fire additional controlled bursts whenever enemies appear ahead. Continue pushing forward with deliberate player-controlled movement, using cover naturally and maintaining believable tactical pacing. **Environment:** Large modern military base with guard towers, armored vehicles, shipping containers, blast barriers, damaged buildings, smoke plumes, burning debris, scattered shell casings, dust clouds, and atmospheric battlefield haze. Cool natural daylight mixed with smoke and orange firelight creates a cinematic battlefield atmosphere. **Camera Motion:** Authentic player-controlled movement with subtle head bob, weapon sway, natural mouse-look adjustments, small left-right corrections while aiming, realistic recoil, smooth tracking of moving targets, brief pauses before shooting, and fluid forward progression. Avoid cinematic camera moves—everything should feel like genuine live gameplay captured by a skilled player. **Visual Quality:** Ultra-photorealistic, AAA game graphics with realistic PBR materials, detailed weapon models, physically accurate lighting, volumetric smoke, dynamic particle effects, crisp textures, realistic bullet impacts, muzzle flash illumination, motion blur only during rapid movement, and high-end military shooter presentation. **Gameplay UI:** Display a realistic modern FPS HUD inspired by games like PUBG, Battlefield, or Call of Duty (without copying exact copyrighted assets). Include: * Central dynamic crosshair or reticle * Ammo counter with magazine and reserve ammunition * Fire mode indicator * Compass at the top * Squad/team status panel * Mini-map in the upper corner * Health bar * Tactical equipment icons (grenades, medkit) * Hit markers when bullets connect * Directional damage indicators * Kill notification feed * Objective marker in the distance * Subtle interaction prompts and realistic HUD animations The HUD should feel polished, modern, and fully integrated into the gameplay, enhancing the illusion of authentic recorded footage from a contemporary military FPS. #MiniMaxH3

Éléments à fournir

  • Rien à téléverser — cette route ne prend que le prompt.

Pourquoi il fonctionne

  • La cible de réalisme est « recorded from a skilled player » : balancement de tête, corrections de visée et rythme pause-puis-tir sont spécifiés comme comportements de caméra.
  • Le HUD est détaillé jusqu’aux marqueurs de touche et au fil des éliminations tout en restant explicitement générique — assez dense pour évoquer un vrai jeu, assez sûr pour être publié.
  • « Avoid cinematic camera moves » est l’inversion clé : ce que la plupart des prompts recherchent est exactement ce qui casserait celui-ci.

Variables à remplacer

  • environnement et style de faction
  • jeu d’éléments du HUD
  • rythme des engagements
  • météo et lumière

Contraintes

  • Le prompt garde le HUD « inspired by, without copying » — préservez cette clause ; cloner le HUD d’un jeu précis est une tâche différente (et plus risquée).

Réglages

Texte vers vidéo · 15s · 16:9 · Aucun média de référence

Prompts MiniMax H3 : Vlog & caméra selfie

Clip façon selfie MiniMax H3 : une femme qui se filme en forêt retourne son téléphone pour révéler un ovni écrasé et fumant entre les arbresTEXTE VERS VIDÉO
15s1:1Aucun média de référence

Vlog & caméra selfie

Découverte d’ovni en caméra selfie

Une démonstration de réalisme téléphone : images selfie à main levée avec respiration d’autofocus et rolling shutter, dialogue japonais scénarisé, et un retournement de caméra du visage vers un ovni écrasé.

Voir les détails

Prompt complet (original anglais vérifié)

Ultra photorealistic live-action captured on an iPhone 17. Authentic handheld selfie footage with premium cinematic documentary color grading, realistic HDR, deep green foliage, warm sunlight, subtle teal shadows, natural skin tones, gentle filmic contrast, rolling shutter, autofocus breathing, slight motion blur, and natural handheld shake. A lush forest in daytime with dense trees, wild plants, an uneven dirt trail, scattered leaves, soft sunlight through the canopy, and a gentle breeze. The atmosphere is quiet and slightly unsettling. A cute Japanese woman in her early twenties wearing a stylish bikini walks through the forest while recording herself in selfie mode. She suddenly notices something ahead, looks shocked, turns the camera, and points into the distance. A large crashed UFO is partially embedded in the forest floor. Its metallic hull is badly damaged with broken panels, scorch marks, exposed internal structures, thick gray smoke, and occasional sparks. She says in Japanese: 「ちょっと待って! あそこ見て! UFOじゃない!? 完全に墜落してるんだけど! 煙まで出てる! やばい、本物かもしれない! ちょっと近づいてみる!」 She alternates between filming herself and the UFO while continuing to point at it. Continuous single take. Natural walking movement, realistic hand tremors, slight framing imperfections, quick pans, and autofocus shifts between her face and the UFO. Natural sunlight creates cinematic highlights, soft shadows, realistic reflections on the UFO, subtle volumetric light, and realistic smoke. Audio: footsteps on leaves, gentle wind, birds becoming quieter near the crash site, creaking branches, faint electrical crackling from the UFO, and distant eerie unidentified animal calls echoing through the forest. Negative: no blood, no visible aliens, no monsters, no horror creature reveal, no excessive explosions, no CGI, no cartoon style, no text, no subtitles, no watermark, no logo.

Éléments à fournir

  • Rien à téléverser — cette route ne prend que le prompt.

Pourquoi il fonctionne

  • Les artefacts du téléphone sont énumérés (autofocus hésitant, rolling shutter, tremblement des mains, cadrages imparfaits) — le réalisme vient de défauts nommés, pas du mot « realistic ».
  • Le dialogue est cité mot pour mot en japonais, si bien que l’audio natif de H3 génère une vraie parole avec la synchronisation labiale correspondante au lieu de charabia.
  • Le son est empilé en couches diégétiques — pas, vent, oiseaux qui se taisent, crépitement électrique — sans musique qui briserait l’illusion du téléphone retrouvé.

Variables à remplacer

  • répliques et langue parlées
  • l’objet découvert
  • décor forestier ou urbain
  • tenue et style du personnage

Contraintes

  • La liste négative (pas d’aliens, pas de révélation horrifique) est porteuse : elle maintient le clip en territoire de teaser et empêche le modèle de faire escalader la scène.
  • Le clip publié était en 1:1 — réglez le cadre via le paramètre aspect, et gardez dans le texte l’alternance de cadrage entre soi et l’objet.

Réglages

Texte vers vidéo · 15s · 1:1 · Aucun média de référence

Clip documentaire MiniMax H3 : une photographe de rue cadre un homme âgé et son terrier à la terrasse d’un café, puis montre la photo capturée au spectateurTEXTE VERS VIDÉO
15s16:9Aucun média de référence

Vlog & caméra selfie

Instant de photographe de rue

Un beat documentaire compact avec une caméra dans la caméra : une photographe cadre une scène de rue sur le vif, déclenche, puis retourne son appareil pour montrer au spectateur la photo qu’elle vient de capturer.

Voir les détails

Prompt complet (original anglais vérifié)

A young Western female street photographer walks through a lively downtown street and notices an elderly man sitting outside a café with his small dog. She carefully composes the candid moment through her camera, captures the photo, then turns the camera toward the viewer to proudly show the shot she just took. She smiles, says “Look at that,” then continues walking through the city. Ultra-photorealistic visuals, natural handheld documentary movement, realistic camera interaction, authentic facial expressions, accurate hand movements, realistic dog behavior, natural daylight, cinematic depth of field, continuous character consistency, immersive city ambience, premium documentary realism.

Éléments à fournir

  • Rien à téléverser — cette route ne prend que le prompt.

Pourquoi il fonctionne

  • Le beat « montrer la photo » force H3 à rendre une image fixe cohérente à l’intérieur de la vidéo — une démonstration de capacité discrète qui se lit comme un geste naturel.
  • La chaîne d’interaction est entièrement spécifiée (cadrer → capturer → retourner → « Look at that » → repartir), donnant au clip un arc complet en une seule prise.
  • Les sujets sont décrits par rôle, pas par identité — homme âgé, petit chien, café — gardant la scène de rue générique et sûre.

Variables à remplacer

  • le sujet pris sur le vif
  • ville et lumière
  • la réplique parlée
  • type d’appareil photo accessoire

Contraintes

  • La photo dans l’appareil doit correspondre à la scène dont elle provient ; si vous changez les sujets, changez les deux descriptions ensemble.

Réglages

Texte vers vidéo · 15s · 16:9 · Aucun média de référence

Vlog de voyage MiniMax H3 : une femme ouvre les rideaux sur une terrasse en bord de mer, puis passe en mode selfie pour dire bonjour avec l’océan derrière elleTEXTE VERS VIDÉO
15s9:16Aucun média de référence

Vlog & caméra selfie

Arc de vlog matinal en bord de mer

Un vlog matinal seconde par seconde avec une bascule de mode délibérée : les cinq premières secondes sont cinématographiques à la troisième personne, et ce n’est qu’ensuite que le personnage commence à se filmer — l’instant où le « vlog » commence.

Voir les détails

Prompt complet (original anglais vérifié)

Create a 15-second ultra-realistic cinematic lifestyle vlog video, vertical 9:16, featuring the same young woman throughout the entire video. Preserve her facial identity, facial proportions, hairstyle, skin tone and overall appearance consistently in every shot. She wears the same outfit throughout: fitted white V-neck T-shirt with a small subtle logo, blue denim jeans, natural makeup, long softly wavy brown hair. 0:00–0:01 — Wake-up: Close-up inside a beautiful bright bedroom. The woman is lying comfortably on the bed, slowly wakes up, stretches naturally and opens her eyes. She is NOT filming a vlog yet and does not hold a phone or camera. Soft morning sunlight enters through the curtains. 0:01–0:02 — Gets up: Medium shot. She sits up on the bed, smiles softly, fixes her hair and gets ready to start her morning. Natural, effortless movement. 0:02–0:03 — Walks to window: She walks toward the large glass balcony door/window. Camera follows her naturally from behind/side. 0:03–0:04 — Seaside reveal: She opens the curtains/door and looks outside. Reveal a breathtaking blue ocean, coastal hills, flowers, balcony and beautiful morning sunlight. She smiles happily while taking in the view. 0:04–0:05 — Steps outside: She walks out onto the seaside terrace. Gentle ocean breeze moves her hair naturally. Wide cinematic shot showing the beautiful surroundings. 0:05–0:06 — VLOG START: Only now she starts filming herself in handheld selfie-vlog style. She looks into the camera with a bright natural smile and says: “Good morning!” 0:06–0:07 — Show the view: She turns the camera away from herself and slowly pans across the stunning ocean, coastal mountains, flowers and terrace. Smooth handheld vlog movement. 0:07–0:08 — Back to selfie: Selfie shot. She looks into the camera and happily says: “This place is just perfect!” 0:08–0:09 — Location reveal: Wide cinematic shot of the cozy seaside terrace with wooden table, chairs, plants and flowers overlooking the ocean. 0:09–0:10 — Walk to table: Medium tracking shot as she walks toward the table, enjoying the view. Her hair and T-shirt move gently in the sea breeze. 0:10–0:11 — Sit and relax: She sits at the seaside table, smiling peacefully and enjoying the ocean view. A refreshing orange-colored juice is placed on the table. 0:11–0:12 — Juice close-up: Cinematic close-up of her hand picking up the glass of fresh orange juice. Beautiful ocean bokeh in the background, natural sunlight reflecting through the glass. 0:12–0:13 — Vlog toast: Selfie shot. She raises the juice toward the camera with a cheerful smile and says: “Cheers to good days!” 0:13–0:14 — Happy close-up: Beautiful close-up of her smiling naturally at the camera, ocean and warm sunlight softly blurred behind her. 0:14–0:15 — Ending: Camera moves from her toward the sparkling ocean and peaceful coastal landscape. Warm sunlight, gentle waves and a relaxing cinematic ending. Overall Style Ultra-realistic, cinematic travel vlog, natural handheld camera movement, realistic human motion, smooth transitions, soft morning sunlight, realistic ocean waves, gentle wind in hair and clothes, beautiful coastal atmosphere, premium lifestyle aesthetic, natural expressions, authentic vlog feeling, shallow depth of field, cinematic composition, realistic skin texture, high detail, 4K quality.

Éléments à fournir

  • Rien à téléverser — cette route ne prend que le prompt.

Pourquoi il fonctionne

  • La note « she is NOT filming yet » des beats de réveil prévient l’artefact de vlog le plus courant — un téléphone qui apparaît avant le début du vlog.
  • Quinze beats d’une seconde alternent caméra selfie et plans de coupe scéniques, exactement comme la grammaire d’un vrai vlog de voyage.
  • Trois courtes répliques citées (« Good morning! ») donnent à l’audio natif des points de repère naturels sans monologue à soutenir.

Variables à remplacer

  • révélation du lieu
  • les trois répliques parlées
  • tenue et verrouillage d’identité
  • la boisson accessoire

Contraintes

  • Le prompt demande du 9:16 et c’est bien ce format qu’il faut demander dans la requête ; le clip publié a été réencodé à environ 3:2 — une raison de plus de régler l’orientation dans la requête plutôt qu’en prose.

Réglages

Texte vers vidéo · 15s · 9:16 · Aucun média de référence

Prompts MiniMax H3 : Montage & transformation

Montage vidéo généré avec MiniMax H3 : dans un clip source, le journal, la chaise, les lunettes de soleil et la voiture en feu ont été remplacés ou supprimésRÉFÉRENCE MULTIMODALE
10s16:91 média de référence

Montage & transformation

Montage de scène multi-éléments

Six modifications séparées d’un clip source, écrites comme une liste cible → résultat sans redécrire la scène.

Voir les détails

Prompt complet (original anglais vérifié)

Replace the newspaper in the reference video with a green-covered book; change the chair the character is sitting on to a red sofa; remove the sunglasses worn by the character to retain a clear face; remove the car burning effect to keep the vehicle in a normal state; change the photo the character takes out of his arms to a small black book; and add a tree on the left side of the screen

Éléments à fournir

  • Video 1 : le clip à modifier, 2 à 15 secondes, MP4 ou MOV, H.264 ou H.265, jusqu’à 50 Mo.
  • Une liste de modifications, chacune indiquant quoi changer et en quoi.

Pourquoi il fonctionne

  • Chaque consigne est une paire — cible plus résultat — et ne laisse rien à l’interprétation (« le journal » devient « un livre à couverture verte »).
  • Les suppressions indiquent l’état final voulu (« retirer les lunettes de soleil pour dégager le visage »), ce qui évite un trou là où se trouvait l’objet.
  • Il n’y a aucune description de scène, donc le modèle traite le clip source comme la vérité et n’applique que les écarts.

Variables à remplacer

  • nombre de modifications
  • objets remplacés
  • effets supprimés
  • éléments ajoutés

Contraintes

  • EvoLink expose trois routes H3 ; le travail de montage passe par reference-to-video avec le clip source en Video 1.
  • La durée de la vidéo de référence est facturée : coupez la source sur la portion utile avant de la téléverser.
  • Indiquez ce qui doit rester intact quand une modification jouxte un élément auquel vous tenez — les zones non mentionnées sont à la merci du modèle.

Réglages

Référence multimodale · 10s · 16:9 · 1 média de référence

Plan de scène généré avec MiniMax H3 : deux magiciens échangent la couleur de leur costume dans un nuage de fumée pendant que le rideau passe du rouge au bleuPREMIÈRE / DERNIÈRE IMAGE
7s16:91 média de référence

Montage & transformation

Permutation des costumes de magiciens

Test de suivi d’instructions : deux costumes s’échangent, un détail reste identique et le fond change de couleur au bon moment.

Voir les détails

Prompt complet (original anglais vérifié)

Two magicians stand onstage facing the audience and perform a "swap" trick. They wave their wands at the same time, and a cloud of smoke rises. When it clears, their suit colors have switched: the person on the left wears a white suit, and the person on the right now wears a black suit, while both magicians' glove colors remain unchanged. They bow to thank the audience. The red curtain behind them closes, transitioning from deep red to deep blue.

Éléments à fournir

  • Une image de départ montrant les deux artistes, leurs costumes et la scène.
  • Un état avant/après clair pour tout ce qui doit être échangé.

Pourquoi il fonctionne

  • L’échange est masqué par un événement — le nuage de fumée — ce qui donne au modèle un moment légitime pour opérer le changement plutôt que de morpher à l’image.
  • Ce qui ne doit pas changer (la couleur des gants) est écrit juste à côté de ce qui change : c’est exactement ainsi qu’on empêche un montage de déborder.
  • Le plan se termine sur un état défini : le salut, le rideau qui se ferme, la couleur qui se pose sur un bleu profond.

Variables à remplacer

  • artistes et costumes
  • le détail qui reste fixe
  • événement qui masque l’échange
  • transition de couleur finale

Contraintes

  • La route image-vers-vidéo déduit le format de l’image d’entrée et rejette le champ aspect_ratio.
  • Tout attribut non mentionné est à la merci du modèle. Si un détail doit survivre au changement, écrivez-le.

Réglages

Première / dernière image · 7s · 16:9 · 1 média de référence

Vous cherchez l’API MiniMax H3 ?

Page modèle avec tarification à la seconde, trois routes de génération et docs d’intégration.

Accéder à l’API

Le framework de prompt MiniMax H3

H3 comprend les références ordonnées et génère son propre audio. Écrivez pour le workflow choisi plutôt qu’avec une formule générique.

La structure d’un prompt H3

Objectif → références ordonnées → identité du sujet → actions chronologiques → trajectoire de caméra → audio ou dialogue → éléments à conserver → état final. Cette structure évite d’oublier le son et la fin.

Texte vers vidéo

Décrivez une chronologie réalisable : le sujet, quelques actions, un seul mouvement de caméra continu et des couches séparées pour le dialogue, l’ambiance et la musique.

Première / dernière image

Les images définissent déjà l’apparence. Décrivez seulement la transformation, le mouvement de caméra, ce qui doit rester identique et l’état final.

Références multimodales

Attribuez une seule fonction à chaque fichier et citez sa position : Image 1 pour le personnage, Image 2 pour le lieu, Video 1 pour le mouvement et Audio 1 pour la voix.

Modifier une vidéo existante

Créez deux listes : « Modifier » avec cible → résultat et « Conserver » pour les éléments intacts. Envoyez uniquement l’extrait utile comme Video 1.

Audio et dialogue

Citez mot pour mot les répliques. Limitez la référence vocale au timbre, puis précisez séparément l’accent, l’émotion et le rythme.

FAQ des prompts MiniMax H3

MiniMax H3 et Hailuo 3 désignent-ils le même modèle ?

Oui. MiniMax H3 est aussi appelé Hailuo 3, Hailuo 3.0 ou Hailuo 03. EvoLink emploie MiniMax H3 et propose trois routes : texte vers vidéo, image vers vidéo et référence vers vidéo.

Puis-je utiliser ces prompts sans coder ?

Oui. « Utiliser ce prompt » envoie le prompt anglais vérifié au Playground MiniMax H3 avec le bon workflow. Vous ajoutez ensuite les fichiers de référence.

Quelle peut être la durée d’une vidéo MiniMax H3 ?

Les trois routes acceptent une durée entière de 4 à 15 secondes et produisent actuellement du 2K. La durée affichée sur chaque carte correspond à l’exemple publié.

Combien de références un prompt peut-il utiliser ?

La route de référence accepte jusqu’à 9 images, 3 vidéos et 3 audios, dans la limite de 12 fichiers au total : un ensemble complet 9 + 3 + 3 est donc refusé. Une image ou une vidéo est obligatoire ; l’audio seul est refusé. Chaque vidéo ou audio doit durer de 2 à 15 secondes.

Pourquoi les prompts mentionnent-ils « Image 1 » ou « Video 1 » ?

L’API associe les fichiers selon leur position dans image_urls, video_urls et audio_urls. Ces mentions anglaises conservées dans le prompt vérifié attribuent un rôle à un fichier précis.

D’où viennent les prompts et les vidéos ?

Chaque carte indique sa source. Les exemples officiels utilisent une version anglaise vérifiée du prompt chinois ; les exemples communautaires renvoient vers la publication originale sur X.

Puis-je envoyer ces prompts par API ?

Oui. Le même prompt anglais fonctionne dans le Playground et dans le champ prompt de l’API. Le guide MiniMax H3 couvre les requêtes, tâches asynchrones, callbacks et erreurs.

Choisissez un prompt et générez

Chaque prompt correspond à une route MiniMax H3 active sur EvoLink. Envoyez-le au Playground ou utilisez la même requête via l’API unifiée.