MiniMax H3 (Hailuo 3) ist live auf EvoLinkMit 10 Gratis-Credits testen

MiniMax H3 Prompts und Videobeispiele

Entdecken Sie 12 geprüfte Prompts mit echten MiniMax-H3-Ergebnissen, Eingabeanforderungen und austauschbaren Variablen. Kopieren Sie eine Vorlage oder senden Sie sie an den EvoLink Playground.

MiniMax H3 ist auch als Hailuo 3, Hailuo 3.0 oder Hailuo 03 bekannt.

Generierungsmodus

Anwendungsfall

12 von 12 Prompts

Mit MiniMax H3 erzeugter Sci-Fi-Trailer: eine einzelne Figur vor einem riesigen kreisförmigen kosmischen Portal, während ein Titel aus der Dunkelheit auftauchtMULTIMODALE REFERENZ
15s16:92 Referenzmedien

Filmisch & VFX

Sci-Fi-Mystery-Trailer

Filmischer Trailer mit zwei Referenzen: Ein Bild bestimmt die Atmosphäre, das zweite die Hauptfigur; der Prompt steuert Kamerafahrt, Titel und Ton.

Details anzeigen

Vollständiger Prompt (geprüftes englisches Original)

Realistic cinematic look, high-contrast lighting, and a tight pace. Use Figure 1 as the overall atmosphere and style reference, and Figure 2 as the protagonist reference. Shot 1 — Ultra-wide establishing shot. A huge circular cosmic gateway nearly fills the frame. The person is only a tiny figure seen from behind before the gateway, positioned toward the lower right. The ground is wet and reflective, and the center of the gateway is pitch black. The camera slowly pushes forward. A large title fades in from the edge of the darkness, blurred at first and then sharp: "THE STARS WERE LISTENING". Use an extremely condensed, heavy, all-caps typeface in dark red mixed with rust red, with subtle grain and misted edges. Audio: a deep low-frequency pulse, faint metallic vibrations in the distance, and a soft hit as the text becomes sharp. → Hard cut.

Benötigte Eingaben

  • Bild 1: Atmosphäre und Stil — Umgebung, Farbpalette und Grading, die die Einstellung übernehmen soll.
  • Bild 2: die Hauptfigur, groß genug aufgenommen, damit Gesicht und Silhouette auch als kleine Figur im Bild lesbar bleiben.
  • Ein Titeltext, den Sie wirklich eingeblendet haben wollen: H3 rendert genau das, was Sie schreiben — kurz halten und exakt buchstabieren.

Warum das funktioniert

  • Jede Referenz hat genau eine Aufgabe — Bild 1 die Atmosphäre, Bild 2 die Figur —, sodass das Modell nie raten muss, welche Vorlage den Look bestimmt.
  • Die Einstellung ist als eine durchgehende Kamerafahrt mit einem einzigen Ereignis beschrieben (der Titel wird scharf) — genau so viel, wie 15 Sekunden tragen.
  • Der Ton ist in drei konkrete Ebenen zerlegt (tiefer Puls, fernes metallisches Vibrieren, ein Schlag auf den Titel) statt als vager „Kino-Score“.

Austauschbare Variablen

  • Titeltext und Typografie
  • Portal oder Landmarke in der Establishing-Einstellung
  • Farbe des Titels
  • Klangteppich
  • Verhalten des Schlussschnitts

Einschränkungen

  • Sprechen Sie Assets über ihre Position im Array an — „Figure 1“, „Figure 2“ — passend zur Reihenfolge in image_urls. Die Syntax @image1 gehört nicht zu diesem API-Vertrag.
  • Der veröffentlichte Prompt ist bewusst ein Startpunkt: Er endet auf einem harten Schnitt, damit Sie eine zweite Einstellung anschließen können.

Einstellungen

Multimodale Referenz · 15s · 16:9 · 2 Referenzmedien

Mit MiniMax H3 erzeugter Text-zu-Video-Clip: eine abendliche Küche, handgehalten gefilmt, während sich ein handgezeichnetes leuchtendes Wesen zwischen den Requisiten bewegtTEXT ZU VIDEO
15s16:9Keine Referenzmedien

Filmisch & VFX

Leuchtendes Küchenwesen

Text-zu-Video-Vorlage, die reale Küchenaufnahmen mit leuchtender Handzeichnung kombiniert und Kamerafehler sowie Ausschlüsse präzise beschreibt.

Details anzeigen

Vollständiger Prompt (geprüftes englisches Original)

15-second, 16:9 landscape video. Blend live-action footage of a small kitchen at dusk with hand-drawn glowing animation. The last light of sunset lingers by the window. The lived-in kitchen contains an old wooden table, a half-washed mug, a slightly fogged glass bottle, and a hanging dishcloth. Give the footage subtle one-handed smartphone shake, hesitant close-range focusing, exposure fluctuations caused by backlight, and slightly coarse noise in the shadows. It should not look carefully arranged like an advertisement; instead, it should feel like someone hurriedly captured an unbelievable event at home. Do not show huge eyes, gaping mouths, fangs, threatening or lunging movements, sudden black frames, or jump scares. Use only kitchen room tone, cloth rubbing, the soft clink of a mug, water dripping from the faucet, the camera operator's footsteps and quiet breathing, plus gentle electronic sounds and tiny calls from the hand-drawn creature.

Benötigte Eingaben

  • Nichts hochzuladen — diese Route arbeitet allein mit dem Prompt.
  • Dauer und Seitenverhältnis gehören in die Request-Parameter, nicht nur in den Prompt-Text.

Warum das funktioniert

  • Die Fehler der Kamera sind benannt — einhändiges Wackeln, zögerlicher Fokus, Belichtungsschwankungen im Gegenlicht, grobes Rauschen in den Schatten. Genau das verkauft „zu Hause schnell mitgefilmt“ statt „Werbespot“.
  • Eine kurze, explizite Verbotsliste (keine riesigen Augen, keine Reißzähne, kein Zuschnappen, keine Jumpscares) verhindert, dass ein niedliches Wesen ins Horrorfach kippt.
  • Die Tonregie benennt jede Quelle einzeln: Raumton, Stoff, Tasse, Wasserhahn, Schritte, Atmen und die Laute des Wesens.

Austauschbare Variablen

  • Raum und Tageszeit
  • Design und Verhalten des Wesens
  • Requisiten auf dem Tisch
  • welche Kamerafehler sichtbar sind
  • Tonebenen

Einschränkungen

  • Der Prompt nennt Länge und Bildformat im Text; die API braucht duration und aspect_ratio trotzdem als Request-Felder.
  • Negative Anweisungen wirken am besten als kurze, klare Liste. Dutzende Verbote fressen das Budget, das Sie für die Handlung brauchen.

Einstellungen

Text zu Video · 15s · 16:9 · Keine Referenzmedien

Mit MiniMax H3 erzeugter vertikaler Kurzdrama-Trailer: ein Vampir und eine menschliche Heldin in einem kerzenbeleuchteten SchlossinnerenMULTIMODALE REFERENZ
15s9:162 Referenzmedien

Kurzdrama & Story

Vampir-Romance-Kurzdrama

Vertikaler Kurzdrama-Hook: Ein Bild fixiert beide Hauptfiguren, ein weiteres den Ort; der Prompt konzentriert sich auf Beziehung, Tempo und Einstellungsgrößen.

Details anzeigen

Vollständiger Prompt (geprüftes englisches Original)

Generate a 15-second, 9:16 vertical trailer segment for an international live-action vampire romance short drama. Use Figure 1 as the appearance reference for the male and female leads, and Figure 2 as the scene reference. Keep both leads' identities consistent, with a realistic live-action look and premium short-drama production quality. Story: an innocent human heroine accidentally enters a forbidden area of an old castle and awakens a sleeping aristocratic vampire. He discovers that she carries an aura connected to an ancient war, which sparks a powerful urge to control her and a dangerous fascination with her. She fears him but does not completely submit, resisting his pressure. Overall style: an international ReelShort / DramaBox vampire-romance trailer. Dark romance, dangerous attraction, fate, intense control, brooding oppression, and a striking reversal. Keep the visuals premium, restrained, and tightly paced, like the opening 15-second hook of a hit short drama. No gore, cheap horror, Halloween aesthetic, or modern street feel. Format: 9:16 vertical composition for TikTok / ReelShort / DramaBox. Use primarily medium close-ups, close-ups, and extreme close-ups, emphasizing faces, eye contact, pressure, and relationship tension within the vertical frame.

Benötigte Eingaben

  • Bild 1: beide Hauptfiguren gemeinsam, damit das Modell sie als ein zusammengehöriges Casting liest.
  • Bild 2: der Ort — das Schlossinnere, sein Licht und seine Materialien.
  • Eine Prämisse in einem Satz und eine benannte emotionale Wendung; ein 15-Sekunden-Hook trägt eine Wendung, keine ganze Folge.

Warum das funktioniert

  • Die Nennung der Genre-Referenz (ReelShort-/DramaBox-Trailer) überträgt Tempo, Grading und Bildsprache mit wenigen Worten.
  • Das Einstellungs-Vokabular ist festgelegt — Halbnah, Nah, Detail —, und genau das lässt ein Hochformat hochwertig statt beengt wirken.
  • Die Ausschlussliste (kein Blut, kein billiger Horror, keine Halloween-Optik, kein moderner Straßenlook) entfernt die vier üblichen Abstürze dieses Genres.

Austauschbare Variablen

  • Referenz für das Aussehen der Hauptfiguren
  • Ort
  • Prämisse und Wendung
  • Look der Zielplattform
  • Mischung der Einstellungsgrößen

Einschränkungen

  • Das Hochformat wird über aspect_ratio auf der Referenz-Route angefordert, nicht dadurch, dass „9:16“ im Prompt steht.
  • Die Identität hält deutlich besser, wenn beide Hauptfiguren auf einem gemeinsamen Bild ankommen statt als zwei separat zugeschnittene Porträts.

Einstellungen

Multimodale Referenz · 15s · 9:16 · 2 Referenzmedien

Mit MiniMax H3 erzeugter vertikaler Brillen-Werbeclip: zwei Models in einem nahtlos weißen Studio mit futuristischen, umlaufenden BrillenMULTIMODALE REFERENZ
15s9:163 Referenzmedien

Marke & Produktwerbung

Futuristische Brillenkampagne

Modewerbung mit drei Bildern, die getrennt Key Visual, Gesichter und Produktdesign steuern.

Details anzeigen

Vollständiger Prompt (geprüftes englisches Original)

Generate a vertical screen 9:16 high-end fashion glasses commercial, taking overall reference to the storyboard rhythm, editing speed, white studio texture and cool fashion atmosphere of the given video. The picture is a minimalist white booth, a seamless white background, a strong sense of high-end advertising, and a clean, simple, handsome, avant-garde, international first-line fashion blockbuster texture. Key visual character reference picture 1, two full-body female models, one black female model and one European and American model, maintain their high-end clothing, body posture, white studio light and shadow, fashion show temperament and overall cool attitude. Both of them wear futuristic high-end glasses. The design of the glasses refers to Figure 3, emphasizing the covered curved surface, sharp geometric cat-eye/goggle hybrid outline, mirror reflection, streamlined temples, and the texture of high-end fashion accessories. Please refer to Figure 2 for the appearance details of the two characters.

Benötigte Eingaben

  • Bild 1: das Key Visual — Models in Ganzkörperansicht, Garderobe, Studiolicht und Haltung.
  • Bild 2: Detailaufnahme der Gesichter, damit die beiden Figuren über die Schnitte hinweg gleich bleiben.
  • Bild 3: das Produkt, klar genug aufgenommen, damit Silhouette und Materialien auch bei schnellem Schnitt erhalten bleiben.
  • Ein nahtloser Studiohintergrund, den Sie über den ganzen Clip beibehalten wollen.

Warum das funktioniert

  • Drei Referenzen mit drei klar getrennten Aufgaben sind genau das Muster, für das die Referenz-Route gebaut ist; Mehrdeutigkeit ist der Grund, warum Multi-Bild-Prompts scheitern.
  • Das Produkt wird über seine Geometrie beschrieben — umlaufende Wölbung, Cat-Eye-Goggle-Mischform, verspiegelte Oberfläche, stromlinienförmige Bügel — nicht nur über seinen Namen.
  • Ein einfarbiges weißes Studio nimmt Varianz aus dem Hintergrund, damit das Budget in Produkt und Models fließt.

Austauschbare Variablen

  • Produktkategorie
  • Casting der Models
  • Studiofarbe
  • Schnitttempo
  • Garderobe

Einschränkungen

  • Der veröffentlichte Prompt verlangt zusätzlich das Tempo eines gegebenen Videos. Das freigegebene Material zu diesem Fall besteht aus drei Bildern — behandeln Sie die Zeile als Stilangabe oder hängen Sie einen eigenen Clip als Video 1 an.
  • Pro Referenz-Request sind bis zu 9 Bilder, 3 Videos und 3 Audioclips möglich, insgesamt höchstens 12 Dateien; Audio darf nie der einzige Referenztyp sein.

Einstellungen

Multimodale Referenz · 15s · 9:16 · 3 Referenzmedien

Mit MiniMax H3 erzeugte Knetanimation: ein Knetfuchs springt über eine Lavaschlucht, während die Kamera unter ihm hindurchfliegtERSTES / LETZTES BILD
10s16:91 Referenzmedien

Figur & Bewegung

Knetfuchs springt über eine Schlucht

Ein Startbild wird zu einer klaren Aktion animiert; die Kamerabewegung ist ebenso präzise beschrieben wie der Sprung.

Details anzeigen

Vollständiger Prompt (geprüftes englisches Original)

Claymation style. A sprinting fox reaches the edge of a cliff and launches without hesitation, making a dramatically tense, heroic slow-motion leap across a vast lava canyon. While the fox is airborne, the camera rushes at high speed beneath its belly in a sweeping dynamic move, fully revealing the terrifying depth of the chasm and the fox's clay body at maximum extension in midair.

Benötigte Eingaben

  • Ein Startbild, das den Stil bereits enthält — hier der Knetfuchs und sein Material.
  • Eine Aktion, die passieren soll. Nicht drei.

Warum das funktioniert

  • Der Prompt beschreibt die Veränderung, nicht das Bild. Das Startbild trägt das Aussehen bereits, also kauft jedes Wort Bewegung.
  • Die Kamera bekommt eine eigene Anweisung — ein Hochgeschwindigkeitsflug unter dem Bauch des Fuchses hindurch —, und daraus wird aus einem Sprung eine Einstellung.
  • Der benannte Höhepunkt („maximal gestreckt in der Luft“) gibt dem Modell eine Zielpose, um die es das Timing baut.

Austauschbare Variablen

  • Figur und Materialstil
  • Umgebung und Gefahr
  • Kamerapfad
  • Zeitlupen-Schwerpunkt

Einschränkungen

  • Die Bild-zu-Video-Route leitet das Ausgabeformat aus dem Eingabebild ab und weist aspect_ratio zurück.
  • Beschreiben Sie nicht erneut, was das Startbild schon zeigt; wiederholtes Beschreiben des Aussehens ist der häufigste Weg, einen Bild-zu-Video-Prompt zu verschwenden.

Einstellungen

Erstes / letztes Bild · 10s · 16:9 · 1 Referenzmedien

Mit MiniMax H3 erzeugter Videoschnitt: In einem Quellclip wurden Zeitung, Stuhl, Sonnenbrille und brennendes Auto ersetzt oder entferntMULTIMODALE REFERENZ
10s16:91 Referenzmedien

Bearbeitung & Transformation

Szenenbearbeitung mit mehreren Elementen

Sechs getrennte Änderungen an einem Quellclip, als klare Ziel-zu-Ergebnis-Liste ohne erneute Szenenbeschreibung.

Details anzeigen

Vollständiger Prompt (geprüftes englisches Original)

Replace the newspaper in the reference video with a green-covered book; change the chair the character is sitting on to a red sofa; remove the sunglasses worn by the character to retain a clear face; remove the car burning effect to keep the vehicle in a normal state; change the photo the character takes out of his arms to a small black book; and add a tree on the left side of the screen

Benötigte Eingaben

  • Video 1: der zu bearbeitende Clip, 2–15 Sekunden, MP4 oder MOV, H.264 oder H.265, bis 50 MB.
  • Eine Liste von Änderungen, jede mit dem Ziel und dem gewünschten Ergebnis.

Warum das funktioniert

  • Jede Anweisung ist ein Paar — Ziel plus Ergebnis —, sodass nichts der Auslegung überlassen bleibt („die Zeitung“ wird „ein Buch mit grünem Einband“).
  • Entfernungen nennen den gewünschten Endzustand („die Sonnenbrille entfernen, damit das Gesicht frei ist“), damit dort kein Loch bleibt, wo das Objekt war.
  • Es gibt überhaupt keine Szenenbeschreibung, also behandelt das Modell den Quellclip als Wahrheit und wendet nur die Deltas an.

Austauschbare Variablen

  • Anzahl der Änderungen
  • ersetzte Objekte
  • entfernte Effekte
  • hinzugefügte Elemente

Einschränkungen

  • EvoLink stellt drei H3-Routen bereit; Schnittarbeit läuft über Reference-to-Video mit dem Quellclip als Video 1.
  • Die Dauer des Referenzvideos ist abrechnungsrelevant — kürzen Sie den Clip vor dem Upload auf den Abschnitt, den Sie wirklich brauchen.
  • Sagen Sie, was unverändert bleiben muss, wenn eine Änderung neben etwas Wichtigem liegt — nicht genannte Bereiche sind für das Modell Freiwild.

Einstellungen

Multimodale Referenz · 10s · 16:9 · 1 Referenzmedien

Mit MiniMax H3 erzeugter Visual-Novel-Übergang zwischen einem festgelegten Anfangs- und einem festgelegten SchlussbildERSTES / LETZTES BILD
15s16:92 Referenzmedien

Kurzdrama & Story

Übergang im Otome-Visual-Novel-Stil

Erstes und letztes Bild fixieren beide Endpunkte; der Prompt beschreibt nur den Weg und die emotionale Veränderung dazwischen.

Details anzeigen

Vollständiger Prompt (geprüftes englisches Original)

Use the first image as the opening frame and the second image as the exact final frame to generate an otome visual-novel interface transition. Overall feel: a premium Chinese otome romance-interaction interface capturing an intimate moment before and after a performance. Transition naturally from "choose to watch his performance" to "Han Xu is drawn in by the heroine's words and reacts with intrigued interest." UI text, choices, and dialogue boxes should appear with refined otome-game presentation. Keep the transition silky smooth and the emotion suggestive yet restrained.

Benötigte Eingaben

  • Bild 1: das Anfangsbild, samt seinem UI-Zustand.
  • Bild 2: exakt das Schlussbild, auf dem die Einstellung landen soll.
  • Ein Satz zur emotionalen Veränderung zwischen den beiden Zuständen.

Warum das funktioniert

  • Beide Endpunkte sind fixiert, also löst das Modell eine Interpolation statt einer Komposition — der zuverlässigste Weg zu einer vorhersehbaren Einstellung.
  • Der Prompt benennt den emotionalen Übergang („den Auftritt ansehen“ → „hineingezogen und neugierig“), statt Bilder aufzuzählen; so trägt das Schauspiel den Schnitt.
  • Die Vorgabe, dass die Interface-Elemente im Idiom des Genres animieren sollen, verhindert, dass die UI neu gezeichnet wird.

Austauschbare Variablen

  • Anfangs- und Schlussbild
  • emotionaler Bogen dazwischen
  • Stil der UI-Darstellung
  • Tempo des Übergangs

Einschränkungen

  • Übergeben Sie beide Bilder als image_start und image_end auf der Bild-zu-Video-Route; die Referenz-Route akzeptiert diese Felder gar nicht.
  • Je ähnlicher sich die beiden Bilder in Bildausschnitt und Licht sind, desto weicher die Interpolation. Zwei unverbundene Kompositionen ergeben einen Schnitt, keinen Übergang.

Einstellungen

Erstes / letztes Bild · 15s · 16:9 · 2 Referenzmedien

Mit MiniMax H3 erzeugte Bewegungsübertragung: zwei referenzierte Figuren tanzen Streetdance, kopiert aus einem ReferenzvideoMULTIMODALE REFERENZ
10s16:93 Referenzmedien

Figur & Bewegung

Streetdance-Bewegungsübertragung

Eine kurze Anweisung überträgt Choreografie aus einem Referenzvideo auf zwei durch Bilder definierte Figuren.

Details anzeigen

Vollständiger Prompt (geprüftes englisches Original)

Have the characters perform street dance following the movements in Video 1. Use Figure 1 and Figure 2 as the character references.

Benötigte Eingaben

  • Bild 1 und Bild 2: die beiden Figuren, je eine saubere Ganzkörperreferenz.
  • Video 1: die zu kopierende Bewegung, 2–15 Sekunden, mit der tanzenden Person vollständig im Bild.

Warum das funktioniert

  • Der Prompt ist kurz, weil die Referenzen die Information tragen — das Video besitzt die Bewegung, die Bilder besitzen die Identitäten.
  • Jedes Asset wird über seine Array-Position angesprochen, sodass es keine Unklarheit gibt, welche Referenz was liefert.
  • Mehr wird nicht verlangt. Kein Licht, keine Kamera, kein Stil — jede zusätzliche Anweisung würde mit der zu kopierenden Bewegung konkurrieren.

Austauschbare Variablen

  • Figuren
  • Ausgangschoreografie
  • Umgebung
  • Anzahl der Tanzenden

Einschränkungen

  • Die Gesamtdauer der Referenzvideos muss unter 15 Sekunden bleiben, jeder Clip 2–15 Sekunden bei 23,976–60 FPS.
  • Referenzvideos müssen MP4 oder MOV mit H.264 oder H.265 sein, je bis 50 MB, der gesamte JSON-Body unter 64 MB.

Einstellungen

Multimodale Referenz · 10s · 16:9 · 3 Referenzmedien

Mit MiniMax H3 erzeugter Dialogtausch: Die gesprochene Zeile einer Figur wurde durch eine neue Zeile aus einem Referenz-Audioclip ersetztMULTIMODALE REFERENZ
10s16:92 Referenzmedien

Natives Audio & Dialog

Dialog und Schauspiel ersetzen

Eine gesprochene Zeile wird ersetzt, indem alter und neuer Text wörtlich genannt und die erlaubte Schauspieländerung begrenzt wird.

Details anzeigen

Vollständiger Prompt (geprüftes englisches Original)

Replace the girl's line in Video 1, "We can't be together. It's not that we don't love each other; we truly can't make it to the end," with the line from Audio 1: "Don't go, okay? This time, let's not let go of each other." Slightly adjust the corresponding performance.

Benötigte Eingaben

  • Video 1: der Clip mit der zu ersetzenden Zeile.
  • Audio 1: die neue Zeile, WAV oder MP3, bis 15 MB und 15 Sekunden.
  • Beide Zeilen im Prompt wörtlich ausgeschrieben.

Warum das funktioniert

  • Das Zitieren der alten Zeile sagt dem Modell genau, welchen Abschnitt des Clips es bearbeiten soll, statt „den Dialog irgendwo in der Mitte“.
  • Das Zitieren der neuen Zeile gibt der Lippensynchronität ein Ziel, statt sie allein aus dem Audio abzuleiten.
  • „Das Schauspiel leicht anpassen“ erteilt eine begrenzte Erlaubnis, das Spiel zu verändern — begrenzt, damit der Rest der Aufnahme überlebt.

Austauschbare Variablen

  • Quellclip
  • zu ersetzende Zeile
  • neue Zeile und Stimme
  • wie stark sich das Schauspiel ändern darf

Einschränkungen

  • Audio darf nie der einzige Referenztyp sein; es muss zusammen mit einem Bild oder Video kommen.
  • Referenz-Audio und -Video sind pro Request auf je 15 Sekunden Gesamtdauer begrenzt.
  • Sagen Sie, was fest bleibt. Bildausschnitt, Garderobe und Hintergrund driften, wenn der Prompt nur über die Zeile spricht.

Einstellungen

Multimodale Referenz · 10s · 16:9 · 2 Referenzmedien

Mit MiniMax H3 erzeugter Stimmreferenz-Clip: eine Figur spricht einen geschriebenen Satz in der Klangfarbe eines Referenz-AudioclipsMULTIMODALE REFERENZ
10s16:92 Referenzmedien

Natives Audio & Dialog

Stimmreferenz „Folge dem Wind“

Minimaler Audio-Referenz-Prompt: der genaue Satz plus ein Clip, der die Zielstimme definiert.

Details anzeigen

Vollständiger Prompt (geprüftes englisches Original)

Character dialogue: "Follow the wind, live free. Leave worries behind, enjoy the moment." Use Audio 1 as the voice-timbre reference.

Benötigte Eingaben

  • Video 1: die Figur, die den Satz sprechen wird.
  • Audio 1: eine saubere Probe der Zielstimme, 2–15 Sekunden, idealerweise ohne Musik darunter.
  • Der exakte Dialogsatz, ausgeschrieben.

Warum das funktioniert

  • Der Dialog ist zitiert statt umschrieben, sodass Timing und Lippensynchronität etwas Konkretes haben, woran sie andocken.
  • Audio 1 bekommt genau eine eng gefasste Aufgabe — die Klangfarbe — statt als allgemeiner „Soundtrack“ übergeben zu werden.
  • Sonst ist nichts festgelegt, also behält der Referenzclip die volle Kontrolle über Bildausschnitt und Spiel.

Austauschbare Variablen

  • Dialogzeile
  • Stimmreferenz
  • Clip der Figur
  • Sprechtempo

Einschränkungen

  • Eine Stimmreferenz überträgt Klangfarbe, nicht Akzent, Emotion oder Tempo; schreiben Sie diese in den Prompt, wenn sie wichtig sind.
  • Musik oder mehrere Sprechende in der Referenz verschlechtern das Ergebnis — liefern Sie eine isolierte Stimme.

Einstellungen

Multimodale Referenz · 10s · 16:9 · 2 Referenzmedien

Mit MiniMax H3 erzeugter Bühnenclip: zwei Magier tauschen in einer Rauchwolke ihre Anzugfarben, während der Vorhang von Rot nach Blau wechseltERSTES / LETZTES BILD
7s16:91 Referenzmedien

Bearbeitung & Transformation

Kostümtausch der Magier

Anweisungstest mit zwei getauschten Kostümen, einem unveränderten Detail und einem getakteten Farbwechsel im Hintergrund.

Details anzeigen

Vollständiger Prompt (geprüftes englisches Original)

Two magicians stand onstage facing the audience and perform a "swap" trick. They wave their wands at the same time, and a cloud of smoke rises. When it clears, their suit colors have switched: the person on the left wears a white suit, and the person on the right now wears a black suit, while both magicians' glove colors remain unchanged. They bow to thank the audience. The red curtain behind them closes, transitioning from deep red to deep blue.

Benötigte Eingaben

  • Ein Startbild mit beiden Darstellern, ihren Kostümen und der Bühne.
  • Ein klarer Vorher-/Nachher-Zustand für alles, was getauscht wird.

Warum das funktioniert

  • Der Tausch wird durch ein Ereignis verdeckt — die Rauchwolke — und gibt dem Modell einen legitimen Moment für die Änderung, statt vor der Kamera zu morphen.
  • Was sich nicht ändern darf (die Handschuhfarbe), steht direkt neben dem, was sich ändern soll — genau so verhindert man, dass ein Edit ausufert.
  • Die Einstellung endet in einem definierten Zustand: die Verbeugung, der schließende Vorhang, die Farbe, die auf Dunkelblau landet.

Austauschbare Variablen

  • Darsteller und Kostüme
  • das Detail, das fest bleibt
  • Ereignis, das den Tausch verdeckt
  • abschließender Farbwechsel

Einschränkungen

  • Die Bild-zu-Video-Route leitet das Seitenverhältnis aus dem Eingabebild ab und weist das Feld aspect_ratio zurück.
  • Jedes nicht genannte Attribut ist für das Modell Freiwild. Wenn ein Detail die Änderung überstehen muss, schreiben Sie es auf.

Einstellungen

Erstes / letztes Bild · 7s · 16:9 · 1 Referenzmedien

Mit MiniMax H3 erzeugter Produktfilm: hochwertige Over-Ear-Kopfhörer drehen sich über einem spiegelnden Sockel in einem schwarzen StudioTEXT ZU VIDEO
15s16:9Keine Referenzmedien

Marke & Produktwerbung

Luxuriöse Kopfhörer-Präsentation

15-Sekunden-Produktfilm in vier Zeitblöcken mit eigener Kamerafahrt und Aufgabe – direkt nutzbar ohne Referenzmaterial.

Details anzeigen

Vollständiger Prompt (geprüftes englisches Original)

Create a 15-second luxury cinematic product showcase for premium wireless over-ear headphones. 0–4s: Begin with an extreme macro tracking shot moving across the soft memory-foam ear cushion, fine fabric texture, brushed-metal hinge and precision-machined controls. A narrow light band travels across the surface, revealing realistic materials against a deep black studio background. 4–8s: Pull back into a three-quarter hero view. The headphones rotate slowly above a glossy reflective pedestal. The ear cups pivot naturally while the adjustable headband extends slightly, demonstrating flexible construction and comfort. Maintain exact symmetry, stable geometry and consistent proportions. 8–12s: Transition into an elegant exploded-view reveal. The ear cushion, acoustic driver, internal sound chamber, control ring and outer shell separate smoothly in perfect alignment. Subtle luminous sound waves pulse outward from the driver while the camera performs a restrained side orbit. 12–15s: Every component reconnects seamlessly. The headphones settle into a centered front-facing hero composition as soft rim lighting defines the silhouette. Complete a gentle dolly-in toward the ear cups. Premium technology-commercial finish, controlled reflections, realistic shadows, shallow depth of field, crisp surface detail, stable product shape, no hands, no distortion, no onscreen text.

Benötigte Eingaben

  • Nichts hochzuladen — Text zu Video arbeitet allein mit dem Prompt.
  • Ein Produkt, das Sie über Material und Mechanik beschreiben können, nicht nur über den Namen.

Warum das funktioniert

  • Die Zeit ist in 0–4 s, 4–8 s, 8–12 s und 12–15 s aufgeteilt, sodass das Modell eine Einstellungsliste bekommt statt einer Wunschliste.
  • Jeder Block bewegt die Kamera anders — Makrofahrt, Rückzug, seitlicher Orbit, Dolly nach vorn —, und genau das lässt den Clip geschnitten statt driftend wirken.
  • Die Schlusszeile ist eine Verbotsliste (keine Hände, keine Verzerrung, kein Bildschirmtext) und deckt die drei üblichen Fehlerquellen von Produktrenderings ab.

Austauschbare Variablen

  • Produkt
  • Materialien und Oberfläche
  • Timing der einzelnen Blöcke
  • Hintergrund und Licht
  • ob die Explosionsansicht vorkommt

Einschränkungen

  • Die Dauer ist eine ganze Zahl von 4 bis 15 Sekunden und wird im Request gesetzt; die Zeitblöcke im Prompt müssen in der Summe dazu passen.
  • Zeitblöcke sind Regieanweisung, keine harte Timeline. Für 15 Sekunden nicht mehr als vier.
  • Diesen Clip hat der Autor in 720p veröffentlicht; die H3-Routen auf EvoLink liefern 2K.

Einstellungen

Text zu Video · 15s · 16:9 · Keine Referenzmedien

Das MiniMax-H3-Prompt-Framework

H3 verarbeitet geordnete Referenzen und erzeugt eigenes Audio. Schreiben Sie für den jeweiligen Workflow statt nur nach einer allgemeinen Prompt-Formel.

Das H3-Prompt-Grundgerüst

Ziel → geordnete Referenzen → Motiv- und Identitätsanker → chronologische Aktionen → Kamerapfad → Audio oder Dialog → unveränderliche Elemente → Endzustand. So fehlen weder Ton noch ein klares Ende.

Text zu Video

Beschreiben Sie eine umsetzbare Zeitleiste: Motiv, wenige Aktionen, einen durchgehenden Kamerapfad und getrennte Tonspuren für Dialog, Atmosphäre und Musik.

Erster / letzter Frame

Die Bilder geben das Aussehen bereits vor. Beschreiben Sie nur die Bewegung dazwischen, die Kamerafahrt, unveränderliche Elemente und den gewünschten Endzustand.

Multimodale Referenzen

Geben Sie jedem Asset genau eine Aufgabe und nennen Sie seine Array-Position: Bild 1 für die Figur, Bild 2 für den Ort, Video 1 für die Kamerafahrt und Audio 1 für die Stimme. Höchstens 12 Dateien pro Anfrage.

Vorhandenen Clip bearbeiten

Schreiben Sie zwei Listen: „Ändern“ mit Ziel → Ergebnis und „Beibehalten“ für alles, was unverändert bleiben muss. Laden Sie nur den benötigten Ausschnitt als Video 1 hoch.

Audio und Dialog

Zitieren Sie den gewünschten Dialog wörtlich. Nutzen Sie die Stimmreferenz nur für die Klangfarbe und beschreiben Sie Akzent, Emotion und Tempo separat.

Fehlerdiagnose

Sieben typische Fehler in H3-Prompts und wie Sie sie beheben.

Der Clip ignoriert einen Teil des Prompts
Wahrscheinliche UrsacheZu viele Motive, Stile und Ereignisse konkurrieren in kurzer Zeit.
LösungReduzieren Sie auf ein Motiv, einen Ort und so viele Aktionen, wie die Dauer tragen kann.
Die Kamera driftet oder widerspricht sich
Wahrscheinliche UrsacheZwei unvereinbare Kamerabewegungen stehen im selben Shot.
LösungGeben Sie dem Shot einen durchgehenden Kamerapfad; eine zweite Bewegung wird als Schnitt beschrieben.
Die falsche Referenz steuert das falsche Element
Wahrscheinliche UrsacheDie Rollen der hochgeladenen Assets sind nicht festgelegt.
LösungNennen Sie jedes Asset nach Position und geben Sie ihm genau eine Aufgabe.
Die Geschichte wirkt gehetzt
Wahrscheinliche UrsacheEine vollständige Handlung wurde in eine kurze Dauer gepresst.
LösungPlanen Sie etwa eine Aktion pro drei bis vier Sekunden; zehn Sekunden tragen zwei bis drei Aktionen.
Im Bild bewegt sich kaum etwas
Wahrscheinliche UrsacheDer Prompt beschreibt Aussehen statt Veränderung.
LösungVerwenden Sie Verben: Was bewegt sich, in welcher Reihenfolge und in welchem Zustand endet der Shot?
Eine Bearbeitung greift auf andere Bereiche über
Wahrscheinliche UrsacheEs wurden keine zu erhaltenden Bereiche oder Eigenschaften genannt.
LösungListen Sie Gesicht, Kleidung, Hintergrund und Bildausschnitt auf, sofern sie identisch bleiben sollen.
Der Ton ist unklar und überladen
Wahrscheinliche UrsacheDialog, Atmosphäre und Musik haben keine Priorität.
LösungBestimmen Sie die führende Spur, halten Sie die anderen leise und lassen Sie Raum für den Dialog.

FAQ zu MiniMax-H3-Prompts

Sind MiniMax H3 und Hailuo 3 dasselbe Modell?

Ja. MiniMax H3 ist auch als Hailuo 3, Hailuo 3.0 oder Hailuo 03 bekannt. EvoLink verwendet MiniMax H3 als Produktnamen und bietet Text-zu-Video-, Bild-zu-Video- und Referenz-zu-Video-Routen.

Kann ich diese Prompts ohne Code verwenden?

Ja. „Diesen Prompt verwenden“ überträgt den englischen Originalprompt in den MiniMax-H3-Playground und wählt den passenden Workflow. Referenzdateien ergänzen Sie dort.

Wie lang kann ein MiniMax-H3-Clip sein?

Alle drei Routen akzeptieren ganzzahlige Dauern von 4 bis 15 Sekunden und geben aktuell 2K aus. Die Kartendauer entspricht dem veröffentlichten Beispielclip.

Wie viele Referenzdateien kann ein Prompt verwenden?

Die Referenzroute akzeptiert bis zu 9 Bilder, 3 Videos und 3 Audioclips, insgesamt jedoch höchstens 12 Dateien — ein volles 9 + 3 + 3 wird also abgelehnt. Mindestens ein Bild oder Video ist erforderlich; Audio allein ist nicht zulässig. Video- und Audioreferenzen müssen 2 bis 15 Sekunden lang sein.

Warum steht im Prompt „Image 1“ oder „Video 1“?

Die API ordnet Referenzen anhand ihrer Position in image_urls, video_urls und audio_urls zu. Die englischen Bezeichnungen im verifizierten Prompt weisen einem bestimmten Asset seine Aufgabe zu.

Woher stammen die Prompts und Clips?

Jede Karte nennt ihre Quelle. Offizielle MiniMax-Beispiele nutzen eine geprüfte englische Fassung des chinesischen Originalprompts; Community-Beispiele verlinken den Originalbeitrag auf X.

Kann ich diese Prompts über die API verwenden?

Ja. Derselbe englische Prompt funktioniert im Playground und im prompt-Feld der API. Der MiniMax-H3-API-Leitfaden erklärt Requests, asynchrone Tasks, Callbacks und Fehlerbehandlung.

Prompt auswählen und generieren

Jeder Prompt ist einer aktiven MiniMax-H3-Route auf EvoLink zugeordnet. Nutzen Sie den Playground oder dieselbe Anfrage über die einheitliche API.