Alles steht still, nur die Kamera läuft
Den eingefrorenen Moment gibt es auf drei Wegen. Einer baut ihn in einem Foto und lässt die Kamera darum fahren, einer beschreibt eine ganze Szene in einem einzigen Videoprompt, und der dritte hält die Zeit mitten in einem laufenden Video an. Alle drei stehen hier komplett, mit den Einstellungen, an denen sie hängen.
Welcher passt zu dir?
A: Foto plus Kamerafahrt
Ein Standbild, um das sich die Kamera in einem kurzen Bogen bewegt. Fünf Sekunden, zwei Prompts, rund fünf Minuten Arbeit. Der verlässlichere Weg, weil das Videomodell nur eine einzige Aufgabe bekommt.
Für den schnellen, sauberen Effekt.
B: Der durchgehende Kinoprompt
Ein einziger Prompt über fünfzehn Sekunden, der Handlung, Zeitlupe, Licht und Ton zugleich beschreibt. Aufwendiger und weniger vorhersehbar, dafür entsteht eine ganze Szene statt eines Moments.
Für die filmische Variante, mit mehr Anläufen.
C: Zeitstopp mitten im Video
Ein laufendes Video, in dem plötzlich alles stehen bleibt. Die Kamera fliegt durch die eingefrorene Szene, danach geht es einfach weiter. Dreißig Sekunden, ein Prompt, gemacht fürs Hochformat.
Für die Szene mit Überraschungsmoment.
Die Einstellungen der drei Wege widersprechen sich: fünf, fünfzehn und dreißig Sekunden, der Ton bei A aus, bei B und C an. Das ist Absicht, sie gehören zu verschiedenen Verfahren. Misch sie nicht.
Foto plus Kamerafahrt
Zwei Prompts, fünf Sekunden, etwa fünf Minuten
Der Bullet-Time-Effekt aus den sozialen Netzen ist kein Videotrick, sondern ein Standbild plus eine einzige Kamerafahrt, und genau dort liegt der Fehler, an dem die meisten scheitern.
- Zwei Prompts, ein Bild, ein Video, etwa fünf Minuten Arbeit
- Der eingefrorene Moment entsteht im Bild, nicht im Videomodell
- Eine einzige Einstellung entscheidet, ob die Kamera sauber fährt oder durchdreht
Warum das kein Videotrick ist
Wer versucht, das Einfrieren vom Videomodell erzeugen zu lassen, bekommt Zeitlupe. Die Modelle kennen Bullet Time überwiegend als „sehr langsam“ und nicht als „angehalten“. Deshalb wird der Moment vorher gebaut: Das Standbild enthält den Sturz, die Gischt, die fliegenden Gegenstände bereits fertig eingefroren. Das Videomodell bekommt nur noch eine einzige Aufgabe, nämlich die Kamera zu bewegen.
Warum der Bogen kurz sein muss
Eine volle Umrundung sieht nach Produktvideo aus, nicht nach Film. Der Effekt entsteht bei einem kurzen Bogen, ungefähr einer Achtel- bis Vierteldrehung. Dabei verschieben sich Vordergrund, Motiv und Hintergrund unterschiedlich schnell gegeneinander, und genau diese Verschiebung liest das Auge als Räumlichkeit.
Das Gesicht entscheidet
Das Gesicht muss die ganze Zeit lesbar bleiben. Sobald die Kamera hinter die Person wandert, verliert der Clip seine Pointe.
Was du brauchst
- Ein Bildmodell, das Referenzgesichter verarbeitet (GPT Image 2 in ChatGPT)
- Zugang zu Seedance 2.0, zum Beispiel über Higgsfield
- Ein scharfes Foto des Gesichts als Referenz, frontal, gutes Licht
Schritt 1: Das Standbild
Hier entsteht der eingefrorene Moment. Alles, was später in der Luft hängen soll, muss schon in diesem Bild hängen. Die Platzhalter in eckigen Klammern ersetzt du durch deine Szene.
Erstelle ein fotorealistisches Hochformat im Verhältnis 9:16. Eine Person ist im spektakulärsten Moment eines kleinen Missgeschicks eingefroren, so wie es mit einer sehr kurzen Belichtungszeit aussähe. Die Person: [BESCHREIBUNG], nah an der Kamera, das dominante Motiv im Bild, Gesicht klar erkennbar und passend zur hochgeladenen Referenz. Das Missgeschick: [WAS PASSIERT]. Auslöser und Reaktion müssen beide im Bild sichtbar sein, damit man in einer Sekunde versteht, was gerade schiefgeht. Schwebende Elemente: [OBJEKTE] hängen bewegungslos in der Luft, nah um die Person herum und deutlich innerhalb des Bildrands. Wasser als einzelne große Tropfen, kein feiner Sprühnebel. Der Ort: [UMGEBUNG] bei hellem Tageslicht. Baue klare Tiefe in drei Ebenen, etwas im Vordergrund, die Person in der Mitte, ein erkennbarer Hintergrund dahinter. Qualität: wie ein Einzelbild aus einem teuren Werbespot. Durchgehend scharf, keine Bewegungsunschärfe, natürliche Materialien und Reflexe, keine Illustration, kein 3D-Render-Look. Kein aufgesetzt wirkendes Gesicht, keine steifen Posen, keine doppelten Gliedmaßen.
Die Platzhalter einmal wirklich ausschreiben. Bleiben sie abstrakt, baut das Modell eine beliebige Szene und der Gag verschwindet.
Erstelle ein fotorealistisches Hochformat im Verhältnis 9:16. Eine Person ist im spektakulärsten Moment eines kleinen Missgeschicks eingefroren, so wie es mit einer sehr kurzen Belichtungszeit aussähe. Die Person: ein Mann Mitte dreißig im grauen T-Shirt, nah an der Kamera, das dominante Motiv im Bild, Gesicht klar erkennbar und passend zur hochgeladenen Referenz. Das Missgeschick: der Campingstuhl bricht unter ihm zusammen, er kippt nach hinten und reißt beide Arme hoch. Auslöser und Reaktion müssen beide im Bild sichtbar sein, damit man in einer Sekunde versteht, was gerade schiefgeht. Schwebende Elemente: Chips, eine umgekippte Schüssel und eine Flasche, aus der das Wasser in einem Bogen herausschießt, hängen bewegungslos in der Luft, nah um die Person herum und deutlich innerhalb des Bildrands. Wasser als einzelne große Tropfen, kein feiner Sprühnebel. Der Ort: ein Stellplatz an der Küste, dahinter ein Campingbus und ein Zelt, bei hellem Tageslicht. Baue klare Tiefe in drei Ebenen, etwas im Vordergrund, die Person in der Mitte, ein erkennbarer Hintergrund dahinter. Qualität: wie ein Einzelbild aus einem teuren Werbespot. Durchgehend scharf, keine Bewegungsunschärfe, natürliche Materialien und Reflexe, keine Illustration, kein 3D-Render-Look. Kein aufgesetzt wirkendes Gesicht, keine steifen Posen, keine doppelten Gliedmaßen.
So konkret dürfen die Platzhalter werden. Ein zusammenbrechender Campingstuhl am Meer, damit man in einer Sekunde versteht, was schiefgeht.
Schritt 2: Die Einstellungen
Diese sieben Werte entscheiden mehr über das Ergebnis als jede Formulierung im Prompt.
| Einstellung | Wert | Warum |
|---|---|---|
| Modell | Seedance 2.0 | die Fast-Variante hält die Kameravorgaben nicht ein |
| Modus | Std | Voraussetzung für 1080p und für saubere Kameraführung |
| Dauer | 5 Sekunden | siehe Kasten unten |
| Auflösung | 1080p für den finalen Take | 720p reicht zum Testen |
| Seitenverhältnis | 9:16 für Reels, 4:5 für den Feed | sonst schneidet die Plattform |
| Ton | aus | Bewegungsgeräusch unter einem stehenden Bild wirkt falsch |
| Bilder | Standbild als Startbild, Gesichtsfoto als Referenz | hält die Identität |
Die eine Einstellung
Seedance verteilt die Kamerastrecke über die eingestellte Dauer. Vier Sekunden ergeben einen sehr engen Bogen, fünf Sekunden treffen den Bereich, in dem der Effekt funktioniert, sechs Sekunden lassen die Kamera einmal komplett herumfahren und im Startbild enden. Die Gradangabe im Prompt steuert das nicht, die Dauer schon.
Schritt 3: Der Videoprompt
Das Standbild kommt als Startbild rein, das Gesichtsfoto als Referenz. Der Prompt hat danach nur noch eine Aufgabe: dem Modell zu sagen, dass sich nichts bewegen darf außer der Kamera.
Das Bild bleibt in jedem Detail so stehen, wie es ist. Die Person rührt sich nicht, die Pose bleibt exakt erhalten. Alle schwebenden Objekte, Tropfen und Partikel bleiben an ihrem Platz und über die volle Länge sichtbar. Nichts fällt, dreht sich, schwingt, löst sich auf oder führt die Bewegung fort. Die Zeit ist nicht verlangsamt, sie steht still. Bewegen darf sich ausschließlich die Kamera. Sie fährt in einem einzigen ruhigen Bogen um die Szene, von Anfang an in eine Richtung und bis zum Schnitt in dieselbe Richtung weiter. Sie kehrt nie um und erreicht nie den Rücken der Person. Der Abstand zur Szene bleibt gleich, es wird nicht herangefahren, kein Close-up auf das Gesicht. Der letzte Frame zeigt einen anderen Blickwinkel als der erste. Person und Objekte sind starre Körper, fest im Raum verankert. Sie drehen sich nicht mit der Kamera. Neue Ansichten entstehen nur dadurch, dass die Kamera ihre Position wechselt, mit korrekter Perspektive und natürlichen Überschneidungen. Licht, Schatten und Farben bleiben unverändert. Das Ergebnis soll aussehen wie eine echte Aufnahme, nicht wie eine Animation. Kein Flackern, kein Nachziehen, kein Verformen von Gesicht oder Körper.
Der Satz zur stillstehenden Zeit muss drinbleiben. Ohne ihn liest das Modell Bullet Time als Zeitlupe und die Person bewegt sich weiter.
Wenn Weg A nicht klappt
Die Kamera dreht einmal komplett herum und endet dort, wo sie angefangen hat
- Ursache
- Dauer steht auf 6 Sekunden
- Lösung
- auf 5 Sekunden stellen
Die Kamera fährt hin und wieder zurück, das Ergebnis wirkt hektisch
- Ursache
- Fast-Variante des Modells
- Lösung
- auf Seedance 2.0 im Std-Modus wechseln
Die Person bewegt sich langsam weiter statt stillzustehen
- Ursache
- das Modell liest Bullet Time als Zeitlupe
- Lösung
- den Satz „Die Zeit ist nicht verlangsamt, sie steht still“ im Prompt lassen
Ein schwebendes Objekt verschwindet nach der Hälfte
- Ursache
- es lag im Standbild am Bildrand und wandert durch die Kamerafahrt hinaus
- Lösung
- im Bildprompt alle schwebenden Objekte nah an die Person setzen
Feiner Sprühnebel flackert oder verändert seine Form
- Ursache
- das Modell rendert feine Partikel neu statt sie einzufrieren
- Lösung
- im Bildprompt große einzelne Tropfen statt Nebel anlegen
Unter dem stehenden Bild liegt ein Geräusch
- Ursache
- Tonerzeugung war aktiv
- Lösung
- Ton in den Einstellungen abschalten
Prompts, die von vornherein sitzen
Ein Bildprompt ist nur so gut wie die Beschreibung darin. Im Prompt-Builder baust du dir Aufträge aus festen Bausteinen, statt sie jedes Mal neu zu erfinden.
Zum Prompt-BuilderDer durchgehende Kinoprompt
Ein Prompt, fünfzehn Sekunden, neun Blöcke
Hier macht das Videomodell alles auf einmal: Handlung, Verlangsamung, Kamerafahrt, Licht und Ton. Das ist der Weg, mit dem der Clip aus dem Reel entstanden ist. Er liefert eine ganze Szene, verlangt dafür aber mehr Anläufe und beschert dir Überraschungen, die weiter unten offen benannt sind.
SEEDANCE 2.0 — "THE DODGE" — VERTICAL 9:16 — 15 SECONDS [OPENING HOOK — 0 to 2s] Begin on pure black, total silence. At 0.6s a single amber glyph particle ignites center-frame and falls. At 0.9s, 200 more ignite and cascade downward as a vertical rain of glowing amber characters (#E8A317) against deep navy (#111827) — abstract angular glyphs, NOT alphanumeric, NOT green. At 1.4s hard low-frequency sub-drop, and the glyph rain resolves into a rain- slicked rooftop surface seen from a low 15-degree angle. Camera roll 12 degrees off-horizon. Wet concrete reflecting amber light. [ESTABLISHING — 2 to 4.5s] Rooftop of a mid-rise European city building at night, light rain falling. Skyline in background: 40% out of focus, cool teal window lights (#0D9488), atmospheric haze at 25% density, volumetric light shafts from an off-frame source. Subject @material[kai_ref] stands frame-center-left, occupying 35% of frame, back three-quarters to camera. Wardrobe: matte navy technical shell jacket, high collar, no logos, no long coat, no sunglasses. Camera: 35mm equivalent, low angle at hip height, slow dolly forward 2 ft/s. At 4.2s he turns his head toward camera-right. Eyes lock off-frame. [PRIMARY ACTION — 4.5 to 8.5s] At 4.5s: four glowing projectiles enter from frame-right at high velocity — angular amber shards, 6 inches long, each trailing a 2-foot light streak and faint glyph fragments. Motion blur heavy. At 5.2s: Kai's weight shifts, left foot plants, torso begins to arc backwards. Movement is controlled and unhurried, not panicked. Arms extend outward for counterbalance, palms open and down. At 6.0s: speed ramp begins. Playback decelerates from 100% to 12% over 0.8s. Rain droplets slow to individual suspended beads. Jacket fabric ripples in slow motion. At 7.0s: Kai's torso is arched backward roughly 55 degrees from vertical, face upward toward the falling rain, eyes open and calm. [BULLET-TIME CLIMAX — 8.5 to 12s] Time is effectively frozen at 8% speed. The four projectiles hang suspended 2 feet above his chest, their light streaks frozen as solid amber ribbons. Camera orbits 180 degrees around the subject over 3.5 seconds at constant radius of 8 feet, moving right-to-left, staying at chest height, subject locked frame-center throughout. Parallax: suspended rain beads in foreground pass rapidly, skyline background rotates slowly. Rim light sweeps across his jaw and shoulder as the camera passes the backlight position at 10.2s. Depth of field f/2.0, focus locked on his face. The projectiles remain untouched. They never make contact. [RESOLUTION — 12 to 15s] At 12.0s: speed ramps back to 100% over 0.5s with an audible whoosh. The four projectiles shoot past out of frame-left and dissipate into amber sparks. At 12.8s: Kai snaps upright in one fluid motion, settles, shoulders drop. At 13.4s: he turns his head fully to camera. Direct eye contact. Neutral, faintly amused expression. Slight exhale visible in the cold air. At 14.2s: camera push-in 18 inches over 0.8s. Rain continues. Amber glyph rain fades back in over the skyline behind him at 20% opacity. Hold on eye contact to 15s. [CAMERA & TECHNICAL SPECS] Aspect ratio 9:16 vertical. Duration 15s. Resolution 720p. Focal lengths: 35mm establishing, 50mm for the orbit, 65mm for final push-in. Depth of field f/2.0 throughout climax, f/2.8 elsewhere. Anamorphic-style horizontal flares on all specular highlights. Subject action confined to center 70% vertical safe zone for mobile UI. Camera motion: dolly 2 ft/s, orbit 51 degrees/second constant, final push 22 inches/second. No handheld jitter during the orbit — locked and smooth. [LIGHTING] Key: 3200K amber, hard, from frame-right at 40 degrees elevation, 70% intensity, motivated as rooftop signage spill. Fill: 5600K cool teal from frame-left, soft, 25% intensity, ratio 3:1. Rim: 4000K, hard, from behind at 160 degrees, 90% intensity, separating subject from the dark skyline. Practicals: teal window lights in background, amber projectile glow as moving practical light source on his chest and face. Volumetric haze 25%, visible light shafts, rain catching all three sources. [COLOR GRADING] Split-tone: amber highlights at 35 degrees hue, deep navy-teal shadows at 200 degrees hue. Saturation 112%. Shadow crush moderate — blacks lifted to 8 IPRE so detail survives in the jacket. Contrast curve S-shaped, mild. Halation 15% on all amber sources. Fine film grain 4%. Slight vignette. NO green channel push. NO green cast anywhere in frame. [AUDIO INTEGRATION] 0–1.4s: full silence. 1.4s: sub-bass drop at +2dB, single hit. 1.4–4.5s: low ambient drone (-8dB), rain on concrete (-6dB), distant city hum. 4.5–6.0s: four sharp incoming whoosh transients, rising pitch, panned right to left, -2dB. 6.0–8.5s: pitch-drop as speed ramps down, all audio stretches and darkens, low sustained tone. 8.5–12s: near-silence. One sustained sub-tone (-10dB). Individual rain droplet ticks, spaced and unnaturally slow. Faint high-frequency shimmer on the suspended projectiles. 12.0s: sharp whoosh at +3dB as time resumes, four rapid pass-by Doppler streaks. 12.8–15s: rain and ambient return at normal level, low confident bass note enters (-4dB) and sustains under the final eye contact. [MATERIAL REFERENCES] @material[kai_ref_front], @material[kai_ref_profile], @material[kai_ref_threequarter]: Use these for facial identity, hairline, build and skin tone. Maintain exact likeness across all camera angles including the 180-degree orbit. Do not alter face structure during speed ramps. [NEGATIVE / EXCLUSIONS] No green digital rain. No alphanumeric falling code. No long leather trench coat. No small oval or round sunglasses. No firearms, no visible weapons, no muzzle flashes, no shell casings. No blood, no impact wounds. No recognisable brand logos, no film titles, no on-screen text of any kind. No other human figures in frame. No recognisable real-world landmarks. [OUTPUT SPECS] 15-second vertical sci-fi action beat. Single continuous shot, no cuts. Sound design integrated. Optimised for Instagram Reels and TikTok.
Unverändert der Prompt, mit dem der Clip entstanden ist. Nichts nachträglich geglättet, samt der Eigenheiten, die unten stehen.
Die neun Blöcke
In der Reihenfolge, in der sie im Prompt stehen. Wer den Aufbau versteht, kann ihn für eigene Szenen neu füllen.
Womit das Bild anfängt
Schwarz, ein Funke, dann der Glyphen-Regen. Der erste Block entscheidet, ob jemand nach einer halben Sekunde weiterwischt. Deshalb steht hier die Sekunde, in der der erste Funke zündet, und nicht nur „beginne dunkel".
Wo wir sind und wer da steht
Ort, Tageszeit, Wetter, Position der Figur im Bild, Kleidung, Brennweite, Kamerahöhe. Der Block, in dem die meisten zu wenig schreiben und sich hinterher über beliebige Ergebnisse wundern.
Die eigentliche Bewegung
Was passiert, in welcher Reihenfolge, in welchem Tempo. Hier steht auch die Speed-Ramp: von 100 auf 12 Prozent über 0,8 Sekunden. Ohne diese Angabe wird aus Bullet-Time bloß Zeitlupe.
Der Moment, für den alles gebaut ist
Die Zeit steht praktisch still, die Kamera fährt weiter. Genau dieser Widerspruch macht den Effekt. Der Block beschreibt Radius, Höhe, Richtung und Geschwindigkeit der Kamerafahrt getrennt voneinander.
Wie es endet
Zurück auf normales Tempo, aufrichten, in die Kamera schauen. Ein Ende gehört in den Prompt, sonst hört der Clip einfach auf, statt zu schließen.
Objektiv, Blende, Kamerabewegung
Brennweiten pro Abschnitt, Schärfentiefe, Bewegungsgeschwindigkeit in Fuß pro Sekunde. Klingt übertrieben, ist aber der Unterschied zwischen einer Fahrt und einem Wackeln.
Drei Lichter mit Aufgabe
Führungslicht, Aufheller, Kantenlicht, jeweils mit Farbtemperatur, Richtung und Intensität. Das Kantenlicht ist der Grund, warum sich die Figur überhaupt vom dunklen Hintergrund trennt.
Farbe und Ton
Split-Toning, Sättigung, Korn, dazu ein kompletter Tonplan im Sekundentakt. Seedance erzeugt den Ton mit, wenn man ihn anfordert.
Was auf keinen Fall vorkommen darf
Der kürzeste Block und der wichtigste. Ohne ihn wird aus der Szene eine Filmkopie. Mehr dazu weiter unten.
Die Einstellungen dieser Generierung
Was bestellt war und was wirklich herauskam
Alles am fertigen Clip nachgeprüft, nicht aus dem Prompt abgeschrieben. Genau diese Abweichungen sind der Grund, warum Weg A überhaupt entstanden ist.
Bestellt: Im Prompt steht groß „VERTICAL 9:16" und im Technikblock noch einmal „Aspect ratio 9:16 vertical".
Herausgekommen: Herausgekommen ist ein Querformat-Clip mit 1280 mal 720 Pixeln. Für das Reel musste er nachträglich auf eine Karte im Hochformat beschnitten werden.
Das Auswahlfeld im Tool gewinnt gegen jeden Satz im Prompt. Stell das Seitenverhältnis dort ein und benutz den Prompt nicht dafür.
Bestellt: Der Höhepunkt fordert eine 180-Grad-Kamerafahrt um die Figur, über 3,5 Sekunden, bei acht Fuß Radius.
Herausgekommen: Die kam nicht. Der fertige Clip zeigt die Rückwärtsbewegung und vorbeiziehende Lichtspuren, aber keine Umkreisung. Die Wirkung entsteht trotzdem, nur anders als bestellt.
Detaillierte Kameraführung ist ein Wunsch, keine Zusage. Plane so, dass die Szene auch ohne die aufwendigste Bewegung trägt.
Bestellt: Der Prompt taktet jeden Beat auf die Zehntelsekunde, von 0,6 bis 15,0.
Herausgekommen: Die Reihenfolge stimmt, die Uhrzeiten nicht. Das Aufrichten am Ende beginnt bei Sekunde 11,1 statt bei 12,8.
Sekundenangaben lesen sich für das Modell als Reihenfolge und Gewichtung. Miss die Beats hinterher am fertigen Clip nach, bevor du darauf schneidest.
Bestellt: Die Figur soll über alle Kamerawinkel hinweg dieselbe bleiben.
Herausgekommen: Das hat funktioniert, aber nur, weil eine Charakter-Referenz angehängt war. Der Platzhalter im Prompt allein bewirkt nichts.
Lade ein Referenzbild als Charakter hoch und verknüpf es. Ohne diesen Schritt bekommst du eine fremde Person mit deiner Beschreibung.
Wenn der Kinoprompt klemmt
Fünf Fälle, die bei Weg B immer wieder auftreten. Die meisten lassen sich schon im Prompt verhindern.
Das Ergebnis sieht aus wie ein grüner Zahlenregen
Ohne ausdrückliches Verbot greift das Modell auf das bekannteste Vorbild zurück, das es zu „Bullet-Time" kennt.
Die Negativliste mitschicken und die eigene Farbwelt positiv beschreiben. Im Prompt oben stehen deshalb Bernstein und Navy mit Farbwerten und ausdrücklich „NOT green".
Aus Bullet-Time wird gewöhnliche Zeitlupe
Der Prompt sagt „slow motion", aber nicht, dass die Kamera sich weiterbewegen soll, während die Zeit steht.
Tempo und Kamerabewegung getrennt beschreiben. Erst die Verlangsamung mit Prozentwert, dann die Fahrt mit Radius, Richtung und Dauer.
Das Gesicht wechselt mitten im Clip
Keine Charakter-Referenz angehängt, oder mehrere widersprüchliche Referenzen gleichzeitig.
Genau eine saubere Referenz mit klarem Gesicht. Lieber ein gutes Bild als fünf mittelmäßige.
Die Figur steht zu klein oder halb außerhalb des Bildes
Position und Bildanteil sind nicht angegeben, das Modell entscheidet selbst.
Schreib beides hin, so wie oben: „frame-center-left, occupying 35% of frame". Bei Hochformat zusätzlich eine Sicherheitszone für die Bedienoberfläche der Plattform.
Der Clip endet einfach, statt zu schließen
Der Prompt beschreibt nur die Aktion, nicht den Ausklang.
Einen eigenen Abschlussblock schreiben. Beim Prompt oben ist das der direkte Blick in die Kamera, und genau der ist im Reel der Schluss.
Zeitstopp mitten im Video
Ein Prompt, dreißig Sekunden, Seedance 2.5
Bei Weg A steht die Zeit von Anfang an, bei Weg B wird sie nur langsamer. Hier läuft die Szene zuerst ganz normal. Dann bleibt alles in der Luft hängen, die Kamera löst sich und fliegt durch den eingefrorenen Moment, und am Ende läuft die Zeit einfach weiter. Grundlage ist ein Reel, in dem Kai mit Kaffee und Handy über die Domplatte in Köln rennt und stolpert.
So läuft das Video ab
- 0 bis 2,5 sDie Person rennt mit dem Handy am Ohr und dem Kaffee in der Hand auf die Kamera zu.
- rund 3 sSie stolpert. Becher, Handy, Aktentasche und Papiere fliegen los.
- ab rund 4 sDie Zeit steht. Die Kamera löst sich aus der Hand und steigt auf.
- rund 9 bis 12 sMakroflug an den schwebenden Kaffeetropfen vorbei, dann am Handy.
- rund 14 bis 17 sDas Blatt mit deinem Text, umgeben von Tropfen.
- rund 18 bis 20 sRückflug in die Ausgangsposition.
- ab rund 21 sDie Zeit läuft weiter. Aufprall, die Person rappelt sich auf.
- bis 30 sEin Blick aufs Handy, dann fassungslos in die Kamera.
Am fertigen Video abgelesen. Die Zeiten sind ungefähr, jeder Durchlauf setzt sie etwas anders.
Die Vorlage
Der Prompt aus dem Reel, umgebaut zum Ausfüllen. Die Stellen in eckigen Klammern ersetzt du durch deine Szene, und zwar auf Englisch, weil der ganze Prompt englisch ist. Nur der Text auf dem Blatt darf deutsch sein. Als Referenz lädst du ein Foto der Person hoch, die rennen soll.
ONE CONTINUOUS SHOT. NO CUTS, TRANSITIONS, TELEPORTATION OR HIDDEN EDITS. Use the person exactly as shown in the reference photo: identical face, hair, body and clothing ([KLEIDUNG]), carrying a briefcase and an early-2000s mobile phone. No identity, wardrobe or prop changes. Bright, colorful, sunny [STADT] city center, early-2000s MiniDV handycam aesthetic: CCD softness, natural handheld shake, tape artifacts. No modern cinematic sharpness or desaturation. [WAHRZEICHEN] clearly visible in the background throughout the running shot. NO DIALOGUE, NO VOICEOVER, NO LIP-SYNCED SPEECH IN ANY LANGUAGE. The person does not speak at any point in the video. The person runs through the crowd on [STRASSE] toward [PLATZ]. Their right hand holds only the phone, pressed against their ear, nothing else in that hand. Their left hand holds the white paper to-go coffee cup and the briefcase handle together, both swinging naturally at hip height as they run, coffee cup upright with the lid still on. Mouth closed, expression urgent, cameraman following with handheld micro-jitter (0.5 to 1 mm frame vibration). [WAHRZEICHEN] towers behind them. Pace and expression alone carry the urgency, no dialogue anywhere in the shot. At approximately 2.5s, the person trips near [PLATZ]. The coffee cup flies out of their left hand along with the briefcase, coffee bursting out of the cup in mid-air. The phone flies out of their right hand at the same instant. Papers scatter as they lose balance. If the person wears glasses, they remain one intact, unbroken pair. Within 2 to 3 seconds of the trip, TIME FREEZES COMPLETELY. Everything freezes except the camera. Absolute silence from this point: no dialogue, no voice, no traffic, no phone audio. The empty coffee cup hangs frozen in mid-air, and the spilled coffee hangs suspended as a trail of individual glossy amber droplets, spherical, 8 to 12 mm in diameter, reflective like small glass orbs, one droplet suspended directly in front of the person's face. Camera smoothly evolves from handheld into FPV flight: rises vertically roughly 4 meters over 2 seconds above the frozen scene, [WAHRZEICHEN] framed behind the person, then flies in extreme macro past the suspended coffee droplets and the frozen cup, f/1.4-equivalent shallow depth of field, droplets rendered glossy and refracting sunlight and [WAHRZEICHEN]. Camera weaves through the frozen papers, phone and briefcase at close range. End on a plain sheet of white printer paper with no logos, no letterhead, no coat of arms, no eagle, no seals and no stamps, reading exactly: "[DEIN TEXT]" No digital text or overlays, no spoken audio. A few frozen coffee droplets hang beside the paper. Camera orbits 180 degrees back to the original position over 3 seconds, [WAHRZEICHEN] still visible behind the person. Time instantly resumes with no transition. Objects continue naturally, the empty cup and remaining coffee droplets hit the ground with a sharp splash sound, the person hits the ground, gets up, straightens their clothes, looks at the phone, then at the camera in disbelief, still without speaking. Crowd and traffic continue normally, ambient street sound returns instantly. [WAHRZEICHEN] stands in the background throughout. Audio: ambient street sound and footsteps before the trip, complete silence during the freeze and FPV sequence, sharp coffee-splash impact sound as time resumes, ambient street sound returns afterward. No dialogue, no voiceover, no lip-synced speech in any language at any point. Maintain realistic physics, bright colors, exact identity and continuous spatial continuity throughout.
Gegenüber dem Reel an drei Stellen verändert: Die Formatangabe ist raus, weil sie der Einstellung widerspricht. Das Blatt am Ende ist ausdrücklich ein schlichtes weißes Blatt ohne Logos und Wappen. Und alles Persönliche steht jetzt in Platzhaltern.
Was in die Platzhalter gehört
| Platzhalter | Was hinein gehört | So stand es im Reel |
|---|---|---|
| [KLEIDUNG] | Was die Person trägt, genau wie auf dem Referenzfoto. | grey double-breasted suit, tie, silver glasses |
| [STADT] | Die Stadt, in der die Szene spielt. | Cologne |
| [WAHRZEICHEN] | Ein bekanntes Bauwerk, das die ganze Zeit im Hintergrund steht. Es hält die Szene zusammen, wenn die Kamera durch den Raum fliegt. | Cologne Cathedral |
| [STRASSE] | Die belebte Straße, durch die die Person rennt. | Hohe Straße |
| [PLATZ] | Der Ort, an dem sie stolpert. | the Domplatte |
| [DEIN TEXT] | Der Satz auf dem Blatt am Ende. Höchstens sechs Wörter, und am besten ohne Anführungszeichen im Text selbst. | KOMMENTIERE KI FÜR DEN VOLLEN PROMPT |
Die Einstellungen dieser Generierung
Was bestellt war und was herauskam
Auch hier am fertigen Video nachgeprüft, Bild für Bild. Von der Szene gab es zwei Durchläufe, und die beiden unterscheiden sich an genau den Stellen, auf die du achten solltest.
Bestellt: a physical document, ohne weitere Angaben
Herausgekommen: Ein deutsches Behördenschreiben mit Bundesadler oben links und einem Dienstsiegel oben rechts. Aus der Stadt, der Sprache und dem Wort document hat das Modell ein Amtsschreiben gemacht.
In einem zweiten Durchlauf derselben Szene kam ein schlichtes Blatt, das Modell entscheidet also jedes Mal neu. Deshalb verbietet die Vorlage Logos, Briefkopf, Wappen, Adler, Siegel und Stempel ausdrücklich. Ein erfundenes Hoheitszeichen willst du nicht im eigenen Video, die unbefugte Nutzung des Bundesadlers ist in Deutschland eine Ordnungswidrigkeit (§ 124 OWiG).
Bestellt: 4:3 SD im Prompt
Herausgekommen: 9:16. Eingestellt war das Hochformat, und die Einstellung hat den Prompt überstimmt.
Das Format gehört in die Einstellungen, nicht in den Prompt. In der Vorlage ist die Angabe deshalb gestrichen.
Bestellt: Camcorder-Look der frühen 2000er mit Bandartefakten
Herausgekommen: Ein scharfes, sattes, modernes Bild. Vom Camcorder ist nichts zu sehen.
Der Retro-Look kommt nicht verlässlich. Wer ihn will, legt ihn im Schnitt als Filter darüber. Die Zeile steht trotzdem in der Vorlage, sie schadet nicht.
Bestellt: Der Endtext, Wort für Wort vorgegeben
Herausgekommen: In einem Durchlauf stand der Text richtig da, nur die Anführungszeichen um KI passten nicht zusammen. Im zweiten Durchlauf stand dafür ein Wort doppelt: FÜR DEN DEN VOLLEN PROMPT.
Text im Bild klappt oft, aber nicht jedes Mal. Rechne mit zwei oder drei Durchläufen, halte den Text kurz, lass Anführungszeichen weg und prüf das Blatt Bild für Bild, bevor du postest.
Kurz beantwortet
Zur Kennzeichnung von KI-Inhalten steht das Nötige in der AI-Act-Checkliste.
Der nächste Kamera-Trick
Solche Effekte gibt es reichlich, man muss nur wissen, dass es sie gibt. Kais KI-Radar bringt dir News und Tipps direkt ins Postfach.
Zum KI-RadarKein Spam, jederzeit mit einem Klick abbestellbar.
Stand 10. September 2026. Seedance ist eine Marke von ByteDance, Higgsfield eine Marke von Higgsfield AI. Diese Seite ist ein unabhängiges Angebot der KI Agenten Werkstatt und steht in keiner Verbindung zu den genannten Unternehmen. Modelle, Einstellungen und Tarife ändern sich regelmäßig, prüf den aktuellen Stand in deinem eigenen Konto.