Von Aufnahmen zum spielbaren Spiel — ohne eine Zeile Code zu schreiben
Was wäre, wenn du auf ein beliebiges Video zeigen und sagen könntest: „Mach daraus ein Spiel“? Genau das macht dieser Workflow. Eigent's Multi-Modal Agent schaut sich Aufnahmen der Spring Festival Gala 2026 an — eine spektakuläre Robotik-Kampfkunstperformance — extrahiert die Charaktere, Bewegungen und den visuellen Stil und übergibt diese strukturierte Analyse dann an einen Developer Agent, der darauf aufbauend ein komplettes Three.js-Spiel erstellt. Die gesamte Pipeline läuft mit einem Prompt und einer Videodatei.
Die Zwei-Agenten-Pipeline
Dieser Workflow erfordert zwei spezialisierte Agenten, die nacheinander arbeiten:
- Multi-Modal Agent — übernimmt Bildanalyse (Image Analysis), Videoverarbeitung (Video Processing), Audioverarbeitung (Audio Processing) und Bilderzeugung (Image Generation). Er sieht sich das Video an und erstellt strukturierte Daten darüber, was er erkennt.
- Developer Agent — übernimmt Terminal & Shell, Webbereitstellung (Web Deployment) und Bildschirmaufnahme (Screen Capture). Er nimmt die strukturierte Analyse und baut daraus das Spiel.
Der entscheidende Punkt ist die Übergabe: Der Developer Agent erhält nicht das Rohvideo — er erhält ein strukturiertes Textdokument, das Charaktere, Bewegungen, Farben, Umgebung und Themen beschreibt. Dieser Übersetzungsschritt sorgt dafür, dass das Spielergebnis präzise statt generisch wird.
Video anhängen und den Prompt schreiben
Hänge Martial Arts.mp4 an und beschreibe, was du möchtest:
Analysiere die angehängte Videodatei, um die Roboter-Performance, Charaktere, Bewegungen, den visuellen Stil und die Umgebung der Spring Festival Gala 2026 zu verstehen, und erstelle dann ein vollständiges, einseitiges interaktives 3D-HTML-Spiel mit Three.js, das die Schlüsselelemente, Charaktere und Aktionen aus dem Video mit ansprechender Spielmechanik, intuitiver Steuerung und festlichen visuellen Effekten originalgetreu nachbildet.
Sofort werden zwei Aufgaben erzeugt — die zweite bleibt blockiert, bis die erste abgeschlossen ist.
Aufgabe 1 — Multi-Modal Agent beobachtet das Video
Der Multi-Modal Agent verarbeitet Martial Arts.mp4 Bild fĂĽr Bild mithilfe des Video Downloader Toolkit, um Screenshots aus den SchlĂĽsselmomenten zu extrahieren. AnschlieĂźend analysiert er diese Bilder und erstellt eine umfassende schriftliche Analyse, gespeichert als martial_arts_video_analysis.txt:
- Charaktere und Roboter: physisches Erscheinungsbild, Proportionen, Farbschema (Gold und Rot), Anzahl der Performer
- Bewegungen und Aktionen: beobachtete spezifische Kampfkunsttechniken — Schläge, Tritte, Stockangriffe, choreografierte Sequenzen
- Visueller Stil: Bühnenbeleuchtung, Farbpalette, Stil der festlichen Dekoration, Tiefe und Größe des Aufführungsraums
- Umgebung und Hintergrund: Bühnenumgebung, Hintergrunddesign, atmosphärische Elemente
- Festliche Elemente: CNY-spezifische Dekorationen, symbolische Motive, in der Performance verwendete Effekte
Dieses Dokument wird zum kreativen Briefing — einer strukturierten Beschreibung, die der Developer Agent präzise umsetzen kann.
Aufgabe 2 — Developer Agent baut das Spiel
Mit der Analyse in der Hand liest der Developer Agent die Notizen aus dem Note Taking Toolkit und erstellt spring_festival_martial_arts_game.html — eine einzelne, in sich geschlossene Datei mit allem HTML, CSS und JavaScript inline.
Das Spiel implementiert originalgetreu alles, was der Multi-Modal Agent erkannt hat:
- 3D-Robotercharaktere in Three.js gerendert, mit dem Gold-/Rot-Farbschema aus dem Video
- Kampfkunst-Animationen, die die beobachteten Schläge, Tritte und Stockangriffe nachbilden
- BĂĽhnenumgebung, die dem visuellen Setting der Spring Festival Gala-Performance entspricht
- Festliche Partikeleffekte — Laternen, Funken, CNY-Dekorationen
- Mehrere Spielmodi: Performance Mode, Combat Mode, Free Practice
Das fertige Spiel
Das Öffnen von spring_festival_martial_arts_game.html in einem Browser liefert ein vollständiges Erlebnis:
- Startbildschirm: 2026 Spring Festival Gala — Martial Arts Performance — Year of the Horse
- Steuerung: W/S/A/D Bewegung · J Schlag/Angriff · K Tritt · L Stockangriff · Leertaste Spezialbewegung · Maus für Kamera · Scrollen zum Zoomen
- HUD: Punktestand (527 in der Demo angezeigt), Kombinationszähler, Modusanzeige
- Visuals: 3D-Robotercharaktere in Gold/Rot, festlicher BĂĽhnenhintergrund, Partikeleffekte
Verwendete Gesamttokens: ungefähr 467.000 — ein Ausdruck der Tiefe der Videoanalyse und der kombinierten Three.js-Spielgenerierung.
Warum Video-zu-Spiel eine neue Workflow-Kategorie ist
Diese Pipeline etabliert etwas Neues: die Nutzung von Videoverständnis als Werkzeug für eine Designspezifikation. Statt ein Game-Design-Dokument zu schreiben, nimmst du eine Aufnahme oder findest Footage der Ästhetik, Charaktere und Interaktionen, die du möchtest — und lässt den Multi-Modal Agent das in umsetzbare Spezifikationen übersetzen.
Die Anwendungen gehen weit ĂĽber Spiele hinaus. Dieselbe Pipeline von Video zu strukturierter Analyse zu Code funktioniert fĂĽr die Rekonstruktion von UI-Mockups, das Design von Animationssystemen, die Generierung interaktiver Demos und jeden Kontext, in dem Video Intention besser erfasst als Text.
Was du als Nächstes ausprobieren kannst
Analysiere ein Produkt-Unboxing-Video und generiere einen interaktiven 3D-Produktviewer, der das Objekt aus dem Footage nachbildet.
Schau dir ein Kochvideo an und generiere eine interaktive Schritt-fĂĽr-Schritt-Rezept-App, die dem visuellen Stil des Videos entspricht.
Analysiere ein Sports-Highlight-Video und generiere ein Minispiel auf Basis der gezeigten Sportart.
Nimm das Spring-Festival-Spiel und fĂĽge einen Multiplayer-Modus hinzu, in dem zwei Spieler als unterschiedliche Roboter aus der Performance gegeneinander antreten.
Tipps fĂĽr bessere Ergebnisse
-
Verwende hochwertiges Quellmaterial. Die Szenenextraktion des Multi-Modal Agenten ist bei klarem, gut beleuchtetem Video am genauesten. Performance-Aufnahmen mit klar unterscheidbaren Charakteren und Bewegungen — wie dieses Gala-Video — liefern reichhaltigere Analysen als schnell geschnittene oder niedrig aufgelöste Inhalte.
-
Bitte darum, die Analyse vor dem Erstellen zu prüfen. Wenn du „zeige mir das Video-Analysetextdokument, bevor du das Spiel erstellst“ hinzufügst, erhältst du einen Kontrollpunkt, um zu prüfen, ob der Agent das Video korrekt verstanden hat, bevor er mit dem Build fortfährt.
-
Fordere eine einzelne Datei an. Die Angabe „einseitiges interaktives 3D-HTML-Spiel“ stellt sicher, dass alles in sich geschlossen und sofort teilbar ist, ohne Build-Schritt oder Server.



