Dieses Jahr markiert eine rasante Beschleunigung. Google DeepMind veröffentlichte Genie 3 für interaktive 3D-Welten in Echtzeit. NVIDIA brachte seine Cosmos-Plattform für physikalische KI auf den Markt. Fei-Fei Lis World Labs präsentierten Marble, und Yann LeCuns AMI Labs akquirierte beträchtliche Mittel für die Entwicklung realitätsnaher Systeme.
Weltmodelle stellen die nächste Stufe jenseits der Vorhersage des nächsten Tokens dar. Sie ermöglichen es der KI, Ergebnisse zu „vorstellen“, sicher zu planen und zuverlässig mit der realen Welt zu interagieren – entscheidend für Robotik, autonome Fahrzeuge, wissenschaftliche Entdeckungen und AGI.
In diesem Artikel erläutern wir, was Weltmodelle sind, welche Hauptakteure die bahnbrechenden Entwicklungen bis 2026 vorantreiben, welche Fähigkeiten sie besitzen, welche realen Anwendungen es gibt und welche Herausforderungen bestehen, und wie Entwickler damit beginnen können.

Was sind Weltmodelle?
Weltmodels Weltmodelle sind KI-Systeme, die eine interne Repräsentation der physischen Welt erstellen – einschließlich Raum, Zeit, Physik, Kausalität und Objektpermanenz. Im Gegensatz zu LLMs, die Text vorhersagen, oder Videogeneratoren, die isolierte Clips erzeugen, simulieren Weltmodelle, wie sich Umgebungen als Reaktion auf Aktionen entwickeln.
Hauptmerkmale:
- Vorhersagesimulation: Zukünftige Zustände prognostizieren („Wenn ich X tue, was passiert dann als Nächstes?“).
- HandlungsbedingtAuf Interventionen in Echtzeit reagieren.
- Räumliche und körperliche Intelligenz: Verständnis von 3D-Geometrie, Schwerkraft, Materialien und Persistenz.
- Langfristige Planung: Kohärenz über Minuten oder Stunden, nicht Sekunden, aufrechterhalten.
Das Konzept geht auf die Arbeiten von Jürgen Schmidhuber zurück, wurde aber erst 2025–2026 durch skalierbare Videodaten, bessere Architekturen (autoregressive latente Diffusion, JEPA) und massive Rechenleistung in die praktische Realität umgesetzt.
Weltmodelle unterscheiden sich von reinen Videomodellen (wie Sora), weil sie interaktiv sind und das Agententraining „in der Vorstellungskraft“ unterstützen.
Wichtige Akteure und Durchbrüche im Jahr 2026
Google DeepMind – Genie 3
Genie 3, das als Forschungsvorschau veröffentlicht wurde, generiert fotorealistische, interaktive 3D-Umgebungen aus Text oder Bildern mit 24 Bildern pro Sekunde in Echtzeit. Es unterstützt persistente Welten mit Objektpermanenz und emergenter Physik. Es bildet die Grundlage für Project Genie für Google AI Ultra-Nutzer und unterstützt das Training und die Simulation von Agenten.
NVIDIA Cosmos
Cosmos ist eine Plattform für offene, gewichtete World Foundation Models (WFMs), die mit umfangreichen Robotik- und Fahrdaten trainiert wurden. Cosmos unterstützt die Generierung von Text2World-, Image2World- und Video2World-Modellen mit fundiertem physikalischem Verständnis. Sie dient als Infrastruktur für die Generierung synthetischer Daten und das Training von Roboterrichtlinien.
World Labs (Fei-Fei Li) – Marmor
Marble erstellt editierbare 3D-Welten aus Text, Bildern, Skizzen oder Videos. Es verwendet Gaußsche Flächeneffekte für interaktive Szenen, die als Meshes oder Videos exportiert werden können. Der Fokus liegt auf räumlicher Intelligenz und präziser Steuerung, wodurch es sich für die Kreativwirtschaft, VR und Robotersimulationen eignet.
Yann LeCuns AMI Labs
Der Fokus liegt auf JEPA-Architekturen, die abstrakte Repräsentationen durch Vorhersagen im latenten Raum anstatt auf Pixelebene erlernen. Ziel ist ein fundiertes, effizientes Weltverständnis mit persistentem Speicher und komplexer Planung.

Zu den weiteren bemerkenswerten Projekten gehören Runway, HunyuanWorld von Tencent und die kontinuierliche Weiterentwicklung von Sora durch OpenAI.
Wichtigste technische Fähigkeiten und Benchmarks
Modern World Models zeichnen sich aus durch:
- Echtzeit-Interaktivität — Genie 3 erreicht eine Navigationsgeschwindigkeit von 24 fps.
- Physikalische Konsistenz — Cosmos ist führend bei Benchmarks wie dem Sampson-Fehler und der Pose-Schätzung.
- Bearbeitbarkeit und Kontrollierbarkeit — Marble unterstützt Objektmanipulation und Stiltransfer.
- Agentenschulung — Simulierte Umgebungen beschleunigen das Reinforcement Learning mit weniger realen Daten.
| Modell / Plattform | Hauptstärke | Auflösung / Geschwindigkeit | Primärer Anwendungsfall | Verfügbarkeit |
|---|---|---|---|---|
| Genie 3 (DeepMind) | Interaktives 3D in Echtzeit | 720p bei 24 Bildern pro Sekunde | Agententraining, Spiele | Forschungsvorschau |
| NVIDIA Cosmos | Physikbasierte synthetische Daten | Variiert (offene Modelle) | Robotik, AV | Offene Gewichtsklasse |
| Marble (World Labs) | Bearbeitbare räumliche 3D-Intelligenz | Interaktiv (Browser) | Kreative Werkzeuge, Simulation | Öffentlich / Kommerziell |
| AMI Labs (LeCun) | Zusammenfassung der JEPA-Darstellungen | Aufkommen | Begründetes Denken | Frühes Stadium |
Diese Systeme weisen im Vergleich zu den Videomodellen von 2024–2025 deutliche Verbesserungen hinsichtlich Langzeitkohärenz und Interventionssensitivität auf.
Anwendungen und Auswirkungen in der Praxis
Sektor 01
Robotik und verkörperte KI
Weltmodelle generieren vielfältige Trainingsdaten und ermöglichen sichere Richtlinientests in Simulationen vor dem realen Einsatz. NVIDIA Cosmos unterstützt die Entwicklung humanoider Roboter.
Sektor 02
Autonome Fahrzeuge
Die Simulation seltener Grenzfälle erhöht die Sicherheit. Genie 3 ist mit Waymo-Simulatoren kompatibel.
Sektor 03
Kreativwirtschaft & Spiele
Schnelles Prototyping interaktiver Welten für Film, VR und Spiele. Project Genie ermöglicht benutzergenerierte, spielbare Umgebungen.
Sektor 04
Wissenschaftliche Entdeckung
Simulation physikalischer Systeme (Materialien, Klima, Molekulardynamik) zur beschleunigten Forschung.
Sektor 05
Autonome Agenten
Ausbildung zuverlässiger, langfristig denkender Agenten, die in dynamischen Umgebungen planen und handeln.
Herausforderungen und Einschränkungen
- Konsistenzlücken — Auch über lange Zeiträume hinweg verschwinden Objekte oder es treten Verstöße gegen die Physik auf.
- Daten- und Rechenhunger — Für das Training werden enorme Videodatensätze benötigt.
- Schwierigkeitsgrad der Bewertung — Es gibt keine allgemeingültigen Maßstäbe für „Weltverständnis“.
- Realwelttransfer — Die Diskrepanz zwischen Simulation und Realität (sim2real) bleibt erheblich.
Die aktuellen Modelle sind vielversprechende Prototypen, aber noch keine perfekten digitalen Abbilder der Realität.
Wie Entwickler und Unternehmen loslegen können
- NVIDIA Cosmos — Laden Sie offene Modelle von Hugging Face oder NGC herunter. Experimentieren Sie mit Pipelines für synthetische Daten.
- Project Genie — Verfügbar für Abonnenten von Google AI Ultra zur Erstellung interaktiver Welten.
- World Labs Marmor — Melden Sie sich an unter marble.worldlabs.ai zur 3D-Weltgenerierung.
- Rahmenwerke — Integration mit Isaac Lab, MuJoCo oder benutzerdefinierten RL-Umgebungen.
TippsBeginnen Sie mit kurzfristigen Aufgaben, kombinieren Sie diese mit bestehenden LLMs für die übergeordnete Planung und konzentrieren Sie sich auf die domänenspezifische Feinabstimmung.
Das große Ganze: Weltmodelle und der Weg zu AGI
Branchenführer wie Demis Hassabis sehen Weltmodelle als unerlässlich für AGI. Sie schließen die Lücke zwischen Sprachverständnis und physischer Intelligenz. Die Konvergenz von Weltmodellen mit agentenbasierter KI und Robotik im Jahr 2026 deutet auf eine zuverlässigere, verkörperte Intelligenz hin.
Auf globaler Ebene sind an diesem Wettlauf die USA (DeepMind, NVIDIA, World Labs) und Europa/Asien beteiligt, die leistungsstarke Simulationswerkzeuge demokratisieren.
Abschluss
Weltmodelle sind nicht nur ein weiterer KI-Trend – sie bilden die Grundlage für die nächste Ära intelligenter Systeme. Ob Sie Roboter bauen, virtuelle Welten erschaffen oder autonome Agenten entwickeln: 2026 ist das Jahr, in dem Sie sich mit dieser Technologie auseinandersetzen sollten.
Bereit für neue Entdeckungen? Testen Sie noch heute die Modelle von NVIDIA Cosmos oder World Labs Marble. Welche physische oder virtuelle Welt werden Sie zuerst simulieren?
Abonniere den Kanal für weitere detaillierte Einblicke in die Welt der KI und teile deine Gedanken in den Kommentaren.
Häufig gestellte Fragen
F: Worin besteht der Unterschied zwischen einem Weltmodell und einem Videogenerierungsmodell?
Weltmodelle sind interaktive und handlungsabhängige Simulatoren, während Videomodelle typischerweise statische Clips generieren.
F: Ist Genie 3 öffentlich verfügbar?
Es befindet sich in einer begrenzten Forschungsvorschau und unterstützt Project Genie für berechtigte Google AI Ultra-Nutzer.
F: Wie können Weltmodelle die Robotikentwicklung unterstützen?
Sie generieren synthetische Trainingsdaten und sichere Simulationsumgebungen, wodurch das Ausprobieren in der realen Welt reduziert wird.
F: Wer leitet die Forschung zum Weltmodell?
DeepMind, NVIDIA, Fei-Fei Lis World Labs und Yann LeCuns AMI Labs gehören zu den führenden Unternehmen auf diesem Gebiet.
F: Sind die Weltmodelle Open Source?
NVIDIA Cosmos bietet Modelle mit offener Gewichtsverteilung an; andere reichen von Forschungsvorschau bis hin zu kommerziellen Versionen.
Dieser Artikel basiert auf offiziellen Bekanntmachungen, technischen Dokumenten und Branchenberichten mit Stand Ende Mai 2026.


Einloggen