Este año se observa una importante aceleración. Google DeepMind lanzó Genie 3 para mundos 3D interactivos en tiempo real. NVIDIA presentó su plataforma Cosmos para IA física. World Labs, de Fei-Fei Li, presentó Marble, y AMI Labs, de Yann LeCun, recaudó una financiación significativa para desarrollar sistemas basados en la realidad.
Los modelos del mundo representan la próxima frontera más allá de la predicción del siguiente token. Permiten a la IA "imaginar" resultados, planificar de forma segura e interactuar de manera fiable con el mundo real, algo fundamental para la robótica, los vehículos autónomos, el descubrimiento científico y la IA general.
En este artículo, analizamos qué son los Modelos Mundiales, los principales actores que impulsan los avances de 2026, sus capacidades, aplicaciones en el mundo real, desafíos y cómo los desarrolladores pueden comenzar.

¿Qué son los modelos mundiales?
Modelos del mundo Los modelos de mundo son sistemas de IA que construyen una representación interna del mundo físico, incluyendo el espacio, el tiempo, la física, la causalidad y la permanencia de los objetos. A diferencia de los modelos de lógica descriptiva (LLM) que predicen texto o los generadores de vídeo que crean clips aislados, los modelos de mundo simulan cómo evolucionan los entornos en respuesta a las acciones.
Características clave:
- Simulación predictiva: Pronosticar estados futuros (“Si hago X, ¿qué sucede después?”).
- Condicionado a la acción: Responder a las intervenciones en tiempo real.
- Inteligencia espacial y física: Comprender la geometría 3D, la gravedad, los materiales y la persistencia.
- Planificación a largo plazo: Mantener la coherencia durante minutos u horas, no segundos.
El concepto se remonta al trabajo de Jürgen Schmidhuber, pero entre 2025 y 2026 se convirtió en realidad práctica gracias a los datos de vídeo escalables, las mejores arquitecturas (difusión latente autorregresiva, JEPA) y la computación masiva.
Los modelos de mundo se diferencian de los modelos de vídeo puros (como Sora) porque son interactivos y permiten el entrenamiento de agentes "en la imaginación".
Principales actores y avances en 2026
Google DeepMind – Genie 3
Lanzada en versión preliminar para investigación, Genie 3 genera entornos 3D interactivos y fotorrealistas a partir de texto o imágenes a 24 fps en tiempo real. Admite mundos persistentes con permanencia de objetos y física emergente. Impulsa Project Genie para usuarios de Google AI Ultra y facilita el entrenamiento y la simulación de agentes.
NVIDIA Cosmos
Cosmos es una plataforma de modelos de base mundial (WFM) de peso abierto, entrenados con datos masivos de robótica y conducción. Admite la generación de Text2World, Image2World y Video2World con un profundo conocimiento de la física. Sirve como infraestructura para la generación de datos sintéticos y el entrenamiento de políticas robóticas.
World Labs (Fei-Fei Li) – Mármol
Marble crea mundos 3D editables a partir de texto, imágenes, bocetos o vídeo. Utiliza patrones gaussianos para escenas interactivas que se pueden exportar como mallas o vídeos. Destaca por su inteligencia espacial y control preciso, lo que lo hace ideal para industrias creativas, realidad virtual y simulación robótica.
Laboratorios AMI de Yann LeCun
Se centra en arquitecturas de estilo JEPA que aprenden representaciones abstractas mediante predicciones en el espacio latente en lugar de en píxeles. Su objetivo es lograr una comprensión del mundo sólida y eficiente, con memoria persistente y planificación compleja.

Otros proyectos destacables incluyen Runway, HunyuanWorld de Tencent y la continua evolución de Sora de OpenAI.
Capacidades técnicas clave y puntos de referencia
Los modelos del mundo moderno sobresalen en:
- Interactividad en tiempo real — Genie 3 logra una navegación a 24 fps.
- Consistencia física — Cosmos lidera en pruebas comparativas como el error de Sampson y la estimación de pose.
- Editabilidad y controlabilidad — Marble admite la manipulación de objetos y la transferencia de estilo.
- Formación de agentes — Los entornos simulados aceleran el aprendizaje por refuerzo con menos datos del mundo real.
| Modelo/Plataforma | Fortaleza clave | Resolución / Velocidad | Caso de uso principal | Disponibilidad |
|---|---|---|---|---|
| Genie 3 (DeepMind) | 3D interactivo en tiempo real | 720p a 24 fps | Formación de agentes, juegos | Avance de la investigación |
| NVIDIA Cosmos | Datos sintéticos que tienen en cuenta la física | Varía (modelos abiertos) | Robótica, AV | Peso libre |
| Mármol (World Labs) | Inteligencia espacial 3D editable | Interactivo (navegador) | Herramientas creativas, simulación | Público / Comercial |
| AMI Labs (LeCun) | Representaciones JEPA abstractas | Emergente | Razonamiento fundamentado | Etapa temprana |
Estos sistemas muestran importantes mejoras en la coherencia a largo plazo y la sensibilidad a las intervenciones en comparación con los modelos de vídeo de 2024-2025.
Aplicaciones en el mundo real e impacto
Sector 01
Robótica e IA incorporada
Los modelos del mundo generan datos de entrenamiento diversos y permiten realizar pruebas de políticas seguras en simulación antes de su implementación real. NVIDIA Cosmos impulsa el desarrollo de robots humanoides.
Sector 02
Vehículos autónomos
La simulación de casos límite poco frecuentes mejora la seguridad. Genie 3 se integra con los simuladores de Waymo.
Sector 03
Industrias creativas y videojuegos
Prototipado rápido de mundos interactivos para cine, realidad virtual y videojuegos. Project Genie permite crear entornos jugables generados por el usuario.
Sector 04
Descubrimiento científico
Simulación de sistemas físicos (materiales, clima, dinámica molecular) para acelerar la investigación.
Sector 05
Agentes autónomos
Formar agentes fiables con visión a largo plazo que planifiquen y actúen en entornos dinámicos.
Desafíos y limitaciones
- Brechas de consistencia — Los objetos siguen desapareciendo o se producen violaciones de las leyes de la física en horizontes temporales amplios.
- Hambre de datos y computación — El entrenamiento requiere enormes conjuntos de datos de vídeo.
- Dificultad de evaluación — No existen parámetros universales para la “comprensión mundial”.
- Transferencia al mundo real — La brecha entre la simulación y la realidad (sim2real) sigue siendo significativa.
Los modelos actuales son prototipos sólidos, pero aún no son réplicas digitales perfectas de la realidad.
Cómo pueden empezar los desarrolladores y las empresas
- NVIDIA Cosmos — Descarga modelos abiertos de Hugging Face o NGC. Experimenta con flujos de datos sintéticos.
- Proyecto Genio — Disponible para los suscriptores de Google AI Ultra para la creación de mundos interactivos.
- Mármol de World Labs — Regístrate en mármol.worldlabs.ai para la generación de mundos 3D.
- Marcos de trabajo — Integrarse con Isaac Lab, MuJoCo o entornos de aprendizaje por refuerzo personalizados.
ConsejosComience con tareas a corto plazo, combínelas con los modelos LLM existentes para la planificación de alto nivel y concéntrese en el ajuste fino específico del dominio.
El panorama general: Modelos mundiales y el camino hacia la IA general
Líderes de la industria como Demis Hassabis consideran que los modelos del mundo son esenciales para la IA general. Estos modelos cierran la brecha entre la comprensión del lenguaje y la inteligencia física. En 2026, la convergencia de los modelos del mundo con la IA agente y la robótica apunta hacia una inteligencia encarnada más fiable.
A nivel mundial, esta carrera involucra las contribuciones de EE. UU. (DeepMind, NVIDIA, World Labs) y de Europa/Asia, democratizando potentes herramientas de simulación.
Conclusión
Los modelos del mundo no son solo una tendencia más en IA, sino la infraestructura fundamental para la próxima era de los sistemas inteligentes. Ya sea que construyas robots, crees mundos virtuales o desarrolles agentes autónomos, 2026 es el año para adentrarse en esta tecnología.
¿Listo para explorar? Prueba hoy mismo los modelos NVIDIA Cosmos o World Labs Marble. ¿Qué mundo físico o virtual simularás primero?
Suscríbete para acceder a análisis más profundos sobre la IA de vanguardia y comparte tus opiniones en los comentarios.
Preguntas frecuentes
P: ¿Cuál es la diferencia entre un modelo mundial y un modelo de generación de vídeo?
Los modelos de mundo son simuladores interactivos y condicionados por la acción, mientras que los modelos de vídeo suelen generar clips fijos.
P: ¿Genie 3 está disponible para el público?
Se encuentra en fase de investigación preliminar limitada y es la herramienta que utiliza Project Genie para los usuarios de Google AI Ultra que cumplen los requisitos.
P: ¿Cómo pueden los modelos del mundo ayudar al desarrollo de la robótica?
Generan datos de entrenamiento sintéticos y entornos de simulación seguros, lo que reduce el método de ensayo y error en el mundo real.
P: ¿Quién lidera la investigación del Modelo Mundial?
DeepMind, NVIDIA, World Labs de Fei-Fei Li y AMI Labs de Yann LeCun están a la vanguardia.
P: ¿Los modelos mundiales son de código abierto?
NVIDIA Cosmos ofrece modelos de peso abierto; otros varían desde versiones preliminares para investigación hasta modelos comerciales.
Este artículo se basa en comunicados oficiales, documentos técnicos e informes de la industria a finales de mayo de 2026.


Acceso