Generar un universo jugable en segundos ya no es ciencia ficción. El Genie 3 de Google Deepmind está dando forma a espacios inmersivos que evolucionan bajo demanda y redefinen la forma de imaginar la simulación y el entrenamiento.
La producción 3D se abre a nuevas audiencias gracias a la IA y su capacidad para generar objetos y mundos en 3D a partir de imágenes 2D o descripciones textuales. La semana pasada, mencionamos la última innovación de Microsoft AI, 3D Copilot, un servicio web que convierte una imagen 2D (JPG/PNG) en un modelo 3D descargable en formato GLB, utilizable en espectadores, herramientas de diseño y motores de juego. La herramienta es gratuita con una cuenta de Microsoft, no se basa en las imágenes remotas para entrenar sus modelos, mantener las creaciones 28 días y permanecer, estadio, enfocado en la conversión de una imagen única en lugar de la generación por texto rápido. Un posicionamiento de ideación rápida, útil para la creación de prototipos y los activos de «borrador».
En un contexto más amplio, la IA parece un poco más «mágica» para todos aquellos que manipulan universos 3D todos los días. En lugar de dejarlos apilar activos y configuraciones, ofrece entornos listos para explorar o modificar. En este contexto, la generación no reemplaza las tuberías convencionales, sino que acelera el bucle de prueba, multiplica las variantes y ayuda a salir de las necesidades específicas. Estos modelos generativos de universos 3D se distinguen de la IA de video (que producen clips congelados) y simuladores 3D convencionales (que requieren escenas y activos predefinidos): aquí, el entorno se genera «bajo demanda».
Genio 3El nuevo modelo mundial de Deepmind es parte de esta dinámica pero con una ambición diferente: este modelo mundial generalista simula entornos interactivos en tiempo real. Desde un texto rápido, Genie 3 genera mundos explorables en el teclado/mouse en 720p a 24 imágenes/s, consistente durante varios minutos. La novedad clave se debe a la «memoria» visual de la escena y a los «eventos promocionables por pronóstico», lo que permite desarrollar el clima, los objetos o los personajes durante la exploración. El proyecto se publica en Búsqueda limitada Con un pequeño grupo de académicos y creadores, con una marcada insistencia en la responsabilidad y la seguridad del diseño.
«Genie 3 es el primer generalista interactivo de 'modelo mundial' en tiempo realResume el investigador de Shlomi Fruchter AI en Deepmind. El objetivo aquí supera el marco estricto de los videojuegos. El modelo tiene como objetivo proporcionar varios entornos para capacitar, probar y avanzar a los agentes capaces de planificar y aprender a través de la experiencia.
Nuevos usos para 3D dopado en AI
En el lado de I + D, Genie 3 ya ha sido evaluado con el modelo de agente generalista SIMA, responsable de lograr objetivos en mundos generados. La estabilidad temporal del modelo de Google permite encadenar acciones más largas y evaluar la robustez del comportamiento.
Para los sectores de educación/capacitación y robótica, la generación «en demanda» ofrece un depósito de ejercicios y escenarios «¿Qué pasa si? Sin costos de activos o preparación de escenas, sin tener en cuenta que los lugares reales no se reproducen con una precisión geográfica.
A largo plazo, la comunidad de realidad virtual lo ve como un candidato creíble para generar mundos fotorrealistas interactivos en tiempo real, incluso si las restricciones de entrada/salida (6DOF, estereoscopia, latencia, audio) aún no se han resuelto.
Una herramienta cuyos contornos aún no se pueden explorar
En otras palabras, Genie 3 no es un motor de juego o un gemelo digital llave en mano: es un modelo generativo de tiempo real con un horizonte de interacción de unos minutos y un espacio de acción aún limitado.
Las interacciones de múltiples agentes siguen siendo un desafío, la legibilidad del texto in -scene no está garantizada y la capacidad de «pegarse» a un lugar real o a las especificaciones detalladas no está en las preocupaciones actuales de sus creadores.
Por el momento, el acceso está bajo control a través de una preversión de investigación, que enmarca los riesgos y la exposición de los datos.
If Copilot 3D illustrates the lowering of the entrance barrier to quickly create 3D objects from images, Genie 3, he moves the debate: he does not only produce assets, he suitulados Mundos con consistencia y capacidad de respuesta, para servir a la capacitación y evaluación de los agentes, con un posicionamiento asumido de hitos hacia la IA más general. Para las organizaciones, el desafío es anticipar la integración de estos modelos mundiales en los canales de producción, prueba y seguridad, teniendo en cuenta sus límites actuales.
https://www.youtube.com/watch?v=pdkhuknuqdg<
Leer también:
Copiloto 3D: Microsoft prueba la imagen de la imagen 2D en modelos 3D
Microsoft lanza su «copiloto de juegos» para jugadores, no europeos
Google I/O '25: Veo 3, Imagen 4, Lyria 2 … ¡AI más creativo que nunca!
Google lanza Wathisk para manipular las imágenes y VEO 2 para el video
[

