La inteligencia artificial generativa está avanzando desde la creación de imágenes y videos hacia un desafío mucho más complejo: comprender y reconstruir espacios tridimensionalesWorld Labs, compañía especializada en modelos capaces de interpretar y generar entornos espaciales, ha presentado Atlas, un nuevo sistema diseñado para transformar instrucciones de texto, fotografías y otros archivos visuales en escenas 3D que pueden explorarse desde diferentes perspectivas.

La principal diferencia frente a muchos generadores visuales tradicionales está en la consistencia espacialAtlas no se limita a producir una secuencia de imágenes que simula el movimiento de una cámara. El objetivo es representar una escena con una geometría tridimensional coherente, de manera que el usuario pueda modificar la posición y orientación de la cámara mientras los objetos mantienen su ubicación y estructura dentro del entorno.

Esta tecnología podría tener aplicaciones mucho más amplias que la creación de contenido. World Labs plantea usos relacionados con:

  • Producción audiovisual
  • Videojuegos
  • Reconstrucción de espacios reales
  • Simulación de entornos para entrenar robots y sistemas de inteligencia artificial física

¿Qué es Atlas y qué lo diferencia de un generador de imágenes?

Los modelos generativos de imágenes producen normalmente una representación bidimensional. El usuario escribe una descripción y la inteligencia artificial genera una imagen desde un punto de vista determinado.

Atlas intenta resolver un problema diferente.

El sistema debe comprender que detrás de esa imagen existe potencialmente un espacio tridimensional. Esto significa identificar relaciones entre profundidad, objetos, superficies, iluminación y perspectiva para construir una representación que pueda observarse desde otros ángulos.

En términos sencillos, si una IA convencional genera una fotografía de una habitación, Atlas busca generar la habitación como espacio.

El usuario puede posteriormente mover la cámara por ese entorno y observarlo desde diferentes posiciones sin que la estructura fundamental de la escena tenga que reinventarse completamente en cada fotograma.

Esta capacidad resulta especialmente importante para aplicaciones donde la coherencia espacial es fundamental.


De varias fotografías a un espacio 3D completo

Una de las funciones más interesantes de Atlas es la reconstrucción tridimensional utilizando múltiples imágenes de referencia.

Supongamos que se fotografía una habitación desde diferentes posiciones:

  1. Una imagen desde la entrada
  2. Otra desde una esquina
  3. Varias fotografías de los muebles y paredes

Atlas puede utilizar esas perspectivas para interpretar cómo están relacionados los elementos y construir una representación tridimensional más completa.

Regla clave: Cuantas más imágenes útiles estén disponibles, mayor información tendrá el modelo sobre la geometría real del espacio.

Este enfoque podría simplificar procesos que tradicionalmente requieren:

  • Técnicas especializadas de fotogrametría
  • Sensores de profundidad
  • Escáneres LiDAR
  • Trabajo manual de artistas 3D

No significa necesariamente que estas herramientas vayan a desaparecer. Para aplicaciones que exigen precisión milimétrica seguirán siendo importantes. Sin embargo, los modelos generativos espaciales pueden reducir considerablemente la barrera necesaria para crear reconstrucciones tridimensionales rápidas.


¿Qué ocurre cuando solo existe una fotografía?

Aquí aparece uno de los desafíos más interesantes de la inteligencia artificial espacial.

Atlas también puede trabajar utilizando una única imagen.
El problema es evidente: una fotografía solamente muestra una parte del entorno.

Si vemos la fotografía frontal de una habitación, no sabemos exactamente qué existe detrás de la cámara, detrás de determinados muebles o fuera de los límites de la imagen.

Inferencia espacial

Atlas intenta resolver esta ausencia de información mediante inferencia.

El modelo utiliza lo que ha aprendido sobre la estructura de espacios y objetos para generar una representación plausible de las zonas que no son visibles:

  • Estructuras continuas: Si observa parcialmente una mesa, puede inferir cómo probablemente continúa su estructura.
  • Completado de superficies: Si únicamente aparece una parte de una habitación, puede intentar completar las superficies y elementos necesarios para permitir que la cámara cambie de posición.

Distinción clave:

  • Reconstrucción: Cuando existen varias fotografías, el modelo dispone de mayor evidencia visual sobre el entorno original.
  • Inferencia: Cuando solamente existe una imagen, las partes ocultas necesariamente contienen un mayor componente de predicción.

Por esta razón, agregar imágenes de referencia debería aumentar la fidelidad de la reconstrucción.


La geometría permanece consistente al mover la cámara

Uno de los grandes problemas de la generación de video mediante IA ha sido históricamente la consistencia.

Inconsistencias comunes en generadores tradicionales:

  • Un objeto puede aparecer en un lugar y posteriormente cambiar ligeramente de forma.
  • Una puerta puede desaparecer al modificar el ángulo.
  • Una mesa puede aumentar de tamaño.
  • Una pared puede presentar detalles diferentes entre fotogramas.

En un video convencional generado únicamente como una sucesión de imágenes, estas inconsistencias pueden pasar relativamente desapercibidas. En un entorno interactivo, serían mucho más problemáticas.

Atlas busca mantener la geometría de la escena estable mientras cambia la perspectiva de la cámara. Esto permite que el usuario explore el espacio de una manera más parecida a como movería una cámara dentro de un videojuego o una aplicación 3D.

La diferencia es importante: el sistema no debería estar imaginando un mundo completamente nuevo cada vez que cambia el punto de vista, sino manteniendo una representación espacial coherente.


Videos de hasta un minuto y resolución 1440p

Atlas también extiende estas capacidades hacia la generación audiovisual.

El sistema puede producir videos controlables de hasta un minuto en resolución 1440p, según las características anunciadas para el modelo.

Control de cámara de precisión

La palabra «controlables» es especialmente relevante.
Uno de los problemas de los primeros generadores de video mediante IA era la dificultad para controlar exactamente cómo debía moverse la cámara.

  • Enfoque antiguo: El usuario podía pedir algo como «la cámara avanza lentamente hacia el edificio», pero el modelo interpretaba esa instrucción de manera relativamente libre.
  • Enfoque de Atlas: Introduce un enfoque diferente al permitir definir directamente la trayectoria de la cámara.

Esto podría ofrecer a creadores audiovisuales un nivel de control mucho más cercano a las herramientas tradicionales de producción 3D. Un director o diseñador podría:

  1. Establecer primero el entorno.
  2. Decidir cómo recorrerlo: avanzar, girar, elevar la cámara, acercarse a un objeto o construir una secuencia alrededor de determinados elementos.

De una habitación real a un simulador para robots

Probablemente una de las aplicaciones más importantes de Atlas no tenga relación directa con películas ni videojuegos.

World Labs también plantea utilizar el modelo para crear simulaciones destinadas al entrenamiento de robots.