World Labs, Fei-Fei Li y la apuesta por la «inteligencia espacial»
World Labs, la startup fundada por Fei-Fei Li en 2024, presentó Atlas, su nuevo modelo del mundo que genera escenas 3D navegables a partir de texto, imágenes, vídeo, mapas de profundidad y trayectorias de cámara. La compañía ha levantado en torno a US$1.230M en financiación total, incluyendo una ronda de US$1.000M cerrada en febrero de 2026 con Nvidia, AMD, Autodesk (que entró con US$200M como inversor ancla), Emerson Collective, Fidelity y Sea, según TechTimes. Atlas ya está disponible en early access para socios seleccionados, aunque la empresa no ha anunciado fecha de lanzamiento general ni precio.
El movimiento encaja con la tesis de Li, que dirigió el Stanford AI Lab y codesarrolló ImageNet, según Bloomberg y SiliconANGLE: los grandes modelos de lenguaje actuales son, en sus palabras, «escritores versados a ciegas», elocuentes pero sin anclaje con la realidad física. Atlas busca llenar ese hueco prediciendo lo que debería verse desde una posición arbitraria del espacio, no el siguiente token de una frase.
¿Qué es Atlas y qué lo diferencia de Sora o Genie 3?
Atlas no es un generador de vídeo más. Técnicamente se apoya en una arquitectura de multimodal autoregressive diffusion transformer, descrita por World Labs como un modelo entrenado desde cero para ingerir texto, imágenes, posiciones de cámara, mapas de profundidad y secuencias de vídeo. La diferencia operativa, según SiliconANGLE, es que las trayectorias de cámara son una entrada nativa del modelo y no una descripción en lenguaje natural imprecisa, como ocurre en Sora de OpenAI o Genie 3 de Google DeepMind.
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidadEn las pruebas de la empresa, Atlas es capaz de generar hasta un minuto de vídeo en 1440p a partir de una sola imagen y mantener coherencia geométrica desde cualquier ángulo. También exporta point clouds y 3D Gaussian splats, formatos que un motor gráfico puede consumir directamente sin reconstruir polígonos. En evaluaciones humanas ciegas sobre adherencia a la trayectoria de cámara, Atlas fue preferido de forma amplia frente a Gemini Omni Flash y FLUX, y superó a varios modelos open source en reconstrucción 3D con entradas dispersas, de acuerdo con SiliconANGLE.
La clave conceptual, como resume la propia Li en conversación con a16z, es que «no hay lenguaje ahí fuera». El mundo físico se describe con geometría, luz y movimiento, no con palabras. Por eso Atlas intenta razonar sobre el espacio directamente, en lugar de traducir instrucciones vagas a píxeles.
¿Cómo se entrena un robot dentro de Atlas?
El uso más ambicioso que World Labs plantea para Atlas es el flujo real-to-sim: un desarrollador graba un espacio real con dos o tres smartphones, lo sube al modelo y obtiene una simulación 3D navegable con mallas de colisión aptas para física. El robot virtual se mueve por esa simulación mientras Atlas genera las imágenes RGB y lecturas de profundidad que sus sensores captarían en cada trayectoria, según SiliconANGLE. Esto permite variar la iluminación, mover objetos o cambiar la disposición del entorno sin destruir nada en el mundo físico.
El problema que Atlas intenta resolver, según TechTimes, es estructural: los robots no pueden entrenarse con datos a escala de internet como los LLM. Las demostraciones de robótica están, en palabras de la propia empresa, «confinadas a montajes de laboratorio muy controlados», y el salto del demo vistoso a un robot funcionando en una cocina o un almacén sigue siendo enorme. NVIDIA ya publicó un flujo de trabajo técnico que importa escenas de Marble (el primer producto de World Labs) en formato Gaussian splat y malla de colisión a NVIDIA Isaac Sim para construir entornos de entrenamiento. Atlas es la siguiente iteración de esa línea, apunta SiliconANGLE.
La tesis de fondo es lo que la compañía llama, con algo de grandilocuencia, una «internet de los robots»: un repositorio masivo de espacios 3D utilizables como datos de entrenamiento, donde los videojuegos y simuladores existentes aportan una materia prima que el texto nunca podrá ofrecer.
¿Quién compite en la carrera de los modelos del mundo?
Atlas no llega solo. SiliconANGLE y TechTimes identifican al menos cuatro líneas competidoras que empujan en paralelo:
- NVIDIA, con su pila alrededor de Omniverse y los modelos Cosmos como world foundation models.
- Google DeepMind, que mostró Genie 3 como renderer interactivo.
- Odyssey, centrada en simulaciones de mundo interactivas.
- AMI Labs, el laboratorio de Yann LeCun, que trabaja en arquitecturas de planificación física.
- Niantic Spatial, con sistemas de mapeo geoespacial avanzado.
La diferencia que World Labs reivindica es que Atlas es un único modelo base que intenta unificar percepción, generación, razonamiento e interacción, en lugar de resolver solo una pieza del bucle. Runway, mencionada en la nota de Xataka, persigue una ambición parecida con GWM-1.
Más allá de la competencia, hay una cuestión epistemológica que la propia World Labs plantea en su ensayo de junio de 2026 recogido por TechTimes: los «modelos del mundo» se han convertido en un término paraguas que mezcla tres funciones muy distintas, renderers que producen píxeles, simuladores que producen estado 3D fiel a la física, y planners que deciden la próxima acción de un agente. Atlas apuesta por la categoría intermedia, el simulador, que la empresa considera el «eje» porque puede alimentar tanto al renderer como al planner.
¿Qué significa esto para tu startup?
Aunque Atlas aún no tiene precio ni apertura general, marca una dirección clara del gasto computacional en IA durante los próximos 18-24 meses. Varios founder del ecosistema hispanohablante deberían prestarle atención.
Si trabajas en robótica, VFX o realidad virtual, conviene empezar a mapear qué tareas de generación de entornos 3D pueden absorberse con un modelo como Atlas frente al pipeline tradicional de modelado manual. TechTimes documenta que el flujo Marble a NVIDIA Isaac Sim ya comprime configuraciones que antes tomaban semanas en horas. Rediseñar ese cuello de botella interno es, probablemente, una de las palancas de margen más claras del año que viene.
Si construyes herramientas para creadores de contenido o marketing, el flujo single-image-to-3D-scene abre productos antes inviables: tours virtuales a partir de fotos de producto, escenarios para anuncios, demos arquitectónicas generadas desde renders. La pregunta operativa es qué nivel de control fino necesitás sobre cámara, geometría y profundidad, y ahí Atlas lleva ventaja sobre Sora.
Si estás en otro vertical, el dato estratégico es de otra naturaleza: la financiación privada de World Labs ronda los US$1.230M, con Nvidia, AMD y Autodesk como inversores. Cuando资本的 así se concentra en una categoría, los precios de cómputo, los formatos estándar (Gaussian splats) y los benchmarks que se vuelvan referencia se definirán desde ahí. Adaptar tu stack de 3D a esos formatos será más barato a futuro que esperar.
Como recuerda la propia Li, los LLM dominaron porque tuvieron texto infinito para aprender. El próximo capítulo de la IA dependerá de quién logre construir el equivalente para el mundo físico. Atlas es la primera apuesta seria a esa escala.
Fuentes
- Xataka: «No hay lenguaje ahí fuera»: Atlas quiere hacer con el mundo físico lo que los LLM hicieron con internet
- SiliconANGLE: Fei-Fei Li’s World Labs debuts Atlas, a world model showcase for advanced spatial intelligence
- TechTimes: Fei-Fei Li’s World Labs Splits World Model Into Three Types: Marble Targets Simulation Linchpin
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidad













