World Labs dice que Atlas gana en el 75-94% de las pruebas frente a sus rivales. No hay paper, ni model card, ni forma de replicar esa cifra
El 1 de septiembre, World Labs presentó Atlas, un modelo que genera mundos 3D navegables desde una sola foto, afirmando que evaluadores humanos lo prefirieron sobre modelos rivales en 75-94% de las pruebas. No hay paper técnico ni model card que permita verificarlo -- y ni siquiera la comparación fue pareja: los rivales no aceptan cámara como entrada nativa.
El primer "world model" de World Labs, lanzado el 1 de septiembre de 2026: genera entornos 3D navegables y editables a partir de una sola imagen, con control preciso de cámara y video de hasta un minuto en 1440p.
Qué prometen vs. qué se puede verificar hoy
World Labs presentó a Atlas como demostración de su tesis de "inteligencia espacial" -- un modelo que entiende y reconstruye el mundo físico mejor que los modelos de video genéricos. La cifra que más circuló: evaluadores humanos prefirieron a Atlas sobre modelos rivales en 75-94% de las pruebas, y superó a modelos especializados de última generación en reconstrucción espacial, según la compañía.
Esa cifra es difícil de verificar de forma independiente. World Labs no publicó paper técnico, model card, conteo de parámetros, datos de entrenamiento, ni los prompts, semillas o intervalos de confianza usados en la evaluación -- nada que permita reproducir el resultado. La comparación misma tiene un sesgo estructural: ninguno de los modelos rivales usados como referencia acepta una cámara como entrada nativa, así que World Labs tuvo que convertir cada trayectoria de cámara en una descripción de texto para esos rivales -- una desventaja de formato, no solo de capacidad, que infla la brecha reportada específicamente en control de cámara.
Frente a qué compite
Compite en la categoría de "world models" y generación de video 3D controlable -- un terreno más cercano a los modelos de video/simulación que a los asistentes conversacionales revisados aquí antes. World Labs lo compara contra modelos de video especializados, pero sin una tabla estandarizada con suficiente detalle numérico para una comparación tipo procurement -- por ahora, las cifras deben tratarse como afirmaciones del fabricante, no benchmarks verificados.
Para quién importa
Para equipos de efectos visuales, videojuegos o robótica interesados en generar entornos 3D navegables desde una imagen, vale la pena pedir acceso anticipado y probarlo directamente -- el modelo está cerrado, sin checkpoint público, limitado a socios seleccionados vía formulario, sin precio anunciado. Para quien decide basado en el titular "gana en el 75-94% de las pruebas", conviene esperar a que exista un paper técnico o una evaluación independiente antes de tomar esa cifra como un hecho establecido.