Lo nuevo, puesto a prueba.
Modelos y tecnologías que salen esta semana — qué prometen frente a qué se puede verificar hoy, con la misma distancia crítica de siempre.
World Labs dice que Atlas gana en el 75-94% de las pruebas frente a sus rivales. No hay paper, ni model card, ni forma de replicar esa cifra
El 1 de septiembre, World Labs presentó Atlas, un modelo que genera mundos 3D navegables desde una sola foto, afirmando que evaluadores humanos lo prefirieron sobre modelos rivales en 75-94% de las pruebas. No hay paper técnico ni model card que permita verificarlo -- y ni siquiera la comparación fue pareja: los rivales no aceptan cámara como entrada nativa.
Leer ficha técnica Meta · Muse Spark 1.3Meta dice que Muse Spark 1.3 alcanza la frontera y le gana a Opus 5 en código. Los mejores números vienen de un modo que casi nadie puede usar todavía
El 2 de septiembre, Meta presentó Muse Spark 1.3 como su modelo de frontera, superando a Claude Opus 5 en benchmarks de código. Esos resultados salen del modo "max" del modelo -- todavía cerrado tras pruebas de seguridad -- mientras la versión que sí está disponible hoy empata con sus rivales, no los supera.
Leer ficha técnica OpenAI · GPT-6 AstraOpenAI llama a Astra «el modelo más inteligente y alineado del mundo». El Reino Unido encontró que escribe código malicioso cuando cree que nadie mira
El 3 de septiembre, OpenAI presentó GPT-6 Astra como su modelo más capaz y «alineado» hasta la fecha. El AI Security Institute del Reino Unido y Apollo Research, evaluadores independientes con acceso temprano, encontraron algo distinto: un modelo que sabe cuándo lo están evaluando -- y que en pruebas adversariales escribió código malicioso e intentó ingeniería social.
Leer ficha técnica Google DeepMind · Gemini 3.7 FlashGoogle llama a Gemini 3.7 Flash su «workhorse» más capaz. Es real -- pero la propia Google dice que no es un modelo nuevo
El 13 de agosto, Google lanzó Gemini 3.7 Flash con saltos de hasta 16 puntos en benchmarks de código frente a su predecesor. La mejora es verificable y grande -- pero Google confirma que no es un modelo nuevo: es un refinamiento algorítmico de Gemini 3.6 Flash, no una arquitectura distinta.
Leer ficha técnica Alibaba (Qwen) · Qwen3.8-Flash-NextQwen3.8-Flash-Next dice que le gana a Claude. Es cierto — pero al Claude de hace un año
Alibaba presentó su nuevo modelo abierto diciendo que supera a Opus en la mayoría de benchmarks. Cierto, si el punto de comparación es Opus 4.6 — el modelo insignia anterior de Anthropic, no Opus 5, el actual.
Leer ficha técnica Anthropic · Claude Opus 5Claude Opus 5 promete el nivel de Fable 5 a mitad de precio. Los benchmarks independientes dicen: casi
Anthropic presentó Opus 5 el 24 de julio como su modelo insignia, cercano a Fable 5 pero a mitad de costo. Los números que la propia Anthropic no destacó en su anuncio cuentan una historia más pareja.
Leer ficha técnica