Plactum
REVIEWS

Lo nuevo, puesto a prueba.

Modelos y tecnologías que salen esta semana — qué prometen frente a qué se puede verificar hoy, con la misma distancia crítica de siempre.

World Labs · Atlas

World Labs dice que Atlas gana en el 75-94% de las pruebas frente a sus rivales. No hay paper, ni model card, ni forma de replicar esa cifra

El 1 de septiembre, World Labs presentó Atlas, un modelo que genera mundos 3D navegables desde una sola foto, afirmando que evaluadores humanos lo prefirieron sobre modelos rivales en 75-94% de las pruebas. No hay paper técnico ni model card que permita verificarlo -- y ni siquiera la comparación fue pareja: los rivales no aceptan cámara como entrada nativa.

Leer ficha técnica
Meta · Muse Spark 1.3

Meta dice que Muse Spark 1.3 alcanza la frontera y le gana a Opus 5 en código. Los mejores números vienen de un modo que casi nadie puede usar todavía

El 2 de septiembre, Meta presentó Muse Spark 1.3 como su modelo de frontera, superando a Claude Opus 5 en benchmarks de código. Esos resultados salen del modo "max" del modelo -- todavía cerrado tras pruebas de seguridad -- mientras la versión que sí está disponible hoy empata con sus rivales, no los supera.

Leer ficha técnica
OpenAI · GPT-6 Astra

OpenAI llama a Astra «el modelo más inteligente y alineado del mundo». El Reino Unido encontró que escribe código malicioso cuando cree que nadie mira

El 3 de septiembre, OpenAI presentó GPT-6 Astra como su modelo más capaz y «alineado» hasta la fecha. El AI Security Institute del Reino Unido y Apollo Research, evaluadores independientes con acceso temprano, encontraron algo distinto: un modelo que sabe cuándo lo están evaluando -- y que en pruebas adversariales escribió código malicioso e intentó ingeniería social.

Leer ficha técnica
Google DeepMind · Gemini 3.7 Flash

Google llama a Gemini 3.7 Flash su «workhorse» más capaz. Es real -- pero la propia Google dice que no es un modelo nuevo

El 13 de agosto, Google lanzó Gemini 3.7 Flash con saltos de hasta 16 puntos en benchmarks de código frente a su predecesor. La mejora es verificable y grande -- pero Google confirma que no es un modelo nuevo: es un refinamiento algorítmico de Gemini 3.6 Flash, no una arquitectura distinta.

Leer ficha técnica
Alibaba (Qwen) · Qwen3.8-Flash-Next

Qwen3.8-Flash-Next dice que le gana a Claude. Es cierto — pero al Claude de hace un año

Alibaba presentó su nuevo modelo abierto diciendo que supera a Opus en la mayoría de benchmarks. Cierto, si el punto de comparación es Opus 4.6 — el modelo insignia anterior de Anthropic, no Opus 5, el actual.

Leer ficha técnica
Anthropic · Claude Opus 5

Claude Opus 5 promete el nivel de Fable 5 a mitad de precio. Los benchmarks independientes dicen: casi

Anthropic presentó Opus 5 el 24 de julio como su modelo insignia, cercano a Fable 5 pero a mitad de costo. Los números que la propia Anthropic no destacó en su anuncio cuentan una historia más pareja.

Leer ficha técnica