Meta dice que Muse Spark 1.3 alcanza la frontera y le gana a Opus 5 en código. Los mejores números vienen de un modo que casi nadie puede usar todavía
El 2 de septiembre, Meta presentó Muse Spark 1.3 como su modelo de frontera, superando a Claude Opus 5 en benchmarks de código. Esos resultados salen del modo "max" del modelo -- todavía cerrado tras pruebas de seguridad -- mientras la versión que sí está disponible hoy empata con sus rivales, no los supera.
El modelo insignia de Meta para código y agentes, lanzado el 2 de septiembre de 2026 -- unas cuatro semanas después de la versión 1.2 -- con entrada de texto, imagen y video y ventana de contexto de 1 millón de tokens.
Qué prometen vs. qué se puede verificar hoy
Meta presentó a Muse Spark 1.3 como un modelo de rendimiento "de frontera", con cifras que en efecto superan a rivales de peso: 75.4 en DeepSWE v1.1 frente a 74.0 de Claude Opus 5 y 73.0 de GPT-5.6 Sol, y un empate con GPT-5.6 Sol en Terminal-Bench 2.1 (88.8), por encima del 86.7 de Opus 5. En tareas de contexto largo, la recuperación es casi perfecta (98.5 y 98.1).
Pero Artificial Analysis y VentureBeat señalan la letra pequeña: esos números de frontera salen del modo "max" de Muse Spark 1.3, que sigue cerrado tras pruebas de seguridad internas de Meta y todavía no está disponible para desarrolladores. La versión que sí se puede usar hoy, el modo "xhigh", saca 61 puntos en el Artificial Analysis Intelligence Index -- empatada con GPT-5.6 Sol y Grok 4.6, no por encima de ellos. Meta también comparó el modo "max" de 1.3 contra el modo "xhigh" de la versión anterior (1.2) para calcular el salto de rendimiento, mezclando dos niveles de razonamiento distintos en la misma comparación -- lo que infla la sensación de salto generacional limpio.
Frente a qué compite
Compite directo con Claude Opus 5, GPT-5.6 Sol y Grok 4.6 en código y agentes -- el mismo terreno que GPT-6 Astra y Gemini 3.7 Flash, revisados aquí las últimas dos semanas. En la versión realmente disponible (xhigh), Muse Spark 1.3 empata con esos rivales; solo el modo max, todavía inaccesible, lo pondría por delante.
Para quién importa
Para equipos que ya usan el ecosistema de Meta y priorizan menos llamadas a herramientas y menos tokens por tarea de código (Meta reporta 20% y 25% menos, respectivamente, frente a 1.2), la mejora real ya está disponible. Para quien decide qué modelo usar basado en el titular de "supera a Opus 5", vale la pena esperar a que el modo max salga de pruebas de seguridad antes de tomar esa cifra al pie de la letra.
Fuentes
- Meta says Muse Spark 1.3 has frontier performance — but its best results come from a model developers can't broadly use yet — VentureBeat
- Muse Spark 1.3: Meta reaches the frontier — Artificial Analysis
- Muse Spark 1.3 Jumps 16 Points on DeepSWE — TechTimes
- Muse Spark 1.3 Benchmarks, Pricing & Speed — benchlm.ai