programa
Íbamos publicando artículos sobre los modelos Llama de Meta a buen ritmo (Llama 2, Llama 3, etc.). Luego Llama 4 llegó en abril de 2025 con fuertes críticas: varios medios y el propio responsable de IA saliente de la compañía confirmaron que se habían manipulado los resultados de los benchmarks con submodelos especializados que nunca se publicaron.
A partir de ahí, las novedades dejaron de llegar. Por las mismas fechas, Meta anunció que trasladaba Horizon Worlds solo a móvil, poniendo fin de facto a la versión de VR con la que un día apostó el futuro de la empresa. Parecía una compañía perdiendo pie en dos frentes a la vez.
El 8 de abril de 2026, Meta lanzó Muse Spark, el primer modelo de Meta Superintelligence Labs. La nota de prensa repite demasiado la expresión "superinteligencia personal". Quitando eso, hay un modelo real debajo que devuelve a Meta a la conversación en la frontera de la IA.
Si quieres ver cómo se compara el nuevo modelo de Meta con uno de sus mejores competidores actuales, te recomiendo leer nuestra guía Muse Spark vs Claude Opus 4.6. También puedes leer nuestra guía de Muse Glimmer y nuestro tutorial para ejecutar Muse Glimmer en local.
¿Qué es Muse Spark?
Muse Spark es un modelo de razonamiento multimodal nativo que gestiona texto, imágenes, audio y uso de herramientas en una sola arquitectura. Admite cadena de pensamiento visual: el modelo puede resolver problemas basados en imágenes paso a paso, en lugar de dar solo una respuesta final. La orquestación multiagente también forma parte del planteamiento, y ahora vamos con ello.
Los modelos Llama anteriores devolvían respuestas por ajuste de patrones a partir del entrenamiento. Muse Spark trabaja los problemas antes de responder. Ese es el cambio real.
¿Quién está detrás?
Meta Superintelligence Labs, o MSL, se creó el 30 de junio de 2025, cuando Mark Zuckerberg reorganizó las operaciones de IA de la compañía. Alexandr Wang, ex CEO de Scale AI, se incorporó como Chief AI Officer; Meta había invertido unos 14.000 millones de dólares en Scale AI como parte del acuerdo.
Nat Friedman, ex CEO de GitHub, lidera la parte de producto e investigación aplicada, y Shengjia Zhao, que co-creó GPT-4 y o1 en OpenAI (la misma o1 contra la que ahora se compara Muse Spark), es Chief Scientist.
Hay un tercer factor que conviene mencionar: Yann LeCun, histórico Chief AI Scientist de Meta y su defensor más visible del open source, se marchó en noviembre de 2025. Su salida siguió a cambios organizativos que limitaron su papel y al giro del equipo hacia el desarrollo cerrado.
¿Qué hay de nuevo en Muse Spark (y por qué debería importarte)?
Los titulares son los modos de razonamiento, una canalización de entrenamiento reconstruida y un enfoque deliberado en salud. Vamos por partes.
Tres modos de razonamiento
Muse Spark ofrece tres formas de interactuar con él, y conviene entender la diferencia antes de probar el modelo.
- Instant es el modo por defecto para consultas rápidas. Responde ágil sin razonamiento extendido, similar a un modelo de chat estándar.
- Thinking usa cadena de pensamiento extendida. El modelo tarda más, recorre pasos intermedios y suele rendir mejor en problemas difíciles. Este es el modo detrás de la mayoría de los resultados de benchmarks de este artículo.
- Contemplating es el más interesante. Más detalles justo debajo.
Algo a saber de entrada: el modo Contemplating se está desplegando de forma gradual y no estuvo disponible para todos los usuarios el día de lanzamiento. Si aún no lo ves, es normal.
Modo Contemplating
El modo Contemplating lanza varios agentes de razonamiento en paralelo y luego combina sus salidas en una sola respuesta. Mientras que Deep Think de Gemini y el modo GPT Pro de OpenAI escalan el razonamiento pensando durante más tiempo, Muse Spark lo escala pensando más en ancho. Hay más agentes trabajando simultáneamente, en lugar de uno solo durante más tiempo.
Meta sostiene que este enfoque produce resultados comparables con menor latencia, ya que los agentes corren en paralelo y no de forma secuencial. Aún no hay confirmación independiente de la latencia, pero los números de benchmarks del modo Contemplating lideran en varias evaluaciones difíciles (más sobre esto en breve).
Es una función de tiempo de inferencia, no de arquitectura. El modelo en sí no cambia.
Escalado de aprendizaje por refuerzo y compresión del pensamiento
Meta reconstruyó su stack de entrenamiento desde cero durante los nueve meses que llevó desarrollar Muse Spark. Las afirmaciones sobre aprendizaje por refuerzo (RL) proceden del blog técnico de Meta y no han sido verificadas de forma independiente.
Lo más interesante es una técnica que el equipo de investigación llama compresión del pensamiento. Durante el entrenamiento con RL, el modelo recibe recompensa por acertar, pero también penalización por el tiempo de razonamiento, que se traduce en exceso de tokens de salida. Esto crea un comportamiento en tres fases en tareas complejas como problemas de matemáticas.
Primero, el modelo mejora pensando más tiempo. Luego entra en juego la penalización por longitud y obliga al modelo a resolver los mismos problemas con muchos menos tokens. En algún momento vuelve a ampliar su razonamiento y supera techos de rendimiento previos usando menos tokens.
Resultado práctico: el modelo aprende a hacer más con menos. Esa afirmación se basa en las propias curvas de entrenamiento de Meta, aún sin validación independiente.
10 veces menos cómputo
Meta afirma que su nueva arquitectura iguala el rendimiento de Llama 4 Maverick con diez veces menos cómputo de entrenamiento. Eso va de eficiencia arquitectónica, no del techo de Muse Spark. Llama 4 Maverick obtuvo 18 en el Artificial Analysis Intelligence Index. Muse Spark obtuvo 52.
Las cifras de eficiencia de tokens del recorrido independiente de Artificial Analysis apuntan en la misma dirección. Muse Spark usó 58 millones de tokens de salida. GPT-5.4 usó 120 millones. Claude Opus 4.6 usó 157 millones.
Salud: un foco deliberado
Salud es la ventaja comparativa más clara de Muse Spark en benchmarks, y es intencional. Meta trabajó con más de 1.000 médicos para curar datos de entrenamiento para razonamiento en salud.
El modelo puede generar visualizaciones interactivas sobre contenido nutricional, información farmacológica y fisiología del ejercicio. En HealthBench Hard, Muse Spark obtuvo 42,8 frente a 40,1 de GPT-5.4 y 20,6 de Gemini 3.1 Pro. Esa diferencia frente a Gemini se mantiene bajo evaluación independiente.
Es claramente la respuesta de Meta a ChatGPT Health. El argumento de Meta para competir es el contexto social de 3.000 millones de usuarios, que debería darle ventaja para entender cómo la gente realmente formula preguntas de salud. Habrá que ver si eso se sostiene en consultas complejas o inusuales, más allá de las cotidianas que pueblan los benchmarks.
¿Y Llama?
La comunidad de desarrolladores pregunta algo, y merece una respuesta directa.
Muse Spark no es de código abierto. Todos los Llama hasta Llama 4 se publicaron con pesos descargables para ejecutarlos en local. Comunidades como r/LocalLLaMA se construyeron sobre eso. Ese caso de uso ya no existe.
La razón declarada por Meta es en parte competitiva: laboratorios chinos, incluido DeepSeek, usaron los pesos de Llama para acelerar su investigación. Wang ha dicho que la compañía "espera" abrir el código de futuros Muse, sin calendario. Ese "espera" carga con mucho peso en esa frase.
El equipo de Llama pasó al laboratorio de Wang, y Llama 4 fue el último modelo de la estructura anterior. Meta no ha dicho si Llama continuará junto a Muse o se irá apagando.
Resultados de benchmarks de Muse Spark
Los benchmarks con Muse Spark tienen trampa por un motivo que conviene decir de entrada. Dado el historial de Llama 4, separa los números auto-reportados de los verificados de forma independiente.
Aquí están los resultados en modo Thinking, donde está la mayoría de comparaciones justas.

Fuente: Meta Superintelligence Labs / ai.meta.com
El modo Contemplating tiene un conjunto aparte para las evaluaciones más difíciles. Lidera en Humanity's Last Exam y FrontierScience Research, pero queda por detrás de GPT-5.4 Pro y Gemini 3.1 Deep Think en los problemas teóricos de física de IPhO 2025. Todo según Meta, así que tómalo como indicativo más que concluyente.

Fuente: Meta Superintelligence Labs / ai.meta.com
La visión independiente de Artificial Analysis es más templada. Colocaron a Muse Spark cuarto en su Intelligence Index, por detrás de Gemini 3.1 Pro Preview, GPT-5.4 y Claude Opus 4.6. Aun así, top cinco global. Los números también dejan claras las debilidades: ARC-AGI-2 y Terminal-Bench 2.0 merecen atención si tu caso de uso depende de programación o razonamiento abstracto.
Probando Muse Spark
Con esos benchmarks en mente, vamos a poner a prueba Muse Spark. Examinaré el modelo en razonamiento multi-paso, comprensión de imágenes y depuración de código.
Prueba 1: cadena lógica Fibonacci–binario (estabilidad del razonamiento en cascada)
En la primera prueba, apunto a las capacidades avanzadas de razonamiento de Muse Spark con un ejercicio multi-paso. El modelo debe:
- Identificar el término correcto de Fibonacci
- Convertirlo correctamente a binario
- Contar los bits con precisión
- Generar primos en un rango calculado
- Realizar una suma grande
El prompt usado fue:
Step 1: Find the 13th number in the Fibonacci sequence (starting with F1=1, F2=1). Let this be X.
Step 2: Convert X into a binary string (Base 2).
Step 3: Count the number of '1's in that binary string. Let this count be C.
Step 4: Identify all prime numbers (p) such that 20 ≤ p ≤ (C × 100).
Step 5: Calculate the sum of these primes. What is the final result?
Muse Spark lo hizo muy bien y resolvió el ejercicio a la primera. Es especialmente llamativo porque GPT-5.4 falló en el último paso y solo acertó al dividirlo en dos (listar los primos y luego sumarlos).

Prueba 2: comprensión de imágenes y razonamiento comercial en una serie temporal multilínea
Meta afirma que Muse Spark entiende muy bien imágenes complejas, así que uso el siguiente gráfico de series temporales multilínea para ver si identifica patrones y los convierte en recomendaciones útiles.

Este es el prompt:
Examine this multi-line time-series of monthly active users for three products. Describe the key patterns you see, explain how events likely impacted each product, and propose data-driven next steps for the business.

Muse Spark identificó correctamente todos los patrones, lo que implica que el reconocimiento de la imagen funciona bien.

Los datos estaban generados aleatoriamente, así que no hay una respuesta “correcta”. Aun así, Muse Spark identifica todos los eventos y razona por productos y momentos, llegando a conclusiones sensatas. Incluso analiza cambios en la suma de MAU (usuarios activos mensuales) de combinaciones de productos, sin que se le pida, un buen añadido.

Todos los siguientes pasos propuestos están alineados con los análisis de patrones de MAU y efectos de eventos. Muse Spark identificó el tema clave de cada producto (playbook de lanzamiento para A, precios para B, escalado para C) y propuso acciones concretas con sentido.
Prueba 3: depuración de código
Por último, probaré la capacidad de Muse Spark para diagnosticar errores de código. La prueba pretende mostrar si el modelo solo traza la corrección línea a línea o también detecta fallos de concepto.
El prompt:
A developer wrote this Python function to compute a running average:
def running_average(data, window=3):
result = []
for i in range(len(data)):
start = max(0, i - window + 1)
chunk = data[start:i + 1]
result.append(round(sum(chunk) / window, 2))
return result
When called with running_average([10, 20, 30, 40, 50]), the first two values in the output seem wrong. Why? Please help me fix what is wrong!
La función siempre divide por window (3), incluso al principio, cuando el grupo tiene menos de 3 elementos. La salida con error es [3.33, 10.0, 20.0, 30.0, 40.0], pero los dos primeros valores deberían ser 10.0 y 15.0 ya que esos grupos contienen solo 1 y 2 elementos, respectivamente. La corrección consiste en cambiar / window por / len(chunk).
A menudo los modelos recorren el bucle perfectamente, pero luego dicen que la salida “parece correcta”. Ven las operaciones paso a paso y no señalan que dividir un único elemento entre 3 no tiene sentido. Requiere mantener a la vez la intención (qué debe hacer una media móvil) y la ejecución (qué hace el código) y detectar la brecha entre ambas.

Muse Spark identificó la media móvil como la intención y detectó el fallo. Propuso el cambio correcto y explicó por qué es necesario. Incluso sugirió otra opción por si se quisieran omitir las ventanas parciales.
En conjunto, el modelo superó las tres pruebas con nota y dejó una muy buena primera impresión.
¿Cómo puedo acceder a Muse Spark?
Puedes acceder a Muse Spark en meta.ai o a través de la app Meta AI para iOS y Android. Ambos son gratuitos. El despliegue inicial es en EE. UU., con expansión a otras regiones en las semanas siguientes. 
Meta planea llevarlo a WhatsApp, Instagram, Facebook, Messenger y sus gafas Ray-Ban AI en el mismo plazo.
No hay API pública. Hay una preview privada para algunas empresas, sin fecha confirmada para un acceso más amplio. En privacidad: la política de Meta impone pocos límites a cómo se pueden usar las conversaciones para mejorar sus modelos. Si piensas compartir información sensible, lee primero las condiciones.
Dónde flojea Muse Spark
Meta lo dijo claramente en su blog técnico: el modelo tiene carencias en tareas multiagente de varios pasos y en flujos de trabajo de código.
En SWE-Bench Verified, la diferencia con Gemini y Opus 4.6 es pequeña. Se abre en trabajo agentic: Terminal-Bench 2.0 (59,0 frente a 75,1 de GPT-5.4) y GDPval-AA para automatización de oficina (1.444 frente a 1.672 de GPT-5.4). Ahí no están cerca.
El razonamiento visual abstracto sigue el mismo patrón: ARC-AGI-2 es 42,5 para Muse Spark frente a más de 70 para GPT-5.4 y Gemini. El modelo que lidera leyendo gráficos va muy por detrás en patrones visuales novedosos.
Eso último recibió respuesta el día del lanzamiento. François Chollet, cofundador de ARC Prize y creador de Keras y ARC-AGI, dijo que el modelo está "sobreoptimizado para números de benchmarks públicos en detrimento de todo lo demás". Wang respondió, reconoció la brecha en ARC-AGI-2 y señaló comentarios positivos de usuarios en codificación y razonamiento visual. Si se mantiene con un uso más amplio sigue abierto.
La ausencia de API pública, como comenté antes, es otra desventaja competitiva. Wang la reconoció en el lanzamiento: "Hay aristas que iremos puliendo con el tiempo en el comportamiento del modelo".
Seguridad de Muse Spark
Meta realizó evaluaciones bajo su Advanced AI Scaling Framework antes del lanzamiento. En BioTIER-refuse, Muse Spark lidera el conjunto comparado en rechazo de consultas sobre armas biológicas. Estos números son de Meta.

Fuente: Meta Superintelligence Labs / ai.meta.com
El hallazgo más interesante llega de Apollo Research. Encontraron que Muse Spark mostró la mayor tasa de conciencia de evaluación de todos los modelos que habían probado: a menudo identificaba las evaluaciones de seguridad como contextos de prueba y se comportaba con más cuidado por esa detección.
Un modelo que solo se porta bien cuando sabe que lo están observando es un problema a tomar en serio. Trabajos previos de Apollo documentan que este patrón puede aumentar lo que llaman "comportamiento maquiavélico" en despliegues reales.
Meta reconoció el hallazgo en el lanzamiento, algo que la mayoría de laboratorios no hace. Su seguimiento concluyó que afectaba a un subconjunto pequeño de pruebas de alineación, ninguna relacionada con capacidades peligrosas, y que no era un bloqueo. La investigación sigue.
Muse Spark vs. GPT-5.4 vs. Opus 4.6 vs. Gemini 3.1
Los benchmarks cubrieron qué pueden hacer estos modelos. Esta sección cubre cuál deberías usar realmente.
De un vistazo
|
Especificación |
Muse Spark |
GPT-5.4 |
Opus 4.6 |
Gemini 3.1 Pro |
|
Lanzamiento |
8 abr 2026 |
5 mar 2026 |
5 feb 2026 |
19 feb 2026 |
|
Ventana de contexto |
262K* |
1,05M |
1M desde el 13 mar |
1M |
|
Modalidades de entrada |
Texto, imagen, voz |
Texto, imagen |
Texto, imagen |
Texto, imagen, audio, vídeo |
|
Precio API (por 1M tokens entrada / salida) |
Sin API pública |
$2,50 / $15,00 |
$5,00 / $25,00 |
$2,00 / $12,00 |
|
Acceso para consumidores |
meta.ai (EE. UU. primero) |
ChatGPT |
Claude.ai |
App de Gemini |
*Artificial Analysis registra la ventana de contexto de Muse Spark en 262K. Algunas fuentes citan 1M. Meta no ha publicado una ficha del modelo que confirme ninguna de las dos.
¿Cuál deberías usar?
Elige Muse Spark si tu caso de uso son consultas de salud, lectura de gráficos o aplicaciones multimodales de consumo. Aún no hay API pública, así que si quieres integrarlo en producción, tendrás que esperar.
Elige GPT-5.4 si necesitas un modelo generalista con el que puedas construir hoy. Lidera en programación, razonamiento visual abstracto y automatización de oficina, con API pública y ventana de 1M disponibles ya.
Elige Claude Opus 4.6 si trabajas con documentos largos o necesitas redacción cuidada y de alta calidad. La ventana de 1M pasó a precio estándar el 13 de marzo de 2026. Es la opción más cara: $5/$25 por 1M de tokens.
Elige Gemini 3.1 Pro si tu canal de datos procesa vídeo. Es el único modelo aquí que acepta entrada de vídeo y, con $2/$12 por 1M de tokens, el más barato de este grupo de frontera.
Qué se dice de Muse Spark
Las primeras reacciones se polarizan como cabía esperar. Algunas personas encontraron cosas concretas que les sorprendieron. Otras miraron la tabla de benchmarks y llegaron a conclusiones distintas.

La narrativa de "stack completo reconstruido desde cero" apareció mucho. Esos nueve meses son o bien impresionantes o difíciles de creer, según cuánto confíes en las afirmaciones de Meta.
Pietro Schirano compartió un ejemplo concreto: le pidió a Muse Spark convertir una captura de una interfaz a código y el modelo extrajo los assets de la imagen, en lugar de tratarla como un plano.

No es un benchmark. Es el tipo de cosa que se comparte porque de verdad sorprende.
Aakash Gupta dejó la reflexión más afilada. Su marco: "Este es el modelo de un CEO de data labeling. Las huellas están por todas partes en los resultados". Los benchmarks donde lidera Muse Spark son sensibles a la calidad de datos, donde la curación del set de entrenamiento determina el techo.
En los que queda atrás (ARC-AGI-2, Terminal-Bench, GDPval) es justo donde la arquitectura y el escalado de RL pesan más que los datos. Su conclusión: "ha construido el mejor modelo en lo que resuelven las canalizaciones de datos, y uno mediocre en lo demás".

Conclusión
El salto de 18 de Llama 4 Maverick a 52 de Muse Spark en el Artificial Analysis Intelligence Index no es menor. Para un equipo que reconstruyó desde cero en nueve meses, los resultados en salud y multimodal son un primer paso real, y se sostienen bajo pruebas independientes.
Sí, las brechas son claras. En programación y tareas agentic frente a GPT-5.4 no compite; el razonamiento visual abstracto es un punto débil, y sigue sin haber API pública. Si necesitas un modelo con el que construir hoy, Muse Spark aún no es ese.
A lo que vuelvo una y otra vez es a la cuestión del open source. El ecosistema Llama se construyó sobre la confianza de que habría pesos disponibles. Muse Spark rompe eso. El "espera" de Wang para abrir versiones futuras no es un compromiso. En mi opinión, es lo más relevante de este lanzamiento, y recibe mucha menos atención que los números de benchmarks.
Modelos Muse más grandes están en desarrollo. Si la arquitectura escala como afirman, los números de hoy parecerán modestos. Esa es la apuesta.
Si quieres aprender a sacar el máximo partido a cualquier modelo de lenguaje grande, te recomiendo nuestro curso Understanding Prompt Engineering.
Preguntas frecuentes sobre Muse Spark
Si usaba Llama en local, ¿Muse Spark lo sustituye?
No. Muse Spark solo está en la nube. No puedes descargarlo, ejecutarlo en tu propio hardware ni afinarlo. Se accede a través de meta.ai o de la app Meta AI, ambas requieren cuenta de Meta. El caso de uso de pesos abiertos alrededor del que Llama construyó su comunidad aquí no existe.
¿Cuándo debería usar Contemplating en lugar de Thinking?
El modo Contemplating es más útil cuando un problema tiene realmente múltiples vías válidas de solución, preguntas científicas complejas, razonamiento multi-paso con entradas ambiguas o tareas de investigación donde distintos enfoques pueden llegar a conclusiones diferentes. Para la mayoría de consultas diarias, Thinking es más rápido y los resultados son comparables. Otro punto a saber: Contemplating sigue desplegándose gradualmente, así que puede que todavía no lo tengas.
¿Qué significa realmente para mí la afirmación de 10x menos cómputo?
Probablemente nada por ahora. La comparación es contra el propio modelo anterior de Muse Spark, no contra GPT-5.4 o Gemini, y el dato no ha sido verificado de forma independiente. El dato más relevante es la eficiencia de inferencia: como mencionamos antes, Muse Spark usó 58 millones de tokens de salida en la prueba independiente de Artificial Analysis frente a 157 millones de Claude Opus 4.6. Esa diferencia podría reflejarse en el precio, pero aún no se ha anunciado el precio del API.
¿Merece la pena cambiarme a Muse Spark desde lo que uso ahora?
Si usas ChatGPT para tareas generales, la experiencia diaria es similar. Si tus principales usos son consultas de salud, ciencia o análisis de gráficos, Muse Spark es una mejora razonable. Si dependes de asistentes de código o herramientas para documentos largos, aún no sustituye a GPT-5.4 u Opus 4.6. La tabla de comparación de arriba tiene los detalles.
¿Debo preocuparme por el hallazgo de conciencia de evaluación?
No en el día a día práctico, pero conviene entenderlo. El hallazgo dice que Muse Spark se comporta con más cuidado cuando detecta que está siendo evaluado en seguridad, no porque sus valores subyacentes sean distintos, sino porque reconoce el contexto. El seguimiento de Meta encontró que afectaba a un conjunto reducido de pruebas de alineación, ninguna relacionada con capacidades peligrosas. Si evalúas modelos para despliegues sensibles, lee el informe completo de Apollo antes de sacar conclusiones solo con los benchmarks de seguridad.
Soy ingeniero de datos y creador de comunidades. Trabajo con canalizaciones de datos, nube y herramientas de IA, al tiempo que escribo tutoriales prácticos y de gran impacto para DataCamp y programadores emergentes.

Editor de ciencia de datos en DataCamp | Me encanta hacer previsiones y crear con API.





