Curso
El 6 de octubre de 2026, Mistral lanzó una preview pública de Mistral Large 4 (ML4), un modelo de 1 billón de parámetros con 49.000 millones activos, entrada de texto e imagen y con pesos abiertos prometidos para finales de mes. Es el modelo más grande que Mistral ha construido hasta la fecha, entrenado desde cero en 3.800 GPUs Nvidia Grace Blackwell en sus propios centros de datos europeos.
Durante la mayor parte del último año, los modelos de pesos abiertos más potentes han salido de laboratorios chinos (GLM, DeepSeek, Kimi, Qwen), mientras que los más fuertes en general se han mantenido cerrados tras APIs estadounidenses. Mistral quiere abrir una tercera vía. En su anuncio afirma que ML4 "ya logra un rendimiento competitivo con los modelos open source más fuertes a nivel global, superando con diferencia a cualquier modelo de pesos abiertos desarrollado en EE. UU. o Europa".
La realidad es más compleja de lo que sugiere el post de lanzamiento. A continuación cubro la arquitectura, los benchmarks (separando lo reproducido de forma independiente de lo que no), codificación, visión, ciberseguridad, pesos abiertos y lo que aún no sabemos. Si solo tienes tiempo para una sección, que sea la de ciberseguridad.
La respuesta rápida
Mistral Large 4 (Le Chonk) es un modelo de pesos abiertos con 1 billón de parámetros que Mistral presenta como el más fuerte construido fuera de China, especialmente para ciberseguridad, finanzas, derecho y "visual grounding". Evaluaciones independientes respaldan las afirmaciones en ciberseguridad y legal, sitúan finanzas en la zona media y colocan a ML4 en el puesto 32 de 44 modelos en un índice agregado amplio. La API ya está activa y los pesos llegarán el 27 de octubre.
¿Qué es Mistral Large 4 (Le Chonk)?
Ese resumen se deja mucho en el tintero, así que vamos a lo básico. ML4 es el nuevo buque insignia de Mistral y, en sus palabras, su "modelo más grande y capaz hasta la fecha". Le Chonk es el apodo, aunque en el texto de lanzamiento Mistral invierte lo habitual: "Extraoficialmente ML4, muy oficialmente: le Chonk".
Es un modelo Mixture-of-Experts (MoE) multimodal nativo. Las cifras titulares son 1 billón de parámetros totales y 49.000 millones activos por token, aunque en los docs del modelo Mistral da cifras ligeramente distintas (1,05T en total, 52B activos). Ninguna fuente explica la diferencia. (Por qué importan los "activos" lo vemos en la siguiente sección).
Mistral apunta ML4 al trabajo enterprise: codificación, ciberseguridad, finanzas, legal, fabricación e ingeniería, y tareas visuales como leer planos técnicos o imágenes satelitales.
|
Especificación |
Detalle |
|
Parámetros totales |
|
|
Parámetros activos |
|
|
Arquitectura |
Mixture-of-Experts, híbrido instruct y reasoning |
|
Entrada |
|
|
Salida |
Solo texto |
|
Ventana de contexto |
Para cualquiera que planee un despliegue, hay dos filas que importan más y ambas están en el aire: la ventana de contexto y la licencia. Antes de entrar en cómo funciona el modelo, merece una explicación rápida el nombre.
¿Por qué se llama Le Chonk?
En junio de 2026, Mistral publicó un anuncio satírico de "Le Chaton Fat", un modelo ficticio de 24 billones de parámetros, y luego lo borró. Internet siguió su curso, inflando las especificaciones hasta los cientos de billones. Cuatro meses después Mistral lanzó un modelo real de billón de parámetros y el nombre prácticamente se eligió solo. No hay más. Volvamos al modelo.
Cómo funciona Mistral Large 4
Mistral aún no ha publicado los detalles arquitectónicos completos (prometidos junto con los pesos), así que aquí me ciño a lo divulgado.
1 billón de parámetros, 49.000 millones activos
Un modelo de 1 billón de parámetros no usa los 1 billón en cada token. En los MoE, cada token se enruta por un subconjunto pequeño de subredes "expertas", por lo que el cómputo en inferencia se corresponde con los 49.000 millones de parámetros activos. Eso lo acerca más a un modelo denso de ~50B que a uno de 1T.
¿Barato de servir? No. Los 1 billón de parámetros siguen teniendo que residir en memoria en algún lugar, así que alojar ML4 en tu propia infraestructura requiere un despliegue serio de múltiples GPUs. Además, los MoE son más difíciles de servir con baja latencia que los modelos densos con el mismo recuento activo. Mistral no ha publicado requisitos de hardware, y me sorprendería que muchos equipos fuera de grandes empresas y gobiernos ejecuten el modelo completo por su cuenta.
Entrada multimodal
Esos parámetros activos manejan más que texto. ML4 acepta imágenes también, aunque solo devuelve texto. Mistral dice que "razona con fuerza sobre documentos complejos, gráficos e imágenes naturales" y apunta a sectores donde la percepción visual importa, como ingeniería, fabricación y observación terrestre. Las demos son todas industriales: inspeccionar piezas mecánicas en planos técnicos, extraer evidencias de PDFs, escanear imágenes satelitales gigapíxel para encontrar objetos difíciles.
Más de 160 idiomas
Estos clientes industriales a menudo trabajan a caballo entre países, y ahí entra el idioma. Mistral afirma que una "parte significativa" de los datos de entrenamiento fue multilingüe, cubriendo más de 160 idiomas y todas las lenguas oficiales de la UE. Para una empresa europea que corteja a gobiernos europeos, es una pieza clave del discurso.
Infraestructura de entrenamiento
En Europa, también cuenta dónde se entrenó. Según Mistral, ML4 fue entrenado desde cero en 3.800 GPUs Nvidia Grace Blackwell en sus propios centros de datos europeos. Pierre Stock, VP of Science de Mistral, dio a TechCrunch una cifra redonda de 4.000 y dijo que es "dos o tres veces menos que nuestros competidores chinos". Nadie ha verificado esa comparación.
El despliegue de cómputo detrás de esto es público desde hace tiempo. En marzo de 2026, Mistral levantó 830 millones de dólares de deuda para comprar 13.800 GPUs Nvidia GB300 para un centro de datos cerca de París. Mistral no dice si ML4 se entrenó específicamente en ese clúster, así que no voy a unir los puntos.
Un detalle cambia cómo debes leer cada benchmark en este artículo. La fase de aprendizaje por refuerzo (RL) sigue en marcha. El RL es la etapa posterior al entrenamiento en la que el modelo mejora siendo puntuado sobre sus propios intentos de tareas, y Mistral dice que su corrida usa actualmente unas 3.000 GPUs, genera alrededor de 33.000 millones de tokens al día y "no muestra signos de saturación". Así que el modelo que puedes llamar por la API hoy no será el mismo cuyos pesos se publiquen el 27 de octubre.
Benchmarks de Mistral Large 4
Ese RL inacabado es la primera razón para tratar todo en esta sección como preliminar. La segunda es que la mayoría de las cifras de Mistral no han sido reproducidas de forma independiente, y las que sí, no siempre cuadran.
La evaluación independiente en el lanzamiento cae en tres bloques:
- Reproducido de forma independiente: el Artificial Analysis (AA) Cyber Index, incluido su componente CyberGym-E2E, y cinco evaluaciones de vals.ai, incluido Terminal-Bench 4.0.
- Ejecutado por AA, pero aún no público: una nota al pie en los gráficos de codificación de Mistral dice que las puntuaciones de DeepSWE, Terminal-Bench y SWE-Atlas "usan las cifras evaluadas en privado por Artificial Analysis antes del lanzamiento público del harness". Aparecerán en el Coding Agent Index de AA una vez se publique ese harness. Hasta entonces, nadie fuera de AA y Mistral puede comprobarlas.
- Solo Mistral: todo lo demás.
Fíjate sobre todo en la última columna de la tabla. Un benchmark puede ser construido por un grupo independiente mientras que la puntuación de ML4 en él sigue siendo solo una afirmación de Mistral.
Resumen de benchmarks
|
Benchmark |
Resultado ML4 |
Competidores |
Qué mide |
|
DeepSWE v1.1 |
61,7%, ejecutado en privado por AA |
Kimi K3 69%, GLM-5.3 61%, DeepSeek V4 Pro 57%, Qwen3.8 Max 51%, Reflection Beam 44% (autoinformado) |
Ingeniería de software de largo recorrido |
|
Terminal-Bench 4.0 |
28,3% según Mistral, 22,73% según vals.ai |
Puesto 20 de 44 en vals.ai |
Flujos complejos en terminal |
|
SWE-Atlas-QnA |
59,4%, ejecutado en privado por AA |
No publicado |
Comprensión de repositorios |
|
Coding Agent Index |
49,8%, ejecutado en privado por AA |
Por delante de DeepSeek V4 Pro 0813 y Qwen3.8 Max |
Compuesto de los tres benchmarks de código anteriores |
|
AutomationBench |
59,9% según Mistral |
Por delante de Kimi K3, MiMo-V2.6-Pro, DeepSeek V4 Pro |
657 flujos de trabajo empresariales en apps como Gmail, Slack y Salesforce |
|
AA-Briefcase |
1.393 Elo, citado por Mistral como AA |
Por delante de DeepSeek V4 Pro |
Trabajo de conocimiento de largo recorrido |
|
Dense 200 |
42% según Mistral |
GPT-6 Astra 41% |
Visual grounding |
|
AA Cyber Index |
Grok 4.7 56%, MiMo-V2.6-Pro 56%, GPT-6 Luna 53% |
Encontrar y arreglar fallos en software real |
|
|
CyberGym-E2E |
MiMo-V2.6-Pro 79%, GPT-6 Luna 78% |
Reproducir y parchear una vulnerabilidad real |
|
|
93% según Mistral |
"De las más altas" en pesos abiertos, según Mistral |
40 retos de competiciones de seguridad |
|
|
Finance Agent v2 |
Puesto 22 de 75, 7.º de 32 en pesos abiertos |
Tareas de agente financiero |
|
|
Harvey's Legal Agent |
#1 de 31 en pesos abiertos |
Tareas legales autónomas |
|
|
1,691 de 2 según Mistral |
La más alta entre los modelos abiertos que Mistral probó |
Comportamiento de IA responsable |
|
|
93,3% según Mistral |
"Sin puntuaciones más altas entre competidores", según Mistral |
Resistencia a prompt injection |
|
|
Vals Index |
9.º de 16 en pesos abiertos |
Índice agregado amplio de tareas |
Rankings de benchmarks de Mistral 4
Lee la última fila junto a la afirmación titular de Mistral. En el índice amplio de vals.ai, ML4 queda en el puesto 32 de 44 en general y 9.º de 16 si miramos solo modelos de pesos abiertos. Cuesta encajarlo con "competitivo con los modelos open source más fuertes a nivel global", al menos en agregado. Los resultados verticales de Mistral pintan bastante mejor, y no son falsos: simplemente miden algo más acotado. Si estás decidiendo si construir sobre ML4, el vertical que te importa pesa más que cualquier titular.
Codificación
La codificación es donde primero se ve la brecha entre titular y detalle. Las cifras de Mistral lucen bien a primera vista. Pero en su gráfico de DeepSWE verás algo que el texto no menciona: la barra más alta es Kimi K3, con 69%, siete puntos por encima de ML4. ML4 adelanta a GLM-5.3 (62% frente a 61%), pero un punto entra de sobra en el ruido por elección de harness. Un "harness" es el andamiaje que envuelve un modelo en un benchmark agente, es decir, herramientas, prompts y número de intentos; y en el gráfico de Mistral cada competidor corrió con uno distinto. En el ranking en vivo de DeepSWE de Datacurve, que ejecuta todos los modelos con la misma configuración, GLM-5.3 y Kimi K3 alcanzan 69% y DeepSeek V4 Pro llega a 63%. ML4 aún no aparece.
Terminal-Bench muestra el mismo efecto en sentido contrario. Mistral informa 28,3%, la ejecución independiente de vals.ai obtuvo 22,73%. No lo leo como inflar nada, solo como recordatorio de que un número de una sola configuración no es un ranking.
Las evaluaciones humanas son más interesantes. En una evaluación ciega encargada por Mistral a Surge AI, anotadores profesionales puntuaron salidas de código del 1 al 5. ML4 quedó segundo de cinco (3,74), por delante de GLM-5.3 (3,60), Kimi K3 (3,59) y GLM-5.2 (3,40), y muy por detrás de Claude Opus 5 (4,22). Ojo con Kimi K3: siete puntos por delante de ML4 en DeepSWE, por detrás en preferencia humana. Pasar tests y escribir código agradable de leer no son la misma habilidad. (Y eso es Opus 5, no el 5.5 más nuevo, así que la brecha con el mejor modelo cerrado probablemente sea mayor).
Una segunda evaluación interna de Mistral lo enreda más: encontró a ML4 "a la par o cerca" de GLM-5.3 en codificación y finanzas, y preferido solo en CAD y STEM. Yo diría que andan parejos.
Finanzas
Finanzas es más sencillo, en gran parte porque hay una cifra independiente a la que anclarse. ML4 obtiene 54,68% en Finance Agent v2 en vals.ai, que lo sitúa 22.º de 75 en general y 7.º de 32 entre modelos de pesos abiertos. Mitad de tabla con solvencia. La afirmación de Mistral es más acotada: que ML4 supera a GPT-6 Astra en este benchmark.
Mistral también reporta buenos resultados en FinWorkBench, que prueba si un modelo puede construir y editar hojas de cálculo para tareas reales de finanzas y contabilidad. Esas cifras provienen de los gráficos de Mistral y no han sido reproducidas aún.
Legal
Legal pinta mucho mejor sobre el papel. En el Harvey's Legal Agent Benchmark, ML4 ocupa el 6.º de 75 y primero entre 31 modelos de pesos abiertos. Su puntuación es 15,83%.
Lee ese número dos veces. Ser sexto del mundo en trabajo legal autónomo implica completar alrededor de una tarea de cada seis. El benchmark es duro y el ranking es real, pero nadie debería interpretar esto como "ML4 puede hacer trabajo legal sin supervisión". Aún no puede ningún modelo.
Visión y visual grounding
Visión es el caso opuesto: afirmaciones contundentes, sin datos independientes todavía. La afirmación principal es sobre visual grounding, que significa localizar objetos o regiones específicas en una imagen a partir de una descripción en texto, como "encuentra la soldadura agrietada en este plano" en lugar de "describe esta imagen". Mistral reporta 42% en Dense 200, justo por delante de GPT-6 Astra con 41%. No basaría una decisión de compra en un punto.
Mistral dice que ML4 también rinde bien en ChartQA Pro y GDP.pdf, un benchmark de razonamiento sobre documentos. Ninguno de los resultados de visión ha sido reproducido de forma independiente aún. Los casos de uso que Mistral destaca son mayoritariamente industriales: desde imágenes satelitales para respuesta a desastres hasta inspección de planos técnicos y escaneo de grandes imágenes geoespaciales.
¿Qué tal es Mistral Large 4 para programar?
Volvamos a la codificación, ya que es para lo que la mayoría usará ML4. Es competitivo entre los modelos de pesos abiertos, pero no es el mejor modelo de código disponible, ni siquiera el mejor abierto en el propio gráfico de Mistral. No repetiré los números. Así se traducen al trabajo real:
- Corregir problemas en una base de código real (ingeniería de software agente): usable, pero Kimi K3 parece más fuerte.
- Entender un repositorio grande: prometedor, aunque se apoya en una puntuación ejecutada en privado.
- Ejecuciones de agente largas, de varias horas: el setup de RL de Mistral está pensado para trayectorias largas, pero nadie lo ha probado de forma independiente aún.
- Trabajo intensivo en terminal: la señal independiente más débil por ahora.
Yo esperaría a la entrada de ML4 en el Coding Agent Index público de AA, prevista tras la publicación de los pesos, antes de llamarlo algo más que una opción abierta y creíble.
Lo que aportan aquí los pesos abiertos no tiene que ver con las puntuaciones. Una empresa puede ejecutar ML4 en su propia infraestructura y no enviar nunca código propietario a una API externa. Para agentes de código sobre repositorios confidenciales, eso por sí solo puede decantar la elección.
Mistral Large 4 para ciberseguridad
Esta es la afirmación más ambiciosa de Mistral. En el Artificial Analysis Cyber Index, la evaluación independiente de AA sobre cómo de bien encuentran, reproducen y parchean vulnerabilidades los modelos en software real, ML4 obtiene 50%. Eso lo sitúa en el top cinco de los 18 modelos probados. Solo Grok 4.7, MiMo-V2.6-Pro y GPT-6 Luna puntúan más alto, y GLM-5.3 Flash empata. Mistral afirma que ML4 "lidera por amplio margen entre los modelos de pesos abiertos desarrollados fuera de China", y el gráfico de AA es coherente con ello.
Lo más destacado es CyberGym-E2E, uno de los tres componentes del índice. Pide al modelo reproducir una vulnerabilidad real en software open source (un "CVE", es decir, un fallo de seguridad catalogado públicamente) y luego parchearla. ML4 logra 82%, primero de los 18 modelos que AA probó. Mistral también reporta 93% en Cybench, un conjunto de 40 retos de competiciones de seguridad, aunque nadie ha reproducido esa puntuación.
Los datos de negativas también son interesantes. En CyberGym-E2E, el gráfico de AA muestra que Claude Opus 5.5 se bloquea por motivos de seguridad en ~96% de las tareas, y GPT-6 Astra en el 100%. Esos modelos puntúan cerca de cero porque la tarea se rechaza, así que sus resultados no dicen nada de lo que podrían hacer realmente. Si negarse es la política correcta es otra discusión.
Y ahí está el núcleo del argumento de Mistral. El trabajo de seguridad defensiva a menudo empieza reproduciendo un fallo para probar que existe, y los equipos de seguridad necesitan hacerlo a escala, escaneando grandes bases de código y triando cientos de hallazgos. Un modelo que rechaza la mayor parte de esa carga de trabajo, o cuyo proveedor puede cambiar las reglas de moderación en mitad de un incidente, es un riesgo. El argumento declarado de Mistral es que ejecutar ML4 en tu propia infraestructura pone su comportamiento bajo tu control. El debate más amplio sobre salvaguardas de IA que bloquean trabajo defensivo legítimo lleva tiempo abierto.
Ahora, la parte mala: cuando los pesos sean públicos, los atacantes tendrán la misma capacidad. El índice de AA está deliberadamente orientado a la defensa (los modelos trabajan desde código fuente y nunca se les pide construir un exploit funcional), así que un 82% en reproducción no equivale a 82% de capacidad ofensiva. Aun así, la distancia entre "reproduce un crash" y "arma el fallo" no es infinita. Mistral está empleando las tres semanas previas al lanzamiento en hacer red teaming del modelo, es decir, forzarlo a comportarse mal a propósito, junto con "líderes de ciberseguridad, partners verificados y autoridades estatales".
Por qué importan los pesos abiertos en Mistral Large 4
El argumento de ciberseguridad es, en realidad, un argumento a favor de los pesos abiertos, y va mucho más allá de la seguridad. "Puedes descargar el modelo" se queda corto.
Un banco que ejecute ML4 en sus propios servidores no envía datos de clientes a Mistral. Un organismo público controla todo el entorno de despliegue. Un equipo de seguridad puede ajustar el comportamiento del modelo sin esperar a la política de moderación de un proveedor, lo cual, tras la sección anterior, no es una preocupación hipotética. Y si un proveedor cae o retira una versión del modelo, los despliegues autoalojados siguen funcionando.
Los pesos abiertos también hacen viable la personalización. Ya hablamos de Mistral Forge en abril, y Mistral afirma que ML4 "usa el mismo entorno de entrenamiento, personalización y RL" que ofrece a clientes enterprise a través de Forge. Para organizaciones que quieran afinar ML4 con sus propios datos, Forge es la vía obvia.
Una nota rápida sobre términos. Pesos abiertos significa que los parámetros entrenados del modelo están disponibles públicamente. No implica que los datos de entrenamiento, el código de entrenamiento u otros componentes se publiquen bajo licencia open source. La página del modelo de Mistral describe a ML4 como de pesos abiertos, pero no ha publicado los términos de la licencia. Hasta que lo haga, el uso comercial, los derechos de fine-tuning y la redistribución siguen en el aire. Resulta algo frustrante escribir "mira la licencia" sobre un modelo cuyo discurso es el control, pero así están las cosas.
Mistral Large 4 y el impulso europeo por la soberanía en IA
El control también está en el centro del mensaje político de Mistral. El presidente francés Macron ha descrito el enfoque de Mistral como "una tercera vía en IA". Las dos primeras vías son los modelos cerrados de EE. UU., capaces pero sujetos a la ley americana y a la política del proveedor, y los modelos abiertos chinos, a menudo capaces pero con preocupaciones de residencia de datos y geopolítica para instituciones europeas. La propuesta de Mistral es pesos abiertos, infraestructura europea y ley europea.
Eso incluye un despliegue europeo que Mistral dice operar "extremo a extremo, de forma independiente de otros proveedores de servicios digitales y bajo la legislación europea". Si estás sujeto al RGPD o a normas sectoriales de residencia de datos, contrasta esa afirmación con los acuerdos de tratamiento de datos de Mistral antes de fiarte.
Mistral también tiene dinero para respaldar la propuesta. Mistral presenta ML4 como "el primer hito en la hoja de ruta financiada por nuestra Serie D de 3.000 millones de euros", una ronda liderada por Samsung a una valoración de 21.000 millones de euros, que Mistral describe como la mayor ronda de equity jamás levantada por una tecnológica europea. La mayor parte se destina a capacidad de centros de datos en Europa.
Entonces, ¿puede Europa producir modelos de frontera a la vez que da más control a las organizaciones sobre dónde y cómo se ejecutan? ML4 es un dato contundente a favor de la parte del control. En la parte de frontera, el puesto 32 de 44 en el Vals Index dice que Europa aún no ha llegado.
Mistral Large 4 frente a otros modelos de pesos abiertos
Si Europa aún no está ahí, es justo preguntar quién sí lo está y cómo se compara ML4. No voy a poner las puntuaciones de cada modelo en una sola tabla, porque vienen de configuraciones distintas y mezclarlo daría a entender que son comparables. El recuento de parámetros tampoco es un buen proxy de capacidad. La tabla de abajo solo ubica cada uno:
|
Modelo |
Arquitectura |
Pesos disponibles |
Punto fuerte |
Origen |
|
Mistral Large 4 |
MoE, 1T total / 49B activos |
27 de octubre (previsto) |
Ciberseguridad, legal (con soporte independiente) |
Francia |
|
GLM-5.3 |
No divulgado |
Sí |
Codificación, STEM |
China |
|
DeepSeek V4 Pro |
MoE |
Sí |
Codificación, matemáticas |
China |
|
Reflection Beam |
No divulgado |
Sí |
Razonamiento general |
EE. UU. |
|
Qwen3.8 Max |
No divulgado |
No confirmado |
Multilingüe, codificación |
China |
Mistral Large 4 vs. GLM-5.3
La comparación que más importa, ya que GLM-5.3 es de los modelos abiertos chinos más fuertes. Como vimos en codificación, están a un punto en el gráfico de Mistral, las evaluaciones humanas se reparten, y GLM-5.3 marca 69% en el leaderboard en vivo donde ML4 aún no se ha probado. Empate hasta que haya tablas independientes con ambos.
Mistral Large 4 vs. DeepSeek V4 Pro
ML4 gana en todas las comparativas que publicó Mistral (DeepSWE, Coding Agent Index, AutomationBench, AA-Briefcase), pero ninguna está confirmada de forma independiente, y DeepSeek V4 Pro llega al 63% en el leaderboard en vivo de DeepSWE, por encima del 62% de ML4. No hay comparativa publicada en finanzas.
Mistral Large 4 vs. Reflection Beam
Reflection Beam es el otro contendiente occidental de pesos abiertos, lo que lo convierte en la prueba más directa de la afirmación de Mistral de ser "el mejor fuera de China". Los datos son escasos. El gráfico de DeepSWE de Mistral sitúa a Beam en 44%, casi 18 puntos por debajo de ML4, pero es un dato autoinformado comparado con una cifra ejecutada por AA; no me apoyaría en esa brecha. Reflection no ha divulgado el tamaño de Beam, así que tampoco es posible comparar por escala. ML4 sí tiene una entrada multimodal más amplia y evidencia publicada de ciberseguridad mucho más sólida.
¿Cuándo puedes usar Mistral Large 4?
No tienes que esperar a que se asienten esas comparativas para probar ML4 por tu cuenta. Este es el despliegue hasta ahora:
- 6 de octubre: comenzó la preview pública. Cualquiera puede llamar a mistral-large-4 vía Mistral Studio.
- Durante la preview: líderes de ciberseguridad, partners verificados y autoridades públicas reciben una versión con "moderación reducida y capacidades cibernéticas ampliadas" para red teaming. Pierre Stock dijo a TechCrunch que Mistral "trabajará con socios de confianza y gobiernos para asegurar que los pesos open source se puedan usar para defender, pero no para realizar ataques maliciosos". Mientras tanto, el entrenamiento por RL continúa, así que el modelo de la API sigue cambiando.
- 27 de octubre: está previsto que salgan los pesos junto con detalles arquitectónicos completos, más benchmarks y la metodología de post-entrenamiento de Mistral.
Actualizaré esta sección cuando se publiquen los pesos.
Lo que aún no sabemos de Mistral Large 4
Hasta entonces, quedan muchas incógnitas. Escribo esto el día del lanzamiento, así que la lista es larga:
- Rendimiento final en benchmarks: el RL sigue en curso, así que todas las puntuaciones de arriba podrían cambiar. Mistral espera "mejoras grandes y rápidas", pero nadie las ha medido aún.
- Resultados independientes en codificación, visión y trabajo de conocimiento: más allá del AA Cyber Index y vals.ai, no hay reproducciones.
- Precios: el anuncio y la página de docs discrepan, y las tarifas de la preview pueden no mantenerse.
- Términos de la licencia: no puedes construir un producto sobre "pesos abiertos" sin una licencia.
- Requisitos de hardware para autoalojar: no publicados.
- Arquitectura completa: prometida junto con los pesos, lo que quizá también explique la discrepancia de 49B frente a 52B en parámetros activos.
- Ventana de contexto: 1M tokens según los docs de Mistral, 512K según vals.ai.
- Evaluación final de seguridad: el red teaming se extiende hasta octubre.
Conclusión
Mistral Large 4 es un modelo disperso de 1 billón de parámetros con 49.000 millones activos, entrada multimodal y pesos abiertos en camino. En el día de lanzamiento, vemos que es el mejor modelo de pesos abiertos en el benchmark legal de Harvey, pero queda 32.º de 44 en el Vals Index y por detrás de Kimi K3 en el propio gráfico de codificación de Mistral.
No creo que el liderazgo en benchmarks sea realmente la apuesta de Mistral. La apuesta es que unos pesos abiertos capaces y el autoalojamiento son lo que más importa a empresas y gobiernos. Los datos de negativas en ciberseguridad son la evidencia más clara hasta ahora de que este paquete resuelve un problema que los equipos de seguridad ya tienen.
El 27 de octubre es la fecha a vigilar. Es cuando llegan los pesos, investigadores independientes podrán ejecutar el checkpoint final por sí mismos, y Artificial Analysis y vals.ai podrán probar el modelo que Mistral publique realmente en lugar de un preview que aún se está entrenando. Le Chonk o cumple lo prometido en su post de lanzamiento, o no.
Si quieres repasar los conceptos detrás de los modelos MoE, nuestro curso Introduction to Large Language Models cubre los fundamentos. Para más sobre los productos de Mistral, echa un vistazo a nuestra cobertura de Mistral Forge, Mistral Large 3, Mistral Le Chat y Mistral Vibe 2.0, su agente de codificación en terminal.
Redactor técnico especializado en IA, ML y ciencia de datos, que hace que las ideas complejas sean claras y accesibles.
FAQs
¿Qué es Mistral Large 4 (Le Chonk)?
Es el nuevo buque insignia de Mistral, lanzado en preview pública el 6 de octubre de 2026: un modelo Mixture-of-Experts con alrededor de 1 billón de parámetros totales y 49.000 millones activos por token. Acepta texto e imágenes, produce texto y tiene pesos abiertos previstos para el 27 de octubre.
¿Por qué se llama Le Chonk?
Es un guiño a "Le Chaton Fat", un modelo ficticio de 24 billones de parámetros que Mistral anunció en broma y luego borró en junio de 2026. La broma se extendió por las redes de IA y, cuando llegó un modelo real de billón de parámetros, el nombre se quedó.
¿En qué destaca Mistral Large 4?
Sus mejores resultados independientes están en ciberseguridad y trabajo legal. Se sitúa en el top cinco de 18 modelos en el Artificial Analysis Cyber Index y sexto de 75 en el Harvey's Legal Agent Benchmark, primero entre los modelos de pesos abiertos (ambos a 6 de octubre). En el índice amplio de vals.ai, queda 32.º de 44, así que la fortaleza por vertical y el rendimiento global cuentan historias distintas.
¿Mistral Large 4 es open source?
No. Es de pesos abiertos, que es distinto. Pesos abiertos significa que los parámetros del modelo están disponibles públicamente, pero no necesariamente los datos de entrenamiento, el código de entrenamiento u otros componentes. Mistral aún no ha publicado los términos de la licencia, así que consúltalos antes de construir un producto sobre el modelo.
¿Cuándo podré descargar los pesos de Mistral Large 4?
27 de octubre de 2026, según Axios. La API ya está disponible vía Mistral Studio, pero la preview sigue en aprendizaje por refuerzo, así que los pesos publicados diferirán de lo que sirve hoy la API.




