Pular para o conteúdo principal

Mistral Large 4 (Le Chonk): tudo o que sabemos

O modelo de 1 trilhão de parâmetros da Mistral, com pesos abertos, lidera em benchmarks de cibersegurança e jurídico.
Actualizado 9 de out. de 2026  · 15 min leer

Explore com IA

ChatGPTClaudePerplexity

Em 6 de outubro de 2026, a Mistral lançou uma prévia pública do Mistral Large 4 (ML4), um modelo com 1 trilhão de parâmetros, 49 bilhões ativos por token, entrada de texto e imagem, e pesos abertos prometidos até o fim do mês. É o maior modelo que a Mistral já construiu, treinado do zero em 3.800 GPUs Nvidia Grace Blackwell nos próprios data centers europeus da empresa.

Durante a maior parte do último ano, os modelos de pesos abertos mais fortes vieram de laboratórios chineses (GLM, DeepSeek, Kimi, Qwen), enquanto os modelos mais fortes no geral permaneceram fechados por trás de APIs dos EUA. A Mistral quer um terceiro caminho. Seu anúncio diz que o ML4 "já atinge desempenho competitivo com os modelos open-source mais fortes do mundo, superando significativamente qualquer modelo de pesos abertos desenvolvido nos EUA ou na Europa".

O quadro é mais complexo do que o post de lançamento sugere. Abaixo, eu explico a arquitetura, os benchmarks (separando o que já foi reproduzido de forma independente do que ainda não foi), código, visão, cibersegurança, pesos abertos e o que ainda não sabemos. Se você só tiver tempo para uma seção, vá de cibersegurança.

A resposta rápida

Mistral Large 4 (Le Chonk) é um modelo de pesos abertos com 1 trilhão de parâmetros que a Mistral apresenta como o mais forte construído fora da China, especialmente para cibersegurança, finanças, direito e visual grounding. Avaliações independentes sustentam as alegações em cibersegurança e direito, colocam finanças no meio do pelotão e classificam o ML4 em 32º de 44 modelos em um índice agregado amplo. A API já está no ar, e os pesos estão previstos para 27 de outubro.

O que é o Mistral Large 4 (Le Chonk)?

Essa versão curta deixa muita coisa de fora, então vamos ao básico. O ML4 é o novo carro-chefe da Mistral e, nas palavras da empresa, seu "maior e mais capaz modelo até hoje". Le Chonk é o apelido, embora o texto de lançamento da Mistral inverta a ordem usual: "Extraoficialmente ML4, muito oficialmente: le Chonk".

É um modelo MoE (Mixture-of-Experts) multimodal nativo. Os números de destaque são 1 trilhão de parâmetros totais e 49 bilhões ativos por token, embora a própria documentação do modelo liste números um pouco diferentes (1,05T totais, 52B ativos). Nenhuma das fontes explica a diferença. (Por que "ativos" importam está na próxima seção.)

A Mistral mira o ML4 em trabalho corporativo: coding, cibersegurança, finanças, jurídico, manufatura e engenharia, e tarefas visuais como ler desenhos técnicos ou imagens de satélite.

Especificação

Detalhe

Parâmetros totais

1 trilhão segundo o anúncio, 1,05T segundo a documentação

Parâmetros ativos

49B segundo o anúncio, 52B segundo a documentação

Arquitetura

Mixture-of-Experts, híbrido de instrução e raciocínio

Entrada

Texto e imagens

Saída

Somente texto

Janela de contexto

1M de tokens segundo a documentação, 512K segundo vals.ai (em aberto)

Duas linhas importam mais para quem planeja um deployment, e ambas estão indefinidas: a janela de contexto e a licença. Antes de entrar em como o modelo funciona, vale uma explicação rápida do nome.

Por que se chama Le Chonk?

Em junho de 2026, a Mistral publicou um anúncio satírico do "Le Chaton Fat", um modelo fictício com 24 trilhões de parâmetros, e depois apagou. A internet seguiu em frente mesmo assim, inflando as especificações para centenas de trilhões. Quatro meses depois, a Mistral entregou um modelo real de um trilhão de parâmetros, e o nome meio que se escolheu sozinho. É isso. De volta ao modelo.

Como o Mistral Large 4 funciona

A Mistral ainda não publicou os detalhes completos da arquitetura (prometidos junto com os pesos), então esta seção se limita ao que foi divulgado.

1 trilhão de parâmetros, 49 bilhões ativos

Um modelo com 1 trilhão de parâmetros não usa todos eles em cada token. Modelos MoE roteiam cada token por um pequeno subconjunto de sub-redes "especialistas", então o custo de inferência acompanha os 49 bilhões de parâmetros ativos. Isso o coloca mais perto de um modelo denso de ~50B do que de um 1T.

Barato de servir? Não. Todos os 1 trilhão de parâmetros ainda precisam estar na memória em algum lugar, então hospedar o ML4 por conta própria exige infraestrutura séria com múltiplas GPUs. Modelos MoE também são mais difíceis de servir com baixa latência do que modelos densos com a mesma contagem de parâmetros ativos. A Mistral não publicou requisitos de hardware, e eu ficaria surpreso se muitas equipes fora de grandes empresas e governos rodarem o modelo completo internamente.

Entrada multimodal

Esses parâmetros ativos lidam com mais do que texto. O ML4 aceita imagens também, embora só devolva texto. A Mistral diz que ele "raciocina com força sobre documentos complexos, gráficos e imagens naturais" e mira setores onde a percepção visual importa, como engenharia, manufatura e observação da Terra. As demos são todas industriais: inspecionar peças mecânicas em desenhos técnicos, extrair evidências de PDFs, vasculhar imagens de satélite em gigapixels atrás de objetos difíceis de encontrar.

160+ idiomas

Esses mesmos clientes industriais atuam muitas vezes além das fronteiras, e é aí que entra o idioma. A Mistral diz que uma "parcela significativa" dos dados de treinamento foi multilíngue, cobrindo mais de 160 idiomas e todos os oficiais da UE. Para uma empresa europeia cortejando governos europeus, isso é parte importante do discurso.

Infraestrutura de treinamento

Para um apelo europeu, onde o treinamento aconteceu também conta. Segundo a Mistral, o ML4 foi treinado do zero em 3.800 GPUs Nvidia Grace Blackwell nos seus próprios data centers europeus. O VP de Ciência da Mistral, Pierre Stock, deu à TechCrunch um número arredondado de 4.000 e disse que isso é "duas a três vezes menos do que nossos concorrentes chineses". Ninguém verificou essa comparação.

A ampliação de compute por trás disso é pública há um tempo. Em março de 2026, a Mistral levantou US$ 830 milhões em dívida para comprar 13.800 GPUs Nvidia GB300 para um data center perto de Paris. A Mistral não diz se o ML4 foi treinado naquele cluster especificamente, então não vou ligar os pontos.

Um detalhe muda como você deve ler todos os benchmarks deste artigo. A etapa de RL (reinforcement learning) ainda está em andamento. RL é a fase pós-treinamento em que o modelo melhora ao ser avaliado nas próprias tentativas de resolver tarefas, e a Mistral diz que sua corrida atualmente usa cerca de 3.000 GPUs, gera aproximadamente 33 bilhões de tokens por dia e "não mostra sinais de saturação". Então o modelo acessível hoje via API não será o mesmo cujos pesos serão liberados em 27 de outubro.

Benchmarks do Mistral Large 4

Esse RL inacabado é o primeiro motivo para tratar tudo nesta seção como preliminar. O segundo é que a maioria dos números da Mistral ainda não foi reproduzida de forma independente, e os que foram nem sempre batem.

As avaliações independentes no lançamento caem em três grupos:

  • Reproduzidos de forma independente: o Artificial Analysis (AA) Cyber Index, incluindo o componente CyberGym-E2E, e cinco avaliações do vals.ai, incluindo o Terminal-Bench 4.0.
  • Rodados pela AA, mas ainda não públicos: uma nota de rodapé nos gráficos de coding da Mistral diz que os scores do DeepSWE, Terminal-Bench e SWE-Atlas "usam os números avaliados privadamente pela Artificial Analysis antes do lançamento público do harness". Eles aparecerão no Coding Agent Index da AA quando esse harness for lançado. Até lá, ninguém fora a AA e a Mistral consegue verificar.
  • Só Mistral: todo o resto.

Preste mais atenção à última coluna da tabela. Um benchmark pode ser criado por um grupo independente enquanto o score do ML4 nele ainda é apenas uma alegação da Mistral.

Resumo dos benchmarks

Benchmark

Resultado do ML4

Concorrentes

O que mede

DeepSWE v1.1

61,7%, rodado privadamente pela AA

Kimi K3 69%, GLM-5.3 61%, DeepSeek V4 Pro 57%, Qwen3.8 Max 51%, Reflection Beam 44% (auto-reportado)

Engenharia de software de longo horizonte

Terminal-Bench 4.0

28,3% segundo a Mistral, 22,73% segundo o vals.ai

20º de 44 no vals.ai

Workflows complexos em terminal

SWE-Atlas-QnA

59,4%, rodado privadamente pela AA

Não publicado

Compreensão de repositórios

Coding Agent Index

49,8%, rodado privadamente pela AA

À frente de DeepSeek V4 Pro 0813 e Qwen3.8 Max

Composto dos três benchmarks de coding acima

AutomationBench

59,9% segundo a Mistral

À frente de Kimi K3, MiMo-V2.6-Pro, DeepSeek V4 Pro

657 workflows de negócios em apps como Gmail, Slack e Salesforce

AA-Briefcase

1.393 Elo, citado pela Mistral como AA

À frente de DeepSeek V4 Pro

Trabalho intelectual de longo horizonte

Dense 200

42% segundo a Mistral

GPT-6 Astra 41%

Visual grounding

AA Cyber Index

50%, top 5 de 18

Grok 4.7 56%, MiMo-V2.6-Pro 56%, GPT-6 Luna 53%

Encontrar e corrigir falhas em software real

CyberGym-E2E

82%, 1º de 18

MiMo-V2.6-Pro 79%, GPT-6 Luna 78%

Reproduzir e corrigir uma vulnerabilidade real

Cybench

93% segundo a Mistral

"Um dos mais altos" para pesos abertos, segundo a Mistral

40 desafios de competições de segurança

Finance Agent v2

54,68%

22º de 75, 7º de 32 com pesos abertos

Tarefas de agente financeiro

Harvey's Legal Agent

15,83%, 6º de 75

1º de 31 com pesos abertos

Tarefas jurídicas autônomas

KORA Benchmark

1,691 de 2 segundo a Mistral

Maior entre os modelos abertos testados pela Mistral

Comportamento de IA responsável

B3 Attack Resistance

93,3% segundo a Mistral

"Sem scores mais altos entre concorrentes", segundo a Mistral

Resistência a prompt injection

Vals Index

48,05%, 32º de 44

9º de 16 com pesos abertos

Agregado amplo entre tarefas

Rankings de benchmark do Mistral 4

Leia a última linha ao lado da alegação principal da Mistral. No índice amplo do vals.ai, o ML4 fica em 32º de 44 no geral e em 9º de 16 entre modelos só de pesos abertos. É difícil conciliar com "competitivo com os modelos open-source mais fortes do mundo", pelo menos no agregado. Os resultados verticais da Mistral parecem bem melhores, e não estão errados. Eles só medem algo mais específico. Se você está decidindo se deve construir em cima do ML4, o seu vertical importa mais do que qualquer manchete.

Coding

Coding é onde a distância entre a manchete e os detalhes aparece primeiro. Os números da Mistral parecem bons à primeira vista. Mas olhe o gráfico do DeepSWE e verá algo que o texto não cita. A barra mais alta é da Kimi K3, com 69%, sete pontos à frente do ML4. O ML4 supera o GLM-5.3 (62% versus 61%), mas um ponto está bem dentro do ruído da escolha de harness. "Harness" é a estrutura que envolve o modelo em um benchmark agentic: ferramentas, prompts e quantas tentativas ele tem; e no gráfico da Mistral cada concorrente rodou com um diferente. No ranking ao vivo do DeepSWE da Datacurve, que roda todo modelo no mesmo setup, GLM-5.3 e Kimi K3 chegam a 69% e o DeepSeek V4 Pro a 63%. O ML4 ainda não aparece.

O Terminal-Bench mostra o mesmo efeito pelo outro lado. A Mistral reporta 28,3%; o vals.ai obteve 22,73% em execução independente. Não leio isso como alguém inflando números, só um lembrete de que um número de um único setup não é ranking.

As avaliações humanas são mais interessantes. Em uma avaliação cega encomendada pela Mistral à Surge AI, anotadores profissionais deram notas de 1 a 5 para saídas de código, e o ML4 ficou em 2º de 5 (3,74), à frente de GLM-5.3 (3,60), Kimi K3 (3,59) e GLM-5.2 (3,40), e bem atrás do Claude Opus 5 (4,22). Repare na Kimi K3: sete pontos à frente do ML4 no DeepSWE, atrás na preferência humana. Passar testes e escrever código que as pessoas gostam de ler não são a mesma habilidade. (E é o Opus 5, não o 5.5 mais novo, então a distância para o melhor modelo fechado provavelmente é maior.)

Uma segunda avaliação interna da Mistral deixa tudo mais nebuloso. Ela achou o ML4 "no mesmo nível ou próximo" do GLM-5.3 em coding e finanças, e preferido apenas em CAD e STEM. Eu diria que os dois estão pau a pau.

Finanças

Finanças é mais simples, sobretudo porque há um número independente para ancorar. O ML4 marca 54,68% no Finance Agent v2 no vals.ai, que o coloca em 22º de 75 no geral e 7º de 32 entre modelos de pesos abertos. Meio de tabela. A alegação da Mistral é mais específica: que o ML4 supera o GPT-6 Astra nesse benchmark.

A Mistral também reporta bons resultados no FinWorkBench, que testa se um modelo consegue construir e editar planilhas para tarefas reais de finanças e contabilidade. Esses números vêm dos gráficos da Mistral e ainda não foram reproduzidos em outro lugar.

Jurídico

No papel, jurídico parece bem melhor. No Harvey's Legal Agent Benchmark, o ML4 fica em 6º de 75 e 1º entre 31 modelos de pesos abertos. Seu score é 15,83%.

Leia esse número duas vezes. Sexto lugar no mundo em trabalho jurídico autônomo significa concluir cerca de uma tarefa em cada seis. O benchmark é difícil e o ranking é real, mas ninguém deve interpretar isso como "o ML4 consegue fazer trabalho jurídico sem supervisão". Nenhum modelo consegue ainda.

Visão e visual grounding

Visão é o caso oposto: afirmações ousadas, nenhum dado independente por enquanto. A alegação principal é sobre visual grounding, que significa localizar objetos ou regiões específicos em uma imagem a partir de uma descrição em texto, como "encontre a solda trincada neste desenho" em vez de "descreva esta imagem". A Mistral reporta 42% no Dense 200, um ponto à frente do GPT-6 Astra com 41%. Eu não basearia uma decisão de compra em um ponto.

A Mistral diz que o ML4 também vai bem no ChartQA Pro e no GDP.pdf, um benchmark de raciocínio sobre documentos. Nenhum dos resultados de visão foi reproduzido de forma independente ainda. Os casos de uso destacados pela Mistral são majoritariamente industriais, de imagens de satélite para resposta a desastres a inspeção de desenhos técnicos e varredura de grandes imagens geoespaciais.

Quão bom é o Mistral Large 4 para coding?

Voltando a coding, já que é para isso que a maioria vai usar o ML4. Ele é competitivo entre modelos de pesos abertos, mas não é o melhor modelo de coding disponível, e nem o melhor aberto no próprio gráfico da Mistral. Não vou repetir os números. É assim que eles se traduzem no trabalho do dia a dia:

  • Corrigir issues em um codebase real (engenharia de software agentic): usável, mas a Kimi K3 parece mais forte.
  • Entender um repositório grande: promissor, embora dependa de um score rodado em privado.
  • Execuções agentic longas, de múltiplas horas: a configuração de RL da Mistral foi feita para trajetórias longas, mas ninguém testou isso independentemente ainda.
  • Trabalho pesado em terminal: o sinal independente mais fraco até agora.

Eu esperaria a entrada do ML4 no Coding Agent Index público da AA, prevista após a liberação dos pesos, antes de chamá-lo de algo além de uma opção aberta crível.

O que os pesos abertos agregam aqui não tem a ver com scores. Uma empresa pode rodar o ML4 na própria infraestrutura e nunca enviar código proprietário para uma API externa. Para agentes de coding em codebases confidenciais, só isso já pode decidir a escolha.

Mistral Large 4 para cibersegurança

Esta é a alegação mais ousada da Mistral. No Artificial Analysis Cyber Index, avaliação independente da AA sobre o quão bem os modelos encontram, reproduzem e corrigem vulnerabilidades em software real, o ML4 marca 50%. Isso o coloca no top 5 entre os 18 modelos testados. Só Grok 4.7, MiMo-V2.6-Pro e GPT-6 Luna ficam acima, e o GLM-5.3 Flash empata. A Mistral diz que o ML4 "lidera os modelos de pesos abertos desenvolvidos fora da China com ampla margem", e o gráfico da AA é consistente com isso.

O destaque é o CyberGym-E2E, um dos três componentes do índice. Ele pede que um modelo reproduza uma vulnerabilidade real em software open-source (um "CVE", ou seja, uma falha de segurança catalogada publicamente) e depois a corrija. O ML4 marca 82%, primeiro dos 18 modelos testados pela AA. A Mistral também reporta 93% no Cybench, um conjunto de 40 desafios de competições de segurança, embora ninguém tenha reproduzido esse score.

Os dados de recusa também chamam atenção. No CyberGym-E2E, o gráfico da AA mostra o Claude Opus 5.5 bloqueando por motivos de segurança em cerca de 96% das tarefas, e o GPT-6 Astra em 100%. Esses modelos pontuam perto de zero porque a tarefa é recusada, então seus scores não dizem nada sobre o que eles realmente poderiam fazer. Se recusar é a política certa é outra discussão.

E esse é o núcleo do pitch da Mistral. O trabalho de segurança defensiva muitas vezes começa reproduzindo uma falha para provar que ela existe, e times de segurança precisam fazer isso em volume, varrendo grandes codebases e triando centenas de achados. Um modelo que recusa a maior parte desse trabalho, ou cujo provedor pode mudar regras de moderação no meio de um incidente, é um risco. O argumento declarado da Mistral é que rodar o ML4 na sua própria infraestrutura coloca o comportamento sob seu controle. O debate mais amplo sobre salvaguardas de IA bloquearem trabalho defensivo legítimo já vem de longa data.

Agora o lado ruim: quando os pesos forem públicos, atacantes têm a mesma capacidade. O índice da AA é deliberadamente defensivo (os modelos trabalham a partir do código-fonte e nunca são convidados a construir um exploit funcional), então um score de 82% em reprodução não é 82% de capacidade ofensiva. Ainda assim, a distância de "reproduzir um crash" para "armazená-lo" não é infinita. A Mistral está usando as três semanas antes do lançamento para fazer red teaming do modelo, ou seja, tentar fazê-lo se comportar mal de propósito, com "líderes de cibersegurança, parceiros validados e autoridades estatais".

Por que os pesos abertos importam no Mistral Large 4

O caso de cibersegurança é, na verdade, um argumento para pesos abertos — e vai muito além de segurança. "Você pode baixar o modelo" é dizer pouco.

Um banco rodando o ML4 nos próprios servidores nunca envia dados de clientes para a Mistral. Um órgão público controla todo o ambiente de deployment. Um time de segurança pode ajustar o comportamento do modelo sem depender da política de moderação do provedor, o que, depois da seção anterior, não é uma hipótese. E se um provedor cair ou aposentar uma versão, deployments self-hosted continuam rodando.

Pesos abertos também tornam a personalização prática. Eu cobri o Mistral Forge em abril, e a Mistral diz que o ML4 "usa o mesmo ambiente de treinamento, customização e RL" que oferece a clientes enterprise via Forge. Para organizações que queiram ajustar o ML4 nos próprios dados, o Forge é o caminho natural.

Um esclarecimento rápido de termos. Pesos abertos significa que os parâmetros treinados do modelo estão publicamente disponíveis. Não significa que os dados de treinamento, o código de treinamento ou qualquer outra coisa sejam liberados sob licença open-source. A página do modelo da Mistral descreve o ML4 como de pesos abertos, mas não publicou os termos de licença. Até lá, uso comercial, direitos de fine-tuning e redistribuição seguem em aberto. É um pouco frustrante escrever "confira a licença" sobre um modelo cujo apelo é controle — mas é onde estamos.

Mistral Large 4 e a busca europeia por soberania em IA

Controle também está no centro do discurso político da Mistral. O presidente francês Macron descreveu a abordagem da Mistral como "um terceiro caminho em IA". Os dois primeiros caminhos são modelos fechados dos EUA, capazes mas sujeitos à lei americana e à política do provedor, e modelos abertos chineses, muitas vezes capazes, mas um problema de residência de dados e geopolítica para instituições europeias. A oferta da Mistral é: pesos abertos, infraestrutura europeia e legislação europeia.

Isso inclui um deployment europeu que a Mistral diz operar "de ponta a ponta, de forma independente de outros provedores de serviços digitais e sob a lei europeia". Se você está sob o GDPR ou regras setoriais de residência de dados, confira essa alegação frente aos acordos de processamento de dados da Mistral antes de confiar nela.

A Mistral também tem dinheiro para sustentar o plano. A empresa chama o ML4 de "o primeiro marco do roadmap financiado pela nossa Série D de €3 bilhões", uma rodada liderada pela Samsung a um valuation de €21 bilhões, que a Mistral descreve como a maior rodada de equity já levantada por uma empresa de tecnologia europeia. A maior parte vai para capacidade de data centers na Europa.

Então a Europa consegue produzir modelos de fronteira enquanto dá às organizações mais controle sobre onde e como eles rodam? O ML4 é um ponto forte a favor do lado do controle. No lado da fronteira, 32º de 44 no Vals Index diz que a Europa ainda não chegou lá.

Mistral Large 4 vs. outros modelos de pesos abertos

Se a Europa ainda não chegou lá, vale perguntar quem chegou, e como o ML4 se compara. Não vou colocar os scores de cada modelo em uma única tabela, já que vêm de setups diferentes e uma tabela combinada sugeriria comparabilidade. Contagens de parâmetros também não são proxy de capacidade.er. A tabela abaixo só posiciona cada um:

Modelo

Arquitetura

Pesos disponíveis

Ponto forte

Origem

Mistral Large 4

MoE, 1T total / 49B ativos

27 de outubro (planejado)

Cibersegurança, jurídico (com suporte independente)

França

GLM-5.3

Não divulgado

Sim

Coding, STEM

China

DeepSeek V4 Pro

MoE

Sim

Coding, matemática

China

Reflection Beam

Não divulgado

Sim

Raciocínio geral

EUA

Qwen3.8 Max

Não divulgado

Não confirmado

Multilíngue, coding

China

Mistral Large 4 vs. GLM-5.3

A comparação que mais importa, já que o GLM-5.3 é um dos modelos abertos chineses mais fortes. Como visto na seção de coding, eles estão a um ponto de distância no gráfico da Mistral, as avaliações humanas se dividem, e o GLM-5.3 bate 69% no ranking ao vivo onde o ML4 ainda não foi testado. Chame de empate até que rankings independentes incluam ambos.

Mistral Large 4 vs. DeepSeek V4 Pro

O ML4 vence todas as comparações publicadas pela Mistral (DeepSWE, Coding Agent Index, AutomationBench, AA-Briefcase), mas nenhuma foi confirmada independentemente, e o DeepSeek V4 Pro chega a 63% no ranking ao vivo do DeepSWE, acima dos 62% do ML4. Não há head-to-head publicado em finanças.

Mistral Large 4 vs. Reflection Beam

Reflection Beam é o outro concorrente ocidental de pesos abertos, o que o torna o teste mais direto da alegação da Mistral de "melhor fora da China". Os dados são escassos. O gráfico da Mistral para o DeepSWE coloca o Beam em 44%, quase 18 pontos abaixo do ML4, mas é um número auto-reportado comparado a um score rodado pela AA, então eu não me apoiaria nessa diferença. A Reflection não divulgou o tamanho do Beam, então a comparação de escala também não é possível. O ML4 tem entrada multimodal mais ampla e evidências publicadas de cibersegurança bem mais fortes.

Quando você pode usar o Mistral Large 4?

Você não precisa esperar essas comparações se assentarem para testar o ML4. Eis o cronograma até agora:

  1. 6 de outubro: começou a prévia pública. Qualquer um pode chamar mistral-large-4 via Mistral Studio.
  2. Durante a prévia: líderes de cibersegurança, parceiros validados e autoridades governamentais recebem uma versão com "moderação reduzida e capacidades cibernéticas expandidas" para red teaming. Pierre Stock disse à TechCrunch que a Mistral vai "trabalhar com parceiros confiáveis e governos para garantir que os pesos open source possam ser usados para defender, mas não para realizar ataques maliciosos". Enquanto isso, o treinamento de RL continua, então o modelo da API vai mudando.
  3. 27 de outubro: os pesos estão programados para serem liberados junto com detalhes completos da arquitetura, mais benchmarks e a metodologia de pós-treinamento da Mistral.

Vou atualizar esta seção quando os pesos saírem.

O que ainda não sabemos sobre o Mistral Large 4

Até lá, muita coisa segue em aberto. Estou escrevendo no dia do lançamento, então a lista é longa:

  • Desempenho final em benchmarks: o RL ainda roda, então cada score acima pode mudar. A Mistral espera "melhorias grandes e rápidas", mas ninguém mediu isso.
  • Resultados independentes em coding, visão e trabalho de conhecimento: além do AA Cyber Index e do vals.ai, nada foi reproduzido.
  • Preços: o anúncio e a página de documentação divergem, e as tarifas da prévia podem não valer depois.
  • Termos de licença: não dá para construir um produto só com "pesos abertos" sem uma licença.
  • Requisitos de hardware para self-hosting: não publicados.
  • Arquitetura completa: prometida com os pesos, o que também pode explicar a divergência de 49B vs. 52B parâmetros ativos.
  • Janela de contexto: 1M de tokens segundo a documentação da Mistral, 512K segundo o vals.ai.
  • Avaliação final de segurança: red teaming vai até outubro.

Conclusão

O Mistral Large 4 é um modelo esparso com 1 trilhão de parâmetros, 49 bilhões ativos, entrada multimodal e pesos abertos a caminho. No dia do lançamento, vemos que ele é o melhor modelo de pesos abertos no benchmark jurídico da Harvey, mas fica em 32º de 44 no Vals Index e atrás da Kimi K3 no próprio gráfico de coding da Mistral.

Eu não acho que a aposta da Mistral seja liderar benchmarks. A aposta é que pesos abertos capazes e self-hosting são o que empresas e governos mais valorizam. Os dados de recusa em cibersegurança são a evidência mais clara até agora de que esse pacote resolve um problema que os times de segurança já têm.

27 de outubro é a data para ficar de olho. É quando os pesos saem, pesquisadores independentes rodam o checkpoint final por conta própria, e a Artificial Analysis e o vals.ai podem testar o modelo que a Mistral realmente liberar, em vez de uma prévia que ainda está em treinamento. Le Chonk confirma o post de lançamento — ou não.

Para entender os conceitos por trás de modelos MoE, nosso curso Introduction to Large Language Models cobre os fundamentos. Para saber mais sobre os produtos da Mistral, veja nossa cobertura do Mistral Forge, Mistral Large 3, Mistral Le Chat e do Mistral Vibe 2.0, seu agente de coding no terminal.


Oluseye Jeremiah's photo
Author
Oluseye Jeremiah
LinkedIn

Escritor técnico especializado em IA, ML e ciência de dados, tornando ideias complexas claras e acessíveis.

FAQs

O que é o Mistral Large 4 (Le Chonk)?

É o novo carro-chefe da Mistral, lançado em prévia pública em 6 de outubro de 2026: um modelo Mixture-of-Experts com cerca de 1 trilhão de parâmetros totais e 49 bilhões ativos por token. Recebe texto e imagens, produz texto e tem pesos abertos previstos para 27 de outubro.

Por que se chama Le Chonk?

É uma referência ao "Le Chaton Fat", um modelo fictício de 24 trilhões de parâmetros que a Mistral anunciou de brincadeira — e depois apagou — em junho de 2026. A piada se espalhou pelas redes de IA e, quando chegou um modelo real de um trilhão de parâmetros, o nome veio junto.

Em que o Mistral Large 4 é melhor?

Seus resultados independentes mais fortes são em cibersegurança e trabalho jurídico. Ele fica no top 5 de 18 modelos no Artificial Analysis Cyber Index e em sexto de 75 no Harvey's Legal Agent Benchmark, primeiro entre os modelos de pesos abertos (ambos em 6 de outubro). No amplo Vals Index, ele fica em 32º de 44, então força em verticais e desempenho geral contam histórias diferentes.

O Mistral Large 4 é open source?

Não. Ele é de pesos abertos, o que é diferente. Pesos abertos significam que os parâmetros do modelo estão disponíveis publicamente, mas não necessariamente os dados de treinamento, o código de treinamento ou outros componentes. A Mistral ainda não publicou os termos de licença, então confira-os antes de construir um produto com o modelo.

Quando posso baixar os pesos do Mistral Large 4?

27 de outubro de 2026, segundo a Axios. A API já está disponível via Mistral Studio, mas a prévia ainda está em reinforcement learning, então os pesos liberados serão diferentes do que a API serve hoje.

Temas
Inteligência Artificial

Aprenda com a DataCamp

Curso

Entendendo a inteligência artificial

2 h
427.3K
Aprenda os conceitos básicos da Inteligência Artificial, como aprendizado de máquina, aprendizado profundo, PNL, IA generativa e outros.
Ver detalhesRight Arrow
Começar Curso
Ver maisRight Arrow
Relacionado

blog

O que é o Mistral Large 2? Como funciona, casos de uso e muito mais

O Mistral Large 2 é o modelo de idioma mais recente da Mistral AI, competindo com modelos como GPT-4o, Llama 3.1 e Claude 3 Opus.
Ryan Ong's photo

Ryan Ong

8 min

blog

A OpenAI anuncia o GPT-4 Turbo com visão: O que sabemos até o momento

Descubra a atualização mais recente da OpenAI, GPT-4 Turbo com visão, e seus principais recursos, incluindo o corte de conhecimento aprimorado, uma janela de contexto expandida, preço acessível e muito mais.
Richie Cotton's photo

Richie Cotton

7 min

blog

Tudo o que sabemos sobre o GPT-5

Saiba como o GPT-5 evoluirá para um sistema unificado com recursos avançados, visando um lançamento no verão de 2025, com base no mais recente roteiro da OpenAI e no histórico do GPT.
Josep Ferrer's photo

Josep Ferrer

8 min

An avian AI exits its cage

blog

12 Alternativas de código aberto ao GPT-4

GPT-4 alternativas de código aberto que podem oferecer desempenho semelhante e exigem menos recursos computacionais para serem executadas. Esses projetos vêm com instruções, fontes de código, pesos de modelos, conjuntos de dados e interface de usuário do chatbot.
Abid Ali Awan's photo

Abid Ali Awan

9 min

Tutorial

Guia de Introdução ao Ajuste Fino de LLMs

O ajuste fino dos grandes modelos de linguagem (LLMs, Large Language Models) revolucionou o processamento de linguagem natural (PLN), oferecendo recursos sem precedentes em tarefas como tradução de idiomas, análise de sentimentos e geração de textos. Essa abordagem transformadora aproveita modelos pré-treinados como o GPT-2, aprimorando seu desempenho em domínios específicos pelo processo de ajuste fino.
Josep Ferrer's photo

Josep Ferrer

11 min

Tutorial

Visão GPT-4: Um guia abrangente para iniciantes

Este tutorial apresentará tudo o que você precisa saber sobre o GPT-4 Vision, desde o acesso a ele, passando por exemplos práticos do mundo real, até suas limitações.
Arunn Thevapalan's photo

Arunn Thevapalan

12 min

Ver MaisVer Mais