Pular para o conteúdo principal

NVIDIA Nemotron 3.5 Lightning: recursos, benchmarks e acesso

O NVIDIA Nemotron 3.5 Lightning é um modelo MoE aberto de 30B com 3B de parâmetros ativos, feito para execução rápida e em alto volume por agentes. Recursos, benchmarks e preços.
Atualizado 23 de set. de 2026  · 10 min lido

Explorar com IA

ChatGPTClaudePerplexity

Grande parte das conversas sobre IA agentiva foca nos modelos de raciocínio de fronteira que fazem o planejamento.

O argumento da NVIDIA com o Nemotron 3.5 Lightning é que o modelo de fronteira é a ferramenta errada para a maior parte do que um agente realmente faz.

Agentes de longa duração gastam a maior parte do orçamento de tokens em chamadas de ferramentas, validação de saídas e delegação para subagentes — e rodar um modelo de fronteira em cada uma dessas etapas é caro e lento.

Lançado em 11 de agosto de 2026, o Nemotron 3.5 Lightning é um modelo aberto mixture-of-experts (MoE) de 30B com 3B de parâmetros ativos, projetado exatamente para essa camada de execução.

A NVIDIA afirma que ele vence a fronteira de Pareto entre precisão e velocidade no Artificial Analysis Intelligence Index, e reporta até 4x mais velocidade de saída que modelos de porte similar. Ele é distribuído sob a licença permissiva OpenMDW-1.1 com pesos, dados de treino e receitas disponibilizados.

Neste artigo, vou cobrir tudo que há de novo no Nemotron 3.5 Lightning, seus recursos e os benchmarks. Se você quer ver como um MoE de porte parecido se comporta na prática, nosso tutorial sobre fine-tuning do Qwen3.6 em um dataset de perguntas e respostas médicas mostra o fluxo de trabalho de ponta a ponta.

Nemotron 3.5 Lightning em poucas palavras

  • O Nemotron 3.5 Lightning é um MoE aberto de 30B com 3B de parâmetros ativos, lançado em 11 de agosto de 2026, feito para a camada de execução em alto volume de agentes always-on.
  • A NVIDIA alega até 4x mais velocidade de saída que modelos de tamanho similar e 10.000 tarefas concluídas 30% mais rápido que o Qwen3.6-35B com precisão parecida.
  • Principais benchmarks (BF16): SWE-bench Verified 51,56; PinchBench 85,37; GPQA Diamond 75,44; MMLU Pro 81,94.
  • Chega sob a OpenMDW-1.1 com pesos, dados e receitas, e roda em hardware que vai do Jetson ao DGX Spark e a data centers.
  • O NeMo Switchyard direciona a execução para o Lightning e o planejamento para modelos de fronteira como o Nemotron 3 Ultra.

O que é o Nemotron 3.5 Lightning?

O Nemotron 3.5 Lightning é o menor membro da família aberta de modelos Nemotron 3 da NVIDIA, criado especificamente para execução de alto volume e baixa latência em agentes autônomos.

Ele usa uma arquitetura híbrida Mamba-2 + MoE + attention, com 30B de parâmetros totais e 3B ativos por token, e suporta janelas de contexto de até 1M de tokens.

É o design MoE que o torna rápido.

Um roteador envia cada token para apenas alguns de seus vários experts, então só uma fração dos parâmetros roda por token.

Você obtém a capacidade de um modelo denso maior com o custo computacional de um menor — a mesma troca feita pelo Qwen3.6-35B-A3B com seus 3B de parâmetros ativos.

A grande afirmação da NVIDIA é mais posicional que um único número: no Artificial Analysis Intelligence Index, que combina 9 avaliações em tarefas agentivas, código, raciocínio científico e inteligência geral, o Lightning fica na fronteira de Pareto entre precisão e velocidade para modelos abertos pequenos.

Em termos simples, nada na sua faixa de tamanho é ao mesmo tempo mais preciso e mais rápido.

O que há de novo no Nemotron 3.5 Lightning?

Os recursos aqui servem a um objetivo: executar o trabalho rotineiro de um agente com rapidez, sem o modelo tropeçar na precisão.

Veja o que dá para fazer na prática.

Rode agentes capazes em hardware local

Como o modelo é pequeno o suficiente para ser implantado em um NVIDIA DGX Spark, GeForce RTX 5090 ou Jetson, você pode rodar workloads agentivos em um desktop, sem data center.

A NVIDIA trabalhou com a EXO Labs para perfilar o Lightning no DGX Spark e reporta que ele está na fronteira de Pareto para modelos abertos pequenos no ranking local.ai da EXO Labs.

Para quem está na prática, isso significa que um agente always-on, lidando com chamadas de ferramentas e validação de resultados, pode rodar no hardware que você já tem.

Você também pode servi-lo via LM Studio, llama.cpp, Ollama e Unsloth, então o ecossistema local já chega maduro no lançamento.

Direcione execução para baixo e planejamento para cima com o NeMo Switchyard

A NVIDIA está lançando o NeMo Switchyard junto com o modelo — uma biblioteca que direciona cada requisição para o modelo mais eficiente que consegue atendê-la.

O Switchyard expõe o Nemotron 3.5 Lightning como alvo de roteamento ao lado dos seus modelos abertos e fechados, de modo que o planejamento sobe para um modelo de fronteira como o Nemotron 3 Ultra, enquanto a execução desce para o Lightning.

O ganho prático é eficiência de tokens.

Em vez de pagar tarifa de modelo de fronteira para rodar um git pull, validar a saída de uma ferramenta ou formatar um resultado, essas chamadas caem no modelo barato, e o caro fica reservado para os passos difíceis de planejamento, que dominam a qualidade, mas não o volume.

Personalize direto de fábrica

Modelos menores fazem fine-tuning mais rápido, mais barato e em hardware mais modesto do que os grandes — e o Lightning foi feito para ser adaptado a um trabalho específico.

A NVIDIA liberou pesos, dados de treino e receitas sob a OpenMDW-1.1, e você pode fazer fine-tuning com LoRA ou SFT completo usando o NeMo Automodel e o NeMo Megatron Bridge, ou rodar reinforcement learning com o NeMo RL e o NeMo Gym.

O lançamento também inclui o Nemotron-RL Agentic Terminal Pivot, um dataset aberto de RL agentivo usado para treinar parte do comportamento de agentes de código.

Há um ponto voltado à comunidade que vale destacar.

A MindStudio reporta fine-tuning feito por parceiros em menos de 3 horas por cerca de US$ 100 — um custo de adaptação que só faz sentido com um modelo desse porte.

Decodificação especulativa para maior throughput

O Lightning gera múltiplos tokens por passo via decodificação especulativa, em que um modelo de rascunho propõe tokens que são então revisados com eficiência.

Ele passou por uma etapa dedicada de pré-treinamento para incorporar a predição multi-token (MTP) ao modelo, seguida de uma fase de reforço de MTP — a mesma abordagem usada no Nemotron 3 Super e no Ultra.

Além do MTP, a NVIDIA fornece dois modelos de rascunho.

O DSpark é indicado para DGX Spark e workloads de data center com baixa concorrência, enquanto o MTP atende concorrência média a alta, e um modelo de rascunho DFlash também é fornecido para você comparar qual rende melhor no seu padrão de serving.

Benchmarks do Nemotron 3.5 Lightning

A NVIDIA reporta pontuações tanto para os checkpoints BF16 quanto NVFP4, e ambos se acompanham de perto na maioria das tarefas — o que importa porque o NVFP4 é o checkpoint quantizado que você realmente implantaria. Os números abaixo vêm do próprio model card e do post de lançamento da NVIDIA. Não havia reprodução independente de terceiros no momento da escrita, então trate-os como dados do fornecedor.

SWE-bench Verified

O Lightning marca 51,56 (BF16) e 52,80 (NVFP4) no SWE-bench Verified, um benchmark que mede se um modelo consegue resolver issues reais do GitHub produzindo um patch de código funcional. Para um MoE de 30B com 3B de parâmetros ativos, passar de 50% é um resultado sólido e dá suporte direto ao caso de uso de agentes de código.

O SWE-bench Multilingual vem mais baixo, em 39,33 (BF16), o que é esperado dada a maior dificuldade e diversidade de bases de código multilíngues.

PinchBench e eficiência em tarefas

No PinchBench, o Lightning alcança 85,37 (BF16) e 83,43 (NVFP4), e o OpenRouter reporta que ele conclui 10.000 tarefas 30% mais rápido que o Qwen3.6-35B com precisão semelhante. 

Esse é o benchmark que melhor captura a proposta do modelo, já que a eficiência de um agente depende de quão rápido o modelo termina trabalhos úteis — e não apenas da velocidade bruta de geração de tokens.

A comparação com o Qwen3.6 merece atenção. Quando analisamos o Qwen3.6-35B-A3B, destacamos seus 3B de parâmetros ativos e o bom desempenho em SWE-bench e Terminal-Bench, então a NVIDIA escolhê-lo como referência é um duelo justo na mesma faixa de tamanho.

GPQA Diamond e raciocínio

O Lightning marca 75,44 (BF16) no GPQA Diamond sem ferramentas — um conjunto de perguntas de ciência em nível de pós-graduação, feito para ser difícil até para não especialistas mesmo com acesso à web.

É um número forte para um modelo pequeno, embora o model card deixe claro que o Lightning não se posiciona como motor de raciocínio.

O Humanity's Last Exam (apenas texto, sem ferramentas) mostra o outro lado da moeda com 11,72 (BF16), e o SciCode fica em 32,60.

Essas pontuações mais baixas estão alinhadas com o enquadramento da NVIDIA: este é um modelo de execução, e o raciocínio aberto difícil deve ser roteado para um modelo de fronteira.

Agentividade e seguimento de instruções

O Terminal-Bench 2.1 fica em 24,58 (BF16) e o BrowseComp em 36,97, enquanto o IFBench (loose) chega a 71,88, mostrando que o modelo segue instruções estruturadas com confiabilidade.

O conhecimento geral também se sustenta, com o MMLU Pro em 81,94 (BF16) e 81,62 (NVFP4) — uma diferença desprezível que confirma que o checkpoint quantizado é seguro para produção.

Nemotron 3.5 Lightning vs Qwen3.6-35B-A3B

Ambos são modelos MoE com 3B de parâmetros ativos voltados para código e workloads agentivos, então um comparativo lado a lado é a forma mais clara de ver onde o Lightning se encaixa.

Atributo Nemotron 3.5 Lightning Qwen3.6-35B-A3B
Parâmetros totais / ativos 30B / 3B 35B / 3B
Janela de contexto Até 1M de tokens 262K tokens
SWE-bench Verified 51,56 (BF16) Forte (segundo nossa análise)
Licença OpenMDW-1.1 (aberta) Aberta
Posicionamento Camada de execução de agentes Código, raciocínio, longo contexto

Preço e disponibilidade do Nemotron 3.5 Lightning

Você pode testar o Nemotron 3.5 Lightning no build.nvidia.com ou via OpenRouter, e baixar os pesos no Hugging Face e no ModelScope. O modelo expõe endpoints compatíveis com OpenAI via NVIDIA NIM, incluindo /v1/chat/completions, /v1/completions e /v1/responses, então ele entra em pipelines agentivos existentes sem reescritas.

Os preços hospedados variam por provedor:

  • DeepInfra: US$ 0,05 por 1M de tokens de entrada e US$ 0,20 por 1M de tokens de saída, disponível no dia zero sem provisionamento de GPU.
  • OpenRouter: um nível grátis listado a US$ 0 de entrada e US$ 0 de saída, mas observe que, embora a rota suporte janela de contexto de 1M de tokens, ela impõe um limite de 65.536 tokens máximos na geração de saída.
  • Self-hosted: grátis sob a OpenMDW-1.1, implantável via vLLM, SGLang e TensorRT-LLM.

Vale observar esse limite do OpenRouter. O contexto de 1M é uma capacidade do modelo, mas o limite prático depende do provedor e da rota — confira o endpoint antes de assumir que terá a janela completa.

Considerações finais

O Nemotron 3.5 Lightning revela a aposta da NVIDIA: o futuro de agentes em produção é um sistema de modelos, onde um modelo barato de execução faz o volume e um modelo de fronteira faz o planejamento. Lançar o NeMo Switchyard junto é a pista — o modelo só faz sentido se você conseguir rotear o trabalho com inteligência.

O que acho mais útil é a clareza sobre o escopo. A NVIDIA não finge que este é um modelo de raciocínio, e os benchmarks confirmam: forte no SWE-bench Verified (51,56) e no PinchBench (85,37), modesto no Humanity's Last Exam (11,72). Se o seu workload é chamar ferramentas, validar e formatar em agentes always-on, essa troca é exatamente a certa.

O lançamento aberto sob OpenMDW-1.1 com pesos, dados e receitas — mais um checkpoint pequeno o suficiente para rodar em um DGX Spark — torna o modelo realmente útil para times que querem fazer fine-tuning e hospedar por conta própria em vez de pagar por token. A principal ressalva é que todos os números atuais de benchmark são do fornecedor; eu aguardaria reprodução independente antes de tratar as alegações de 4x de velocidade e 30% de conclusão mais rápida como liquidadas.

Se você quer desenvolver as habilidades de fine-tuning para adaptar um modelo como este ao seu workload, nosso tutorial sobre fine-tuning do Qwen3.6 em um dataset de perguntas e respostas médicas cobre o fluxo QLoRA em um MoE comparável, passo a passo.

FAQs

Como o Nemotron 3.5 Lightning se compara a outros modelos Nemotron?

O Nemotron 3.5 Lightning é o menor membro da família Nemotron 3 da NVIDIA, feito para execução em alto volume e baixa latência, e não para planejamento complexo. Modelos de fronteira como o Nemotron 3 Ultra cuidam da orquestração e do raciocínio difícil, enquanto o Lightning assume a execução rotineira, como chamadas de ferramentas, validação e formatação. O NeMo Switchyard distribui o trabalho entre eles, levando o planejamento para cima e a execução para baixo.

Onde posso acessar o Nemotron 3.5 Lightning?

Você pode testá-lo no build.nvidia.com ou via OpenRouter, e baixar os pesos no Hugging Face e no ModelScope. Ele está disponível desde o dia zero em provedores hospedados como o DeepInfra, e pode ser auto-hospedado via vLLM, SGLang e TensorRT-LLM. Ferramentas locais como LM Studio, llama.cpp, Ollama e Unsloth também são suportadas.

Quais são os preços do Nemotron 3.5 Lightning?

O DeepInfra lista a US$ 0,05 por 1M de tokens de entrada e US$ 0,20 por 1M de tokens de saída. O OpenRouter oferece um nível gratuito com US$ 0 de entrada e US$ 0 de saída, limitado a 65.536 tokens máximos nessa rota. O modelo também é gratuito para auto-hospedagem sob a licença OpenMDW-1.1.

Para que o Nemotron 3.5 Lightning é mais indicado?

Ele foi criado para a camada de execução de agentes autônomos de longa duração: chamadas de ferramentas, validação de resultados, recuperação, formatação, sumarização e classificação. A NVIDIA e parceiros deixam claro que ele não é indicado para chat aberto ou raciocínio profundo — isso deve ser roteado para um modelo de fronteira.

O Nemotron 3.5 Lightning é open source?

Sim. A NVIDIA liberou pesos, dados de treino e receitas sob a licença OpenMDW-1.1, descrita como permissiva e pronta para uso comercial. Ele vem com checkpoint BF16 e um NVFP4 quantizado, além de um dataset aberto de RL agentivo chamado Nemotron-RL Agentic Terminal Pivot.


Matt Crabtree's photo
Author
Matt Crabtree
LinkedIn

Escritor e editor de conteúdo na área de edtech. Comprometido com a exploração de tendências de dados e entusiasmado com o aprendizado da ciência de dados.

Tópicos
Inteligência Artificial
Modelos de idiomas grandes

Principais cursos da DataCamp

Programa

Deploy Production-Ready Agents

2 h
Deploy AI agents to production using Google's ADK, Vertex AI Agent Engine, Cloud Run, and Memory Bank for persistent cross-session state.
Ver detalhesRight Arrow
Iniciar Curso
Ver maisRight Arrow
Relacionado

blog

A OpenAI anuncia o GPT-4 Turbo com visão: O que sabemos até o momento

Descubra a atualização mais recente da OpenAI, GPT-4 Turbo com visão, e seus principais recursos, incluindo o corte de conhecimento aprimorado, uma janela de contexto expandida, preço acessível e muito mais.
Richie Cotton's photo

Richie Cotton

7 min

An avian AI exits its cage

blog

12 Alternativas de código aberto ao GPT-4

GPT-4 alternativas de código aberto que podem oferecer desempenho semelhante e exigem menos recursos computacionais para serem executadas. Esses projetos vêm com instruções, fontes de código, pesos de modelos, conjuntos de dados e interface de usuário do chatbot.
Abid Ali Awan's photo

Abid Ali Awan

9 min

blog

Os 7 melhores geradores de vídeo com IA para 2026, com vídeos de exemplo

Conheça os melhores geradores de vídeo com IA disponíveis hoje, incluindo RunwayML, Synthesia, Colossyan, Pictory, DeepBrain AI, Invideo e os super esperados Sora e Veo da DeepMind.
Dr Ana Rojo-Echeburúa's photo

Dr Ana Rojo-Echeburúa

9 min

Tutorial

Como fazer o ajuste fino do GPT 3.5: Liberando todo o potencial da IA

Explore o GPT-3.5 Turbo e descubra o potencial transformador do ajuste fino. Saiba como personalizar esse modelo de linguagem avançado para aplicativos de nicho, aprimorar seu desempenho e entender os custos associados, a segurança e as considerações de privacidade.
Moez Ali's photo

Moez Ali

11 min

Tutorial

Guia de Introdução ao Ajuste Fino de LLMs

O ajuste fino dos grandes modelos de linguagem (LLMs, Large Language Models) revolucionou o processamento de linguagem natural (PLN), oferecendo recursos sem precedentes em tarefas como tradução de idiomas, análise de sentimentos e geração de textos. Essa abordagem transformadora aproveita modelos pré-treinados como o GPT-2, aprimorando seu desempenho em domínios específicos pelo processo de ajuste fino.
Josep Ferrer's photo

Josep Ferrer

11 min

Tutorial

DCLM-7B da Apple: Configuração, exemplo de uso, ajuste fino

Comece a usar o modelo de linguagem grande DCLM-7B da Apple e saiba como configurá-lo, usá-lo e ajustá-lo para tarefas específicas.
Dimitri Didmanidze's photo

Dimitri Didmanidze

9 min

Ver MaisVer Mais