Ir al contenido principal

NVIDIA Nemotron 3.5 Lightning: características, benchmarks y acceso

NVIDIA Nemotron 3.5 Lightning es un modelo MoE abierto de 30B con 3B de parámetros activos, diseñado para una ejecución rápida y a gran volumen en agentes. Características, benchmarks y precios.
Actualizado 23 sept 2026  · 10 min leer

Explorar con IA

ChatGPTClaudePerplexity

La mayoría de conversaciones sobre IA agentiva se centra en los modelos de razonamiento de frontera que hacen la planificación.

La apuesta de NVIDIA con Nemotron 3.5 Lightning es que el modelo de frontera no es la herramienta adecuada para la mayor parte de lo que hace un agente.

Los agentes de larga duración consumen la mayor parte del presupuesto de tokens en llamadas a herramientas, validación de salidas y delegación a subagentes, y ejecutar un modelo de frontera en cada paso sale caro y es lento.

Nemotron 3.5 Lightning, lanzado el 11 de agosto de 2026, es un modelo abierto mixture-of-experts (MoE) de 30B con 3B de parámetros activos, pensado específicamente para esa capa de ejecución.

NVIDIA afirma que sitúa el modelo en la frontera de Pareto precisión-velocidad en el Artificial Analysis Intelligence Index y reporta hasta 4x más velocidad de salida que modelos de tamaño similar. Se distribuye con la permisiva licencia OpenMDW-1.1, con pesos, datos de entrenamiento y recetas publicados.

En este artículo, repaso todo lo nuevo de Nemotron 3.5 Lightning, sus funciones y los benchmarks. Si quieres ver cómo se comporta en la práctica un MoE de tamaño parecido, nuestro tutorial sobre fine-tuning de Qwen3.6 en un dataset de preguntas y respuestas médicas cubre el flujo de trabajo de principio a fin.

Nemotron 3.5 Lightning en pocas palabras

  • Nemotron 3.5 Lightning es un MoE abierto de 30B con 3B de parámetros activos, lanzado el 11 de agosto de 2026, creado para la capa de ejecución de alto volumen en agentes siempre activos.
  • NVIDIA afirma hasta 4x más velocidad de salida que modelos de tamaño similar y 10.000 tareas completadas un 30% más rápido que Qwen3.6-35B con precisión comparable.
  • Benchmarks clave (BF16): SWE-bench Verified 51,56; PinchBench 85,37; GPQA Diamond 75,44; MMLU Pro 81,94.
  • Se distribuye bajo OpenMDW-1.1 con pesos, datos y recetas, y funciona en hardware desde Jetson y DGX Spark hasta centros de datos.
  • NeMo Switchyard envía la ejecución a Lightning y la planificación a modelos de frontera como Nemotron 3 Ultra.

¿Qué es Nemotron 3.5 Lightning?

Nemotron 3.5 Lightning es el miembro más pequeño de la familia de modelos abiertos Nemotron 3 de NVIDIA, diseñado específicamente para ejecución de alto volumen y baja latencia en agentes autónomos.

Usa una arquitectura híbrida Mamba-2 + MoE + atención, con 30B de parámetros totales y 3B activos por token, y admite una ventana de contexto de hasta 1M de tokens.

El diseño MoE es lo que lo hace rápido.

Un enrutador envía cada token solo a algunos de sus muchos expertos, de modo que por token se ejecuta una fracción de los parámetros.

Obtienes la capacidad de un modelo denso mayor al coste computacional de uno pequeño, el mismo intercambio que plantea Qwen3.6-35B-A3B con sus 3B de parámetros activos.

La gran afirmación de NVIDIA es más posicional que un único número: en el Artificial Analysis Intelligence Index, que combina 9 evaluaciones de tareas agentivas, programación, razonamiento científico e inteligencia general, Lightning se sitúa en la frontera de Pareto entre precisión y velocidad para modelos abiertos pequeños.

Dicho en claro: en su categoría de tamaño, no hay nada que sea a la vez más preciso y más rápido.

¿Qué hay de nuevo en Nemotron 3.5 Lightning?

Todas las funciones persiguen un objetivo: ejecutar rápido el trabajo rutinario de un agente sin que el modelo caiga en precisión.

Esto es lo que puedes hacer realmente con él.

Ejecuta agentes capaces en hardware local

Como el modelo es lo bastante pequeño para desplegarse en un NVIDIA DGX Spark, una GeForce RTX 5090 o un Jetson, puedes ejecutar workloads agentivos en un sobremesa sin necesidad de un centro de datos.

NVIDIA trabajó con EXO Labs para perfilar Lightning en DGX Spark y afirma que se sitúa en la frontera de Pareto para modelos abiertos pequeños en el leaderboard local.ai de EXO Labs.

Para los practicantes, esto significa que un agente siempre activo que gestione llamadas a herramientas y validación de resultados puede correr en el hardware que ya tienes.

También puedes servirlo a través de LM Studio, llama.cpp, Ollama y Unsloth, así que el ecosistema local llega muy maduro desde el lanzamiento.

Deriva la ejecución hacia abajo y la planificación hacia arriba con NeMo Switchyard

NVIDIA lanza junto al modelo NeMo Switchyard, una librería que enruta cada solicitud al modelo más eficiente capaz de manejarla.

Switchyard expone Nemotron 3.5 Lightning como destino de enrutado junto a tus modelos abiertos y cerrados, de modo que la planificación sube a un modelo de frontera como Nemotron 3 Ultra mientras que la ejecución baja a Lightning.

La ganancia práctica es eficiencia de tokens.

En lugar de pagar tarifas de modelo de frontera para hacer un git pull, validar la salida de una herramienta o dar formato a un resultado, esas llamadas se envían al modelo barato, y el caro se reserva para los pasos de planificación difíciles que dominan la calidad pero no el volumen.

Personalízalo desde el primer día

Los modelos pequeños se ajustan más rápido, más barato y en hardware más modesto que los grandes, y Lightning está hecho para adaptarse a un trabajo específico.

NVIDIA publicó los pesos, los datos de entrenamiento y las recetas bajo OpenMDW-1.1, y puedes hacer fine-tuning con LoRA o SFT completo usando NeMo Automodel y NeMo Megatron Bridge, o ejecutar aprendizaje por refuerzo con NeMo RL y NeMo Gym.

El lanzamiento también incluye Nemotron-RL Agentic Terminal Pivot, un dataset abierto de RL agentivo usado para entrenar parte del comportamiento como agente de código.

Una nota para la comunidad que me parece relevante.

MindStudio reporta ajustes por parte de partners completados en menos de 3 horas por unos 100 $, un coste de adaptación que solo tiene sentido con un modelo de este tamaño.

Decodificación especulativa para mayor throughput

Lightning genera varios tokens por paso mediante decodificación especulativa, donde un modelo borrador propone tokens que luego se validan de forma eficiente.

Pasó por una fase específica de preentrenamiento para integrar la predicción multi-token (MTP) en el modelo, seguida de una fase de refuerzo de MTP, el mismo enfoque usado en Nemotron 3 Super y Ultra.

Además de MTP, NVIDIA distribuye dos modelos borrador.

DSpark se recomienda para DGX Spark y cargas en centros de datos con baja concurrencia, mientras que MTP es adecuado para concurrencia media-alta, y también se ofrece un modelo borrador DFlash para que puedas comparar cuál rinde mejor en tu patrón de servicio.

Benchmarks de Nemotron 3.5 Lightning

NVIDIA publica resultados tanto para los checkpoints BF16 como NVFP4, y ambos siguen una trayectoria muy similar en la mayoría de tareas, algo importante porque NVFP4 es el checkpoint cuantizado que realmente desplegarías. Las cifras siguientes proceden de la model card y el blog de lanzamiento de NVIDIA. No había reproducciones independientes de terceros en el momento de escribir, así que trátalas como datos del proveedor.

SWE-bench Verified

Lightning logra 51,56 (BF16) y 52,80 (NVFP4) en SWE-bench Verified, un benchmark que mide si un modelo puede resolver issues reales de GitHub produciendo un parche funcional. Para un MoE de 30B con 3B activos, superar el 50% es un resultado sólido y respalda directamente el caso de uso como agente de código.

SWE-bench Multilingual baja a 39,33 (BF16), algo esperado por la mayor dificultad del conjunto multilingüe.

PinchBench y eficiencia en tareas

En PinchBench, Lightning alcanza 85,37 (BF16) y 83,43 (NVFP4), y OpenRouter informa de que completa 10.000 tareas un 30% más rápido que Qwen3.6-35B con precisión similar. 

Este es el benchmark que mejor refleja la propuesta del modelo, ya que la eficiencia de un agente depende de lo rápido que termina trabajo útil, no solo de la velocidad de generación de tokens.

La comparación con Qwen3.6 merece atención. Cuando analizamos Qwen3.6-35B-A3B, destacamos sus 3B de activos y su buen rendimiento en SWE-bench y Terminal-Bench, así que NVIDIA lo toma como referencia en una comparación entre pares de la misma categoría.

GPQA Diamond y razonamiento

Lightning obtiene 75,44 (BF16) en GPQA Diamond sin herramientas, un conjunto de preguntas de ciencia a nivel de posgrado redactadas para ser difíciles incluso con acceso web.

Es una cifra fuerte para un modelo pequeño, aunque la model card deja claro que Lightning no se posiciona como motor de razonamiento.

Humanity's Last Exam (solo texto, sin herramientas) cuenta la otra cara con 11,72 (BF16), y SciCode queda en 32,60.

Estos resultados más bajos encajan con el enfoque de NVIDIA: es un modelo de ejecución, y el razonamiento abierto difícil debe derivarse a un modelo de frontera.

Capacidades agentivas e instrucciones

Terminal-Bench 2.1 queda en 24,58 (BF16) y BrowseComp en 36,97, mientras que IFBench (loose) alcanza 71,88, lo que muestra que el modelo sigue instrucciones estructuradas de forma fiable.

El conocimiento general también aguanta, con MMLU Pro en 81,94 (BF16) y 81,62 (NVFP4), una brecha mínima que confirma que el checkpoint cuantizado es seguro para producción.

Nemotron 3.5 Lightning vs Qwen3.6-35B-A3B

Ambos son modelos MoE con 3B de parámetros activos orientados a programación y workloads agentivos, así que una comparativa directa es la mejor forma de ver dónde encaja Lightning.

Atributo Nemotron 3.5 Lightning Qwen3.6-35B-A3B
Parámetros totales / activos 30B / 3B 35B / 3B
Ventana de contexto Hasta 1M de tokens 262K tokens
SWE-bench Verified 51,56 (BF16) Sólido (según nuestro análisis)
Licencia OpenMDW-1.1 (abierta) Abierta
Posicionamiento Capa de ejecución de agentes Programación, razonamiento, contexto largo

Precio y disponibilidad de Nemotron 3.5 Lightning

Puedes probar Nemotron 3.5 Lightning en build.nvidia.com o a través de OpenRouter, y descargar los pesos desde Hugging Face y ModelScope. El modelo expone endpoints compatibles con OpenAI mediante NVIDIA NIM, incluidos /v1/chat/completions, /v1/completions y /v1/responses, por lo que encaja en pipelines agentivos existentes sin reescrituras.

El precio en hosting varía según el proveedor:

  • DeepInfra: 0,05 $ por 1M de tokens de entrada y 0,20 $ por 1M de tokens de salida, disponible desde el primer día sin aprovisionar GPU.
  • OpenRouter: un plan gratuito listado a 0 $ entrada y 0 $ salida, pero ten en cuenta que, aunque la ruta admite la ventana de 1M de tokens, impone un límite de 65.536 tokens máximos en la generación de salida.
  • Autoalojado: gratis bajo OpenMDW-1.1, desplegable con vLLM, SGLang y TensorRT-LLM.

Ese límite de OpenRouter conviene tenerlo presente. La longitud de contexto de 1M es una capacidad del modelo, pero el tope práctico depende del proveedor y de la ruta, así que verifica el endpoint antes de asumir que tienes la ventana completa.

Conclusiones

Nemotron 3.5 Lightning refleja una apuesta concreta de NVIDIA: que el futuro de los agentes en producción será un sistema de modelos, donde uno barato hace el volumen de ejecución y uno de frontera hace la planificación. El lanzamiento simultáneo de NeMo Switchyard lo deja claro, porque el modelo solo cobra sentido si puedes enrutar el trabajo con inteligencia.

Lo más útil es la claridad sobre su alcance. NVIDIA no pretende que sea un modelo de razonamiento, y los benchmarks lo confirman: fuerte en SWE-bench Verified (51,56) y PinchBench (85,37), modesto en Humanity's Last Exam (11,72). Si tu carga es llamadas a herramientas, validación y formateo en agentes siempre activos, ese intercambio es el adecuado.

El lanzamiento abierto bajo OpenMDW-1.1 con pesos, datos y recetas, además de un checkpoint lo bastante pequeño para ejecutarse en un DGX Spark, lo hace realmente útil para equipos que quieran hacer fine-tuning y autoalojar en lugar de pagar por token. La salvedad principal es que todas las cifras actuales de benchmarks son del proveedor, así que querría reproducciones independientes antes de dar por sentadas las afirmaciones de 4x en velocidad y 30% en finalización más rápida.

Si quieres desarrollar las habilidades de fine-tuning para adaptar un modelo así a tu propio workload, nuestro tutorial sobre fine-tuning de Qwen3.6 en un dataset de Q&A médico cubre paso a paso el flujo QLoRA en un MoE comparable.

FAQs

¿Cómo se compara Nemotron 3.5 Lightning con otros modelos Nemotron?

Nemotron 3.5 Lightning es el miembro más pequeño de la familia Nemotron 3 de NVIDIA, diseñado para ejecución de alto volumen y baja latencia en lugar de planificación compleja. Los modelos de frontera como Nemotron 3 Ultra se encargan de la orquestación y el razonamiento difícil, mientras que Lightning gestiona la ejecución rutinaria como llamadas a herramientas, validación y formateo. NeMo Switchyard enruta el trabajo entre ellos para que la planificación suba y la ejecución baje.

¿Dónde puedo acceder a Nemotron 3.5 Lightning?

Puedes probarlo en build.nvidia.com o a través de OpenRouter, y descargar los pesos desde Hugging Face y ModelScope. Está disponible desde el primer día en proveedores de hosting como DeepInfra, y se puede autoalojar con vLLM, SGLang y TensorRT-LLM. También es compatible con herramientas locales como LM Studio, llama.cpp, Ollama y Unsloth.

¿Cuáles son los precios de Nemotron 3.5 Lightning?

DeepInfra lo lista a 0,05 $ por 1M de tokens de entrada y 0,20 $ por 1M de tokens de salida. OpenRouter ofrece un plan gratuito a 0 $ entrada y 0 $ salida, limitado a 65.536 tokens máximos en esa ruta. El modelo también es gratuito para autoalojar bajo la licencia OpenMDW-1.1.

¿Para qué es mejor utilizar Nemotron 3.5 Lightning?

Está pensado para la capa de ejecución de agentes autónomos de larga duración: llamadas a herramientas, validación de resultados, recuperación, formateo, resumen y clasificación. NVIDIA y sus partners son claros al decir que no está destinado a chat abierto ni a razonamiento profundo, que deberían dirigirse a un modelo de frontera.

¿Nemotron 3.5 Lightning es de código abierto?

Sí. NVIDIA publicó los pesos, los datos de entrenamiento y las recetas bajo la licencia OpenMDW-1.1, descrita como permisiva y apta para uso comercial. Se distribuye con un checkpoint BF16 y otro cuantizado NVFP4, además de un dataset abierto de RL agentivo llamado Nemotron-RL Agentic Terminal Pivot.


Matt Crabtree's photo
Author
Matt Crabtree
LinkedIn

Escritora y editora de contenidos en el ámbito de la tecnología educativa. Comprometido con la exploración de tendencias de datos y entusiasmado con el aprendizaje de la ciencia de datos.

Temas
Inteligencia Artificial
Grandes modelos lingüísticos

Los mejores cursos de DataCamp

programa

Deploy Production-Ready Agents

2 h
Deploy AI agents to production using Google's ADK, Vertex AI Agent Engine, Cloud Run, and Memory Bank for persistent cross-session state.
Ver detallesRight Arrow
Iniciar Curso
Ver másRight Arrow
Relacionado

blog

¿Qué es Mistral Large 2? Cómo funciona, casos de uso y más

Mistral Large 2 es el último modelo lingüístico de Mistral AI, que compite con modelos como GPT-4o, Llama 3.1 y Claude 3 Opus.
Ryan Ong's photo

Ryan Ong

8 min

An avian AI exits its cage

blog

12 alternativas de código abierto a GPT-4

Alternativas de código abierto a GPT-4 que pueden ofrecer un rendimiento similar y requieren menos recursos informáticos para funcionar. Estos proyectos vienen con instrucciones, fuentes de código, pesos del modelo, conjuntos de datos e IU de chatbot.
Abid Ali Awan's photo

Abid Ali Awan

9 min

Tutorial

Cómo ajustar GPT 3.5: Liberar todo el potencial de la IA

Explore GPT-3.5 Turbo y descubra el potencial transformador del ajuste fino. Aprenda a personalizar este modelo de lenguaje avanzado para aplicaciones especializadas, mejore su rendimiento y comprenda los costes asociados, la seguridad y las consideraciones de privacidad.
Moez Ali's photo

Moez Ali

11 min

Tutorial

Tutorial Mistral 7B: Guía paso a paso para utilizar y ajustar Mistral 7B

El tutorial cubre el acceso, la cuantización, el ajuste fino, la fusión y el almacenamiento de este potente modelo lingüístico de código abierto con 7300 millones de parámetros.
Abid Ali Awan's photo

Abid Ali Awan

12 min

Tutorial

DCLM-7B de Apple: Configuración, Ejemplo de uso, Ajuste fino

Empieza a utilizar el gran modelo de lenguaje DCLM-7B de Apple y aprende a configurarlo, utilizarlo y ajustarlo para tareas específicas.
Dimitri Didmanidze's photo

Dimitri Didmanidze

9 min

Tutorial

Tutorial de DeepSeek-Coder-V2: Ejemplos, instalación, puntos de referencia

DeepSeek-Coder-V2 es un modelo de lenguaje de código de código abierto que rivaliza con el rendimiento de GPT-4, Gemini 1.5 Pro, Claude 3 Opus, Llama 3 70B o Codestral.
Dimitri Didmanidze's photo

Dimitri Didmanidze

8 min

Ver MásVer Más