Weiter zum Inhalt

NVIDIA Nemotron 3.5 Lightning: Funktionen, Benchmarks und Zugang

NVIDIA Nemotron 3.5 Lightning ist ein offenes 30B-MoE-Modell mit 3B aktiven Parametern, entwickelt für schnelle, hochvolumige Agentenausführung. Funktionen, Benchmarks und Preise.
Aktualisiert 23. Sept. 2026  · 10 Min. lesen

Mit KI erkunden

ChatGPTClaudePerplexity

Die meisten Gespräche über agentische KI konzentrieren sich auf die Frontier-Reasoning-Modelle, die die Planung übernehmen.

Die These von NVIDIA mit Nemotron 3.5 Lightning lautet: Das Frontier-Modell ist für das meiste, was ein Agent tatsächlich tut, das falsche Werkzeug.

Laufende Agents verbrauchen den Großteil ihres Token-Budgets für Toolaufrufe, Output-Validierung und die Delegation an Subagenten. Für jeden dieser Schritte ein Frontier-Modell laufen zu lassen, ist teuer und langsam.

Nemotron 3.5 Lightning, veröffentlicht am 11. August 2026, ist ein offenes 30B-Mixture-of-Experts-(MoE)-Modell mit 3B aktiven Parametern, das gezielt auf diese Ausführungsebene zielt.

NVIDIA behauptet, auf dem Artificial Analysis Intelligence Index die Pareto-Front beim Verhältnis von Genauigkeit zu Geschwindigkeit zu erreichen und meldet bis zu 4x Ausgabegeschwindigkeit gegenüber ähnlich großen Modellen. Es wird unter der permissiven OpenMDW-1.1-Lizenz mit veröffentlichten Gewichten, Trainingsdaten und Recipes ausgeliefert.

In diesem Artikel gehe ich auf alles Neue bei Nemotron 3.5 Lightning ein, stelle die Funktionen vor und beleuchte die Benchmarks. Wenn du sehen willst, wie sich ein ähnlich großes MoE-Modell in der Praxis verhält, führt unser Tutorial zum Fine-Tuning von Qwen3.6 auf einem medizinischen Q&A-Datensatz den Workflow Ende-zu-Ende durch.

Nemotron 3.5 Lightning auf einen Blick

  • Nemotron 3.5 Lightning ist ein offenes 30B-MoE-Modell mit 3B aktiven Parametern, veröffentlicht am 11. August 2026, entwickelt für die hochvolumige Ausführungsebene stets aktiver Agents.
  • NVIDIA meldet bis zu 4x Ausgabegeschwindigkeit gegenüber ähnlich großen Modellen und 10.000 erledigte Aufgaben 30% schneller als Qwen3.6-35B bei vergleichbarer Genauigkeit.
  • Wichtige Benchmarks (BF16): SWE-bench Verified 51,56, PinchBench 85,37, GPQA Diamond 75,44, MMLU Pro 81,94.
  • Es kommt unter OpenMDW-1.1 mit Gewichten, Daten und Recipes und läuft auf Hardware von Jetson über DGX Spark bis hin zu Rechenzentren.
  • NeMo Switchyard leitet Ausführungsarbeit an Lightning und Planung an Frontier-Modelle wie Nemotron 3 Ultra.

Was ist Nemotron 3.5 Lightning?

Nemotron 3.5 Lightning ist das kleinste Mitglied der offenen Nemotron 3-Modellfamilie von NVIDIA, speziell gebaut für latenzarme, hochvolumige Ausführung in autonomen Agents.

Es nutzt eine hybride Architektur aus Mamba-2 + MoE + Attention mit insgesamt 30B Parametern und 3B aktiven pro Token und unterstützt eine Kontextlänge von bis zu 1 Mio. Tokens.

Das MoE-Design macht es schnell.

Ein Router schickt jedes Token nur an wenige seiner vielen Experten, sodass pro Token nur ein Bruchteil der Parameter läuft.

Du erhältst die Kapazität eines größeren dichten Modells zu den Rechenkosten eines kleinen — derselbe Trade-off, den Qwen3.6-35B-A3B mit seinen 3B aktiven Parametern macht.

Die große Aussage von NVIDIA ist eher positionell als ein Einzelscore: Auf dem Artificial Analysis Intelligence Index, der 9 Evaluierungen über agentische Aufgaben, Coding, wissenschaftliches Reasoning und allgemeine Intelligenz kombiniert, liegt Lightning bei kleinen offenen Modellen auf der Genauigkeits-Geschwindigkeits-Pareto-Front.

Einfach gesagt: In seiner Größenklasse gibt es nichts, das gleichzeitig genauer und schneller ist.

Was ist neu an Nemotron 3.5 Lightning?

Alle Features dienen einem Ziel: die Routinearbeit eines Agents schnell abwickeln, ohne dass die Genauigkeit leidet.

Das kannst du konkret damit tun.

Leistungsfähige Agents auf lokaler Hardware betreiben

Weil das Modell klein genug ist, um auf einem NVIDIA DGX Spark, einer GeForce RTX 5090 oder einem Jetson zu laufen, kannst du agentische Workloads auf dem Desktop ohne Rechenzentrum betreiben.

NVIDIA hat mit EXO Labs Lightning auf DGX Spark profiliert und berichtet, dass es auf der Pareto-Front für kleine offene Modelle auf dem local.ai-Leaderboard von EXO Labs liegt.

Für Praktiker heißt das: Ein stets aktiver Agent, der Toolaufrufe und Ergebnisvalidierung übernimmt, kann auf Hardware laufen, die du bereits besitzt.

Außerdem lässt es sich über LM Studio, llama.cpp, Ollama und Unsloth bereitstellen — das lokale Tooling ist zum Launch also bereits ausgereift.

Ausführung nach unten und Planung nach oben mit NeMo Switchyard routen

NVIDIA veröffentlicht parallel NeMo Switchyard, eine Bibliothek, die jede Anfrage an das effizienteste Modell routet, das sie bewältigen kann.

Switchyard exponiert Nemotron 3.5 Lightning als Routing-Ziel neben deinen offenen und geschlossenen Modellen, sodass Planung nach oben an ein Frontier-Modell wie Nemotron 3 Ultra geht, während Ausführung nach unten an Lightning geht.

Der praktische Effekt ist Tokeneffizienz.

Statt Frontier-Preise zu zahlen, um ein git pull auszuführen, einen Tool-Output zu validieren oder ein Ergebnis zu formatieren, landen diese Aufrufe auf dem günstigen Modell, und das teure Modell bleibt den harten Planungsschritten vorbehalten, die die Qualität dominieren, aber nicht das Volumen.

Out of the box anpassen

Kleine Modelle lassen sich schneller, günstiger und auf bescheidenerer Hardware feinjustieren als große, und Lightning ist dafür gebaut, auf einen konkreten Job angepasst zu werden.

NVIDIA hat Gewichte, Trainingsdaten und Recipes unter OpenMDW-1.1 veröffentlicht. Du kannst mit LoRA oder per vollem SFT mit NeMo Automodel und NeMo Megatron Bridge feinjustieren oder mit NeMo RL und NeMo Gym Reinforcement Learning fahren.

Zum Release gehört auch Nemotron-RL Agentic Terminal Pivot, ein offener agentischer RL-Datensatz, der für Teile des Coding-Agent-Verhaltens genutzt wurde.

Ein community-relevanter Punkt, den ich hervorheben möchte.

MindStudio berichtet von Partner-Fine-Tuning in unter 3 Stunden für rund 100 US-Dollar — ein Anpassungsaufwand, der nur mit einem Modell dieser Größe sinnvoll ist.

Spekulatives Decoding für höheren Durchsatz

Lightning generiert mehrere Tokens pro Schritt über spekulatives Decoding, bei dem ein Draft-Modell Tokens vorschlägt, die anschließend effizient überprüft werden.

Es durchlief eine dedizierte Pretraining-Phase, um Multi-Token-Prediction (MTP) im Modell zu verankern, gefolgt von einer MTP-Boosting-Phase — derselbe Ansatz wie bei Nemotron 3 Super und Ultra.

Über MTP hinaus liefert NVIDIA zwei Draft-Modelle mit.

DSpark wird für DGX Spark und Workloads mit geringer Parallelität im Rechenzentrum empfohlen, während MTP mittlere bis hohe Parallelität adressiert. Ein DFlash-Draft-Modell ist ebenfalls enthalten, damit du benchmarken kannst, welches für dein Serving-Muster am besten performt.

Nemotron 3.5 Lightning Benchmarks

NVIDIA meldet Scores sowohl für die BF16- als auch die NVFP4-Checkpoints, und beide liegen über die meisten Aufgaben eng beieinander. Das ist wichtig, weil NVFP4 der quantisierte Checkpoint ist, den du tatsächlich ausrollen würdest. Die Zahlen unten stammen aus NVIDIAs eigener Model Card und dem Launch-Blog. Unabhängige Reproduktionen lagen zum Zeitpunkt des Schreibens nicht vor, daher diese Werte als vendor-publiziert betrachten.

SWE-bench Verified

Lightning erzielt 51,56 (BF16) und 52,80 (NVFP4) auf SWE-bench Verified — ein Benchmark, der misst, ob ein Modell reale GitHub-Issues durch funktionierende Code-Patches lösen kann. Für ein 30B-MoE mit 3B aktiven Parametern ist >50% ein starkes Ergebnis und unterstützt den Coding-Agent-Use-Case direkt.

SWE-bench Multilingual liegt erwartungsgemäß niedriger bei 39,33 (BF16), was an der schwierigeren, mehrsprachigen Codebasis liegt.

PinchBench und Aufgabeneffizienz

Auf PinchBench erreicht Lightning 85,37 (BF16) und 83,43 (NVFP4), und OpenRouter meldet, dass 10.000 Aufgaben 30% schneller abgeschlossen werden als mit Qwen3.6-35B bei ähnlicher Genauigkeit. 

Dieser Benchmark trifft den Pitch des Modells am besten, denn Agenteneffizienz hängt davon ab, wie schnell ein Modell nützliche Arbeit abschließt — nicht von der reinen Token-Generationsgeschwindigkeit.

Der Vergleich mit Qwen3.6 lohnt sich. In unserem Review zu Qwen3.6-35B-A3B haben wir die 3B aktiven Parameter sowie starke SWE-bench- und Terminal-Bench-Leistungen hervorgehoben. NVIDIAs Wahl als Referenzpunkt ist also ein fairer Vergleich in derselben Größenklasse.

GPQA Diamond und Reasoning

Lightning erzielt 75,44 (BF16) auf GPQA Diamond ohne Tools — ein Set aus wissenschaftlichen Fragen auf Graduierungsniveau, die selbst mit Webzugang für Nicht-Expert:innen schwer sind.

Das ist für ein kleines Modell eine starke Zahl, wenngleich die Model Card klarstellt, dass Lightning nicht als Reasoning-Engine positioniert ist.

Humanity's Last Exam (nur Text, keine Tools) zeigt die andere Seite mit 11,72 (BF16), und SciCode liegt bei 32,60.

Diese niedrigeren Werte passen zu NVIDIAs Einordnung: Das ist ein Ausführungsmodell, und hartes, offenendes Reasoning soll stattdessen an ein Frontier-Modell geroutet werden.

Agentik und Instruktionsbefolgung

Terminal-Bench 2.1 liegt bei 24,58 (BF16) und BrowseComp bei 36,97, während IFBench (loose) 71,88 erreicht — das zeigt, dass das Modell strukturierte Anweisungen zuverlässig befolgt.

Auch Allgemeinwissen ist solide: MMLU Pro mit 81,94 (BF16) und 81,62 (NVFP4). Die vernachlässigbare Lücke bestätigt, dass der quantisierte Checkpoint sicher einsetzbar ist.

Nemotron 3.5 Lightning vs. Qwen3.6-35B-A3B

Beide sind MoE-Modelle mit 3B aktiven Parametern, ausgerichtet auf Coding- und agentische Workloads. Ein Direktvergleich zeigt am klarsten, wo Lightning passt.

Attribut Nemotron 3.5 Lightning Qwen3.6-35B-A3B
Gesamt-/aktive Parameter 30B / 3B 35B / 3B
Kontextfenster Bis zu 1 Mio. Tokens 262K Tokens
SWE-bench Verified 51,56 (BF16) Stark (laut unserem Review)
Lizenz OpenMDW-1.1 (offen) Offen
Positionierung Ausführungsebene von Agents Coding, Reasoning, langer Kontext

Nemotron 3.5 Lightning: Preise und Verfügbarkeit

Du kannst Nemotron 3.5 Lightning auf build.nvidia.com oder über OpenRouter testen und die Gewichte von Hugging Face und ModelScope herunterladen. Das Modell stellt über NVIDIA NIM OpenAI-kompatible Endpunkte bereit, darunter /v1/chat/completions, /v1/completions und /v1/responses, sodass es ohne Umschreiben in bestehende agentische Pipelines passt.

Gehostete Preise variieren je nach Anbieter:

  • DeepInfra: 0,05 US-Dollar pro 1 Mio. Input-Tokens und 0,20 US-Dollar pro 1 Mio. Output-Tokens, ab Tag 0 verfügbar ohne GPU-Bereitstellung.
  • OpenRouter: Eine Gratis-Stufe mit 0 US-Dollar Input und 0 US-Dollar Output, aber beachte: Die Route unterstützt zwar das 1-Mio.-Token-Kontextfenster, erzwingt jedoch ein Max-Token-Limit von 65.536 für die Ausgabe.
  • Self-hosted: Kostenlos unter OpenMDW-1.1, deploybar via vLLM, SGLang und TensorRT-LLM.

Dieser OpenRouter-Cap ist wichtig. Die 1-Mio.-Kontextlänge ist eine Modellfähigkeit, aber das praktische Limit hängt vom Provider und der Route ab. Prüfe also den Endpunkt, bevor du mit dem vollen Fenster rechnest.

Fazit

Nemotron 3.5 Lightning steht für eine klare Wette von NVIDIA: Die Zukunft produktiver Agents besteht aus einem System von Modellen, in dem ein günstiges Ausführungsmodell das Volumen übernimmt und ein Frontier-Modell die Planung. Der parallele Release von NeMo Switchyard ist ein klares Signal, denn das Modell entfaltet seinen Wert erst, wenn du Arbeit intelligent darauf routen kannst.

Hilfreich finde ich die ehrliche Abgrenzung. NVIDIA gibt nicht vor, dass dies ein Reasoning-Modell ist, und die Benchmarks stützen das: stark bei SWE-bench Verified (51,56) und PinchBench (85,37), verhalten bei Humanity's Last Exam (11,72). Wenn deine Workloads aus Toolaufrufen, Validierung und Formatierung in stets aktiven Agents bestehen, passt dieser Trade-off genau.

Die offene Veröffentlichung unter OpenMDW-1.1 mit Gewichten, Daten und Recipes plus ein Checkpoint, der klein genug ist, um auf einem DGX Spark zu laufen, macht das für Teams wirklich nützlich, die feinjustieren und selbst hosten möchten statt pro Token zu zahlen. Der Hauptvorbehalt: Alle aktuellen Benchmark-Zahlen sind vendor-publiziert. Ich würde unabhängige Reproduktionen abwarten, bevor ich die 4x Speed und 30% schnellere Fertigstellung als gesetzt ansehe.

Wenn du die Fine-Tuning-Kompetenzen aufbauen willst, um ein Modell wie dieses auf deine eigenen Workloads zuzuschneiden, deckt unser Tutorial zum Fine-Tuning von Qwen3.6 auf einem medizinischen Q&A-Datensatz den QLoRA-Workflow auf einem vergleichbaren MoE-Modell Schritt für Schritt ab.

FAQs

Wie unterscheidet sich Nemotron 3.5 Lightning von anderen Nemotron-Modellen?

Nemotron 3.5 Lightning ist das kleinste Mitglied von NVIDIAs Nemotron-3-Familie, gebaut für hochvolumige, latenzarme Ausführung statt komplexer Planung. Frontier-Modelle wie Nemotron 3 Ultra übernehmen Orchestrierung und schweres Reasoning, während Lightning Routineaufgaben wie Toolaufrufe, Validierung und Formatierung erledigt. NeMo Switchyard routet die Arbeit zwischen ihnen, sodass Planung nach oben und Ausführung nach unten geht.

Wo kann ich auf Nemotron 3.5 Lightning zugreifen?

Du kannst es auf build.nvidia.com oder über OpenRouter ausprobieren und die Gewichte von Hugging Face und ModelScope herunterladen. Es ist ab Tag 0 bei gehosteten Providern wie DeepInfra verfügbar und über vLLM, SGLang und TensorRT-LLM selbst hostbar. Lokale Tools wie LM Studio, llama.cpp, Ollama und Unsloth werden ebenfalls unterstützt.

Wie sind die Preise für Nemotron 3.5 Lightning?

DeepInfra listet 0,05 US-Dollar pro 1 Mio. Input-Tokens und 0,20 US-Dollar pro 1 Mio. Output-Tokens. OpenRouter bietet eine Gratis-Stufe mit 0 US-Dollar Input und 0 US-Dollar Output, gedeckelt auf 65.536 Max-Tokens auf dieser Route. Das Modell ist unter der OpenMDW-1.1-Lizenz außerdem kostenlos selbst zu hosten.

Wofür eignet sich Nemotron 3.5 Lightning am besten?

Es ist für die Ausführungsebene langlebiger autonomer Agents gebaut: Toolaufrufe, Ergebnisvalidierung, Retrieval, Formatierung, Zusammenfassung und Klassifikation. NVIDIA und Partner sagen klar, dass es nicht für offenen Chat oder tiefes Reasoning gedacht ist. Diese Fälle sollten an ein Frontier-Modell geroutet werden.

Ist Nemotron 3.5 Lightning Open Source?

Ja. NVIDIA hat die Gewichte, Trainingsdaten und Recipes unter der OpenMDW-1.1-Lizenz veröffentlicht — permissiv und bereit für den kommerziellen Einsatz. Es wird mit einem BF16- und einem NVFP4-quantisierten Checkpoint ausgeliefert, plus einem offenen agentischen RL-Datensatz namens Nemotron-RL Agentic Terminal Pivot.


Matt Crabtree's photo
Author
Matt Crabtree
LinkedIn

Autorin und Redakteurin im Bereich der Bildungstechnologie. Engagiert bei der Erforschung von Datentrends und begeistert davon, Data Science zu lernen.

Themen
Künstliche Intelligenz
Große Sprachmodelle

Top-DataCamp-Kurse

Lernpfad

Deploy Production-Ready Agents

2 Std.
Deploy AI agents to production using Google's ADK, Vertex AI Agent Engine, Cloud Run, and Memory Bank for persistent cross-session state.
Details anzeigenRight Arrow
Kurs Starten
Mehr anzeigenRight Arrow
Verwandt

Blog

Die 36 wichtigsten Fragen und Antworten zum Thema generative KI für 2026

Dieser Blog hat eine ganze Reihe von Fragen und Antworten zu generativer KI, von den Grundlagen bis hin zu fortgeschrittenen Themen.
Hesam Sheikh Hassani's photo

Hesam Sheikh Hassani

15 Min.

Blog

Arten von KI-Agenten: Ihre Rollen, Strukturen und Anwendungen verstehen

Lerne die wichtigsten Arten von KI-Agenten kennen, wie sie mit ihrer Umgebung interagieren und wie sie in verschiedenen Branchen eingesetzt werden. Verstehe einfache reflexive, modellbasierte, zielbasierte, nutzenbasierte, lernende Agenten und mehr.

Blog

Die 20 besten Snowflake-Interview-Fragen für alle Niveaus

Bist du gerade auf der Suche nach einem Job, der Snowflake nutzt? Bereite dich mit diesen 20 besten Snowflake-Interview-Fragen vor, damit du den Job bekommst!
Nisha Arya Ahmed's photo

Nisha Arya Ahmed

15 Min.

Blog

Top 50+ AWS-Interviewfragen und Antworten für 2026

Ein kompletter Guide mit grundlegenden, fortgeschrittenen und szenariobasierten AWS-Interviewfragen – mit Beispielen aus der Praxis.
Zoumana Keita 's photo

Zoumana Keita

15 Min.

Tutorial

AVERAGE() in Excel: Die wichtige Funktion einfach erklärt

Lerne die Arbeit mit Excels AVERAGE()-Funktion – inklusive bedingter und logischer Varianten.
Josef Waples's photo

Josef Waples

3 Min.

Tutorial

OLS-Regression: Die wichtigsten Ideen erklärt

Gewinne Vertrauen in die OLS-Regression, indem du ihre theoretischen Grundlagen beherrschst. Erforsche, wie du einfache Implementierungen in Excel, R und Python durchführst.
Josef Waples's photo

Josef Waples

8 Min.

Mehr AnzeigenMehr Anzeigen