KI für Ihr Unternehmen – Jetzt Demo buchen

NVIDIA präsentiert Nemotron 3.5 Lightning: Ein neues Modell für effiziente agentenbasierte Workflows

Kategorien:
No items found.
Freigegeben:
August 12, 2026

KI sauber im Unternehmen integrieren: Der 5-Schritte-Plan

Von der ersten Idee bis zur voll integrierten KI-Lösung – strukturiert, sicher und mit messbarem Erfolg

1
🎯

Strategie & Zieldefinition

Wir analysieren Ihre Geschäftsprozesse und identifizieren konkrete Use Cases mit dem höchsten ROI-Potenzial.

✓ Messbare KPIs definiert

2
🛡️

Daten & DSGVO-Compliance

Vollständige Datenschutz-Analyse und Implementierung sicherer Datenverarbeitungsprozesse nach EU-Standards.

✓ 100% DSGVO-konform

3
⚙️

Technologie- & Tool-Auswahl

Maßgeschneiderte Auswahl der optimalen KI-Lösung – von Azure OpenAI bis zu Open-Source-Alternativen.

✓ Beste Lösung für Ihren Fall

4
🚀

Pilotprojekt & Integration

Schneller Proof of Concept mit nahtloser Integration in Ihre bestehende IT-Infrastruktur und Workflows.

✓ Ergebnisse in 4-6 Wochen

5
👥

Skalierung & Team-Schulung

Unternehmensweiter Rollout mit umfassenden Schulungen für maximale Akzeptanz und Produktivität.

✓ Ihr Team wird KI-fit

Inhaltsverzeichnis

    mindverse studio – Ihre Plattform für digitale Effizienz

    Optimieren Sie Prozesse, automatisieren Sie Workflows und fördern Sie Zusammenarbeit – alles an einem Ort.
    Mehr über Mindverse Studio erfahren

    Das Wichtigste in Kürze

    • NVIDIA hat das neue Open-Weight-Modell Nemotron 3.5 Lightning vorgestellt, das auf Geschwindigkeit und Effizienz bei Agenten-Workflows optimiert ist.
    • Das Modell nutzt eine hybride Mamba-Transformer-Architektur mit 31,6 Milliarden Gesamtparametern, von denen aber nur 3,6 Milliarden aktiv sind.
    • Nemotron 3.5 Lightning erreicht auf dem Intelligence Index einen Wert von 24, vergleichbar mit OpenAI's gpt-oss-120b, bei deutlich weniger Parametern.
    • Mit einer Verarbeitungsgeschwindigkeit von fast 670 Token pro Sekunde ist es das schnellste Modell seiner Klasse.
    • Besondere Stärken zeigt das Modell in agentischen Benchmarks und übertrifft hierbei größere Modelle.
    • Es wird unter der OpenMDW-1.1 Lizenz veröffentlicht und ist für hochdurchsatzstarke, auf Agenten basierende Pipelines konzipiert.
    • Verfügbar ist es in BF16- und NVFP4-Gewichten, wobei die NVFP4-Variante kaum Qualitätseinbußen zeigt.
    • NVIDIA verfolgt damit die Strategie, kleinere, effizientere LLMs für Agenten-Workloads zu fördern.

    NVIDIAs Nemotron 3.5 Lightning: Effizienz vor maximaler Größe

    NVIDIA hat mit der Veröffentlichung von Nemotron 3.5 Lightning ein neues Kapitel in der Entwicklung von KI-Modellen aufgeschlagen, das den Fokus klar auf Geschwindigkeit und Effizienz legt. Dieses Open-Weight-Modell, das erste aus der neuen Nemotron 3.5-Reihe, zeichnet sich durch seine kompakte Bauweise und seine beeindruckende Leistungsfähigkeit aus, insbesondere im Hinblick auf die Inferenzgeschwindigkeit. Es tritt die Nachfolge von Nemotron 3 Nano 30B A3B an und behält dessen hybride Mamba-Transformer-Architektur bei, ist jedoch in seiner Performance deutlich optimiert.

    Architektur und Leistungskennzahlen

    Nemotron 3.5 Lightning verfügt über insgesamt 31,6 Milliarden Parameter, wovon jedoch zu jedem Zeitpunkt nur etwa 3,6 Milliarden aktiv sind. Diese Architektur ermöglicht es dem Modell, eine hohe Effizienz zu erreichen. Gemäß der unabhängigen Benchmarking-Plattform Artificial Analysis erzielt das Modell einen Wert von 24 auf dem Intelligence Index. Dies stellt eine signifikante Verbesserung um neun Punkte gegenüber seinem Vorgänger (15) dar und positioniert es auf Augenhöhe mit OpenAI's gpt-oss-120b, das ebenfalls einen Wert von 24 erreicht. Bemerkenswert ist, dass Nemotron 3.5 Lightning dies mit nur einem Viertel der Parameter von gpt-oss-120b leistet. Es liegt zudem nur knapp hinter NVIDIAs eigenem, etwa viermal größerem Nemotron 3 Super (26).

    Die schnellsten kleinen Modelle in dieser Größenklasse, wie Qwen3.6 35B A3B (32) und Metas neues Muse Glimmer (35), weisen weiterhin eine höhere Intelligenz auf. NVIDIAs Strategie mit Lightning zielt jedoch auf einen anderen Aspekt der Effizienz ab.

    Geschwindigkeit als Kernkompetenz

    Ein herausragendes Merkmal von Nemotron 3.5 Lightning ist seine Geschwindigkeit. In Vortests mit den finalen NVFP4-Gewichten erreichte das Modell eine Verarbeitungsrate von nahezu 670 Token pro Sekunde. Dies ist der höchste gemessene Durchsatz unter den verglichenen Modellen und fast doppelt so schnell wie Googles Gemini 3.5 Flash-Lite (386 Token/s). Eine Aufgabe aus dem Intelligence Index erledigt Nemotron 3.5 Lightning in etwa 0,5 Minuten, während Qwen3.6 35B A3B dafür etwa 3,5 Minuten und Gemma 4 31B rund 5,8 Minuten benötigt.

    Diese hohe Geschwindigkeit macht Nemotron 3.5 Lightning zu einem idealen Werkzeug für Anwendungen, bei denen ein schneller Durchsatz entscheidend ist, auch wenn proprietäre Modelle wie Gemini 3.5 Flash-Lite (37 Punkte) und GPT-5.6 Luna (max) (52 Punkte) in puncto Gesamtintelligenz weiterhin führend sind.

    Fortschritte in agentischen Benchmarks

    Besonders deutliche Verbesserungen zeigt Nemotron 3.5 Lightning in agentischen Benchmarks. Laut Artificial Analysis erreichte das Modell auf GDPval-AA v2 eine Elo-Bewertung von 824, was einen Zuwachs von 334 Punkten gegenüber Nemotron 3 Nano darstellt. Damit übertrifft es sowohl gpt-oss-120b (800) als auch das größere Nemotron 3 Super (698). Auf Terminal-Bench v2.1 stieg der Wert von 7 auf 24,3 Prozent und liegt damit nahe an gpt-oss-120b (26,2 Prozent).

    Diese Ergebnisse unterstreichen die Eignung des Modells als "Workhorse" für agentenbasierte Pipelines, die einen hohen Durchsatz erfordern.

    Verfügbarkeit und Lizenzierung

    NVIDIA stellt das Modell unter der permissiven OpenMDW-1.1-Lizenz zur Verfügung. Dies ermöglicht eine breite kommerzielle Nutzung und Anpassung ohne Attributionspflicht. Das Modell ist in BF16- und NVFP4-Gewichten erhältlich. Die NVFP4-Variante zeigt laut Artificial Analysis nur minimale Qualitätseinbußen im Vergleich zur höherpräzisen Version, während sie die Effizienz steigert. Das Reasoning-Modell verarbeitet ausschließlich Text und unterstützt ein Kontextfenster von einer Million Token.

    Die Gewichte sind bereits verfügbar, und Serverless-Inferenz wird von verschiedenen Anbietern wie DeepInfra, Fireworks, FriendliAI, CoreWeave, GMI Cloud, Nebius und Crusoe angeboten.

    Strategische Ausrichtung und Zukunftsperspektiven

    Die Fokussierung von NVIDIA auf Effizienz statt reiner Größe ist keine neue Entwicklung. Bereits im vergangenen Jahr argumentierten NVIDIA-Forscher in einer viel beachteten Studie, dass Modelle mit weniger als 10 Milliarden Parametern die meisten Agenten-Workloads ebenso gut bewältigen können wie Modelle mit 70 bis 175 Milliarden Parametern, dies jedoch zu einem Zehntel bis Dreißigstel der Kosten. Nemotron 3.5 Lightning mit seinen 31,6 Milliarden Parametern, von denen nur 3,6 Milliarden pro Schritt aktiviert werden, passt genau in diese Kategorie der "leichten" Modelle. Seine Leistung in agentischen Benchmarks, die sogar gpt-oss-120b und das größere Nemotron 3 Super übertrifft, liefert den bisher deutlichsten Produktbeweis dieser These.

    Diese Entwicklung zeigt, dass der Trend in der KI-Modellentwicklung nicht ausschließlich zu immer größeren Modellen geht, sondern auch die Optimierung für spezifische Anwendungsfälle, insbesondere im Bereich der AI-Agenten, eine entscheidende Rolle spielt. Für Unternehmen bedeutet dies den Zugang zu leistungsstarken, aber ressourcenschonenden KI-Lösungen, die präzise auf ihre Bedürfnisse zugeschnitten werden können.

    Ressourcen und Anpassungsmöglichkeiten

    NVIDIA unterstützt die Anpassung von Nemotron 3.5 Lightning durch umfassende Ressourcen, einschließlich Trainingsrezepten und Datensätzen. Dies ermöglicht es Unternehmen, das Modell für spezifische Domänen und Anwendungen zu optimieren, wie es beispielsweise Partner wie CodeRabbit und Harvey in ihren Post-Training-Bemühungen gezeigt haben. Die Kompatibilität mit NVIDIAs Ökosystem, einschließlich RTX-Grafikkarten und DGX Spark-Systemen, sowie die Integration mit dem NeMo Switchyard Routing-System zur effizienten Aufgabenverteilung, erleichtern die Implementierung und Skalierung in Unternehmensumgebungen.

    Nemotron 3.5 Lightning ist ein Beispiel dafür, wie der Fokus auf gezielte Effizienz und Geschwindigkeit innovative Lösungen für komplexe KI-Herausforderungen bieten kann. Es adressiert die steigende Nachfrage nach leistungsfähigen, aber dennoch kosteneffizienten Modellen für den Einsatz in einer Vielzahl von Geschäftsbereichen.

    Bibliografie

    - Bastian, M. (2026, 11. August). Nvidia's open-weight Nemotron 3.5 Lightning prioritizes speed over maximum intelligence. The Decoder. - Alexiuk, C. (2026, 11. August). NVIDIA Nemotron 3.5 Lightning Delivers Fast, Accurate Specialized Task Execution for Long-Running Agents. NVIDIA Technical Blog. - Artificial Analysis. (2026, 11. August). NVIDIA launches Nemotron 3.5 Lightning. - Leswing, K. (2026, 11. August). Nvidia releases Nemotron 3.5 Lightning, open-source AI model. CNBC. - Thoughtworks. (2026, 11. August). Putting NVIDIA Nemotron 3.5 Lightning to the test. - Thakker, Y. (2026, 11. August). NVIDIA Nemotron 3.5 Lightning: A 30B Open MoE Built for Always-On Agents. Explainx.ai Blog. - Razzaq, A. (2026, 12. August). NVIDIA AI Releases Nemotron 3.5 Lightning: A 30B Open MoE with 3B Active Parameters, and NeMo Switchyard Model Router. MarkTechPost. - NVIDIA. (n.d.). Build Agentic AI with Multimodal Foundation Models | NVIDIA Nemotron. - Horsey, J. (2026, 12. August). NVIDIA Nemotron Lightning Specs and Features Guide. Geeky Gadgets.

    Artikel jetzt als Podcast anhören

    Kunden die uns vertrauen:
    Arise Health logoArise Health logoThe Paak logoThe Paak logoOE logo2020INC logoEphicient logo
    und viele weitere mehr!

    Bereit für den nächsten Schritt?

    Das Expertenteam von Mindverse freut sich darauf, Ihnen zu helfen.
    Herzlichen Dank! Deine Nachricht ist eingegangen!
    Oops! Du hast wohl was vergessen, versuche es nochmal.

    🚀 Neugierig auf Mindverse Studio?

    Lernen Sie in nur 30 Minuten kennen, wie Ihr Team mit KI mehr erreichen kann – live und persönlich.

    🚀 Demo jetzt buchen