MODELLVERZEICHNIS

MODELL-VERZEICHNIS

NVIDIA Nemotron

NVIDIA Nemotron

Nemotron 3 Ultra ist ein Open-Weight-MoE mit 550 Milliarden Gesamt- und 55 Milliarden aktiven Parametern, hybrider Mamba-Attention-Architektur und Fokus auf lang laufende Agenten. Durchsatz und Transparenz sind außergewöhnlich; der 352-GB-NVFP4-Checkpoint und der NVIDIA-lastige Betrieb sind es ebenfalls.

AKTUELLE MODELL-MOMENTAUFNAHME

Anbieter: NVIDIA
Aktueller Anker: Nemotron 3 Ultra
Lebenszyklus: Aktuelle
Gewichte: Offenes Gewicht mit veröffentlichten Daten und Rezepten
Überprüft: 21. Juli 2026

Abstrakter blau-violetter Farbverlauf

Nemotron 3 Ultra optimiert die Ökonomie lang laufender Agenten

NVIDIA hat Nemotron 3 Ultra am 4. Juni 2026 veröffentlicht. Das Modell verfügt über 550 Milliarden Gesamtparameter mit etwa 55 Milliarden aktiven pro Token, eine hybride Mamba-Attention-Mischung aus Expertenarchitektur, native NVFP4-Unterstützung und ein Kontextfenster mit einer Million Token. NVIDIA veröffentlicht Gewichte, Trainingsdateninformationen und Rezepte, wodurch die Familie für ein Modell dieser Größenordnung ungewöhnlich transparent wird.

Die Architektur ist eher auf einen anhaltenden Inferenzdurchsatz als auf maximale Aufmerksamkeit bei jedem Schritt abgestimmt. Das ist wichtig für Agenten, die große Traces generieren, viele Tools aufrufen oder ein langes Arbeitsgedächtnis haben. Es ist außerdem eng mit dem Hardware- und Software-Stack von NVIDIA abgestimmt, was ein Vorteil für eine bestehende NVIDIA-Umgebung und eine Abhängigkeit für alle anderen sein kann.

Der NVFP4-Checkpoint ist etwa 352 GB groß. Offene Gewichte verbessern die Kontrolle und Überprüfbarkeit; Sie machen Ultra nicht zu einer kleinen Bereitstellung.

Die stärkste Evidenz: hoher Durchsatz plus Agenten-Benchmarks

Bei der Veröffentlichung meldete Artificial Analysis einen Intelligence Index-Wert von 47,7 unter seiner damals aktuellen Methodik und einen Durchsatz von über 400 Ausgabe-Tokens pro Sekunde auf einem Blackbox-Host Konfiguration. Aktuelle Modellseiten zeigen möglicherweise eine andere normalisierte Bewertung an, wenn sich die Suite weiterentwickelt, daher sollten Berichte das Bewertungsdatum und die Methodik beibehalten.

NVIDIA meldet 91 für PinchBench, 33 für EnterpriseOps-Gym, 54 für Terminal-Bench 2.0, 82 für IFBench, 1.448 auf GDPval-AA, 56 bei ProfBench Search und 95 bei RULER bei einer Million Token. Das Unternehmen meldet in seiner Bewertung außerdem erhebliche Durchsatzvorteile gegenüber ausgewählten offenen Konkurrenten und etwa 30 % geringere Aufgabenkosten.

  • Unabhängige Release-Tests untermauern die Behauptung, dass Ultra auf einer optimierten Infrastruktur extrem schnell sein kann.

  • Benchmark-Tabellen der Anbieter erfordern immer noch genaue Hardware, Laufzeit, Sampling und Vergleichsversionskontext.

  • Der Geschäftsfall sollte die Verfügbarkeit von Beschleunigern und die Plattformentwicklung umfassen, nicht nur den Token-Preis.

Der Enterprise-Case: transparent und leistungsstark, aber systemisch groß

Nemotron ist überzeugend für die lang laufende Agenten-Orchestrierung, Codierung und private Inferenz mit hohem Durchsatz – insbesondere dort, wo bereits NVIDIA-Infrastruktur und -Expertise vorhanden sind. Es eignet sich schlecht für Teams, die einen kompakten Prüfpunkt, herstellerneutrale Bereitstellung oder minimale Inferenztechnik wünschen.

Wie wir es bewerten würden

Führen Sie einen mehrstündigen Agentenprozess mit Toolfehlern, Prüfpunkten und strengen Abnahmetests auf der vorgesehenen Hardware aus. Messen Sie akzeptierte Ergebnisse, Wiederherstellung, Token, Durchsatz, Zeit bis zum ersten Token, Energie, Beschleunigerbelegung und Prüferaufwand. Vergleichen Sie den optimierten NVIDIA-Pfad mit einer praktikablen Alternative, einschließlich Personalkosten und Lock-in.

Verwendete Beweise

Beam AI-Unterstützungsstatus

In Bewertung. Diesem Datensatz ist kein Beam-Benchmark oder eine genehmigte Produktionstopologie beigefügt. Validieren Sie den genauen Prüfpunkt, die Laufzeit und die Infrastruktur.

Anwendungsfall 1

Lang laufender Operations-Agent

Führen Sie einen mehrstündigen Prozess mit APIs, Prüfpunkten, Wiederaufnahmebarkeit, Genehmigung und absichtlichen Fehlern aus. Bewerten Sie abgeschlossene Ergebnisse, Wiederherstellung, nicht unterstützte Aktionen, Gesamttoken, Beschleunigerbelegung und Prüferzeit.

Anwendungsfall 2

Kodierungsflotte mit hohem Durchsatz

Benchmark paralleler Repository-Aufgaben auf dem vorgesehenen NVIDIA-Stack. Verfolgen Sie akzeptierte Patches, Regressionen, Durchsatz, Warteschlangenzeit, Energie, Hardwareauslastung und Kosten pro akzeptierter Änderung.

Anwendungsfall 3

Private Recherche über eine Million Token

Verwenden Sie kontrollierte interne Beweise über einen langen Kontext hinweg und testen Sie dann den Abruf mit eingepflanzten Widersprüchen und entfernten Abhängigkeiten. Bewerten Sie Zitate, Auslassungen, nicht unterstützte Schlussfolgerungen, Latenz und Speicherkosten.

Anwendungsfall 4

Bewertung der Open-Model-Plattform

Vergleichen Sie den vollständigen NVIDIA-Bereitstellungspfad mit einer herstellerneutralen Alternative. Dazu gehören Gewichtungen, Laufzeit, Quantisierung, Beobachtbarkeit, Sicherheit, Patching, Personal, Hardwareversorgung, Rollback und dreijährige Betriebskosten.

Verwandte LLMs

Kuratierte Alternativen zum Vergleich, bevor Sie sich für eine Modellfamilie entscheiden.

Heute starten

Bauen Sie KI-Agenten mit dem passenden Modellen für Beam AI

Erfahren Sie, wie Beam gesteuerte KI-Workflows über die Modellfamilie hinweg orchestrieren kann, die Ihren Anforderungen entspricht.

Heute starten

Bauen Sie KI-Agenten mit dem passenden Modellen für Beam AI

Erfahren Sie, wie Beam gesteuerte KI-Workflows über die Modellfamilie hinweg orchestrieren kann, die Ihren Anforderungen entspricht.

Heute starten

Bauen Sie KI-Agenten mit dem passenden Modellen für Beam AI

Erfahren Sie, wie Beam gesteuerte KI-Workflows über die Modellfamilie hinweg orchestrieren kann, die Ihren Anforderungen entspricht.

Häufig gestellte Fragen

Häufig gestellte Fragen

Fragen zu Modellauswahl, Deployment, Governance und Support von Beam AI beantwortet.

Was ist Nemotron 3 Ultra?

Es ist NVIDIAs 550B-Parameter, 55B-aktive Hybrid-Mamba-Achtung MoE für lang andauernde Argumentation und Agenten, mit einem Kontextfenster von einer Million Token und offenen Gewichtungen, Dateninformationen und Rezepten.

Wie schnell ist Nemotron 3 Ultra?

Artificial Analysis meldete bei der Veröffentlichung mehr als 400 Ausgabetokens pro Sekunde auf einer optimierten Blackbox-Konfiguration. Der Durchsatz hängt stark von Hardware, Laufzeit, Stapelverarbeitung und Quantisierung ab. Reproduzieren Sie ihn daher auf dem vorgesehenen Stapel.

Wie stark sind seine Benchmarks?

NVIDIA meldet starke Agent- und Long-Context-Ergebnisse wie 91 bei PinchBench und 95 bei RULER bei 1M. Artificial Analysis meldete bei der Veröffentlichung nach seiner damals aktuellen Methodik einen Intelligenzindex von 47,7. Behalten Sie Daten und Einstellungen beim Vergleich bei.

Ist Nemotron leicht selbst zu hosten?

Es ist offen, aber nicht leichtgewichtig. Der NVFP4-Prüfpunkt ist etwa 352 GB groß, und um den Spitzendurchsatz zu erreichen, sind erhebliche Beschleunigerkapazität und NVIDIA-Inferenz-Know-how erforderlich.

Unterstützt Beam Nemotron 3 Ultra in der Produktion?

Beam-Unterstützung wird derzeit evaluiert. Diesem Datensatz ist keine genehmigte Produktionstopologie oder Beam-Benchmark beigefügt.