Mittelstufe 10 Min.NVIDIA

Nemotron 3 lokal: die NVIDIA-Modelle mit Ollama

NVIDIA stellt nicht nur GPUs her: Das Unternehmen unterzieht auch seine eigenen LLMs, die Nemotron-Familie, einem Post-Training. Dieser Leitfaden zeigt, wie Sie Nemotron 3 lokal mit Ollama installieren, welche Varianten (Nano, Super) Sie je nach verfügbarem VRAM wählen sollten, was NVIDIA anders als andere optimiert – steuerbares Schlussfolgern und den Einsatz als Agent – und wann sich diese Modelle gegenüber vergleichbaren Qwen3-Modellen lohnen.

Von Clara M.·Aktualisierung 2026-07-28·Unter Windows, macOS und Linux getestet

#Warum Nemotron anstatt eines anderen Modells?

Nemotron ist kein von Grund auf trainiertes Modell. NVIDIA geht von soliden Basismodellen mit offenen Gewichten aus (je nach Version Llama oder Qwen) und wendet anschließend sein eigenes Post-Training-Verfahren an: Beschneiden (Pruning), um die Größe zu reduzieren, Destillation, um verlorene Qualität zurückzugewinnen, und umfangreiches Fine-Tuning mit Schwerpunkt auf Schlussfolgern, Mathematik, Code und Tool-Aufrufen. Das Ergebnis zielt auf einen konkreten Punkt: das beste Verhältnis von Qualität zu Rechenkosten für Agentenaufgaben, nicht für allgemeine Gespräche.

Eine weitere Besonderheit: NVIDIA optimiert diese Modelle für die eigene Hardware und die eigenen Inferenz-Pipelines. In der Praxis sorgt das für einen guten Durchsatz auf NVIDIA-GPUs und für eine als stimmige Produktreihe konzipierte Modellfamilie: eine kleine Version für Consumer-Grafikkarten, eine mittlere für Workstations und eine riesige für Server. Sie wählen nach verfügbarem VRAM, ohne Ihre Prompt-Logik ändern zu müssen.

i
Nemotron ist verbessertes Llama/Qwen
Wenn Sie bereits mit Llama oder Qwen im lokalen Betrieb vertraut sind, wird Ihnen Nemotron vertraut vorkommen: dasselbe Chat-Format, dieselben GGUF-Quantisierungen. Der Unterschied liegt im Nachtraining durch NVIDIA, nicht in einer exotischen Architektur.

#Nano, Super und Ultra: welche Variante

Das Lokale-KI-Paket

Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.

  • Lebenslanger Online-Zugang
  • PDF + Dateien
  • Erstattung binnen 30 Tagen

Die Nemotron-3-Serie umfasst drei Größen, jeweils für eine bestimmte Geräteklasse. Der Name weist eher auf die vorgesehene Geräteklasse als auf die genaue Parameterzahl hin.

Nano (~8-9B)
Die Version für Consumer-Grafikkarten. Passt in Q4 problemlos auf eine RTX 3060 mit 12 GB oder jede GPU mit mindestens 8 GB VRAM. Sie ist der ideale Einstieg, um Nemotron zu testen, und eignet sich für leichtgewichtige Agenten.
Super (~49B)
Die Version für Workstations und große GPUs. Sie zielt dank des Prunings von NVIDIA auf die Qualität eines 70B-Modells bei geringerem Rechenaufwand ab. Erfordert eine RTX 4090 mit 24 GB (in Q4 mit knappem Speicherbudget) oder besser eine Karte mit 32–48 GB.
Ultra (~253B)
Die Serverversion übersteigt die Möglichkeiten eines handelsüblichen Rechners. Sie ist Multi-GPU-Workstations oder Rechenzentren vorbehalten. Hier wird sie erwähnt, um die Modellreihe einzuordnen, nicht für den üblichen lokalen Einsatz.

Für einen lokalen Rechner kommen praktisch Nano und Super infrage. Nano, wenn Sie eine Grafikkarte mit 8–16 GB haben oder die Geschwindigkeit Vorrang hat. Super, wenn Sie 24 GB oder mehr haben und maximale Qualität beim Schlussfolgern oder bei anspruchsvollen Codeaufgaben suchen.

#Voraussetzungen und VRAM pro Variante

Wie bei jedem lokal betriebenen Modell ist der VRAM der begrenzende Faktor. Hier finden Sie Richtwerte für die Quantisierung Q4_K_M, die standardmäßig empfohlen wird, weil sie den besten Kompromiss zwischen Qualität und Speicherbedarf bietet. Planen Sie stets eine Speicherreserve für das Kontextfenster ein, das zusätzlich zu den Gewichten Speicher benötigt.

Nemotron Nano (~9B) — Q4
≈ 6–7 GB VRAM. Läuft komfortabel auf einer RTX 3060 mit 12 GB, einer RTX 4070 mit 12 GB oder einem Mac mit Apple Silicon und mindestens 16 GB einheitlichem Speicher.
Nemotron Super (~49B) — Q4
≈ 28-30 GB. Passt nicht auf eine einzige RTX 4090 mit 24 GB ohne Offload: Planen Sie eine Karte mit 32 GB oder mehr, zwei GPUs oder einen Mac M4 Pro/Max mit 48 GB Unified Memory.
Nemotron Super — Q5/Q8
Q5_K_M steigt auf etwa 35 GB, Q8_0 überschreitet 50 GB. Konfigurationen mit viel VRAM oder mehreren GPUs vorbehalten.
Speicherreserve für den Kontext
Planen Sie je nach gewünschter Kontextlänge zusätzlich 1 bis 4 GB ein. Ein langer Kontext beim Reasoning erzeugt viele Zwischentokens und erhöht dadurch den Speicherbedarf.
→
Prüfen, was wirklich in den Speicher passt
Führen Sie nach einem „ollama run“ in einem anderen Terminal „ollama ps“ aus. Die Spalte PROCESSOR zeigt „100% GPU“ an, wenn alles im VRAM liegt, oder eine Aufteilung „GPU/CPU“, wenn Ollama Teile in den Arbeitsspeicher auslagern musste — in diesem Fall sinkt die Geschwindigkeit stark. Das ist das Signal, eine kleinere Modellgröße oder eine Quantisierungsstufe mit weniger Bits zu wählen.

Die Softwarevoraussetzungen sind minimal: Der Ollama-Daemon muss installiert sein; er lauscht standardmäßig unter http://localhost:11434. Stellen Sie bei einer NVIDIA-GPU sicher, dass die CUDA-Treiber aktuell sind; Ollama erkennt die GPU automatisch. Eine zusätzliche Oberfläche wie Open WebUI oder LM Studio bietet mehr Komfort, ist aber nicht erforderlich.

#Nemotron über Ollama installieren

Die Installation folgt genau dem üblichen Ollama-Ablauf. Wenn der Daemon bereits läuft, lädt ein einziger Befehl das Modell herunter und startet es.

  1. 01
    Prüfen, ob Ollama läuft
    Öffnen Sie ein Terminal und führen Sie „ollama --version“ aus. Wenn der Befehl antwortet, ist der Daemon bereit. Andernfalls installieren Sie zuerst Ollama (siehe Installationsanleitung am Ende des Artikels).
  2. 02
    Die Nano-Variante herunterladen
    Um beim Testen keine VRAM-Probleme zu riskieren, beginnen Sie mit Nano. Der Befehl lädt die Gewichte herunter und öffnet direkt eine Chat-Sitzung im Terminal.
  3. 03
    Zu Super wechseln, wenn Ihre GPU mithalten kann
    Sobald Sie mit der Nutzung vertraut sind und über genügend VRAM verfügen, laden Sie die Super-Variante herunter, um die Qualität beim Schlussfolgern und Programmieren zu verbessern.
  4. 04
    Modelle auflisten und verwalten
    « ollama list » zeigt die installierten Modelle und ihre Größe auf dem Datenträger an. « ollama rm <Modell> » gibt den Speicherplatz einer Variante frei, die Sie nicht mehr verwenden.
Terminal — Installation von Nemotron
# Vérifier qu'Ollama répond
ollama --version

# Variante Nano (~9B) — cartes grand public
ollama run nemotron-nano

# Variante Super (~49B) — grosse VRAM / multi-GPU
ollama run nemotron-super

# Voir ce qui est installé et vérifier le placement GPU
ollama list
ollama ps
!
Die Tags ändern sich
Die Ollama-Bibliothek aktualisiert regelmäßig die Namen und Versionen der Nemotron-Modelle. Bevor Sie einen Befehl ausführen, prüfen Sie den genauen Tag auf ollama.com/library — der Modellname und seine Versionsnummer können je nach veröffentlichter Generation vom obigen Beispiel abweichen.

Um Nemotron aus Ihren eigenen Skripten aufzurufen, ist die REST-API von Ollama über den gleichen Port verfügbar. Das Feld „model“ enthält den genauen Tag, den Sie abgerufen haben.

Terminal — API-Aufruf
curl http://localhost:11434/api/generate -d '{
  "model": "nemotron-nano",
  "prompt": "Explique la différence entre RAG et fine-tuning en trois phrases.",
  "stream": false
}'

#Der kontrollierbare Schlussfolgerungsmodus

Das Markenzeichen der Nemotron-Modelle ist ein Denkprozess, den man nach Bedarf ein- oder ausschalten kann. NVIDIA hat diese Modelle darauf trainiert, eine detaillierte Gedankenkette zu erzeugen, wenn man sie im System-Prompt dazu auffordert, und andernfalls direkt zu antworten. Konkret wechselt man mit einer einfachen Systemanweisung zwischen zwei Modi: „detailed thinking on“, um schrittweises Schlussfolgern zu erzwingen, und „detailed thinking off“ für eine knappe und schnelle Antwort.

Dieser Schalter ist nützlich, weil das Schlussfolgern mit Aufwand verbunden ist. Eine Gedankenkette erzeugt viele Zwischentokens: Das ist für ein mathematisches oder logisches Problem oder die Fehlersuche bei einem schwer erkennbaren Fehler wertvoll, beim Umformulieren einer E-Mail aber Verschwendung. Mit Nemotron entscheiden Sie bei jedem Prompt, ob Sie diese zusätzlichen Kosten tragen.

Terminal — Reasoning aktivieren
# Dans une session ollama run, définir le system prompt :
/set system detailed thinking on

# Puis poser une question de raisonnement
Un train part de A à 60 km/h, un autre de B à 90 km/h... résous étape par étape.
→
Reasoning abschalten, um schneller zu sein
Für einfache Textaufgaben, Umformulierungen oder Klassifikation stellen Sie „detailed thinking off“ ein. Sie reduzieren die Latenz und den Tokenverbrauch ohne Qualitätsverlust bei diesen Aufgaben, bei denen lautes Nachdenken nichts bringt.

Diese Funktionsweise ähnelt der von Modellen wie DeepSeek R1 oder Qwen3 in ihrem „thinking“-Modus, bietet aber eine explizitere Steuerung: Das Schlussfolgern ist kein globaler Modus des Modells, sondern eine Einstellung, die Sie im Verlauf des Gesprächs steuern.

#Code, Agenten und Tool-Calling

NVIDIA optimiert Nemotron vor allem für zwei Einsatzbereiche: Reasoning und agentische Anwendungen. Beim Generieren, Erklären und Korrigieren von Code können die Super-Varianten mit guten 32B–70B-Modellen mithalten. Nano ist für gelegentliche Unterstützung weiterhin ordentlich, stößt aber bei langen Aufgaben oder umfangreichen Refactorings an seine Grenzen – das ist bei einem Modell dieser Größe zu erwarten.

Das eigentliche Unterscheidungsmerkmal ist Function Calling. Nemotron ist darauf trainiert, zuverlässige und korrekt strukturierte Tool-Aufrufe zu erzeugen. Das macht es zu einem guten Kandidaten für den Aufbau lokaler Agenten: ein Modell, das entscheidet, eine Funktion aufzurufen, das Ergebnis liest und darauf aufbauend weitermacht. In Kombination mit dem Reasoning-Modus entstehen so Agenten, die vor dem Handeln planen können, statt einfach loszulegen.

Schlussfolgern / Mathematik
Eine klare Stärke, besonders bei Super mit „detailed thinking on“. Die Gedankenkette reduziert Rechen- und Logikfehler.
Code
Super kann bei der Generierung und beim Debugging mit 70B-Modellen mithalten; Nano eignet sich für leichte Unterstützung und Autovervollständigung.
Agenten und Werkzeuge
Zuverlässige Tool-Aufrufe, Einhaltung des JSON-Formats – einer der besten Einsatzzwecke der Modellfamilie für die lokale Automatisierung.
Französisch / allgemeine Konversation
Ordentlich, ohne das beste Modell seiner Kategorie zu sein. Nemotron ist auf Schlussfolgern und Handeln ausgelegt, weniger auf mehrsprachige Plaudereien.

#Im Vergleich zu Qwen3: Wann sollte man Nemotron bevorzugen?

Qwen3 ist das Open-Weight-Referenzmodell für den Vergleich, denn beide Modellfamilien decken dieselben Bereiche ab: logisches Schlussfolgern, Code, mehrere Modellgrößen und einen Thinking-Modus. Bei vielen allgemeinen Aufgaben und bei der Qualität französischer Texte liegt Qwen3 bei gleicher Größe weiterhin vorne — es ist vielseitiger und besser auf Mehrsprachigkeit trainiert.

Nemotron hat wieder die Nase vorn, wenn Ihr Einsatz eher auf agentische Anwendungen und die Integration in ein NVIDIA-Ökosystem ausgerichtet ist. Wenn Sie einen Agenten mit vielen Tool-Aufrufen bauen, das Schlussfolgern für jeden einzelnen Prompt explizit steuern möchten oder einen Bestand an NVIDIA-GPUs betreiben, bei dem der Inferenzdurchsatz zählt, lohnt sich ein Test von Nemotron. Für einen allgemeinen französischsprachigen Gesprächsassistenten ist dagegen Qwen3 die verlässlichere Standardwahl.

Nemotron wählen, wenn
Agenten mit intensivem Tool-Calling, Bedarf an feiner Schaltung des Raisonnement ein/aus, Infrastruktur 100 % NVIDIA, oder Suche nach dem besten Qualitäts/Rechen-Verhältnis bei reinem Raisonnement.
Qwen3 wählen, wenn
Ein Allzweckassistent, Vorrang für Französisch und Mehrsprachigkeit, Vielseitigkeit in Gesprächen oder einfach das bewährteste Modell für ein breites Einsatzspektrum.
Praktisches Fazit
Testen Sie beide bei vergleichbarer Größe (Nano vs Qwen3-8B, Super vs Qwen3-32B) mit IHREN tatsächlichen Prompts. Der Unterschied hängt stark von der Aufgabe ab, nicht von einer abstrakten Rangliste.

#Fehlerbehebung

« model not found » beim Pull
Der Tag existiert nicht unter diesem Namen. Überprüfen Sie die korrekte Schreibweise auf ollama.com/library – die Namen von Nemotron ändern sich von einer Generation zur nächsten.
Massiver Geschwindigkeitseinbruch bei Super
Mangels VRAM wird ein Teil des Modells in den Arbeitsspeicher ausgelagert. „ollama ps“ zeigt eine Aufteilung zwischen GPU und CPU. Wechseln Sie zu Nano oder zu einer niedrigeren Quantisierung (Q4), oder erweitern Sie die GPU-Ausstattung.
Das Reasoning wird nicht aktiviert
Der System-Prompt wird nicht berücksichtigt. In einer interaktiven Sitzung verwenden Sie „/set system detailed thinking on“; über die API geben Sie die Anweisung im Feld „system“ an, nicht im Benutzerprompt.
Zu weitschweifige Antworten
Der Reasoning-Modus ist standardmäßig aktiv oder wurde aus einer übergeordneten Einstellung übernommen. Wechseln Sie für einfache Aufgaben zu „detailed thinking off“.
« Connection refused »
Der Ollama-Daemon läuft nicht. Prüfen Sie dies mit „ollama ps“ und stellen Sie sicher, dass der Dienst auf http://localhost:11434 lauscht.

#Weiterführende Informationen

Nemotron baut auf Bausteinen auf, die auf dieser Website bereits behandelt werden. Diese Leitfäden führen diesen hier weiter:

Qwen 3 lokal: vollständiger Test und echte Benchmarks
Der unverzichtbare Vergleich, um Nemotron gegenüber seiner wichtigsten Alternative mit offenen Modellgewichten einzuordnen, mit Zahlen zu Tokens pro Sekunde.
Quantisierung wählen (Q4, Q5, Q8, FP16)
Um bei Nemotron Super zwischen Qualität und VRAM-Bedarf abzuwägen, denn jede Quantisierungsstufe verändert, was auf Ihre Grafikkarte passt.
Ollama unter Linux installieren
Die Voraussetzung, wenn der Daemon noch nicht eingerichtet ist: Installationsskript, systemd-Dienst und Konfiguration der NVIDIA-GPU.
Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.