gpt-oss lokal: Open-Weight-Modelle von OpenAI mit Ollama
OpenAI hat schließlich offene Modellgewichte veröffentlicht: gpt-oss-20b und gpt-oss-120b, zwei Mixture-of-Experts-Modelle unter der Apache-2.0-Lizenz. Dieser Leitfaden zeigt, wie Sie gpt-oss mit Ollama ausführen, wie viel VRAM jede Version benötigt, wie die native MXFP4-Quantisierung funktioniert und wie Sie den Denkaufwand einstellen. Abschließend geht es darum, wie sich diese Open-Weight-Modelle tatsächlich im Vergleich mit Qwen und DeepSeek schlagen.
#Warum gpt-oss die Spielregeln verändert
Jahrelang hat OpenAI seine Modelle geschlossen gehalten. Mit gpt-oss kehrt das Unternehmen erstmals seit GPT-2 zu tatsächlich herunterladbaren Gewichten zurück, diesmal unter der Apache-2.0-Lizenz: kommerzielle Nutzung erlaubt, keine Klausel, die zur Weitergabe verpflichtet, keine Begrenzung der Nutzerzahl. Sie laden die Gewichte herunter, die Modelle laufen auf Ihrem Rechner, und nichts verlässt Ihr Netzwerk.
Technisch basiert gpt-oss auf einer MoE-Architektur (Mixture of Experts): Das Modell enthält insgesamt viele Parameter, aktiviert aber für jedes Token nur einen kleinen Teil davon. Das Ergebnis: eine Qualität nahe der eines großen dichten Modells bei einem Speicherbedarf und einer Geschwindigkeit wie bei einem deutlich kleineren Modell. Beide Versionen sind auf schlussfolgerndes Denken, Werkzeugaufrufe und das Befolgen von Anweisungen ausgerichtet und haben ein Kontextfenster von 128k Tokens.
- gpt-oss-20b
- Insgesamt ca. 21 Milliarden Parameter, davon ca. 3,6 Milliarden pro Token aktiv. Für eine einzelne Consumer-Grafikkarte mit 16 GB ausgelegt.
- gpt-oss-120b
- ≈ 117 Milliarden Parameter insgesamt, ≈ 5,1 Milliarden aktive Parameter pro Token. Ausgelegt auf eine Rechenzentrums-GPU mit 80 GB oder einen Rechner mit viel vereinheitlichtem Speicher.
- Lizenz
- Apache 2.0 — kommerziell nutzbar, weiterverteilbar und per Fine-Tuning anpassbar, ohne Einschränkungen beim Einsatzzweck.
- Quantisierung
- Natives MXFP4 für die Gewichte der Experten: Das 4-Bit-Format ist Teil der Veröffentlichung und stammt nicht aus einer ungenauen Konvertierung durch Dritte.
#gpt-oss ollama: 20b oder 120b?
Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.
- Lebenslanger Online-Zugang
- PDF + Dateien
- Lebenslange Updates
Die Wahl hängt fast ausschließlich von Ihrer Hardware ab. Beide Modelle gehören zur selben Familie und verwenden dieselbe Formatierung der Antworten; es gibt einen Qualitätsunterschied, doch er bleibt zweitrangig gegenüber der Frage „Passt das in meinen VRAM?“. Hier ist eine einfache Orientierungshilfe.
- 20b — der vernünftige Standard
- Etwa 14–16 GB nach dem Laden in MXFP4. Passt in den Speicher einer RTX 4080 mit 16 GB oder einer RTX 4090 sowie eines Macs mit Apple Silicon ab 24 GB gemeinsamem Arbeitsspeicher (Unified Memory). Das ist die Version, die Sie zuerst installieren sollten.
- 120b — wenn Sie genügend Arbeitsspeicher haben
- Etwa 60–65 GB in MXFP4. Das Modell ist für eine GPU mit 80 GB (H100/A100-Klasse), einen Rechner mit mehreren GPUs oder einen Mac mit viel vereinheitlichtem Speicher (M3/M5 Ultra mit 96 GB und mehr) ausgelegt. Es ist zwecklos, es mit weniger als 64 GB für das Modell verfügbarem Speicher auszuprobieren.
- Relative Qualität
- Das 120b baut seinen Vorsprung beim mehrstufigen Schlussfolgern, bei langem Code und bei mehrdeutigen Aufgaben aus. Bei alltäglichen Fragen und Antworten sowie auf Französisch schneidet das 20b bereits sehr gut ab.
#Voraussetzungen
Nichts Außergewöhnliches: eine aktuelle Ollama-Installation und genügend Speicher für die gewünschte Version. Ollama übernimmt den Download, die MXFP4-Quantisierung und das GPU/CPU-Offloading selbstständig.
- Eine aktuelle Ollama-Version
- Version mit Unterstützung für gpt-oss und MXFP4. Aktualisieren Sie vor dem Start – zu alte Versionen kennen das Format nicht.
- VRAM / gemeinsamer Arbeitsspeicher
- ≥ 16 GB für das 20b-Modell, ≥ 64 GB für das 120b-Modell. Darunter lagert Ollama Teile des Modells in den System-RAM aus, und die Geschwindigkeit bricht ein.
- Festplattenspeicher
- ≈ 12-14 GB für das 20b, ≈ 60-65 GB für das 120b. Die Gewichte werden im Modellordner von Ollama gespeichert.
- Daemon wartet auf Verbindungen
- Ollama stellt seine API standardmäßig unter http://localhost:11434 bereit — praktisch, um Open WebUI anzubinden oder eigenen Code darauf aufzusetzen.
#gpt-oss-20b mit einem Befehl installieren
Die Version 20b lässt sich mit einer einzigen Befehlszeile installieren und starten. Ollama lädt die MXFP4-Gewichte herunter, lädt sie auf die GPU und öffnet eine Chat-Sitzung.
Planen Sie beim ersten Start Zeit für den Download von etwa 13 GB ein. Danach bleibt das Modell im Cache. Um nur die Gewichte herunterzuladen, ohne eine interaktive Sitzung zu öffnen, verwenden Sie pull.
In der Ausgabe von ollama ps sollten Sie einen hohen GPU-Anteil sehen. Wenn die Spalte „100% CPU“ anzeigt, bedeutet das, dass das Modell nicht in den VRAM gepasst hat und in den Arbeitsspeicher ausgelagert wurde – die Generierung wird langsam sein. Auf einer RTX 4090 können Sie mit einem komfortablen Durchsatz im interaktiven Betrieb rechnen; auf einer 4080 mit 16 GB passt das 20b-Modell, allerdings ohne Spielraum für einen großen Kontext.
Wenn Sie das Modell über die API statt im Chat steuern möchten, steht der Endpunkt bereits bereit. Hier ist ein minimaler Aufruf.
#Das 120b-Modell: für welche Rechner?
Der Befehl bleibt gleich, nur der Tag ändert sich. Führen Sie ihn aber nur aus, wenn Sie tatsächlich über den nötigen Speicher verfügen: Unter 64 GB lagert Ollama einen Teil der Experten auf die CPU aus, und Sie erhalten bestenfalls wenige Tokens pro Sekunde.
- 01Den verfügbaren Speicher prüfenBei NVIDIA-GPUs muss nvidia-smi eine Karte mit 80 GB anzeigen (oder mehrere Karten, die zusammen genügend VRAM bieten). Auf einem Mac lassen 96 GB oder mehr gemeinsamer Speicher genügend Spielraum für das Modell und das System.
- 02Pull startenDer Download ist umfangreich (~60 GB): Planen Sie die nötige Bandbreite und den Speicherplatz ein. Das MXFP4-Format erspart Ihnen eine erneute Quantisierung in Eigenregie.
- 03Platzierung prüfenNach ollama run bestätigt ollama ps in einem anderen Terminal, welcher Anteil auf der GPU liegt. Eine massive Auslagerung auf die CPU bedeutet unzureichenden Speicher; wechseln Sie zurück zu 20b.
- 04Kontext anpassenDas 120b-Modell unterstützt 128k Tokens, aber ein voller Kontext benötigt viel zusätzlichen Speicher. Reduzieren Sie num_ctx, wenn Ihr VRAM knapp ist.
#Einstellen des Überlegungsaufwands
Eine Besonderheit von gpt-oss: Die Modelle erzeugen vor ihrer Antwort eine Gedankenkette, und Sie können den dafür betriebenen Aufwand steuern. Drei Stufen – low, medium, high – bestimmen das Verhältnis zwischen Geschwindigkeit und Tiefe. Bei geringem Aufwand antwortet das Modell bei einfachen Aufgaben schnell; bei hohem Aufwand denkt es bei Mathematik, Code oder mehrstufigen logischen Aufgaben länger nach.
Die Einstellung erfolgt in der Systemnachricht. Geben Sie die gewünschte Stufe an, und das Modell passt die Länge seiner internen Überlegungen an.
- Reasoning: low
- Schnelle Antworten, wenig sichtbare Reflexion. Ideal für Umformulierungen, kurze Zusammenfassungen, faktische Fragen.
- Reasoning: medium
- Ein guter Kompromiss als Standardeinstellung: etwas Reasoning, ohne die Latenz stark zu erhöhen.
- Reasoning: high
- Gründliches Nachdenken, besser bei schwierigen Problemen – auf Kosten einer längeren Generierung und eines höheren Tokenverbrauchs.
#Stärken und Schwächen im Vergleich zu Qwen und DeepSeek
gpt-oss tritt in einem Bereich an, in dem es bereits sehr leistungsfähige Open-Weight-Modelle gibt. Hier zeigen wir ungeschönt, wo es sich abhebt und wo es zurückliegt.
- Stärken
- Ausgereiftes Reasoning und zuverlässige Tool-Aufrufe, einstellbarer Reasoning-Aufwand, eine uneingeschränkt offene Apache-2.0-Lizenz und ein überschaubarer Speicherbedarf dank MoE + MXFP4. Der 20b bietet auf einer einzigen Grafikkarte mit 16 GB ein beeindruckendes Verhältnis von Qualität zu VRAM-Bedarf.
- Gegenüber Qwen3
- Qwen liegt bei mehrsprachigen Aufgaben und im Französischen oft weiterhin vorn und bietet eine größere Auswahl an Modellgrößen (von 4B bis hin zu großen MoE-Modellen). gpt-oss gleicht dies durch die Qualität seiner Schlussfolgerungskette und die zuverlässige Befolgung von Anweisungen aus.
- Im Vergleich zu DeepSeek
- Die Reasoning-Modelle von DeepSeek (R1 und V3.2) gehen bei sehr schwierigen Problemen weiter, benötigen in ihren großen Versionen aber deutlich mehr Hardware. Die 20b-Version von gpt-oss zielt auf einen leicht zugänglichen lokalen Betrieb ab, während DeepSeek V3.2 das High-End-Segment anvisiert.
- Nachteil, den man kennen sollte
- Französisch hat bei gpt-oss keine Priorität: Die Qualität auf Französisch ist gut, liegt aber etwas unter der Qualität auf Englisch und manchmal unter der von Qwen. Testen Sie das Modell mit Ihren eigenen Prompts, bevor Sie sich entscheiden.
#Fehlerbehebung
- „unknown model“ oder nicht erkanntes Format
- Ihr Ollama ist zu alt für MXFP4. Aktualisieren Sie auf eine aktuelle Version und starten Sie dann den Pull erneut.
- Sehr langsame Generierung beim 20b-Modell
- ollama ps montre du CPU au lieu du GPU : le modèle a débordé. Fermez les autres applis gourmandes en VRAM, réduisez num_ctx, ou vérifiez que le GPU est bien détecté.
- Das 120b-Modell stürzt ab oder läuft extrem langsam
- Nicht genügend Speicher. Wenn für das Modell tatsächlich weniger als 64 GB verfügbar sind, bleiben Sie beim 20b – das 120b ist nicht für Ihren Rechner geeignet.
- Zu langsame Antworten im Alltag
- Reduzieren Sie den Denkaufwand in der Systemnachricht auf low oder medium: high verbraucht enorm viele Denk-Tokens.
- Kontext, der die VRAM-Kapazität sprengt
- 128k Tokens benötigen viel Speicher. Setzen Sie num_ctx für den täglichen Gebrauch auf einen vernünftigen Wert (z. B. 8192).
#Weiterführende Informationen
Sobald gpt-oss eingerichtet ist, helfen Ihnen diese Anleitungen der Website dabei, Ihren lokalen Stack zu optimieren und die Modelle zu vergleichen:
- Quantisierung wählen (Q4, Q5, Q8, FP16)
- Um zu verstehen, wie MXFP4 im Vergleich zu klassischen GGUF-Formaten einzuordnen ist, und bei Ihren anderen Modellen zwischen Qualität und Speicherbedarf abzuwägen.
- GPU für lokale KI auswählen
- Der Kaufratgeber 2026 zur passenden Dimensionierung der Grafikkarte – je nachdem, ob Sie das 20b-Modell auf 16 GB oder anspruchsvollere Modelle nutzen möchten.
- DeepSeek R1 mit Ollama installieren
- Der direkte Vergleich beim logischen Schlussfolgern: Installieren Sie R1 und vergleichen Sie es direkt mit gpt-oss.
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.