Phi-4 lokal: Installieren mit Ollama, VRAM und Geschwindigkeit
Phi-4 ist das kleine Modell von Microsoft, das Ende 2024 viel Aufmerksamkeit erregte: nur 14 Milliarden Parameter und dennoch Ergebnisse in Mathematik und Programmierung, die dreimal so großen Modellen Konkurrenz machen. Dieser Leitfaden zeigt, wie Sie Phi-4 mit Ollama lokal installieren, was es in der Praxis wirklich leistet und wo es enttäuscht – insbesondere auf Französisch.
#Warum Phi-4?
Phi-4 ist die logische Fortsetzung der Phi-Familie von Microsoft Research: kleine Modelle, die hauptsächlich mit sehr sorgfältig aufbereiteten synthetischen Daten trainiert wurden und darauf ausgelegt sind, bei Denkaufgaben mit deutlich größeren Modellen zu konkurrieren. Die Ende 2024 veröffentlichte Version 4 führt diesen Ansatz mit 14 Milliarden Parametern weiter und erzielt bemerkenswerte Ergebnisse bei GPQA, MATH und HumanEval – bei diesen spezifischen Benchmarks oft besser als Llama 3.3 70B.
Konkret passt das Modell in Q4_K_M in 9 GB VRAM und lässt sich damit auf einer Einsteiger-GPU mit 12 GB wie einer RTX 3060 oder einer RTX 4070 betreiben. Selbst im reinen CPU-Betrieb schlägt es sich ordentlich, wenn Sie 16 GB RAM haben. Dieses Gleichgewicht zwischen Größe und Qualität macht es zu einem hervorragenden Kandidaten für Self-Hosting mit bescheidener Hardware.
#Voraussetzungen
Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.
- Lebenslanger Online-Zugang
- PDF + Dateien
- Erstattung binnen 30 Tagen
- Ollama installiert
- Windows, macOS oder Linux. Falls Ollama noch nicht installiert ist: Mit der Ollama-Installationsanleitung dauert es 3 Minuten.
- VRAM für die Quantisierung Q4_K_M
- ≈ 9 GB. Eine RTX 3060 mit 12 GB, eine RTX 4070 mit 12 GB oder ein Mac mit 16 GB gemeinsamem Arbeitsspeicher reichen problemlos aus.
- Arbeitsspeicher ohne GPU
- Mindestens 16 GB für Q4. Auf einem aktuellen Ryzen 5 oder Core i5 erreichen Sie 4 bis 8 Tokens pro Sekunde – geeignet für Tests, nicht für flüssigen Chat.
- 10 GB Speicherplatz
- Das Q4_K_M-Modell hat eine Größe von etwa 9 GB. Planen Sie mehr Speicherplatz ein, wenn Sie auch Phi-4-Mini parallel testen möchten.
#1. Ollama installieren
Wenn Ollama bereits eingerichtet ist, springen Sie direkt zum nächsten Abschnitt. Andernfalls folgt hier die Installation mit einem einzigen Befehl unter Linux und macOS.
Laden Sie unter Windows das Installationsprogramm von der offiziellen Website herunter.
Nach der Installation lauscht der Ollama-Daemon auf Port 11434.
#2. Phi-4 herunterladen
Phi-4 ist im offiziellen Ollama-Katalog verfügbar. Mit dem Standard-Tag wird die Quantisierung Q4_K_M heruntergeladen, die den empfohlenen Kompromiss darstellt.
Der Download ist etwa 9 GB groß. Um gezielt eine andere Quantisierung auszuwählen, geben Sie den Tag an.
#3. Erste Tests: Mathematik, Code, schlussfolgerndes Denken
Starten Sie eine interaktive Sitzung, um zu überprüfen, ob das Modell läuft, und seine Stärken zu testen.
Sie sollten einen Prompt `>>>` sehen. Dort zeigt Phi-4 seine Stärke: logische und technische Aufgaben. Einige aufschlussreiche Prompts:
Phi-4 arbeitet den Gedankengang Schritt für Schritt durch und gelangt zum Ergebnis. Bei Code kommt das Modell problemlos mit gewöhnlichem Python- und JavaScript-Code zurecht.
#4. Qualität auf Französisch: die tatsächlichen Schwächen
Hier zeigt Phi-4 seine Grenzen. Das Modell wurde überwiegend mit englischsprachigen Daten trainiert (darunter viele synthetische Daten, die auf Englisch erzeugt wurden). Französisch ist im Korpus vorhanden, spielt aber eindeutig eine untergeordnete Rolle.
- Grammatik und Kongruenz
- Gut bei einfachen Sätzen, aber mit Kongruenzfehlern, Anglizismen und schwerfälligen Formulierungen, sobald längere Texte verlangt werden.
- Technisches Vokabular FR
- Tendenz, englische Begriffe („endpoint“, „deployment“, „thread“) zu verwenden, selbst wenn ein gängiger französischer Begriff existiert.
- Verständnis
- Versteht einen Prompt auf Französisch sehr gut. Das Problem liegt in der Textausgabe.
- Code mit französischen Kommentaren
- Codekommentare wechseln während der Generierung häufig ins Englische. Geben Sie die Anweisung ausdrücklich vor; das hilft, löst aber nicht alle Probleme.
- Französische Kultur
- Gering. Oberflächliche Kenntnisse der französischen Rechtsprechung, Geschichte oder Institutionen. Alles andere als ein geeignetes Modell, um einen juristischen Vermerk auf Französisch zu verfassen.
Tipp, der etwas hilft: Ein strenger Systemprompt veranlasst das Modell, auf Französisch zu bleiben, wobei die Antworten manchmal kürzer sind.
#5. Phi-4-Mini: die Version 3,8B
Microsoft hat parallel Phi-4-Mini veröffentlicht, eine Variante mit 3,8 Milliarden Parametern für stark eingeschränkte Hardwarekonfigurationen: Laptops ohne dedizierte GPU, Raspberry Pi 5 und Edge-Geräte. Mit 2,5 GB in Q4 läuft sie auf jeder modernen Maschine.
- Notwendige VRAM/RAM
- ≈ 2,5 GB in Q4_K_M. Passt auf ein MacBook Air M1 mit 8 GB Speicher oder einen PC mit einer GPU mit 4 GB Speicher.
- Geschwindigkeit
- Sehr schnell. 80+ Tokens/s auf einer RTX 3060, 30+ Tokens/s auf einer neueren CPU.
- Stärken
- Befolgt kurze Anweisungen gut, geeignet für Hilfe bei Prompts, einfache Umformulierungen und Klassifikation.
- Schwächen
- Komplexes Reasoning und langer Code übersteigen seine Fähigkeiten. Es ist ein ergänzendes Modell, kein Ersatz für die 14B-Version.
#6. Phi-4 vs Qwen 3.5 9B
2026 ist Qwen 3.5 9B von Alibaba der relevanteste direkte Konkurrent. Es ist etwas kompakter (6,6 GB in Q4 gegenüber 9 GB bei Phi-4), passt auf dieselbe GPU mit 12 GB und richtet sich an dieselbe Nutzergruppe. Was die beiden unterscheidet:
- Schlussfolgern und Mathematik
- Phi-4 liegt bei formalen Benchmarks (GPQA, MATH) vorn. Im praktischen Einsatz bei alltäglichen Problemen ist der Unterschied geringer, als man denkt.
- Code
- Qwen 3.5 9B ist insgesamt besser bei weniger gebräuchlichen Sprachen (Rust, Go, fortgeschrittenes SQL). Phi-4 bleibt wettbewerbsfähig bei Python und JS.
- Französisch
- Qwen 3.5 ist deutlich besser. Viel mehr mehrsprachige Trainingsdaten, ein reichhaltigerer Wortschatz, weniger Wechsel ins Englische. Bei diesem Kriterium hat Qwen einen klaren Vorteil.
- Kontext
- Qwen 3.5 9B unterstützt bis zu 256k Kontexttokens, Phi-4 beschränkt sich auf 16k. Wenn Sie lange Dokumente bearbeiten, ist Qwen viel besser geeignet.
- Befolgen von Anweisungen
- Phi-4 hält sich genauer an strukturierte Anweisungen (JSON-Format, strenge Vorgaben). Qwen ist etwas „kreativer“ und kann sich Freiheiten nehmen.
#Fehlerbehebung
- "Out of memory" beim Laden
- Ihr VRAM reicht für die gewählte Quantisierung nicht aus. Wechseln Sie zu Q4_K_M (der leichtesten sinnvollen Variante) oder lassen Sie Ollama einen Teil auf die CPU auslagern, mit `ollama run phi4 --num-gpu N`, wobei N die Anzahl der Schichten ist, die auf die GPU geladen werden sollen.
- Generierung mit 1–2 Tokens pro Sekunde auf einer Maschine mit GPU
- Das Modell läuft wahrscheinlich auf der CPU. Prüfen Sie mit `ollama ps` die Spalte "PROCESSOR". Wenn dort 100% CPU steht, geben Sie VRAM frei (Chrome, Spiele, andere geladene Modelle) und starten Sie das Modell erneut.
- Antworten, die während der Generierung auf Englisch wechseln
- Bei Phi-4 ist dieses Verhalten im Französischen zu erwarten. Klarere Vorgaben im Systemprompt helfen teilweise. Wechseln Sie bei regelmäßiger französischsprachiger Nutzung das Modell, statt sich damit abzumühen.
- Kontext auf 4096 Tokens gekürzt
- Ollama lädt standardmäßig einen kurzen Kontext. Erweitern Sie ihn ausdrücklich: `/set parameter num_ctx 16384`. Phi-4 wurde allerdings nur bis zu einer Kontextlänge von 16k trainiert – es bringt nichts, darüber hinauszugehen.
- Das Modell erfindet aktuelle Fakten
- Der Wissensstand von Phi-4 ist auf den Zeitpunkt seines Trainings (Ende 2024) begrenzt, und sein Allgemeinwissen ist geringer als das größerer Modelle. Für aktuelle Fakten braucht es eine RAG-Pipeline, nicht das Modell allein.
#Weiterführende Informationen
Phi-4 ist ein guter Einstieg in lokale LLMs mit 14 Milliarden Parametern. Hier sind einige Anregungen, wie Sie mit Ihrer Installation weiterkommen können:
- Einen direkten Konkurrenten testen
- Der Qwen-3-Testleitfaden zeigt vergleichbare Benchmarks auf gängiger Consumer-Hardware und hilft Ihnen dabei, den Vergleich mit Ihren eigenen Prompts durchzuführen.
- Die richtige Quantisierung wählen
- Der Leitfaden „Die Auswahl der Quantisierung (Q4, Q5, Q8, FP16)“ erläutert die Qualitäts- und Speicherkompromisse, die auch für Phi-4 gelten.
- Phi-4 ohne GPU ausführen
- Wenn Sie ausschließlich auf der CPU arbeiten, ergänzt der Leitfaden „Ein LLM lokal ohne GPU ausführen“ das hier Beschriebene um spezifische Optimierungen.
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.