Einsteiger 8 minOllama

Phi-4 lokal: Installieren mit Ollama, VRAM und Geschwindigkeit

Phi-4 ist das kleine Modell von Microsoft, das Ende 2024 viel Aufmerksamkeit erregte: nur 14 Milliarden Parameter und dennoch Ergebnisse in Mathematik und Programmierung, die dreimal so großen Modellen Konkurrenz machen. Dieser Leitfaden zeigt, wie Sie Phi-4 mit Ollama lokal installieren, was es in der Praxis wirklich leistet und wo es enttäuscht – insbesondere auf Französisch.

Von Mohamed Meguedmi·Aktualisierung 2026-08-27·Unter Windows, macOS und Linux getestet
i
Kurz gesagt
Phi-4 ist ein Microsoft-Modell mit 14 Milliarden Parametern unter MIT-Lizenz, das in Mathematik und beim Programmieren stark ist (GPQA, MATH, HumanEval). · In Q4_K_M passt es in etwa 9 GB VRAM und lässt sich bereits mit einer RTX 3060 oder RTX 4070 mit 12 GB betreiben, sogar rein auf der CPU (16 GB RAM, etwa 5 tok/s). · Für die Installation genügt ein Befehl: ollama pull phi4. · Seine Schwäche ist Französisch, mit fehlerhaften grammatischen Übereinstimmungen und Wechseln ins Englische – bevorzugen Sie für französische Texte Mistral Small oder Qwen 3.5 9B.

#Warum Phi-4?

Phi-4 ist die logische Fortsetzung der Phi-Familie von Microsoft Research: kleine Modelle, die hauptsächlich mit sehr sorgfältig aufbereiteten synthetischen Daten trainiert wurden und darauf ausgelegt sind, bei Denkaufgaben mit deutlich größeren Modellen zu konkurrieren. Die Ende 2024 veröffentlichte Version 4 führt diesen Ansatz mit 14 Milliarden Parametern weiter und erzielt bemerkenswerte Ergebnisse bei GPQA, MATH und HumanEval – bei diesen spezifischen Benchmarks oft besser als Llama 3.3 70B.

Konkret passt das Modell in Q4_K_M in 9 GB VRAM und lässt sich damit auf einer Einsteiger-GPU mit 12 GB wie einer RTX 3060 oder einer RTX 4070 betreiben. Selbst im reinen CPU-Betrieb schlägt es sich ordentlich, wenn Sie 16 GB RAM haben. Dieses Gleichgewicht zwischen Größe und Qualität macht es zu einem hervorragenden Kandidaten für Self-Hosting mit bescheidener Hardware.

i
Kurz gesagt
Phi-4 = 14B, stark in Mathematik und Programmierung, schwach beim Allgemeinwissen und im Französischen, MIT-Lizenz. Ideal, wenn Sie ein „kleines Kraftpaket“ für technische Aufgaben auf einer GPU mit 12 GB möchten.

#Voraussetzungen

Das Lokale-KI-Paket

Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.

  • Lebenslanger Online-Zugang
  • PDF + Dateien
  • Erstattung binnen 30 Tagen
Ollama installiert
Windows, macOS oder Linux. Falls Ollama noch nicht installiert ist: Mit der Ollama-Installationsanleitung dauert es 3 Minuten.
VRAM für die Quantisierung Q4_K_M
≈ 9 GB. Eine RTX 3060 mit 12 GB, eine RTX 4070 mit 12 GB oder ein Mac mit 16 GB gemeinsamem Arbeitsspeicher reichen problemlos aus.
Arbeitsspeicher ohne GPU
Mindestens 16 GB für Q4. Auf einem aktuellen Ryzen 5 oder Core i5 erreichen Sie 4 bis 8 Tokens pro Sekunde – geeignet für Tests, nicht für flüssigen Chat.
10 GB Speicherplatz
Das Q4_K_M-Modell hat eine Größe von etwa 9 GB. Planen Sie mehr Speicherplatz ein, wenn Sie auch Phi-4-Mini parallel testen möchten.
→
Fall ohne GPU (CPU-only)
Phi-4 ist eines der wenigen 14B-Modelle, die wirklich ohne GPU nutzbar sind. Auf einem Ryzen 7 5800X oder einem Intel i7-12700 erreicht man in Q4 etwa 5 Tokens/s – langsam, aber für jeweils eine Frage ausreichend. Für eine interaktive Nutzung sollten Sie dennoch eine GPU einplanen.

#1. Ollama installieren

Wenn Ollama bereits eingerichtet ist, springen Sie direkt zum nächsten Abschnitt. Andernfalls folgt hier die Installation mit einem einzigen Befehl unter Linux und macOS.

Linux / macOS
curl -fsSL https://ollama.com/install.sh | sh

Laden Sie unter Windows das Installationsprogramm von der offiziellen Website herunter.

Offizieller Windows-Link
https://ollama.com/download/windows

Nach der Installation lauscht der Ollama-Daemon auf Port 11434.

Prüfung
ollama --version
curl http://localhost:11434/api/tags

#2. Phi-4 herunterladen

Phi-4 ist im offiziellen Ollama-Katalog verfügbar. Mit dem Standard-Tag wird die Quantisierung Q4_K_M heruntergeladen, die den empfohlenen Kompromiss darstellt.

Terminal
ollama pull phi4

Der Download ist etwa 9 GB groß. Um gezielt eine andere Quantisierung auszuwählen, geben Sie den Tag an.

Varianten
ollama pull phi4:14b-q4_K_M    # ≈ 9 Go  (défaut)
ollama pull phi4:14b-q5_K_M    # ≈ 10 Go
ollama pull phi4:14b-q8_0      # ≈ 15 Go
ollama pull phi4:14b-fp16      # ≈ 29 Go (sans quantization)
→
Welche Quantisierung wählen?
Für Phi-4 bleibt Q4_K_M der beste Kompromiss auf handelsüblicher Hardware. Der Unterschied zu Q5_K_M ist bei diesem Modell in der Praxis marginal, und Q8_0 benötigt 15 GB VRAM für einen Qualitätsgewinn, der außerhalb von Benchmarks schwer wahrnehmbar ist.

#3. Erste Tests: Mathematik, Code, schlussfolgerndes Denken

Starten Sie eine interaktive Sitzung, um zu überprüfen, ob das Modell läuft, und seine Stärken zu testen.

Sitzung
ollama run phi4

Sie sollten einen Prompt `>>>` sehen. Dort zeigt Phi-4 seine Stärke: logische und technische Aufgaben. Einige aufschlussreiche Prompts:

Mathematik-Test
>>> Une boutique vend des stylos à 0,80 € pièce. Si vous en achetez 12 ou plus, le prix tombe à 0,65 € pièce. À partir de combien de stylos est-il plus économique de commander une boîte de 12 ?

Phi-4 arbeitet den Gedankengang Schritt für Schritt durch und gelangt zum Ergebnis. Bei Code kommt das Modell problemlos mit gewöhnlichem Python- und JavaScript-Code zurecht.

Code-Test
>>> Écris une fonction Python qui prend une liste d'entiers et renvoie le sous-tableau contigu de somme maximale (algorithme de Kadane). Avec docstring et 3 cas de test.
i
Erwartete Geschwindigkeit
Auf einer RTX 4070 (12 GB) mit Q4_K_M können Sie mit 45–60 Tokens/s rechnen. Auf einer RTX 3060 (12 GB): 25–35 Tokens/s. Auf einem Mac M2 mit 24 GB: 20–30 Tokens/s. Auf einer Ryzen-5-5600X-CPU: 4–6 Tokens/s.

#4. Qualität auf Französisch: die tatsächlichen Schwächen

Hier zeigt Phi-4 seine Grenzen. Das Modell wurde überwiegend mit englischsprachigen Daten trainiert (darunter viele synthetische Daten, die auf Englisch erzeugt wurden). Französisch ist im Korpus vorhanden, spielt aber eindeutig eine untergeordnete Rolle.

Grammatik und Kongruenz
Gut bei einfachen Sätzen, aber mit Kongruenzfehlern, Anglizismen und schwerfälligen Formulierungen, sobald längere Texte verlangt werden.
Technisches Vokabular FR
Tendenz, englische Begriffe („endpoint“, „deployment“, „thread“) zu verwenden, selbst wenn ein gängiger französischer Begriff existiert.
Verständnis
Versteht einen Prompt auf Französisch sehr gut. Das Problem liegt in der Textausgabe.
Code mit französischen Kommentaren
Codekommentare wechseln während der Generierung häufig ins Englische. Geben Sie die Anweisung ausdrücklich vor; das hilft, löst aber nicht alle Probleme.
Französische Kultur
Gering. Oberflächliche Kenntnisse der französischen Rechtsprechung, Geschichte oder Institutionen. Alles andere als ein geeignetes Modell, um einen juristischen Vermerk auf Französisch zu verfassen.
!
Das Urteil zur Nutzung auf Französisch
Für ordentliche französische Texte sollten Sie Mistral Small 24B bevorzugen (vielseitig, gut in Französisch) oder auf einem weniger leistungsfähigen Rechner Qwen 3.5 9B — deutlich besser in Französisch als Phi-4. Phi-4 bleibt hervorragend für Aufgaben, bei denen die Ausgabe aus Code oder strukturierten Schlussfolgerungen besteht und die Sprache der Interaktion kaum eine Rolle spielt.

Tipp, der etwas hilft: Ein strenger Systemprompt veranlasst das Modell, auf Französisch zu bleiben, wobei die Antworten manchmal kürzer sind.

Systemprompt FR
>>> /set system "Tu réponds exclusivement en français, sans jamais basculer en anglais. Les commentaires de code, les noms de variables explicatifs et les titres restent en français."

#5. Phi-4-Mini: die Version 3,8B

Microsoft hat parallel Phi-4-Mini veröffentlicht, eine Variante mit 3,8 Milliarden Parametern für stark eingeschränkte Hardwarekonfigurationen: Laptops ohne dedizierte GPU, Raspberry Pi 5 und Edge-Geräte. Mit 2,5 GB in Q4 läuft sie auf jeder modernen Maschine.

Installation
ollama pull phi4-mini
Notwendige VRAM/RAM
≈ 2,5 GB in Q4_K_M. Passt auf ein MacBook Air M1 mit 8 GB Speicher oder einen PC mit einer GPU mit 4 GB Speicher.
Geschwindigkeit
Sehr schnell. 80+ Tokens/s auf einer RTX 3060, 30+ Tokens/s auf einer neueren CPU.
Stärken
Befolgt kurze Anweisungen gut, geeignet für Hilfe bei Prompts, einfache Umformulierungen und Klassifikation.
Schwächen
Komplexes Reasoning und langer Code übersteigen seine Fähigkeiten. Es ist ein ergänzendes Modell, kein Ersatz für die 14B-Version.
→
Anwendungsfälle für Phi-4-Mini
Hervorragend geeignet, um es an einen lokalen n8n-Workflow anzubinden, E-Mails zu klassifizieren oder ein LLM in ein Python-Skript zu integrieren, das schnell und ressourcenschonend laufen muss. Für allgemeine Chats nicht empfohlen.

#6. Phi-4 vs Qwen 3.5 9B

2026 ist Qwen 3.5 9B von Alibaba der relevanteste direkte Konkurrent. Es ist etwas kompakter (6,6 GB in Q4 gegenüber 9 GB bei Phi-4), passt auf dieselbe GPU mit 12 GB und richtet sich an dieselbe Nutzergruppe. Was die beiden unterscheidet:

Schlussfolgern und Mathematik
Phi-4 liegt bei formalen Benchmarks (GPQA, MATH) vorn. Im praktischen Einsatz bei alltäglichen Problemen ist der Unterschied geringer, als man denkt.
Code
Qwen 3.5 9B ist insgesamt besser bei weniger gebräuchlichen Sprachen (Rust, Go, fortgeschrittenes SQL). Phi-4 bleibt wettbewerbsfähig bei Python und JS.
Französisch
Qwen 3.5 ist deutlich besser. Viel mehr mehrsprachige Trainingsdaten, ein reichhaltigerer Wortschatz, weniger Wechsel ins Englische. Bei diesem Kriterium hat Qwen einen klaren Vorteil.
Kontext
Qwen 3.5 9B unterstützt bis zu 256k Kontexttokens, Phi-4 beschränkt sich auf 16k. Wenn Sie lange Dokumente bearbeiten, ist Qwen viel besser geeignet.
Befolgen von Anweisungen
Phi-4 hält sich genauer an strukturierte Anweisungen (JSON-Format, strenge Vorgaben). Qwen ist etwas „kreativer“ und kann sich Freiheiten nehmen.
→
So wählen Sie aus
Für Aufgaben auf Englisch mit Schlussfolgern, Python-Code und strukturierter Ausgabe: Phi-4. Für Aufgaben auf Französisch, lange Kontexte und Code in mehreren Programmiersprachen: Qwen 3.5 9B. Mit einer GPU mit 12 GB können Sie ohnehin beide Modelle installieren und je nach Aufgabe wechseln.

#Fehlerbehebung

"Out of memory" beim Laden
Ihr VRAM reicht für die gewählte Quantisierung nicht aus. Wechseln Sie zu Q4_K_M (der leichtesten sinnvollen Variante) oder lassen Sie Ollama einen Teil auf die CPU auslagern, mit `ollama run phi4 --num-gpu N`, wobei N die Anzahl der Schichten ist, die auf die GPU geladen werden sollen.
Generierung mit 1–2 Tokens pro Sekunde auf einer Maschine mit GPU
Das Modell läuft wahrscheinlich auf der CPU. Prüfen Sie mit `ollama ps` die Spalte "PROCESSOR". Wenn dort 100% CPU steht, geben Sie VRAM frei (Chrome, Spiele, andere geladene Modelle) und starten Sie das Modell erneut.
Antworten, die während der Generierung auf Englisch wechseln
Bei Phi-4 ist dieses Verhalten im Französischen zu erwarten. Klarere Vorgaben im Systemprompt helfen teilweise. Wechseln Sie bei regelmäßiger französischsprachiger Nutzung das Modell, statt sich damit abzumühen.
Kontext auf 4096 Tokens gekürzt
Ollama lädt standardmäßig einen kurzen Kontext. Erweitern Sie ihn ausdrücklich: `/set parameter num_ctx 16384`. Phi-4 wurde allerdings nur bis zu einer Kontextlänge von 16k trainiert – es bringt nichts, darüber hinauszugehen.
Das Modell erfindet aktuelle Fakten
Der Wissensstand von Phi-4 ist auf den Zeitpunkt seines Trainings (Ende 2024) begrenzt, und sein Allgemeinwissen ist geringer als das größerer Modelle. Für aktuelle Fakten braucht es eine RAG-Pipeline, nicht das Modell allein.

#Weiterführende Informationen

Phi-4 ist ein guter Einstieg in lokale LLMs mit 14 Milliarden Parametern. Hier sind einige Anregungen, wie Sie mit Ihrer Installation weiterkommen können:

Einen direkten Konkurrenten testen
Der Qwen-3-Testleitfaden zeigt vergleichbare Benchmarks auf gängiger Consumer-Hardware und hilft Ihnen dabei, den Vergleich mit Ihren eigenen Prompts durchzuführen.
Die richtige Quantisierung wählen
Der Leitfaden „Die Auswahl der Quantisierung (Q4, Q5, Q8, FP16)“ erläutert die Qualitäts- und Speicherkompromisse, die auch für Phi-4 gelten.
Phi-4 ohne GPU ausführen
Wenn Sie ausschließlich auf der CPU arbeiten, ergänzt der Leitfaden „Ein LLM lokal ohne GPU ausführen“ das hier Beschriebene um spezifische Optimierungen.
Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.