LLM lokal ohne GPU (CPU): Modelle je nach RAM 8/16/32 GB
Ein lokales LLM ohne GPU, allein auf der CPU, zu betreiben, ist 2026 durchaus möglich. Mit einem Ryzen 7 oder einem aktuellen i7 und 16 GB RAM können Sie mit einem 3B-Modell nahezu in Echtzeit chatten oder ein 7B-Modell für weniger dringende Antworten laufen lassen. Dieser Leitfaden zeigt Ihnen, welche Modelle Sie je nach verfügbarem RAM wählen sollten, liefert reale Messwerte auf gängigen Rechnern und erläutert die Einstellungen, die wirklich etwas bewirken.
Wählen Sie einen Rechner? Unsere Empfehlungen nach Budget →
#Warum ein LLM lokal ohne GPU ausführen?
Alle Leitfäden zu lokaler KI gehen davon aus, dass Sie eine RTX 4070 in Ihrem Tower-PC haben. Tatsächlich arbeitet die große Mehrheit der Laptops, beruflich genutzten Desktop-PCs und Mini-PCs mit integrierter GPU oder ganz ohne dedizierte Grafikkarte. Die gute Nachricht: Ein LLM lässt sich auch ausschließlich auf der CPU betreiben.
Drei typische Gründe für einen reinen CPU-Betrieb: ein Laptop ohne NVIDIA-GPU (die meisten Dell- und Lenovo-Laptops sowie ältere Intel-Macs), ein beruflich genutzter Desktop-PC mit einer Intel- oder AMD-iGPU oder ein Linux-Server ohne Bildschirm, den man nicht mit einer GPU ausstatten möchte. In allen drei Fällen geht es nicht um die Frage „Funktioniert das?“, sondern um „Welches Modell bleibt brauchbar?“.
#Was Sie im Alltag erwarten können
Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.
- Lebenslanger Online-Zugang
- PDF + Dateien
- Erstattung binnen 30 Tagen
Bevor Sie etwas herunterladen, passen Sie Ihre Erwartungen an. Ein lokales LLM, das ohne GPU auf der CPU läuft, reagiert nicht so schnell wie ChatGPT oder ein Modell auf einer RTX 4090. Hier sind realistische Größenordnungen für 2026:
- Modell 1B–2B Q4
- 20 bis 40 Tokens pro Sekunde auf einer modernen CPU. Sehr flüssig, fast wie ein Online-Chat. Perfekt für einfache Aufgaben: Umformulierung, kurze Zusammenfassung, Klassifikation.
- Modell 3B Q4
- 10 bis 20 Tokens pro Sekunde. Weiterhin angenehm: Man liest mit, während das Modell schreibt. Der optimale Bereich für den täglichen Einsatz auf der CPU.
- Modell 7B–8B Q4
- 4 bis 10 Tokens pro Sekunde. Nutzbar, aber mit Wartezeiten. Gut für asynchrone Aufgaben (einen Text analysieren, einen Entwurf erstellen).
- Modell 13B–14B Q4
- 2 bis 5 Tokens pro Sekunde. Gerade noch erträglich. Verwenden Sie das Modell nur für Batch-Aufgaben, nicht für interaktive Chats.
- Über 14B
- Möglich, aber mühsam. Es ist besser, für eine Stunde eine Cloud-GPU zu mieten, als ein 32B-Modell auf der CPU laufen zu lassen.
#Empfohlene Modelle basierend auf verfügbarem RAM
Beim Betrieb auf der CPU kann der gesamte System-RAM für das Modell genutzt werden, doch Sie müssen ausreichend Speicher für das Betriebssystem und Ihre Anwendungen freihalten. Planen Sie 4 bis 6 GB für das System ein. Der verbleibende Speicher bestimmt, wie groß das Modell sein kann.
#8 GB RAM: Modelle mit 2B bis 4B Parametern
- Qwen 3.5 2B Q4_K_M
- ≈1,9 GB. Sehr schnell, multimodal, bis zu 256k Kontext und Lizenz Apache 2.0. Gut für die Umformulierung, Übersetzung und Klassifizierung.
- Granite 4.2 3B Q4_K_M
- ≈2,2 GB. Sehr sparsam und token-effizient, von IBM, unter der Apache-2.0-Lizenz. Spricht gutes Französisch.
- Qwen 3.5 4B Q4_K_M
- ≈3,4 GB. Das neue kleine Standardmodell. Solide beim Programmieren und auf Französisch.
- Gemma 4 E2B Q4 (QAT)
- ≈4,3 GB. Kompakt und multimodal, von Google, 2026 auf die Apache-2.0-Lizenz umgestellt.
#16 GB RAM: 8B–12B komfortabel
- Granite 4.2 8B Q4_K_M
- ≈5,3 GB. Sehr token-effizient, 128k Kontext, Lizenz Apache 2.0. Schnell zu laden.
- Qwen 3.5 9B Q4_K_M
- ≈6,6 GB. DIE Wahl für 8 GB im Jahr 2026: 256k Kontext, Bildverarbeitung, hervorragend beim logischen Schlussfolgern und auf Französisch.
- Gemma 4 12B Q4_K_M
- ≈7,6 GB. Multimodal und effizient, Apache-2.0-Lizenz. Eine Stufe darüber, wenn Ihr RAM ausreicht.
- Qwen 2.5 Coder 7B base Q4_K_M
- ≈4,7 GB. Die Ausnahme, die weiter gilt: die Referenz 2026 für die lokale Inline-Code-Autocompletion (FIM).
#32 GB RAM: Ein 24B-Modell kommt infrage
- Mistral Small 24B Q4_K_M
- ≈14 GB. Vielseitig einsetzbar, sehr gut auf Französisch, aber auf der CPU nur 3 bis 5 Tokens pro Sekunde.
- gpt-oss 20B Q4 (MXFP4)
- ≈14 GB. Open-Weight-Modell von OpenAI, dank des MXFP4-Formats sehr schnell, Kontextfenster von 131.000 Tokens.
- Qwen 3.8 27B Q4_K_M (an der Grenze)
- ≈18 GB. 262k Kontext, Bildverarbeitung, Apache-2.0-Lizenz. Möglich, aber langsam, ca. 2 Tokens/s. Eher für die Stapelverarbeitung geeignet – denken Sie daran, das Reasoning auf low zu stellen, damit das Modell nicht übermäßig lange nachdenkt.
#1. Ollama installieren (automatischer CPU-Modus)
Ollama ist das einfachste Werkzeug für den Einstieg. Es erkennt automatisch, wenn keine GPU vorhanden ist, und wechselt ohne besondere Konfiguration zur CPU. Der Daemon lauscht standardmäßig auf http://localhost:11434.
Laden Sie unter Windows und macOS das Installationsprogramm von ollama.com herunter. Für den CPU-Modus sind keine speziellen Einstellungen nötig – Ollama trifft automatisch die richtige Wahl.
Der Befehl ollama ps muss den Status des Dienstes anzeigen. Wenn eine Konversation läuft, zeigt die Spalte PROCESSOR 100 % CPU an – genau das ist hier gewünscht.
#2. Drei Modelle für den Vergleich im reinen CPU-Betrieb
Bei 16 GB RAM lautet die Frage nicht „welches Modell“, sondern „welches der drei führenden kleinen Modelle von 2026“. Laden Sie alle drei herunter und bilden Sie sich innerhalb einer Stunde Ihre eigene Meinung.
- Qwen 3.5 4B
- Das beste Allround-Modell dieser Größe. Sehr stark auf Französisch, gut beim Programmieren, 256k Kontext, befolgt Anweisungen zuverlässig. Das langsamste der drei (bedingt durch die 4B).
- Granite 4.2 3B
- Sehr sparsam und token-effizient, von IBM. Befolgt Anweisungen gut, Apache-2.0-Lizenz. Ein guter Kompromiss zwischen Geschwindigkeit und Qualität.
- Gemma 4 E2B
- Das schnellste der drei Modelle. Multimodal, mit erstaunlicher Qualität für seine Größe. Ideal, wenn Sie auf einer weniger leistungsstarken CPU nahezu in Echtzeit arbeiten möchten. Beim Programmieren schwächer als die beiden anderen.
Die Option --verbose zeigt am Ende jeder Antwort die Statistiken an: prompt eval rate, eval rate (Tokens pro Sekunde bei der Generierung), total duration. Das ist Ihre Referenzmetrik auf diesem Rechner.
#3. Benchmarks in Tokens pro Sekunde: Größenordnungen
Hier sind Größenordnungen für repräsentative Rechner ohne GPU, mit Ollama (das intern llama.cpp nutzt) und Q4_K_M-Quantisierung. Ihre Ergebnisse werden je nach Kontext, Speicher und DDR-Takt um ±20 % variieren.
#Intel Core i5-12400 + DDR4-3200 16 GB
- Gemma 4 E2B Q4
- ≈ 26 Tokens pro Sekunde bei der Generierung
- Granite 4.2 3B Q4_K_M
- ≈ 20 Tokens/Sekunde
- Qwen 3.5 4B Q4_K_M
- ≈ 15 Tokens/s
- Granite 4.2 8B Q4_K_M
- ≈ 8 Tokens pro Sekunde
- Qwen 3.5 9B Q4_K_M
- ≈ 6 Tokens pro Sekunde
#Intel Core i7-13700K + DDR5-5600 32 GB
- Gemma 4 E2B Q4
- ≈ 40 Tokens pro Sekunde
- Granite 4.2 3B Q4_K_M
- ≈ 30 Token/s
- Qwen 3.5 4B Q4_K_M
- ≈ 23 Token pro Sekunde
- Qwen 3.5 9B Q4_K_M
- ≈ 12 Tokens/sec
- Mistral Small 24B Q4_K_M
- ≈ 4 Tokens pro Sekunde
#AMD Ryzen 7 7700X + DDR5-6000 32 GB
- Gemma 4 E2B Q4
- ≈ 44 Tokens pro Sekunde
- Granite 4.2 3B Q4_K_M
- ≈ 32 Tokens/sec
- Qwen 3.5 4B Q4_K_M
- ≈ 24 Tokens pro Sekunde
- Granite 4.2 8B Q4_K_M
- ≈ 13 Tokens pro Sekunde
- Qwen 3.5 9B Q4_K_M
- ≈ 11 Tokens/Sekunde
- Mistral Small 24B Q4_K_M
- ≈ 5 Tokens pro Sekunde
#4. llama.cpp mit AVX-512 kompilieren (für Fortgeschrittene)
Ollama enthält generische, vorkompilierte llama.cpp-Binaries. Wenn Sie llama.cpp manuell mit den Befehlssätzen Ihrer CPU (AVX2, AVX-512, AMX) kompilieren, können Sie auf manchen Prozessoren 10 bis 30 % mehr Tokens pro Sekunde erreichen. Nur für Intel-Core-Prozessoren ab der 11. Generation (Ice Lake / Rocket Lake / Sapphire Rapids), die AVX-512 unterstützen.
Wenn der Befehl Zeilen ausgibt (avx512f, avx512dq usw.), unterstützt Ihre CPU AVX-512. Andernfalls bleiben Sie bei der Standardversion von Ollama; Sie hätten dadurch keinen Vorteil.
Die Option -DGGML_NATIVE=ON lässt den Compiler automatisch die Befehlssätze Ihrer CPU erkennen und aktiviert alles, was verfügbar ist. Dies ist die einfachste und zuverlässigste Methode.
Die Option -t gibt die Anzahl der Threads an (geben Sie die Anzahl der physikalischen Kerne an, nicht die logischen). llama-bench liefert eine Tabelle mit pp512 (Prompt-Evaluation) und tg128 (Generierung) in Token pro Sekunde — Ihr neuer Vergleichspunkt.
#Tipps für mehr Tokens pro Sekunde auf der CPU
- 01Die Anzahl der Threads einstellenOllama verwendet standardmäßig alle logischen Kerne. Auf bestimmten CPUs mit Hyper-Threading wird die Leistung um 5 bis 15 % verbessert, wenn nur die physikalischen Kerne genutzt werden (OLLAMA_NUM_THREADS=8 für einen 8-Kern-Prozessor).
- 02Das Modell geladen haltenDas Laden des Modells dauert einige Sekunden. OLLAMA_KEEP_ALIVE=30m hält das Modell nach der letzten Anfrage 30 Minuten lang im RAM. Ohne GPU ist das noch wertvoller, weil das erneute Laden langsam ist.
- 03Den Kontext nach Möglichkeit reduzierennum_ctx 2048 statt 8192 spart RAM und beschleunigt die Verarbeitung spürbar. Behalten Sie einen großen Kontext nur für Anwendungsfälle bei, die ihn wirklich benötigen (RAG, lange Dokumente).
- 04Chrome und Slack schließenEin 7B-LLM auf der CPU lastet die Speicherbandbreite vollständig aus. Alles, was ebenfalls auf den RAM zugreift (Browser mit 50 Tabs, Slack, Teams), nimmt ihm Rechenzyklen weg. Bei 16 GB kann das den Unterschied zwischen 5 und 8 Tokens/s ausmachen.
- 05Den schnellsten kompatiblen DDR-Speicher wählenWenn Sie aufrüsten: DDR4-3200 → DDR4-3600 = +10 %. DDR4 → DDR5-5600 = +30 bis 50 %. Die CPU hat für die LLM-Inferenz viel weniger Einfluss als der Speicher.
#Wenn die CPU nicht mehr ausreicht
Seien wir ehrlich: Ohne GPU bleiben bestimmte Anwendungen außer Reichweite. Wenn Sie Ihren Anwendungsfall in der folgenden Liste wiedererkennen, ist es Zeit, eine GPU in Betracht zu ziehen, auch eine bescheidene (eine gebrauchte RTX 3060 mit 12 GB für 250 € macht einen enormen Unterschied), oder Cloud-Ressourcen stundenweise zu mieten.
- Interaktiver Chat mit einem 13B+-Modell
- 2 bis 5 Tokens pro Sekunde sind zu langsam für dialogorientierte KI. Eine GPU mit 12 GB löst das sofort.
- RAG mit großem Kontext (16k+)
- Die Verarbeitungszeit für die Prompt-Auswertung steigt auf der CPU enorm an. Eine RTX 3060 verarbeitet einen 8k-Prompt in 1 Sekunde, ein i7 benötigt 30 Sekunden.
- Code-Autovervollständigung in Echtzeit
- Erweiterungen für die Inline-Autovervollständigung (Tabby und Co., im FIM-Modus mit Qwen 2.5 Coder 7B base) benötigen Antworten in unter 200 ms. Auf einer CPU kommen Sie nicht unter 1 bis 2 Sekunden. Eine GPU ist zwingend erforderlich.
- Generierung in großen Mengen
- 1000 Dokumente verarbeiten = Tage auf CPU, Stunden auf GPU. Für einen einzelnen Batch reichen RunPod oder Vast.ai zu 0,30 €/h, um das in einer Nacht zu erledigen.
#Weiterführende Informationen
Sie haben nun ein lokales LLM, das auf der CPU läuft und antwortet. Je nach Ihrer nächsten Frage bieten sich folgende weiterführende Schritte an:
- Die richtige Quantisierung wählen
- Q4_K_M ist der sinnvolle Standard, aber je nach verfügbarem RAM haben auch Q5_K_M oder Q3 ihren Platz. Der Leitfaden zur Quantisierung erläutert die Kompromisse im Detail.
- Das Ganze mit einer Benutzeroberfläche ausstatten
- Das Terminal eignet sich gut zum Testen. Mit Open WebUI oder LM Studio erhalten Sie in wenigen Minuten eine lokale, ChatGPT-ähnliche Benutzeroberfläche.
- Wann eine GPU hinzufügen?
- Sollten Sie den Schritt wagen, bietet der GPU-Wahlleitfaden einen Vergleich zwischen RTX 3060 und 4060 und 4070 mit den zugehörigen LLM-Benchmarks.
Empfohlene Hardware: Radeon RX 9070 XT 16 GB — um vom reinen CPU-Betrieb auf eine dedizierte GPU umzusteigen. Alle KI-Hardware →
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.