Einsteiger 10 Min.Konfiguration

LLM lokal ohne GPU (CPU): Modelle je nach RAM 8/16/32 GB

Ein lokales LLM ohne GPU, allein auf der CPU, zu betreiben, ist 2026 durchaus möglich. Mit einem Ryzen 7 oder einem aktuellen i7 und 16 GB RAM können Sie mit einem 3B-Modell nahezu in Echtzeit chatten oder ein 7B-Modell für weniger dringende Antworten laufen lassen. Dieser Leitfaden zeigt Ihnen, welche Modelle Sie je nach verfügbarem RAM wählen sollten, liefert reale Messwerte auf gängigen Rechnern und erläutert die Einstellungen, die wirklich etwas bewirken.

Wählen Sie einen Rechner? Unsere Empfehlungen nach Budget →

Von Mohamed Meguedmi·Aktualisierung 2026-08-27·Unter Windows, macOS und Linux getestet

#Warum ein LLM lokal ohne GPU ausführen?

Alle Leitfäden zu lokaler KI gehen davon aus, dass Sie eine RTX 4070 in Ihrem Tower-PC haben. Tatsächlich arbeitet die große Mehrheit der Laptops, beruflich genutzten Desktop-PCs und Mini-PCs mit integrierter GPU oder ganz ohne dedizierte Grafikkarte. Die gute Nachricht: Ein LLM lässt sich auch ausschließlich auf der CPU betreiben.

Drei typische Gründe für einen reinen CPU-Betrieb: ein Laptop ohne NVIDIA-GPU (die meisten Dell- und Lenovo-Laptops sowie ältere Intel-Macs), ein beruflich genutzter Desktop-PC mit einer Intel- oder AMD-iGPU oder ein Linux-Server ohne Bildschirm, den man nicht mit einer GPU ausstatten möchte. In allen drei Fällen geht es nicht um die Frage „Funktioniert das?“, sondern um „Welches Modell bleibt brauchbar?“.

i
Der eigentliche begrenzende Faktor: der Arbeitsspeicher, nicht die CPU
Bei reinem CPU-Betrieb begrenzt die Speicherbandbreite die Tokens pro Sekunde, nicht die reine Rechenleistung des Prozessors. Ein neuerer Ryzen 7 und ein neuerer i5 liefern mit demselben Modell oft sehr ähnliche Ergebnisse.

#Was Sie im Alltag erwarten können

Das Lokale-KI-Paket

Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.

  • Lebenslanger Online-Zugang
  • PDF + Dateien
  • Erstattung binnen 30 Tagen

Bevor Sie etwas herunterladen, passen Sie Ihre Erwartungen an. Ein lokales LLM, das ohne GPU auf der CPU läuft, reagiert nicht so schnell wie ChatGPT oder ein Modell auf einer RTX 4090. Hier sind realistische Größenordnungen für 2026:

Modell 1B–2B Q4
20 bis 40 Tokens pro Sekunde auf einer modernen CPU. Sehr flüssig, fast wie ein Online-Chat. Perfekt für einfache Aufgaben: Umformulierung, kurze Zusammenfassung, Klassifikation.
Modell 3B Q4
10 bis 20 Tokens pro Sekunde. Weiterhin angenehm: Man liest mit, während das Modell schreibt. Der optimale Bereich für den täglichen Einsatz auf der CPU.
Modell 7B–8B Q4
4 bis 10 Tokens pro Sekunde. Nutzbar, aber mit Wartezeiten. Gut für asynchrone Aufgaben (einen Text analysieren, einen Entwurf erstellen).
Modell 13B–14B Q4
2 bis 5 Tokens pro Sekunde. Gerade noch erträglich. Verwenden Sie das Modell nur für Batch-Aufgaben, nicht für interaktive Chats.
Über 14B
Möglich, aber mühsam. Es ist besser, für eine Stunde eine Cloud-GPU zu mieten, als ein 32B-Modell auf der CPU laufen zu lassen.
→
Faustregel
Unter 5 Tokens pro Sekunde wird der interaktive Chat frustrierend. Über 15 Tokens pro Sekunde lesen Sie so schnell, wie das Modell schreibt. Streben Sie diesen zweiten Bereich an.

#Empfohlene Modelle basierend auf verfügbarem RAM

Beim Betrieb auf der CPU kann der gesamte System-RAM für das Modell genutzt werden, doch Sie müssen ausreichend Speicher für das Betriebssystem und Ihre Anwendungen freihalten. Planen Sie 4 bis 6 GB für das System ein. Der verbleibende Speicher bestimmt, wie groß das Modell sein kann.

#8 GB RAM: Modelle mit 2B bis 4B Parametern

Qwen 3.5 2B Q4_K_M
≈1,9 GB. Sehr schnell, multimodal, bis zu 256k Kontext und Lizenz Apache 2.0. Gut für die Umformulierung, Übersetzung und Klassifizierung.
Granite 4.2 3B Q4_K_M
≈2,2 GB. Sehr sparsam und token-effizient, von IBM, unter der Apache-2.0-Lizenz. Spricht gutes Französisch.
Qwen 3.5 4B Q4_K_M
≈3,4 GB. Das neue kleine Standardmodell. Solide beim Programmieren und auf Französisch.
Gemma 4 E2B Q4 (QAT)
≈4,3 GB. Kompakt und multimodal, von Google, 2026 auf die Apache-2.0-Lizenz umgestellt.

#16 GB RAM: 8B–12B komfortabel

Granite 4.2 8B Q4_K_M
≈5,3 GB. Sehr token-effizient, 128k Kontext, Lizenz Apache 2.0. Schnell zu laden.
Qwen 3.5 9B Q4_K_M
≈6,6 GB. DIE Wahl für 8 GB im Jahr 2026: 256k Kontext, Bildverarbeitung, hervorragend beim logischen Schlussfolgern und auf Französisch.
Gemma 4 12B Q4_K_M
≈7,6 GB. Multimodal und effizient, Apache-2.0-Lizenz. Eine Stufe darüber, wenn Ihr RAM ausreicht.
Qwen 2.5 Coder 7B base Q4_K_M
≈4,7 GB. Die Ausnahme, die weiter gilt: die Referenz 2026 für die lokale Inline-Code-Autocompletion (FIM).

#32 GB RAM: Ein 24B-Modell kommt infrage

Mistral Small 24B Q4_K_M
≈14 GB. Vielseitig einsetzbar, sehr gut auf Französisch, aber auf der CPU nur 3 bis 5 Tokens pro Sekunde.
gpt-oss 20B Q4 (MXFP4)
≈14 GB. Open-Weight-Modell von OpenAI, dank des MXFP4-Formats sehr schnell, Kontextfenster von 131.000 Tokens.
Qwen 3.8 27B Q4_K_M (an der Grenze)
≈18 GB. 262k Kontext, Bildverarbeitung, Apache-2.0-Lizenz. Möglich, aber langsam, ca. 2 Tokens/s. Eher für die Stapelverarbeitung geeignet – denken Sie daran, das Reasoning auf low zu stellen, damit das Modell nicht übermäßig lange nachdenkt.
!
Aggressivere Quantisierung?
Q3_K_M spart gegenüber Q4_K_M etwa 20 % RAM, aber bei Modellen unter 7B sinkt die Qualität spürbar. Bleiben Sie bei einem 1B–3B-Modell mindestens bei Q4_K_M. Bei einem 13B-Modell auf 16 GB kann Q3 die Situation retten.

#1. Ollama installieren (automatischer CPU-Modus)

Ollama ist das einfachste Werkzeug für den Einstieg. Es erkennt automatisch, wenn keine GPU vorhanden ist, und wechselt ohne besondere Konfiguration zur CPU. Der Daemon lauscht standardmäßig auf http://localhost:11434.

Linux — offizielles Installationsskript
curl -fsSL https://ollama.com/install.sh | sh

Laden Sie unter Windows und macOS das Installationsprogramm von ollama.com herunter. Für den CPU-Modus sind keine speziellen Einstellungen nötig – Ollama trifft automatisch die richtige Wahl.

Prüfen, ob Ollama läuft
ollama --version
ollama ps

Der Befehl ollama ps muss den Status des Dienstes anzeigen. Wenn eine Konversation läuft, zeigt die Spalte PROCESSOR 100 % CPU an – genau das ist hier gewünscht.

#2. Drei Modelle für den Vergleich im reinen CPU-Betrieb

Bei 16 GB RAM lautet die Frage nicht „welches Modell“, sondern „welches der drei führenden kleinen Modelle von 2026“. Laden Sie alle drei herunter und bilden Sie sich innerhalb einer Stunde Ihre eigene Meinung.

Die drei Challenger herunterladen
ollama pull qwen3.5:4b
ollama pull granite4.2:3b
ollama pull gemma4:e2b-it-qat
Qwen 3.5 4B
Das beste Allround-Modell dieser Größe. Sehr stark auf Französisch, gut beim Programmieren, 256k Kontext, befolgt Anweisungen zuverlässig. Das langsamste der drei (bedingt durch die 4B).
Granite 4.2 3B
Sehr sparsam und token-effizient, von IBM. Befolgt Anweisungen gut, Apache-2.0-Lizenz. Ein guter Kompromiss zwischen Geschwindigkeit und Qualität.
Gemma 4 E2B
Das schnellste der drei Modelle. Multimodal, mit erstaunlicher Qualität für seine Größe. Ideal, wenn Sie auf einer weniger leistungsstarken CPU nahezu in Echtzeit arbeiten möchten. Beim Programmieren schwächer als die beiden anderen.
Einen Benchmark für die Leistung in Gesprächen starten
ollama run gemma4:e2b-it-qat --verbose
>>> Explique en 3 phrases la différence entre une LLC et une SAS.

Die Option --verbose zeigt am Ende jeder Antwort die Statistiken an: prompt eval rate, eval rate (Tokens pro Sekunde bei der Generierung), total duration. Das ist Ihre Referenzmetrik auf diesem Rechner.

→
Wissenschaftlich vergleichen
Stellen Sie den drei Modellen exakt dieselbe Frage, in derselben Reihenfolge und bei einem Kaltstart (erster Start). Vergleichen Sie: Antwortqualität, angezeigte eval rate und Gesamtzeit. Welches Modell das „beste“ ist, hängt von Ihrem Anwendungsfall ab, nicht von einer absoluten Rangliste.

#3. Benchmarks in Tokens pro Sekunde: Größenordnungen

Hier sind Größenordnungen für repräsentative Rechner ohne GPU, mit Ollama (das intern llama.cpp nutzt) und Q4_K_M-Quantisierung. Ihre Ergebnisse werden je nach Kontext, Speicher und DDR-Takt um ±20 % variieren.

#Intel Core i5-12400 + DDR4-3200 16 GB

Gemma 4 E2B Q4
≈ 26 Tokens pro Sekunde bei der Generierung
Granite 4.2 3B Q4_K_M
≈ 20 Tokens/Sekunde
Qwen 3.5 4B Q4_K_M
≈ 15 Tokens/s
Granite 4.2 8B Q4_K_M
≈ 8 Tokens pro Sekunde
Qwen 3.5 9B Q4_K_M
≈ 6 Tokens pro Sekunde

#Intel Core i7-13700K + DDR5-5600 32 GB

Gemma 4 E2B Q4
≈ 40 Tokens pro Sekunde
Granite 4.2 3B Q4_K_M
≈ 30 Token/s
Qwen 3.5 4B Q4_K_M
≈ 23 Token pro Sekunde
Qwen 3.5 9B Q4_K_M
≈ 12 Tokens/sec
Mistral Small 24B Q4_K_M
≈ 4 Tokens pro Sekunde

#AMD Ryzen 7 7700X + DDR5-6000 32 GB

Gemma 4 E2B Q4
≈ 44 Tokens pro Sekunde
Granite 4.2 3B Q4_K_M
≈ 32 Tokens/sec
Qwen 3.5 4B Q4_K_M
≈ 24 Tokens pro Sekunde
Granite 4.2 8B Q4_K_M
≈ 13 Tokens pro Sekunde
Qwen 3.5 9B Q4_K_M
≈ 11 Tokens/Sekunde
Mistral Small 24B Q4_K_M
≈ 5 Tokens pro Sekunde
i
Einordnung dieser Zahlen
Springen Sie 50 % zwischen DDR4-3200 und DDR5-6000 auf dem gleichen Modell. Bei der CPU zählt Ihre RAM häufig mehr als der Prozessor. Eine schnelle DDR5 lohnt sich oft vor einem CPU-Upgrade.

#4. llama.cpp mit AVX-512 kompilieren (für Fortgeschrittene)

Ollama enthält generische, vorkompilierte llama.cpp-Binaries. Wenn Sie llama.cpp manuell mit den Befehlssätzen Ihrer CPU (AVX2, AVX-512, AMX) kompilieren, können Sie auf manchen Prozessoren 10 bis 30 % mehr Tokens pro Sekunde erreichen. Nur für Intel-Core-Prozessoren ab der 11. Generation (Ice Lake / Rocket Lake / Sapphire Rapids), die AVX-512 unterstützen.

AVX-512-Unterstützung prüfen (Linux)
grep -o 'avx512[a-z_]*' /proc/cpuinfo | sort -u

Wenn der Befehl Zeilen ausgibt (avx512f, avx512dq usw.), unterstützt Ihre CPU AVX-512. Andernfalls bleiben Sie bei der Standardversion von Ollama; Sie hätten dadurch keinen Vorteil.

llama.cpp mit AVX-512 klonen und kompilieren
git clone https://github.com/ggerganov/llama.cpp
cd llama.cpp
cmake -B build \
  -DGGML_NATIVE=ON \
  -DGGML_AVX512=ON \
  -DGGML_AVX512_VBMI=ON \
  -DGGML_AVX512_VNNI=ON
cmake --build build --config Release -j

Die Option -DGGML_NATIVE=ON lässt den Compiler automatisch die Befehlssätze Ihrer CPU erkennen und aktiviert alles, was verfügbar ist. Dies ist die einfachste und zuverlässigste Methode.

Mit einem GGUF-Modell testen
./build/bin/llama-bench -m qwen3.5-9b-Q4_K_M.gguf -t 8

Die Option -t gibt die Anzahl der Threads an (geben Sie die Anzahl der physikalischen Kerne an, nicht die logischen). llama-bench liefert eine Tabelle mit pp512 (Prompt-Evaluation) und tg128 (Generierung) in Token pro Sekunde — Ihr neuer Vergleichspunkt.

!
AVX-512 auf Intel-CPUs für den Verbrauchermarkt: Vorsicht
Bei Intel-Core-Prozessoren der 12. und 13. Generation (Alder Lake, Raptor Lake) ist AVX-512 seit einem Microcode-Update aus dem Jahr 2022 standardmäßig im BIOS deaktiviert. Auf diesen CPUs bringt Ihnen eine Kompilierung mit AVX-512 nichts — bleiben Sie bei AVX2.

#Tipps für mehr Tokens pro Sekunde auf der CPU

  1. 01
    Die Anzahl der Threads einstellen
    Ollama verwendet standardmäßig alle logischen Kerne. Auf bestimmten CPUs mit Hyper-Threading wird die Leistung um 5 bis 15 % verbessert, wenn nur die physikalischen Kerne genutzt werden (OLLAMA_NUM_THREADS=8 für einen 8-Kern-Prozessor).
  2. 02
    Das Modell geladen halten
    Das Laden des Modells dauert einige Sekunden. OLLAMA_KEEP_ALIVE=30m hält das Modell nach der letzten Anfrage 30 Minuten lang im RAM. Ohne GPU ist das noch wertvoller, weil das erneute Laden langsam ist.
  3. 03
    Den Kontext nach Möglichkeit reduzieren
    num_ctx 2048 statt 8192 spart RAM und beschleunigt die Verarbeitung spürbar. Behalten Sie einen großen Kontext nur für Anwendungsfälle bei, die ihn wirklich benötigen (RAG, lange Dokumente).
  4. 04
    Chrome und Slack schließen
    Ein 7B-LLM auf der CPU lastet die Speicherbandbreite vollständig aus. Alles, was ebenfalls auf den RAM zugreift (Browser mit 50 Tabs, Slack, Teams), nimmt ihm Rechenzyklen weg. Bei 16 GB kann das den Unterschied zwischen 5 und 8 Tokens/s ausmachen.
  5. 05
    Den schnellsten kompatiblen DDR-Speicher wählen
    Wenn Sie aufrüsten: DDR4-3200 → DDR4-3600 = +10 %. DDR4 → DDR5-5600 = +30 bis 50 %. Die CPU hat für die LLM-Inferenz viel weniger Einfluss als der Speicher.

#Wenn die CPU nicht mehr ausreicht

Seien wir ehrlich: Ohne GPU bleiben bestimmte Anwendungen außer Reichweite. Wenn Sie Ihren Anwendungsfall in der folgenden Liste wiedererkennen, ist es Zeit, eine GPU in Betracht zu ziehen, auch eine bescheidene (eine gebrauchte RTX 3060 mit 12 GB für 250 € macht einen enormen Unterschied), oder Cloud-Ressourcen stundenweise zu mieten.

Interaktiver Chat mit einem 13B+-Modell
2 bis 5 Tokens pro Sekunde sind zu langsam für dialogorientierte KI. Eine GPU mit 12 GB löst das sofort.
RAG mit großem Kontext (16k+)
Die Verarbeitungszeit für die Prompt-Auswertung steigt auf der CPU enorm an. Eine RTX 3060 verarbeitet einen 8k-Prompt in 1 Sekunde, ein i7 benötigt 30 Sekunden.
Code-Autovervollständigung in Echtzeit
Erweiterungen für die Inline-Autovervollständigung (Tabby und Co., im FIM-Modus mit Qwen 2.5 Coder 7B base) benötigen Antworten in unter 200 ms. Auf einer CPU kommen Sie nicht unter 1 bis 2 Sekunden. Eine GPU ist zwingend erforderlich.
Generierung in großen Mengen
1000 Dokumente verarbeiten = Tage auf CPU, Stunden auf GPU. Für einen einzelnen Batch reichen RunPod oder Vast.ai zu 0,30 €/h, um das in einer Nacht zu erledigen.

#Weiterführende Informationen

Sie haben nun ein lokales LLM, das auf der CPU läuft und antwortet. Je nach Ihrer nächsten Frage bieten sich folgende weiterführende Schritte an:

Die richtige Quantisierung wählen
Q4_K_M ist der sinnvolle Standard, aber je nach verfügbarem RAM haben auch Q5_K_M oder Q3 ihren Platz. Der Leitfaden zur Quantisierung erläutert die Kompromisse im Detail.
Das Ganze mit einer Benutzeroberfläche ausstatten
Das Terminal eignet sich gut zum Testen. Mit Open WebUI oder LM Studio erhalten Sie in wenigen Minuten eine lokale, ChatGPT-ähnliche Benutzeroberfläche.
Wann eine GPU hinzufügen?
Sollten Sie den Schritt wagen, bietet der GPU-Wahlleitfaden einen Vergleich zwischen RTX 3060 und 4060 und 4070 mit den zugehörigen LLM-Benchmarks.

Empfohlene Hardware: Radeon RX 9070 XT 16 GB — um vom reinen CPU-Betrieb auf eine dedizierte GPU umzusteigen. Alle KI-Hardware →

Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.