Beste kostenlose lokale KI: Top-Auswahl 2026, auch ohne GPU
Ja: Ollama, LM Studio, Jan und GPT4All lassen sich kostenlos herunterladen, und Qwen 3.5, Gemma 4, Granite 4.2 oder gpt-oss sind unter der Apache-2.0-Lizenz veröffentlicht. Die richtige Wahl hängt vom Speicher ab: Eine Datei von 2 bis 4 GB eignet sich für einen Rechner mit 8 GB, 6 bis 8 GB erfordern 16 GB, und bei mehr als 14 GB sind 24 GB VRAM oder 32 GB Arbeitsspeicher erforderlich.
Eine kostenlose lokale KI braucht nur zwei Downloads: eine Software (Ollama, LM Studio, Jan) und ein Sprachmodell mit offenen Gewichten. Das entscheidende Auswahlkriterium ist nicht der Name des Modells, sondern seine Dateigröße im Verhältnis zu Ihrem verfügbaren Speicher. Diese Seite nennt die tatsächlichen, von Ollama veröffentlichten Dateigrößen, zeigt eine Geschwindigkeitsberechnung für Rechner ohne Grafikkarte und erläutert Fälle, in denen eine sogenannte „lokale“ KI Ihre Daten dennoch anderswohin sendet.
Wählen Sie einen Rechner? Unsere Empfehlungen nach Budget →
#Kostenlos starten, abhängig von Ihrem Gerät
Es gibt nicht die eine beste kostenlose lokale KI: Die richtige Wahl ist das größte Modell, dessen Datei mit ausreichend Reserve in Ihren Speicher passt und das Sie mit Ollama oder LM Studio starten. Auf einem Rechner mit 8 GB Speicher ohne Grafikkarte sollten Sie eine Datei von 2 bis 4 GB anstreben, etwa Granite 4.2 3B (2,2 GB) oder Qwen 3.5 4B (3,4 GB). Mit 16 GB sind Qwen 3.5 9B (6,6 GB), Granite 4.2 8B (5,3 GB) oder Gemma 4 12B (7,6 GB) sinnvolle Ausgangspunkte. Ab 24 GB VRAM oder 32 GB Speicher lassen sich gpt-oss 20B (14 GB) und Modelle mit 27 Milliarden Parametern (18 GB) nutzen. Diese Größen entsprechen den von Ollama angegebenen Dateigrößen, nicht den Milliarden Parametern im Namen: Die Datei muss zusammen mit dem Kontext und einer Reserve für das System in den Speicher passen. Das sind erste Ansatzpunkte, keine Garantien für Qualität oder Geschwindigkeit: Probieren Sie das Modell mit Ihren eigenen Aufgaben aus.
| Speicher des Rechners | Modelle zum Testen (Ollama-Tag) | Dateigröße | Angegebene Kontextlänge |
|---|---|---|---|
| 8 GB, ohne GPU | granite4.2:3b ; qwen3.5:4b | 2,2 GB; 3,4 GB | 128 k; 256 k Tokens |
| 16 GB | granite4.2:8b ; qwen3.5:9b ; gemma4:12b | 5,3 GB; 6,6 GB; 7,6 GB | 128 k ; 256 k ; 256 k Tokens |
| 24 GB VRAM oder 32 GB Speicher | gpt-oss:20b ; qwen3.6:27b ; qwen3.8:27b ; gemma4:26b | 14 GB; 18 GB; 18 GB; 19 GB | 128 k ; 256 k ; 256 k ; 256 k Tokens |
| 32 GB und mehr, zum Programmieren | qwen3-coder:30b | 19 GB | 256 k Tokens |
Die angegebene Kontextgröße ist ein Maximum, nicht die Größe, die tatsächlich zugewiesen wird. Ollama startet mit 4 k Tokens, wenn die Grafikkarte weniger als 24 GiB VRAM hat, und empfiehlt mindestens 64.000 Tokens für Webrecherche, Agenten und Code. Jede Erhöhung benötigt zusätzlich zu dem Speicher für die Datei weiteren Speicher.
- Kompatibilität meines Rechners einschätzen
- Quelle: Dateigrößen von Qwen 3.5 in der Ollama-Bibliothek
- Quelle: Standardkontext je nach VRAM, Ollama-Dokumentation
#Was ist eine lokale KI?
Sie wissen, welche kostenlose KI bei Ihnen läuft. Das lokale KI-Kit führt Sie zu einem Assistenten, der Ihnen jeden Tag nützlich ist: eine angeleitete Installation in einer Stunde (Kap. 1), das richtige Modell für genau Ihren Rechner (Kap. 3) und das, was wirklich ohne Grafikkarte funktioniert (Kap. 12).
- Lebenslanger Online-Zugang
- PDF + Dateien
- Erstattung binnen 30 Tagen
Eine lokale KI ist ein Sprachmodell (ein LLM wie Qwen, Gemma oder Granite), dessen Dateien auf Ihrem Laufwerk liegen und das von einer auf Ihrem Rechner installierten Software ausgeführt wird. Die Berechnungen erfolgen auf Ihrem Prozessor oder Ihrer Grafikkarte, nicht auf den Servern eines Anbieters. LM Studio erklärt dies in seiner Dokumentation: Was Sie im Gespräch mit einem Modell eingeben, verlässt das Gerät nicht.
Die betreffenden Modelle werden als Modelle mit offenen Gewichten bezeichnet: Ihre Parameter lassen sich herunterladen. Das ist nicht gleichbedeutend mit Open Source; dieser Status hängt von der Lizenz ab. Google weist bei Gemma darauf hin: Gemma 4, veröffentlicht am 2. April 2026, ist das erste Modell der Familie unter der von der OSI anerkannten Apache-2.0-Lizenz; die vorherigen Generationen standen nicht unter dieser Lizenz. Lesen Sie die Lizenz, bevor Sie ein Modell in einem Produkt wiederverwenden.
Das Gegenteil ist ein Online-Dienst wie ChatGPT, Gemini oder Claude: Ihre Nachrichten werden an die Server des Anbieters gesendet. Zwischen diesen beiden Varianten gibt es hybride Fälle, die weiter unten näher erläutert werden.
#Warum auf lokale KI umsteigen?
- Datenschutz
- Ihre Dokumente und Ihre Prompts bleiben auf dem Rechner, solange Sie weder ein gehostetes Modell noch eine Websuche aktivieren. Das ist nützlich für sensible Arbeiten sowie für juristische oder medizinische Aufgaben.
- Offline
- Das heruntergeladene Modell antwortet ohne Verbindung, im Zug oder in einem isolierten Netzwerk.
- Keine Nachrichtenbegrenzung
- Kein Tarif begrenzt Ihre Gespräche. Die einzige Grenze ist die Geschwindigkeit Ihrer Hardware.
- Kontrolle
- Sie wählen das Modell, seine Quantisierung und den Kontext und ersetzen es, sobald ein besseres Modell erscheint.
Dieser Kompromiss ist real: Ein lokales Modell muss in Ihren Speicher passen und ist daher kleiner als die Modelle der Online-Dienste.
#Kostenlose lokale KI: wirklich ohne etwas zu bezahlen?
Ja, für die hier genannten Programme und Modelle: Sie benötigen kein Abonnement, um mit einem auf Ihrem Rechner installierten Modell zu chatten. Drei Einschränkungen helfen, böse Überraschungen zu vermeiden: Die Softwarelizenzen unterscheiden sich (LM Studio ist kostenlos, aber nicht Open Source), die Kosten verlagern sich auf Speicherplatz und Hardware, und einige Anbieter verkaufen daneben auch Online-Angebote.
- Der Festplattenplatz
- Unter Windows benötigt Ollama mindestens 4 GB für die Installation und anschließend Speicherplatz für die Modelle, die laut Ollamas Dokumentation mehrere Dutzend bis mehrere Hundert GB belegen können.
- Das Hardware-Setup
- Eine 14-GB-Datei ist bei 8 GB Arbeitsspeicher nicht sinnvoll: Testen Sie zunächst mit einem kleinen Modell, bevor Sie etwas kaufen.
- Gehostete Angebote
- Der kostenlose Tarif von Ollama umfasst die lokale Ausführung, aber auch gehostete Modelle mit nutzungsabhängiger Abrechnung; darüber gibt es kostenpflichtige Tarife. Das ist keine lokale KI.
#Die besten kostenlosen Tools
| Tool | Lizenz | Benutzeroberfläche | Unterstützte Systeme |
|---|---|---|---|
| Ollama | MIT | Terminal, lokale API und Desktop-Anwendung | Windows 10 22H2 oder neuer; macOS 14 oder neuer (Apple Silicon, oder Intel im CPU-Only-Modus); Linux |
| LM Studio | Proprietär, kostenlos | Vollständige grafische Oberfläche | macOS 14+ ausschließlich auf Apple Silicon; Windows x64 und ARM; Linux |
| Jan | Apache 2.0 | Desktop-Anwendung | Windows, macOS, Linux |
| GPT4All | MIT | Desktop-Anwendung | Windows, macOS 12.6+, Linux x86-64 |
- Ollama
- Die Wahl der Entwickler: Ein Modell startet mit einem Befehl und bietet eine lokale API auf dem Port 11434.
- LM Studio
- Modellkatalog, Download per Klick und Chatfenster: am einfachsten für den Einstieg. Seit dem 8. Juli 2025 zu Hause ebenso wie am Arbeitsplatz kostenlos, aber proprietär: Die Nutzungsbedingungen gewähren eine Nutzungslizenz, keinen offenen Quellcode.
- Jan
- Lädt Modelle von Hugging Face herunter und startet einen lokalen Server. Das Repository der Anwendung weist darauf hin, dass sie auch mit OpenAI, Anthropic oder anderen Anbietern verbunden werden kann: Es liegt an Ihnen, bei der lokalen Nutzung zu bleiben.
- GPT4All
- Sein Repository behauptet: «Keine API-Aufrufe oder GPUs erforderlich». Die Dokumentation richtet sich an Modelle mit 3 bis 13 Milliarden Parametern und nennt 8 GB RAM für Llama 3 8B. Keine Version wurde seit der 3.10.0 aus Februar 2025 veröffentlicht: überprüfen Sie, ob er das gewünschte Modell unterstützt.
- Starten Sie mit LM Studio, Schritt für Schritt
- Ollama unter Windows, macOS oder Linux installieren
- Quelle: offizielle Voraussetzungen von LM Studio
#Ohne Grafikkarte: Was der Prozessor leistet
Ja, ein Modell kann ausschließlich mit dem Prozessor und dem Arbeitsspeicher laufen. Ollama bestätigt dies in seiner FAQ: Die Spalte Processor von ollama ps zeigt „100% CPU“ an, wenn das Modell vollständig in den Systemspeicher geladen ist. Die eigentliche Frage ist daher die Geschwindigkeit, nicht die Machbarkeit.
#Warum der Prozessor langsam ist: eine Berechnung
Für jedes generierte Token muss die Maschine den Großteil des Modells erneut aus dem Speicher lesen: Die Geschwindigkeit wird stärker durch die Geschwindigkeit des Datenzugriffs als durch die Rechenleistung begrenzt. Eine theoretische Obergrenze ergibt sich, indem man die Speicherbandbreite (GB/s) durch die Dateigröße (GB) teilt. Die Tabelle verwendet einen Beispielwert von 50 GB/s: Das ist eine veranschaulichende Berechnung, keine Messung.
| Modell | Dateigröße | Theoretisches Maximum |
|---|---|---|
| granite4.2:3b | 2,2 GB | etwa 23 Tokens pro Sekunde |
| granite4.2:8b | 5,3 GB | etwa 9 Tokens pro Sekunde |
| qwen3.5:9b | 6,6 GB | etwa 8 Tokens pro Sekunde |
Die Realität bleibt unter dem Niveau. Der Blog TensorFoundry berichtet auf einem Mac M2 Max mit 400 GB/s einer berechneten Grenze von etwa 87 Tokens pro Sekunde für einen 8B in 4 Bit, wobei 64,9 gemessen wurden, also 75 %. Praktische Konsequenz: Ohne GPU ist die Dateigröße der erste Leitfaden für die Geschwindigkeit, da die Grenze direkt davon abhängt. Modelle mit Experten (MoE) verändern die Situation, da sie nur einen Teil ihrer Parameter pro Token aktivieren: Qwen3-Coder 30B-A3B aktiviert 3,3 Milliarden von 30. Dies ist zu testen, sofern ausreichend Speicher für die gesamte Datei vorhanden ist.
#Abhängig von Ihrem System
- Windows
- Ollama erfordert Windows 10 22H2 oder neuer. LM Studio benötigt einen Prozessor mit AVX2 und empfiehlt 16 GB RAM und 4 GB VRAM.
- Mac mit Apple Silicon
- Prozessor und GPU teilen sich den vereinheitlichten Speicher. LM Studio empfiehlt 16 GB oder mehr; bei 8 GB rät es zu kleineren Modellen und kurzen Kontexten.
- Intel-Mac
- LM Studio unterstützt dies nicht. Ollama läuft auf x86, aber ausschließlich auf der CPU: Planen Sie den Einsatz kleiner Modelle ein.
- Linux
- Ollama und LM Studio sind verfügbar; Letzteres wird als AppImage bereitgestellt und erfordert Ubuntu 20.04 oder neuer.
#Die besten kostenlosen Modelle 2026
Diese Auswahl beruht auf dem, was Ollama veröffentlicht und was die Herausgeber dokumentieren, nicht auf einem eigenen Test.
- Qwen 3.5 (Alibaba)
- Multimodale Familie (Text und Bild) mit 0,8 bis 122 Milliarden Parametern, Kontext von 256 k Tokens, Lizenz Apache 2.0. Alibaba kündigt 201 Sprachen und Dialekte an. Die Versionen 4B (3,4 GB) und 9B (6,6 GB) richten sich an kleinere Geräte.
- Qwen 3.6 und 3.8 (Alibaba)
- Qwen 3.6 ist verfügbar in 27B (18 GB) und 35B (23 GB), Qwen 3.8 in 27B (18 GB): zwei Familien, die sich auf Code und Agenten konzentrieren. Der Reflexionsmodus von Qwen3.8 ist standardmäßig aktiv und kann per Anfrage deaktiviert werden: Er fügt vor der Antwort Tokens hinzu.
- Granite 4.2 (IBM)
- Versionen 3B (2,2 GB), 8B (5,3 GB) und 30B, Kontextlänge von 128 k Tokens, Lizenz Apache 2.0. Französisch ist unter den zwölf unterstützten Sprachen enthalten: Es handelt sich um ein Signal, kein Maß für die Qualität. Ein integrierter Reflexionsmodus lässt sich in Ollama mit dem Befehl /set nothink deaktivieren.
- Gemma 4 (Google)
- Größen E2B, E4B, 12B, 26B (für Experten, 3,8 Milliarden aktive Parameter) und 31B, unter Apache 2.0 seit April 2026. Der « E » bedeutet « effektiv »: gemma4:e2b verfügt über 2,3 Milliarden effektive Parameter, aber 5,1 mit den Einbettungen, und die Datei wiegt 7,2 GB bei Ollama. Ein Name mit 2B garantiert nicht eine kleine Datei.
- gpt-oss 20B (OpenAI)
- Modell mit offenen Gewichten unter der Apache-2.0-Lizenz, von OpenAI in MXFP4 quantisiert: Laut Ollama läuft es mit 16 GB Arbeitsspeicher (Dateigröße: 14 GB). Kontextfenster von 128 k Tokens.
- Qwen3-Coder 30B-A3B (Alibaba)
- Spezialist für Code: insgesamt 30 Milliarden Parameter, 3,3 aktiv, Kontext von 256 k Tokens, Dateigröße von 19 GB.
#Einen Benchmark richtig lesen
Die Modellbeschreibungen veröffentlichen Testergebnisse, doch diese stammen vom Herausgeber und beruhen auf dessen eigenem Testprotokoll. Die Beschreibung von Gemma 4 nennt bei MMLU Pro 69,4 % für die Version E4B gegenüber 85,2 % für die 31B: Die Größe zählt, und ein Testergebnis sagt nichts über Ihre Aufgabe aus. Eine weitere begriffliche Falle: „Kostenloses LLM“ bezeichnet auch Online-Angebote mit Nutzungskontingenten, bei denen Ihre Daten an den Anbieter übermittelt werden.
#Nach Einsatzzweck wählen: Chat, Code, Agenten
- Chatten, zusammenfassen, auf Französisch schreiben
- Granite 4.2 8B, Qwen 3.5 9B oder Gemma 4 12B mit 16 GB Speicher. Vergleichen Sie die Modelle anhand von drei Ihrer Texte: Kein Modellsteckbrief ersetzt diesen Test.
- Coder
- Alibaba stellt Qwen3-Coder 30B-A3B als sein am stärksten auf Agenten ausgerichtetes Code-Modell vor. Der begrenzende Faktor ist der Speicher: Code-Tools benötigen einen langen Kontext, dessen Speicherbedarf zur 19-GB-Datei hinzukommt und bei 24 GB nur wenig Spielraum lässt.
- Agenten und Werkzeuge
- Ollama kann Agenten mit einem lokalen Modell starten, beispielsweise Claude Code mit einem Qwen-Modell. Dabei läuft das Tool Claude Code, kein Claude-Modell: Das antwortende Modell ist weiterhin dasjenige, das Sie heruntergeladen haben.
- Ohne Beschränkung
- Die ursprünglichen Modelle werden darauf trainiert, bestimmte Anfragen abzulehnen. Von der Community erstellte Varianten, sogenannte abliterated-Modelle, entfernen diese Fähigkeit: Ein Beitrag auf Hugging Face erklärt, dass die Ablehnung von einer bestimmten Richtung in den Aktivierungen getragen wird, die sich neutralisieren lässt. Die Qualität variiert je nach Variante, und für Ihre Nutzung gelten die gesetzlichen Vorschriften.
#Eine kostenlose KI Schritt für Schritt installieren
- 01Den freien Speicher prüfenSchließen Sie den Browser und speicherintensive Anwendungen: Der verfügbare Speicher, nicht die Gesamtkapazität, entscheidet darüber, welches Modell Sie verwenden können.
- 02Das Programm installierenOllama, wenn Sie sich mit der Eingabe eines Befehls wohlfühlen, LM Studio für eine grafische Oberfläche. Wählen Sie die Version für Ihr Betriebssystem: Windows, macOS oder Linux.
- 03Ein Modell in der richtigen Größe herunterladenOrientieren Sie sich an der Tabelle im ersten Abschnitt: bei 8 GB Speicher eine Datei von 2 bis 4 GB; bei 16 GB eine Datei von 5 bis 8 GB. Bei 8 GB Speicher lässt eine Datei von 6,6 GB keine Reserve.
- 04Starten, dann überprüfenChatten Sie mit dem Modell und führen Sie anschließend ollama ps in einem zweiten Terminal aus, um zu sehen, ob das Modell auf der GPU, der CPU oder beiden läuft.
#Was trotz der Bezeichnung „lokal“ den Rechner verlassen kann
„Lokal“ beschreibt, wo das Modell ausgeführt wird, nicht, was die übrige Software tut. Vier Situationen führen dazu, dass Daten nach außen gelangen oder offengelegt werden.
- Die auf Ollama gehosteten Modelle
- Die Anwendung ermöglicht die Nutzung von Modellen, die in der Ollama-Cloud ausgeführt werden. Diese verarbeitet dann Ihre Prompts und Antworten; Ollama sieht nichts von dem, was Sie lokal ausführen. Um dies zu unterbinden: die Variable OLLAMA_NO_CLOUD=1 oder die Option disable_ollama_cloud verwenden.
- Die Konnektoren von Jan
- Jan lässt sich mit OpenAI, Anthropic, Mistral oder Groq verbinden. Bei einem heruntergeladenen Modell bleibt die Ausführung lokal; bei einem Connector wird das Gespräch an den gewählten Anbieter gesendet.
- Herunterladen der Modelle
- LM Studio sendet Netzwerkanfragen, um Modelle zu suchen, sie herunterzuladen und nach Updates zu suchen. Der Chat, Ihre Dokumente und der lokale Server bleiben auf dem Gerät.
- Zugänglichkeit über das Netzwerk
- Ollama lauscht standardmäßig auf 127.0.0.1: Nur Ihr Computer kann darauf zugreifen. Die Variable OLLAMA_HOST ändert die Adresse; geben Sie den Zugriff nur frei, wenn Sie wissen, wer sich verbinden kann.
Welche kostenlose lokale KI eignet sich am besten für den Einstieg?+
Kann man eine kostenlose lokale KI auch ohne GPU nutzen?+
Sind LM Studio und Ollama wirklich kostenlos?+
Sendet meine lokale KI Daten über das Internet?+
Kann man Claude oder ChatGPT lokal laufen lassen?+
Gibt es eine lokale KI ohne Beschränkungen?+
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.