Einsteiger 14 Min.Kostenlos

Beste kostenlose lokale KI: Top-Auswahl 2026, auch ohne GPU

Direkte Antwort

Ja: Ollama, LM Studio, Jan und GPT4All lassen sich kostenlos herunterladen, und Qwen 3.5, Gemma 4, Granite 4.2 oder gpt-oss sind unter der Apache-2.0-Lizenz veröffentlicht. Die richtige Wahl hängt vom Speicher ab: Eine Datei von 2 bis 4 GB eignet sich für einen Rechner mit 8 GB, 6 bis 8 GB erfordern 16 GB, und bei mehr als 14 GB sind 24 GB VRAM oder 32 GB Arbeitsspeicher erforderlich.

Eine kostenlose lokale KI braucht nur zwei Downloads: eine Software (Ollama, LM Studio, Jan) und ein Sprachmodell mit offenen Gewichten. Das entscheidende Auswahlkriterium ist nicht der Name des Modells, sondern seine Dateigröße im Verhältnis zu Ihrem verfügbaren Speicher. Diese Seite nennt die tatsächlichen, von Ollama veröffentlichten Dateigrößen, zeigt eine Geschwindigkeitsberechnung für Rechner ohne Grafikkarte und erläutert Fälle, in denen eine sogenannte „lokale“ KI Ihre Daten dennoch anderswohin sendet.

Wählen Sie einen Rechner? Unsere Empfehlungen nach Budget →

Von Mohamed Meguedmi·Aktualisierung 2026-09-29·Unter Windows, macOS und Linux getestet

#Kostenlos starten, abhängig von Ihrem Gerät

Es gibt nicht die eine beste kostenlose lokale KI: Die richtige Wahl ist das größte Modell, dessen Datei mit ausreichend Reserve in Ihren Speicher passt und das Sie mit Ollama oder LM Studio starten. Auf einem Rechner mit 8 GB Speicher ohne Grafikkarte sollten Sie eine Datei von 2 bis 4 GB anstreben, etwa Granite 4.2 3B (2,2 GB) oder Qwen 3.5 4B (3,4 GB). Mit 16 GB sind Qwen 3.5 9B (6,6 GB), Granite 4.2 8B (5,3 GB) oder Gemma 4 12B (7,6 GB) sinnvolle Ausgangspunkte. Ab 24 GB VRAM oder 32 GB Speicher lassen sich gpt-oss 20B (14 GB) und Modelle mit 27 Milliarden Parametern (18 GB) nutzen. Diese Größen entsprechen den von Ollama angegebenen Dateigrößen, nicht den Milliarden Parametern im Namen: Die Datei muss zusammen mit dem Kontext und einer Reserve für das System in den Speicher passen. Das sind erste Ansatzpunkte, keine Garantien für Qualität oder Geschwindigkeit: Probieren Sie das Modell mit Ihren eigenen Aufgaben aus.

Modelle zum Ausprobieren je nach verfügbarem Arbeitsspeicher (von Ollama veröffentlichte Dateigrößen, zuletzt abgerufen am 29. September 2026)
Speicher des RechnersModelle zum Testen (Ollama-Tag)DateigrößeAngegebene Kontextlänge
8 GB, ohne GPUgranite4.2:3b ; qwen3.5:4b2,2 GB; 3,4 GB128 k; 256 k Tokens
16 GBgranite4.2:8b ; qwen3.5:9b ; gemma4:12b5,3 GB; 6,6 GB; 7,6 GB128 k ; 256 k ; 256 k Tokens
24 GB VRAM oder 32 GB Speichergpt-oss:20b ; qwen3.6:27b ; qwen3.8:27b ; gemma4:26b14 GB; 18 GB; 18 GB; 19 GB128 k ; 256 k ; 256 k ; 256 k Tokens
32 GB und mehr, zum Programmierenqwen3-coder:30b19 GB256 k Tokens

Die angegebene Kontextgröße ist ein Maximum, nicht die Größe, die tatsächlich zugewiesen wird. Ollama startet mit 4 k Tokens, wenn die Grafikkarte weniger als 24 GiB VRAM hat, und empfiehlt mindestens 64.000 Tokens für Webrecherche, Agenten und Code. Jede Erhöhung benötigt zusätzlich zu dem Speicher für die Datei weiteren Speicher.

#Was ist eine lokale KI?

Das Lokale-KI-Paket

Sie wissen, welche kostenlose KI bei Ihnen läuft. Das lokale KI-Kit führt Sie zu einem Assistenten, der Ihnen jeden Tag nützlich ist: eine angeleitete Installation in einer Stunde (Kap. 1), das richtige Modell für genau Ihren Rechner (Kap. 3) und das, was wirklich ohne Grafikkarte funktioniert (Kap. 12).

  • Lebenslanger Online-Zugang
  • PDF + Dateien
  • Erstattung binnen 30 Tagen

Eine lokale KI ist ein Sprachmodell (ein LLM wie Qwen, Gemma oder Granite), dessen Dateien auf Ihrem Laufwerk liegen und das von einer auf Ihrem Rechner installierten Software ausgeführt wird. Die Berechnungen erfolgen auf Ihrem Prozessor oder Ihrer Grafikkarte, nicht auf den Servern eines Anbieters. LM Studio erklärt dies in seiner Dokumentation: Was Sie im Gespräch mit einem Modell eingeben, verlässt das Gerät nicht.

Die betreffenden Modelle werden als Modelle mit offenen Gewichten bezeichnet: Ihre Parameter lassen sich herunterladen. Das ist nicht gleichbedeutend mit Open Source; dieser Status hängt von der Lizenz ab. Google weist bei Gemma darauf hin: Gemma 4, veröffentlicht am 2. April 2026, ist das erste Modell der Familie unter der von der OSI anerkannten Apache-2.0-Lizenz; die vorherigen Generationen standen nicht unter dieser Lizenz. Lesen Sie die Lizenz, bevor Sie ein Modell in einem Produkt wiederverwenden.

i
Kurz gesagt
Lokale KI = ein auf Ihren Rechner heruntergeladenes Modell + eine Software, die es ausführt. Sobald das Modell auf dem Datenträger liegt, benötigen Sie zum Chatten keine Internetverbindung.

Das Gegenteil ist ein Online-Dienst wie ChatGPT, Gemini oder Claude: Ihre Nachrichten werden an die Server des Anbieters gesendet. Zwischen diesen beiden Varianten gibt es hybride Fälle, die weiter unten näher erläutert werden.

#Warum auf lokale KI umsteigen?

Datenschutz
Ihre Dokumente und Ihre Prompts bleiben auf dem Rechner, solange Sie weder ein gehostetes Modell noch eine Websuche aktivieren. Das ist nützlich für sensible Arbeiten sowie für juristische oder medizinische Aufgaben.
Offline
Das heruntergeladene Modell antwortet ohne Verbindung, im Zug oder in einem isolierten Netzwerk.
Keine Nachrichtenbegrenzung
Kein Tarif begrenzt Ihre Gespräche. Die einzige Grenze ist die Geschwindigkeit Ihrer Hardware.
Kontrolle
Sie wählen das Modell, seine Quantisierung und den Kontext und ersetzen es, sobald ein besseres Modell erscheint.

Dieser Kompromiss ist real: Ein lokales Modell muss in Ihren Speicher passen und ist daher kleiner als die Modelle der Online-Dienste.

#Kostenlose lokale KI: wirklich ohne etwas zu bezahlen?

Ja, für die hier genannten Programme und Modelle: Sie benötigen kein Abonnement, um mit einem auf Ihrem Rechner installierten Modell zu chatten. Drei Einschränkungen helfen, böse Überraschungen zu vermeiden: Die Softwarelizenzen unterscheiden sich (LM Studio ist kostenlos, aber nicht Open Source), die Kosten verlagern sich auf Speicherplatz und Hardware, und einige Anbieter verkaufen daneben auch Online-Angebote.

Der Festplattenplatz
Unter Windows benötigt Ollama mindestens 4 GB für die Installation und anschließend Speicherplatz für die Modelle, die laut Ollamas Dokumentation mehrere Dutzend bis mehrere Hundert GB belegen können.
Das Hardware-Setup
Eine 14-GB-Datei ist bei 8 GB Arbeitsspeicher nicht sinnvoll: Testen Sie zunächst mit einem kleinen Modell, bevor Sie etwas kaufen.
Gehostete Angebote
Der kostenlose Tarif von Ollama umfasst die lokale Ausführung, aber auch gehostete Modelle mit nutzungsabhängiger Abrechnung; darüber gibt es kostenpflichtige Tarife. Das ist keine lokale KI.
i
Was „kostenlos“ hier bedeutet
Software ohne Abonnement, Modelle ohne Lizenzgebühren, kein Nachrichtenlimit. Die Kosten für Festplattenspeicher, Strom und Arbeitsspeicher tragen Sie weiterhin selbst.

#Die besten kostenlosen Tools

Vier kostenlose Tools im Vergleich (Quellen: offizielle Repositorys und Dokumentationen)
ToolLizenzBenutzeroberflächeUnterstützte Systeme
OllamaMITTerminal, lokale API und Desktop-AnwendungWindows 10 22H2 oder neuer; macOS 14 oder neuer (Apple Silicon, oder Intel im CPU-Only-Modus); Linux
LM StudioProprietär, kostenlosVollständige grafische OberflächemacOS 14+ ausschließlich auf Apple Silicon; Windows x64 und ARM; Linux
JanApache 2.0Desktop-AnwendungWindows, macOS, Linux
GPT4AllMITDesktop-AnwendungWindows, macOS 12.6+, Linux x86-64
Ollama
Die Wahl der Entwickler: Ein Modell startet mit einem Befehl und bietet eine lokale API auf dem Port 11434.
LM Studio
Modellkatalog, Download per Klick und Chatfenster: am einfachsten für den Einstieg. Seit dem 8. Juli 2025 zu Hause ebenso wie am Arbeitsplatz kostenlos, aber proprietär: Die Nutzungsbedingungen gewähren eine Nutzungslizenz, keinen offenen Quellcode.
Jan
Lädt Modelle von Hugging Face herunter und startet einen lokalen Server. Das Repository der Anwendung weist darauf hin, dass sie auch mit OpenAI, Anthropic oder anderen Anbietern verbunden werden kann: Es liegt an Ihnen, bei der lokalen Nutzung zu bleiben.
GPT4All
Sein Repository behauptet: «Keine API-Aufrufe oder GPUs erforderlich». Die Dokumentation richtet sich an Modelle mit 3 bis 13 Milliarden Parametern und nennt 8 GB RAM für Llama 3 8B. Keine Version wurde seit der 3.10.0 aus Februar 2025 veröffentlicht: überprüfen Sie, ob er das gewünschte Modell unterstützt.

#Ohne Grafikkarte: Was der Prozessor leistet

Ja, ein Modell kann ausschließlich mit dem Prozessor und dem Arbeitsspeicher laufen. Ollama bestätigt dies in seiner FAQ: Die Spalte Processor von ollama ps zeigt „100% CPU“ an, wenn das Modell vollständig in den Systemspeicher geladen ist. Die eigentliche Frage ist daher die Geschwindigkeit, nicht die Machbarkeit.

#Warum der Prozessor langsam ist: eine Berechnung

Für jedes generierte Token muss die Maschine den Großteil des Modells erneut aus dem Speicher lesen: Die Geschwindigkeit wird stärker durch die Geschwindigkeit des Datenzugriffs als durch die Rechenleistung begrenzt. Eine theoretische Obergrenze ergibt sich, indem man die Speicherbandbreite (GB/s) durch die Dateigröße (GB) teilt. Die Tabelle verwendet einen Beispielwert von 50 GB/s: Das ist eine veranschaulichende Berechnung, keine Messung.

Theoretische Obergrenze der Generierungsgeschwindigkeit bei einer Speicherbandbreite von 50 GB/s (Beispielrechnung, keine Messung)
ModellDateigrößeTheoretisches Maximum
granite4.2:3b2,2 GBetwa 23 Tokens pro Sekunde
granite4.2:8b5,3 GBetwa 9 Tokens pro Sekunde
qwen3.5:9b6,6 GBetwa 8 Tokens pro Sekunde

Die Realität bleibt unter dem Niveau. Der Blog TensorFoundry berichtet auf einem Mac M2 Max mit 400 GB/s einer berechneten Grenze von etwa 87 Tokens pro Sekunde für einen 8B in 4 Bit, wobei 64,9 gemessen wurden, also 75 %. Praktische Konsequenz: Ohne GPU ist die Dateigröße der erste Leitfaden für die Geschwindigkeit, da die Grenze direkt davon abhängt. Modelle mit Experten (MoE) verändern die Situation, da sie nur einen Teil ihrer Parameter pro Token aktivieren: Qwen3-Coder 30B-A3B aktiviert 3,3 Milliarden von 30. Dies ist zu testen, sofern ausreichend Speicher für die gesamte Datei vorhanden ist.

#Abhängig von Ihrem System

Windows
Ollama erfordert Windows 10 22H2 oder neuer. LM Studio benötigt einen Prozessor mit AVX2 und empfiehlt 16 GB RAM und 4 GB VRAM.
Mac mit Apple Silicon
Prozessor und GPU teilen sich den vereinheitlichten Speicher. LM Studio empfiehlt 16 GB oder mehr; bei 8 GB rät es zu kleineren Modellen und kurzen Kontexten.
Intel-Mac
LM Studio unterstützt dies nicht. Ollama läuft auf x86, aber ausschließlich auf der CPU: Planen Sie den Einsatz kleiner Modelle ein.
Linux
Ollama und LM Studio sind verfügbar; Letzteres wird als AppImage bereitgestellt und erfordert Ubuntu 20.04 oder neuer.

#Die besten kostenlosen Modelle 2026

Diese Auswahl beruht auf dem, was Ollama veröffentlicht und was die Herausgeber dokumentieren, nicht auf einem eigenen Test.

Qwen 3.5 (Alibaba)
Multimodale Familie (Text und Bild) mit 0,8 bis 122 Milliarden Parametern, Kontext von 256 k Tokens, Lizenz Apache 2.0. Alibaba kündigt 201 Sprachen und Dialekte an. Die Versionen 4B (3,4 GB) und 9B (6,6 GB) richten sich an kleinere Geräte.
Qwen 3.6 und 3.8 (Alibaba)
Qwen 3.6 ist verfügbar in 27B (18 GB) und 35B (23 GB), Qwen 3.8 in 27B (18 GB): zwei Familien, die sich auf Code und Agenten konzentrieren. Der Reflexionsmodus von Qwen3.8 ist standardmäßig aktiv und kann per Anfrage deaktiviert werden: Er fügt vor der Antwort Tokens hinzu.
Granite 4.2 (IBM)
Versionen 3B (2,2 GB), 8B (5,3 GB) und 30B, Kontextlänge von 128 k Tokens, Lizenz Apache 2.0. Französisch ist unter den zwölf unterstützten Sprachen enthalten: Es handelt sich um ein Signal, kein Maß für die Qualität. Ein integrierter Reflexionsmodus lässt sich in Ollama mit dem Befehl /set nothink deaktivieren.
Gemma 4 (Google)
Größen E2B, E4B, 12B, 26B (für Experten, 3,8 Milliarden aktive Parameter) und 31B, unter Apache 2.0 seit April 2026. Der « E » bedeutet « effektiv »: gemma4:e2b verfügt über 2,3 Milliarden effektive Parameter, aber 5,1 mit den Einbettungen, und die Datei wiegt 7,2 GB bei Ollama. Ein Name mit 2B garantiert nicht eine kleine Datei.
gpt-oss 20B (OpenAI)
Modell mit offenen Gewichten unter der Apache-2.0-Lizenz, von OpenAI in MXFP4 quantisiert: Laut Ollama läuft es mit 16 GB Arbeitsspeicher (Dateigröße: 14 GB). Kontextfenster von 128 k Tokens.
Qwen3-Coder 30B-A3B (Alibaba)
Spezialist für Code: insgesamt 30 Milliarden Parameter, 3,3 aktiv, Kontext von 256 k Tokens, Dateigröße von 19 GB.

#Einen Benchmark richtig lesen

Die Modellbeschreibungen veröffentlichen Testergebnisse, doch diese stammen vom Herausgeber und beruhen auf dessen eigenem Testprotokoll. Die Beschreibung von Gemma 4 nennt bei MMLU Pro 69,4 % für die Version E4B gegenüber 85,2 % für die 31B: Die Größe zählt, und ein Testergebnis sagt nichts über Ihre Aufgabe aus. Eine weitere begriffliche Falle: „Kostenloses LLM“ bezeichnet auch Online-Angebote mit Nutzungskontingenten, bei denen Ihre Daten an den Anbieter übermittelt werden.

#Nach Einsatzzweck wählen: Chat, Code, Agenten

Chatten, zusammenfassen, auf Französisch schreiben
Granite 4.2 8B, Qwen 3.5 9B oder Gemma 4 12B mit 16 GB Speicher. Vergleichen Sie die Modelle anhand von drei Ihrer Texte: Kein Modellsteckbrief ersetzt diesen Test.
Coder
Alibaba stellt Qwen3-Coder 30B-A3B als sein am stärksten auf Agenten ausgerichtetes Code-Modell vor. Der begrenzende Faktor ist der Speicher: Code-Tools benötigen einen langen Kontext, dessen Speicherbedarf zur 19-GB-Datei hinzukommt und bei 24 GB nur wenig Spielraum lässt.
Agenten und Werkzeuge
Ollama kann Agenten mit einem lokalen Modell starten, beispielsweise Claude Code mit einem Qwen-Modell. Dabei läuft das Tool Claude Code, kein Claude-Modell: Das antwortende Modell ist weiterhin dasjenige, das Sie heruntergeladen haben.
Ohne Beschränkung
Die ursprünglichen Modelle werden darauf trainiert, bestimmte Anfragen abzulehnen. Von der Community erstellte Varianten, sogenannte abliterated-Modelle, entfernen diese Fähigkeit: Ein Beitrag auf Hugging Face erklärt, dass die Ablehnung von einer bestimmten Richtung in den Aktivierungen getragen wird, die sich neutralisieren lässt. Die Qualität variiert je nach Variante, und für Ihre Nutzung gelten die gesetzlichen Vorschriften.

#Eine kostenlose KI Schritt für Schritt installieren

  1. 01
    Den freien Speicher prüfen
    Schließen Sie den Browser und speicherintensive Anwendungen: Der verfügbare Speicher, nicht die Gesamtkapazität, entscheidet darüber, welches Modell Sie verwenden können.
  2. 02
    Das Programm installieren
    Ollama, wenn Sie sich mit der Eingabe eines Befehls wohlfühlen, LM Studio für eine grafische Oberfläche. Wählen Sie die Version für Ihr Betriebssystem: Windows, macOS oder Linux.
  3. 03
    Ein Modell in der richtigen Größe herunterladen
    Orientieren Sie sich an der Tabelle im ersten Abschnitt: bei 8 GB Speicher eine Datei von 2 bis 4 GB; bei 16 GB eine Datei von 5 bis 8 GB. Bei 8 GB Speicher lässt eine Datei von 6,6 GB keine Reserve.
  4. 04
    Starten, dann überprüfen
    Chatten Sie mit dem Modell und führen Sie anschließend ollama ps in einem zweiten Terminal aus, um zu sehen, ob das Modell auf der GPU, der CPU oder beiden läuft.
Beispiele: ein leichtes Modell, dann ein 16-GB-Modell
# Machine de 8 Go
ollama run qwen3.5:4b

# Machine de 16 Go
ollama run qwen3.5:9b

# Vérifier le placement CPU ou GPU et le contexte alloué
ollama ps
Agenten und Code: den Kontext vergrößern (verbraucht mehr Speicher)
OLLAMA_CONTEXT_LENGTH=64000 ollama serve

#Was trotz der Bezeichnung „lokal“ den Rechner verlassen kann

„Lokal“ beschreibt, wo das Modell ausgeführt wird, nicht, was die übrige Software tut. Vier Situationen führen dazu, dass Daten nach außen gelangen oder offengelegt werden.

Die auf Ollama gehosteten Modelle
Die Anwendung ermöglicht die Nutzung von Modellen, die in der Ollama-Cloud ausgeführt werden. Diese verarbeitet dann Ihre Prompts und Antworten; Ollama sieht nichts von dem, was Sie lokal ausführen. Um dies zu unterbinden: die Variable OLLAMA_NO_CLOUD=1 oder die Option disable_ollama_cloud verwenden.
Die Konnektoren von Jan
Jan lässt sich mit OpenAI, Anthropic, Mistral oder Groq verbinden. Bei einem heruntergeladenen Modell bleibt die Ausführung lokal; bei einem Connector wird das Gespräch an den gewählten Anbieter gesendet.
Herunterladen der Modelle
LM Studio sendet Netzwerkanfragen, um Modelle zu suchen, sie herunterzuladen und nach Updates zu suchen. Der Chat, Ihre Dokumente und der lokale Server bleiben auf dem Gerät.
Zugänglichkeit über das Netzwerk
Ollama lauscht standardmäßig auf 127.0.0.1: Nur Ihr Computer kann darauf zugreifen. Die Variable OLLAMA_HOST ändert die Adresse; geben Sie den Zugriff nur frei, wenn Sie wissen, wer sich verbinden kann.
!
Ein gehostetes Modell erkennen
In Ollama wird ein Tag, das auf cloud endet, wie gemma4:31b-cloud, nicht auf Ihrem Gerät ausgeführt. Wenn Sie wegen des Datenschutzes auf lokale Ausführung setzen, deaktivieren Sie diese Funktionen in der Konfiguration.
Häufig gestellte Fragen
Welche kostenlose lokale KI eignet sich am besten für den Einstieg?+
Ollama oder LM Studio mit einem Modell, dessen Datei mit reichlich Spielraum in Ihren Arbeitsspeicher passt: Qwen 3.5 4B (3,4 GB) bei 8 GB, Qwen 3.5 9B (6,6 GB) oder Granite 4.2 8B (5,3 GB) bei 16 GB. Vergleichen Sie zwei Modelle anhand Ihrer eigenen Texte.
Kann man eine kostenlose lokale KI auch ohne GPU nutzen?+
Ja. Ein Modell läuft auf dem Prozessor und nutzt den Arbeitsspeicher; Ollama zeigt dann 100 % CPU an. Der begrenzende Faktor ist die Geschwindigkeit, die von der Speicherbandbreite geteilt durch die Dateigröße abhängt. Wählen Sie ein Modell mit einer Dateigröße von 2 bis 4 GB und halten Sie den Kontext kurz.
Sind LM Studio und Ollama wirklich kostenlos?+
Für die lokale Nutzung ja. LM Studio ist seit dem 8. Juli 2025 sowohl zu Hause als auch bei der Arbeit kostenlos, aber nicht Open Source. Ollama steht unter der MIT-Lizenz; seine gehosteten Modelle werden verbrauchsabhängig abgerechnet, mit kostenpflichtigen Tarifen, und fallen nicht unter die kostenlose lokale Nutzung.
Sendet meine lokale KI Daten über das Internet?+
Nicht, wenn das Gespräch mit einem auf Ihrem Rechner geladenen Modell stattfindet: LM Studio gibt an, dass Ihre Eingaben das Gerät nicht verlassen. Bei einem gehosteten Modell, einem Online-Konnektor oder einem Cloud-Tag werden hingegen Daten übertragen. Deaktivieren Sie diese Optionen, wenn Sie eine strikt lokale Nutzung wünschen.
Kann man Claude oder ChatGPT lokal laufen lassen?+
Das Tool Claude Code kann über Ollama mit einem lokalen Modell, beispielsweise Qwen, gestartet werden, aber das antwortende Modell ist dann dasjenige, das Sie heruntergeladen haben. OpenAI veröffentlicht gpt-oss mit offenen Gewichten unter der Apache-2.0-Lizenz: Damit kommen Sie einem lokal betriebenen ChatGPT am nächsten.
Gibt es eine lokale KI ohne Beschränkungen?+
Sogenannte abliterated-Varianten aus der Community entfernen die Fähigkeit eines Modells, Anfragen abzulehnen, und sind auf Hugging Face zu finden. Ihre Qualität variiert von Variante zu Variante, und ihre Nutzung unterliegt weiterhin den gesetzlichen Vorschriften. Der Leitfaden zu diesem Thema erläutert im Detail, was diese Varianten verändern und welche Vorsichtsmaßnahmen zu treffen sind.
Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.