Offline-KI: Ein LLM ohne Internetverbindung nutzen internet
Ein lokales LLM benötigt das Internet nur zum Herunterladen. Sobald das Modell auf Ihrem Datenträger liegt, funktioniert eine Offline-KI vollständig ohne Verbindung: im Flugzeug, in einem Funkloch, beim Wandern oder auf einem vom Netzwerk isolierten Rechner. Dieser Leitfaden zeigt, wie Sie Ihren Computer vor der Abreise vorbereiten, welche kompakten Modelle Sie mitnehmen sollten und wie Sie alles überprüfen, damit Sie nicht im falschen Moment ohne funktionierende KI dastehen.
#Warum eine Offline-KI
Cloud-Assistenten (ChatGPT, Claude, Gemini) funktionieren sofort nicht mehr, sobald die Verbindung abbricht. Eine Offline-KI hingegen läuft vollständig auf Ihrem Rechner: Das Modell wird in den Speicher geladen und berechnet Ihre Antworten lokal, ohne jemals einen entfernten Server abzufragen. Es ist dasselbe Prinzip wie bei einem klassischen lokalen LLM, konsequent zu Ende gedacht – keinerlei Netzwerkabhängigkeit mehr, sobald die Vorbereitung abgeschlossen ist.
Situationen, in denen das einen entscheidenden Unterschied macht, sind häufiger, als man denkt: ein Langstreckenflug, eine Zugfahrt ohne 4G, ein Einsatz in einem Funkloch, eine Baustelle oder ein Industriegelände ohne WLAN oder ein Rechner, der aus Gründen der Vertraulichkeit bewusst vom Internet getrennt ist. In all diesen Fällen bleibt eine gut vorbereitete Offline-KI voll einsatzfähig.
- Vollständige Autonomie
- Keine Unterbrechung, wenn die Netzwerkverbindung ausfällt: im Flugzeug, im Tunnel, auf dem Land oder im Keller.
- Datenschutz
- Nichts verlässt den Rechner. Ideal für sensible Daten oder einen Rechner mit Air-Gap.
- Keine laufenden Kosten
- Kein Abonnement, keine Abrechnung pro Token, kein Nutzungskontingent.
- Stabile Latenz
- Die Geschwindigkeit hängt nur von Ihrer Hardware ab, nicht von einem überlasteten Server am anderen Ende der Welt.
#Was eine Netzwerkverbindung benötigt (und was nicht)
Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.
- Lebenslanger Online-Zugang
- PDF + Dateien
- Lebenslange Updates
Wer den Unterschied zwischen „online“ und „offline“ versteht, vermeidet unangenehme Überraschungen. Nur ein Schritt erfordert eine Internetverbindung: das Herunterladen. Alles andere erfolgt lokal.
- Netzwerk erforderlich (einmal)
- Die Anwendung (Ollama, LM Studio) herunterladen, die Modelle (GGUF-Dateien) herunterladen, Updates herunterladen.
- 100 % offline
- Ein bereits vorhandenes Modell laden, chatten, Text oder Code generieren, ein lokales Dokument zusammenfassen, RAG für Ihre Dateien nutzen.
#Voraussetzungen vor dem Start
Eine Offline-KI passt auf einen gewöhnlichen Laptop. Entscheidend sind der Arbeitsspeicher (RAM beziehungsweise VRAM, wenn Sie eine GPU haben) und der Festplattenspeicher zum Speichern der Modelle.
- Freier Festplattenspeicher
- Je nach mitgelieferten Modellen 5 bis 30 GB einplanen. Ein 7B-Modell in Q4_K_M benötigt etwa 4,5 GB, ein 14B-Modell etwa 9 GB.
- RAM / VRAM
- 8 GB für ein 3B-Modell, 16 GB für den komfortablen Betrieb eines 7B-Modells, 32 GB, wenn Sie ein 14B-Modell anstreben. VRAM-Richtwerte bei Q4: 3B≈2 GB · 7B≈5 GB · 14B≈9 GB.
- GPU (optional)
- Eine GPU beschleunigt die Verarbeitung erheblich, ist aber nicht erforderlich. Ein MacBook mit Apple Silicon (M-Serie) oder ein PC mit 16 GB RAM reichen für den reinen CPU-Betrieb aus.
- Akku
- Die Inferenz beansprucht CPU/GPU: Rechnen Sie bei einem Laptop ohne Netzanschluss mit einer kürzeren Akkulaufzeit. Bevorzugen Sie unterwegs kompakte Modelle.
#Alles herunterladen, bevor die Netzwerkverbindung verloren geht
Das ist der entscheidende Schritt und der einzige, der eine Internetverbindung erfordert. Erledigen Sie ihn in Ruhe zu Hause oder im Büro über WLAN, einige Stunden vor der Abreise — ein mehrere GB großes Modell verträgt instabile Verbindungen schlecht. Hier ist die Vorgehensweise mit Ollama, dem einfachsten Ansatz für eine Offline-KI.
- 01Ollama installieren, solange Sie eine Netzwerkverbindung habenLaden Sie Ollama von ollama.com herunter und installieren Sie es. Es ist der Daemon, der Ihre Modelle lokal ausführt und unter http://localhost:11434 auf Anfragen wartet. Installieren Sie es zuerst, da die App selbst online heruntergeladen wird.
- 02Ein oder zwei kompakte Modelle herunterladenVerwenden Sie ollama pull, um die Modelle auf das Laufwerk herunterzuladen. Wählen Sie Größen, die zu Ihrem Rechner passen (siehe nächster Abschnitt). Ein Pull über eine stabile WLAN-Verbindung dauert je nach Übertragungsgeschwindigkeit und Größe einige Minuten bis zu einer Viertelstunde.
- 03Eine grafische Oberfläche installieren (optional)Wenn Sie ein Chatfenster einem Terminal vorziehen, installieren Sie LM Studio (eine Komplettlösung, die auch den Download übernimmt) oder Open WebUI. LM Studio ist besonders praktisch für unterwegs: App, Modelle und Benutzeroberfläche in einem einzigen Tool.
- 04Jedes Modell einmal warmlaufen lassenStarten Sie einen Testdialog mit jedem heruntergeladenen Modell, solange Sie noch Netzwerkverbindung haben. Dadurch wird bestätigt, dass die Datei vollständig ist und korrekt in den Speicher geladen wird.
#Kompakte Modelle, die unterwegs ausreichen
Beim Offline-Betrieb auf einem Laptop hat Energieeffizienz Vorrang: Ein kleines, schnelles Modell, das wenig Akkuleistung benötigt, ist besser als ein riesiges Modell, das nur schleppend läuft und den Akku leert. Für die meisten Aufgaben unterwegs – Schreiben, Zusammenfassen, allgemeine Fragen, Unterstützung beim Programmieren – leistet ein Modell mit 2 bis 9 Milliarden Parametern in Q4_K_M sehr gute Arbeit.
- Qwen 3.5 2B
- ~1,9 GB. Das leichteste Modell: ideal für einen alten Laptop oder um den Akku zu schonen. Multimodal, 256k Kontext, Apache-2.0-Lizenz. Ausreichend, um Texte zu verfassen, umzuformulieren und einfache Fragen zu beantworten.
- Qwen 3.5 9B
- ~6,6 GB. Hervorragender Allrounder, gut im logischen Schlussfolgern, in der Bildverarbeitung und beim Programmieren, 256k Kontext. Der beste Kompromiss für einen Laptop mit 16 GB RAM – die Referenzwahl in der 8-GB-Klasse im Jahr 2026.
- Granite 4.2 8B
- ~5,3 GB. Sparsam und token-effizient (IBM, Apache 2.0), 128k Kontext, knappe Antworten. Eine zuverlässige Wahl fürs Schreiben, die den Akku schont.
- Granite 4.2 3B
- ~2,2 GB. Kompakt und schnell, sehr ressourcensparend, auf weniger leistungsstarke Rechner zugeschnitten und dennoch leistungsfähig.
Die Quantisierung Q4_K_M ist die empfohlene Standardeinstellung: Sie reduziert die Modellgröße und den benötigten Speicher erheblich, bei einem minimalen Qualitätsverlust, der bei den meisten Anwendungen nicht wahrnehmbar ist. Wenn Sie Spielraum beim RAM/VRAM haben und etwas mehr Feinheit suchen, ist Q5_K_M eine Alternative. Verwenden Sie Q8_0 und FP16 nur auf sehr gut ausgestatteten Rechnern.
#Prüfen, ob alles wirklich offline funktioniert
Verlassen Sie sich niemals allein auf Zusicherungen: Testen Sie unter realen Bedingungen, bevor Sie ohne Netzwerkverbindung dastehen. Ein dreiminütiger Test erspart Ihnen eine Enttäuschung in 10.000 Metern Höhe.
- 01Die Netzwerkverbindung vollständig trennenAktivieren Sie den Flugmodus und deaktivieren Sie sowohl WLAN ALS AUCH Ethernet. Ziel ist es, das vollständige Fehlen einer Verbindung exakt nachzustellen.
- 02Eine Konversation startenÖffnen Sie Ihr Terminal oder LM Studio und chatten Sie mit jedem heruntergeladenen Modell. Wenn das Modell antwortet, ist Ihre Offline-KI einsatzbereit.
- 03Prüfen, dass kein Netzwerkfehler den Betrieb blockiertEinige Benutzeroberflächen zeigen im Offlinebetrieb ein Warnbanner an: Solange die Generierung funktioniert, ignorieren Sie es. Wenn sich der Chat nicht starten lässt, wurde das Modell wahrscheinlich nicht vollständig heruntergeladen.
#Isolierter Rechner und Air-Gap-Betrieb
Einige Maschinen werden absichtlich dauerhaft vom Internet getrennt: Arbeitsplätze mit sensiblen Daten, industrielle Umgebungen, Laboratorien. Dies ist der Einsatz von „air-gapped“ Systemen – die Zielmaschine hat niemals Zugriff auf das Netzwerk, auch nicht für die Installation.
Das Prinzip: die Dateien auf einem mit dem Internet verbundenen Rechner vorbereiten und anschließend per USB-Stick oder externer Festplatte auf den isolierten Rechner übertragen. Ollama speichert seine Modelle in einem Verzeichnis, das sich unverändert kopieren lässt.
- Offline-Installer
- Laden Sie die Installationsdatei von Ollama oder LM Studio auf einem Rechner mit Internetverbindung herunter und kopieren Sie sie anschließend auf den isolierten Rechner.
- Modelldateien
- Unter Linux/macOS befinden sich die Ollama-Modelle unter ~/.ollama/models; unter Windows unter %USERPROFILE%\.ollama\models. Kopieren Sie diesen Ordner auf den Zielrechner an denselben Speicherort.
- GGUF-Alternative
- Mit LM Studio reicht es aus, die heruntergeladenen .gguf-Dateien in das Modellverzeichnis der App auf dem isolierten Gerät zu kopieren.
#Die eigenen Modelle aktualisieren, sobald die Netzwerkverbindung wieder verfügbar ist
Sobald Sie wieder in einem Gebiet mit Netzabdeckung sind, ist es Zeit, Ihre Installation zu pflegen: neue Versionen der Modelle herunterladen, unterwegs entdeckte neue Modelle hinzufügen und die Anwendung aktualisieren. Nichts davon ist offline möglich. Deshalb ist es wichtig, dies zu erledigen, sobald das Netz wieder verfügbar ist.
- 01Bestehende Modelle aktualisierenEin ollama pull sur lädt nur die geänderten Schichten herunter, wenn eine neue Version verfügbar ist, wenn ein bereits vorhandener Modell existiert. Das ist schnell und hält Ihre Modelle aktuell.
- 02Die App aktualisierenStarten Sie das Installationsprogramm von Ollama oder LM Studio erneut, um von Fehlerbehebungen und der Unterstützung neuer Modelle zu profitieren. Updates sind in diesem Ökosystem häufig.
- 03AufräumenLöschen Sie die Modelle, die Sie nicht mehr verwenden, um vor Ihrer nächsten Abreise Speicherplatz auf der Festplatte freizugeben.
- 04Erneut im Flugmodus testenFühren Sie nach jeder Aktualisierung erneut einen Offline-Test durch: Eine neue App-Version könnte ohne Netzwerkverbindung ein unerwartetes Verhalten zeigen.
#Fehlerbehebung
- „Model not found“ im Offlinebetrieb
- Das Modell war vor der Unterbrechung nicht (vollständig) heruntergeladen. Wiederherstellen Sie die Verbindung, starten Sie ollama pull jusqu nach dem Erfolgsnachricht und überprüfen Sie dann mit ollama list.
- Die Anwendung startet ohne Netzwerk nicht
- Einige Benutzeroberflächen versuchen beim Start eine Online-Prüfung durchzuführen. Warten Sie einige Sekunden, bis die Prüfung wegen Zeitüberschreitung endet, oder deaktivieren Sie die Update-Prüfung in den Einstellungen.
- Sehr langsame Antworten unterwegs
- Bei reinem CPU-Betrieb und im Akkubetrieb ist das normal. Wechseln Sie zu einem kleineren Modell (3B) und schließen Sie ressourcenintensive Anwendungen. Schließen Sie den Laptop nach Möglichkeit an das Stromnetz an.
- Der Akku leert sich zusehends
- Die Inferenz belastet den Prozessor stark. Verringern Sie die Modellgröße, begrenzen Sie die Länge der Antworten und aktivieren Sie für nicht dringende Aufgaben den Energiesparmodus.
- Kopiertes Modell lässt sich nicht laden (Air-Gap)
- Die Kopie war unvollständig: fehlende Blobs oder Manifeste. Kopieren Sie den gesamten Ordner .ollama/models erneut.
- Nicht genügend Speicher
- Das Modell benötigt mehr Speicher, als Ihr RAM/VRAM bietet. Wählen Sie eine kleinere Modellgröße oder eine weniger speicherintensive Quantisierung (Q4_K_M statt Q8_0).
#Weiterführende Informationen
Eine Offline-KI basiert auf denselben Grundlagen wie eine klassische lokale Installation. Diese Leitfäden auf dieser Website ergänzen die Vorbereitung:
- Ollama installieren
- Zum Installieren der Inferenz-Engine – dieser Schritt ist auszuführen, solange Sie noch eine Netzwerkverbindung haben.
- Ein LLM lokal ohne GPU ausführen (nur CPU)
- Unverzichtbar für unterwegs: Modelle und zu erwartende Geschwindigkeiten bei reinem CPU-Betrieb im Akkumodus.
- Quantisierung wählen (Q4, Q5, Q8, FP16)
- Um je nach dem Rechner, den Sie mitnehmen, zwischen Dateigröße auf dem Datenträger, Speicherbedarf und Qualität abzuwägen.
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.