Einsteiger 8 minOffline

Offline-KI: Ein LLM ohne Internetverbindung nutzen internet

Ein lokales LLM benötigt das Internet nur zum Herunterladen. Sobald das Modell auf Ihrem Datenträger liegt, funktioniert eine Offline-KI vollständig ohne Verbindung: im Flugzeug, in einem Funkloch, beim Wandern oder auf einem vom Netzwerk isolierten Rechner. Dieser Leitfaden zeigt, wie Sie Ihren Computer vor der Abreise vorbereiten, welche kompakten Modelle Sie mitnehmen sollten und wie Sie alles überprüfen, damit Sie nicht im falschen Moment ohne funktionierende KI dastehen.

Von Léa B.·Aktualisierung 2026-08-27·Unter Windows, macOS und Linux getestet

#Warum eine Offline-KI

Cloud-Assistenten (ChatGPT, Claude, Gemini) funktionieren sofort nicht mehr, sobald die Verbindung abbricht. Eine Offline-KI hingegen läuft vollständig auf Ihrem Rechner: Das Modell wird in den Speicher geladen und berechnet Ihre Antworten lokal, ohne jemals einen entfernten Server abzufragen. Es ist dasselbe Prinzip wie bei einem klassischen lokalen LLM, konsequent zu Ende gedacht – keinerlei Netzwerkabhängigkeit mehr, sobald die Vorbereitung abgeschlossen ist.

Situationen, in denen das einen entscheidenden Unterschied macht, sind häufiger, als man denkt: ein Langstreckenflug, eine Zugfahrt ohne 4G, ein Einsatz in einem Funkloch, eine Baustelle oder ein Industriegelände ohne WLAN oder ein Rechner, der aus Gründen der Vertraulichkeit bewusst vom Internet getrennt ist. In all diesen Fällen bleibt eine gut vorbereitete Offline-KI voll einsatzfähig.

Vollständige Autonomie
Keine Unterbrechung, wenn die Netzwerkverbindung ausfällt: im Flugzeug, im Tunnel, auf dem Land oder im Keller.
Datenschutz
Nichts verlässt den Rechner. Ideal für sensible Daten oder einen Rechner mit Air-Gap.
Keine laufenden Kosten
Kein Abonnement, keine Abrechnung pro Token, kein Nutzungskontingent.
Stabile Latenz
Die Geschwindigkeit hängt nur von Ihrer Hardware ab, nicht von einem überlasteten Server am anderen Ende der Welt.

#Was eine Netzwerkverbindung benötigt (und was nicht)

Das Kit Lokale KI

Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.

  • Lebenslanger Online-Zugang
  • PDF + Dateien
  • Lebenslange Updates

Wer den Unterschied zwischen „online“ und „offline“ versteht, vermeidet unangenehme Überraschungen. Nur ein Schritt erfordert eine Internetverbindung: das Herunterladen. Alles andere erfolgt lokal.

Netzwerk erforderlich (einmal)
Die Anwendung (Ollama, LM Studio) herunterladen, die Modelle (GGUF-Dateien) herunterladen, Updates herunterladen.
100 % offline
Ein bereits vorhandenes Modell laden, chatten, Text oder Code generieren, ein lokales Dokument zusammenfassen, RAG für Ihre Dateien nutzen.
i
Der klassische Fehler
Viele Tools versuchen beim Start, nach Updates zu suchen oder einen automatischen „Pull“ durchzuführen. Ohne Netzwerk verhindert das die Nutzung nicht, solange das Modell bereits heruntergeladen ist – die App kann allerdings eine irreführende Fehlermeldung anzeigen. Testen Sie immer im Flugmodus, BEVOR Sie abreisen.

#Voraussetzungen vor dem Start

Eine Offline-KI passt auf einen gewöhnlichen Laptop. Entscheidend sind der Arbeitsspeicher (RAM beziehungsweise VRAM, wenn Sie eine GPU haben) und der Festplattenspeicher zum Speichern der Modelle.

Freier Festplattenspeicher
Je nach mitgelieferten Modellen 5 bis 30 GB einplanen. Ein 7B-Modell in Q4_K_M benötigt etwa 4,5 GB, ein 14B-Modell etwa 9 GB.
RAM / VRAM
8 GB für ein 3B-Modell, 16 GB für den komfortablen Betrieb eines 7B-Modells, 32 GB, wenn Sie ein 14B-Modell anstreben. VRAM-Richtwerte bei Q4: 3B≈2 GB · 7B≈5 GB · 14B≈9 GB.
GPU (optional)
Eine GPU beschleunigt die Verarbeitung erheblich, ist aber nicht erforderlich. Ein MacBook mit Apple Silicon (M-Serie) oder ein PC mit 16 GB RAM reichen für den reinen CPU-Betrieb aus.
Akku
Die Inferenz beansprucht CPU/GPU: Rechnen Sie bei einem Laptop ohne Netzanschluss mit einer kürzeren Akkulaufzeit. Bevorzugen Sie unterwegs kompakte Modelle.
→
Ohne GPU funktioniert es dennoch
Im Flugzeug oder im Zug werden Sie oft ausschließlich auf der CPU arbeiten. Ein Modell mit 3B oder 7B in Q4_K_M bleibt auf einem aktuellen Laptop flüssig. Der Leitfaden „LLM lokal ohne GPU“ beschreibt die Modelle und die erwarteten Geschwindigkeiten.

#Alles herunterladen, bevor die Netzwerkverbindung verloren geht

Das ist der entscheidende Schritt und der einzige, der eine Internetverbindung erfordert. Erledigen Sie ihn in Ruhe zu Hause oder im Büro über WLAN, einige Stunden vor der Abreise — ein mehrere GB großes Modell verträgt instabile Verbindungen schlecht. Hier ist die Vorgehensweise mit Ollama, dem einfachsten Ansatz für eine Offline-KI.

  1. 01
    Ollama installieren, solange Sie eine Netzwerkverbindung haben
    Laden Sie Ollama von ollama.com herunter und installieren Sie es. Es ist der Daemon, der Ihre Modelle lokal ausführt und unter http://localhost:11434 auf Anfragen wartet. Installieren Sie es zuerst, da die App selbst online heruntergeladen wird.
  2. 02
    Ein oder zwei kompakte Modelle herunterladen
    Verwenden Sie ollama pull, um die Modelle auf das Laufwerk herunterzuladen. Wählen Sie Größen, die zu Ihrem Rechner passen (siehe nächster Abschnitt). Ein Pull über eine stabile WLAN-Verbindung dauert je nach Übertragungsgeschwindigkeit und Größe einige Minuten bis zu einer Viertelstunde.
  3. 03
    Eine grafische Oberfläche installieren (optional)
    Wenn Sie ein Chatfenster einem Terminal vorziehen, installieren Sie LM Studio (eine Komplettlösung, die auch den Download übernimmt) oder Open WebUI. LM Studio ist besonders praktisch für unterwegs: App, Modelle und Benutzeroberfläche in einem einzigen Tool.
  4. 04
    Jedes Modell einmal warmlaufen lassen
    Starten Sie einen Testdialog mit jedem heruntergeladenen Modell, solange Sie noch Netzwerkverbindung haben. Dadurch wird bestätigt, dass die Datei vollständig ist und korrekt in den Speicher geladen wird.
Terminal — Vorbereitung (mit Netzwerk)
# Vérifier qu'Ollama est bien installé
ollama --version

# Télécharger des modèles compacts pour la mobilité
ollama pull qwen3.5:2b         # ~1,9 Go, très léger
ollama pull qwen3.5:9b         # ~6,6 Go, LE polyvalent 2026
ollama pull granite4.2:8b      # ~5,3 Go, sobre et token-efficient

# Lister ce qui est déjà sur le disque
ollama list
!
Gehen Sie nicht mit einem nur halb abgeschlossenen Pull offline
Ein ollama pull interrompu lässt ein unvollständiges Modell zu, das offline nicht geladen werden kann. Warten Sie auf die Nachricht „success“ und bestätigen Sie die Modellvorhandenheit mit ollama list, bevor Sie das Netzwerk unterbrechen.

#Kompakte Modelle, die unterwegs ausreichen

Beim Offline-Betrieb auf einem Laptop hat Energieeffizienz Vorrang: Ein kleines, schnelles Modell, das wenig Akkuleistung benötigt, ist besser als ein riesiges Modell, das nur schleppend läuft und den Akku leert. Für die meisten Aufgaben unterwegs – Schreiben, Zusammenfassen, allgemeine Fragen, Unterstützung beim Programmieren – leistet ein Modell mit 2 bis 9 Milliarden Parametern in Q4_K_M sehr gute Arbeit.

Qwen 3.5 2B
~1,9 GB. Das leichteste Modell: ideal für einen alten Laptop oder um den Akku zu schonen. Multimodal, 256k Kontext, Apache-2.0-Lizenz. Ausreichend, um Texte zu verfassen, umzuformulieren und einfache Fragen zu beantworten.
Qwen 3.5 9B
~6,6 GB. Hervorragender Allrounder, gut im logischen Schlussfolgern, in der Bildverarbeitung und beim Programmieren, 256k Kontext. Der beste Kompromiss für einen Laptop mit 16 GB RAM – die Referenzwahl in der 8-GB-Klasse im Jahr 2026.
Granite 4.2 8B
~5,3 GB. Sparsam und token-effizient (IBM, Apache 2.0), 128k Kontext, knappe Antworten. Eine zuverlässige Wahl fürs Schreiben, die den Akku schont.
Granite 4.2 3B
~2,2 GB. Kompakt und schnell, sehr ressourcensparend, auf weniger leistungsstarke Rechner zugeschnitten und dennoch leistungsfähig.
→
Nehmen Sie zwei Modelle mit, nicht zehn
Ein kleines Modell (2–3B), um den Akku zu schonen und schnell zu antworten, ein mittelgroßes (8–9B) für anspruchsvolle Aufgaben. Das reicht aus, um 95 % des Offline-Bedarfs abzudecken, ohne das Laufwerk vollzumachen.

Die Quantisierung Q4_K_M ist die empfohlene Standardeinstellung: Sie reduziert die Modellgröße und den benötigten Speicher erheblich, bei einem minimalen Qualitätsverlust, der bei den meisten Anwendungen nicht wahrnehmbar ist. Wenn Sie Spielraum beim RAM/VRAM haben und etwas mehr Feinheit suchen, ist Q5_K_M eine Alternative. Verwenden Sie Q8_0 und FP16 nur auf sehr gut ausgestatteten Rechnern.


#Prüfen, ob alles wirklich offline funktioniert

Verlassen Sie sich niemals allein auf Zusicherungen: Testen Sie unter realen Bedingungen, bevor Sie ohne Netzwerkverbindung dastehen. Ein dreiminütiger Test erspart Ihnen eine Enttäuschung in 10.000 Metern Höhe.

  1. 01
    Die Netzwerkverbindung vollständig trennen
    Aktivieren Sie den Flugmodus und deaktivieren Sie sowohl WLAN ALS AUCH Ethernet. Ziel ist es, das vollständige Fehlen einer Verbindung exakt nachzustellen.
  2. 02
    Eine Konversation starten
    Öffnen Sie Ihr Terminal oder LM Studio und chatten Sie mit jedem heruntergeladenen Modell. Wenn das Modell antwortet, ist Ihre Offline-KI einsatzbereit.
  3. 03
    Prüfen, dass kein Netzwerkfehler den Betrieb blockiert
    Einige Benutzeroberflächen zeigen im Offlinebetrieb ein Warnbanner an: Solange die Generierung funktioniert, ignorieren Sie es. Wenn sich der Chat nicht starten lässt, wurde das Modell wahrscheinlich nicht vollständig heruntergeladen.
Terminal — Offline-Test (Flugmodus aktiviert)
# Le daemon tourne en local, aucun réseau requis
ollama run qwen3.5:9b "Résume en trois points les avantages d'une IA hors ligne."

# Vérifier que le serveur local répond bien sur son port par défaut
curl http://localhost:11434/api/tags
i
Der Server bleibt lokal
Ollama lauscht auf http://localhost:11434, einer internen Adresse Ihres Rechners. Diese Adresse hat nichts mit dem Internet zu tun: Sie funktioniert mit oder ohne Internetverbindung genau gleich.

#Isolierter Rechner und Air-Gap-Betrieb

Einige Maschinen werden absichtlich dauerhaft vom Internet getrennt: Arbeitsplätze mit sensiblen Daten, industrielle Umgebungen, Laboratorien. Dies ist der Einsatz von „air-gapped“ Systemen – die Zielmaschine hat niemals Zugriff auf das Netzwerk, auch nicht für die Installation.

Das Prinzip: die Dateien auf einem mit dem Internet verbundenen Rechner vorbereiten und anschließend per USB-Stick oder externer Festplatte auf den isolierten Rechner übertragen. Ollama speichert seine Modelle in einem Verzeichnis, das sich unverändert kopieren lässt.

Offline-Installer
Laden Sie die Installationsdatei von Ollama oder LM Studio auf einem Rechner mit Internetverbindung herunter und kopieren Sie sie anschließend auf den isolierten Rechner.
Modelldateien
Unter Linux/macOS befinden sich die Ollama-Modelle unter ~/.ollama/models; unter Windows unter %USERPROFILE%\.ollama\models. Kopieren Sie diesen Ordner auf den Zielrechner an denselben Speicherort.
GGUF-Alternative
Mit LM Studio reicht es aus, die heruntergeladenen .gguf-Dateien in das Modellverzeichnis der App auf dem isolierten Gerät zu kopieren.
Terminal — Übertragung auf ein isoliertes Gerät
# Sur la machine connectée : localiser les modèles
ls ~/.ollama/models

# Copier tout le dossier .ollama vers une clé USB
cp -r ~/.ollama /media/usb/ollama-backup

# Sur le poste air-gapped : restaurer au même emplacement
cp -r /media/usb/ollama-backup ~/.ollama

# Vérifier que les modèles sont bien reconnus
ollama list
!
Vollständige Kopie erforderlich
Der Ordner models enthält sowohl die Blobs (die Gewichte) als auch die Manifeste (die Metadaten). Kopieren Sie den gesamten Ordner: Ein Manifest ohne den zugehörigen Blob oder umgekehrt macht das Modell auf dem Zielrechner unbrauchbar.

#Die eigenen Modelle aktualisieren, sobald die Netzwerkverbindung wieder verfügbar ist

Sobald Sie wieder in einem Gebiet mit Netzabdeckung sind, ist es Zeit, Ihre Installation zu pflegen: neue Versionen der Modelle herunterladen, unterwegs entdeckte neue Modelle hinzufügen und die Anwendung aktualisieren. Nichts davon ist offline möglich. Deshalb ist es wichtig, dies zu erledigen, sobald das Netz wieder verfügbar ist.

  1. 01
    Bestehende Modelle aktualisieren
    Ein ollama pull sur lädt nur die geänderten Schichten herunter, wenn eine neue Version verfügbar ist, wenn ein bereits vorhandener Modell existiert. Das ist schnell und hält Ihre Modelle aktuell.
  2. 02
    Die App aktualisieren
    Starten Sie das Installationsprogramm von Ollama oder LM Studio erneut, um von Fehlerbehebungen und der Unterstützung neuer Modelle zu profitieren. Updates sind in diesem Ökosystem häufig.
  3. 03
    Aufräumen
    Löschen Sie die Modelle, die Sie nicht mehr verwenden, um vor Ihrer nächsten Abreise Speicherplatz auf der Festplatte freizugeben.
  4. 04
    Erneut im Flugmodus testen
    Führen Sie nach jeder Aktualisierung erneut einen Offline-Test durch: Eine neue App-Version könnte ohne Netzwerkverbindung ein unerwartetes Verhalten zeigen.
Terminal — Wartung (mit Netzwerkverbindung)
# Mettre à jour un modèle vers sa dernière version
ollama pull qwen3.5:9b

# Supprimer un modèle devenu inutile
ollama rm qwen3.5:2b

# Voir l'espace occupé par chaque modèle
ollama list

#Fehlerbehebung

„Model not found“ im Offlinebetrieb
Das Modell war vor der Unterbrechung nicht (vollständig) heruntergeladen. Wiederherstellen Sie die Verbindung, starten Sie ollama pull jusqu nach dem Erfolgsnachricht und überprüfen Sie dann mit ollama list.
Die Anwendung startet ohne Netzwerk nicht
Einige Benutzeroberflächen versuchen beim Start eine Online-Prüfung durchzuführen. Warten Sie einige Sekunden, bis die Prüfung wegen Zeitüberschreitung endet, oder deaktivieren Sie die Update-Prüfung in den Einstellungen.
Sehr langsame Antworten unterwegs
Bei reinem CPU-Betrieb und im Akkubetrieb ist das normal. Wechseln Sie zu einem kleineren Modell (3B) und schließen Sie ressourcenintensive Anwendungen. Schließen Sie den Laptop nach Möglichkeit an das Stromnetz an.
Der Akku leert sich zusehends
Die Inferenz belastet den Prozessor stark. Verringern Sie die Modellgröße, begrenzen Sie die Länge der Antworten und aktivieren Sie für nicht dringende Aufgaben den Energiesparmodus.
Kopiertes Modell lässt sich nicht laden (Air-Gap)
Die Kopie war unvollständig: fehlende Blobs oder Manifeste. Kopieren Sie den gesamten Ordner .ollama/models erneut.
Nicht genügend Speicher
Das Modell benötigt mehr Speicher, als Ihr RAM/VRAM bietet. Wählen Sie eine kleinere Modellgröße oder eine weniger speicherintensive Quantisierung (Q4_K_M statt Q8_0).

#Weiterführende Informationen

Eine Offline-KI basiert auf denselben Grundlagen wie eine klassische lokale Installation. Diese Leitfäden auf dieser Website ergänzen die Vorbereitung:

Ollama installieren
Zum Installieren der Inferenz-Engine – dieser Schritt ist auszuführen, solange Sie noch eine Netzwerkverbindung haben.
Ein LLM lokal ohne GPU ausführen (nur CPU)
Unverzichtbar für unterwegs: Modelle und zu erwartende Geschwindigkeiten bei reinem CPU-Betrieb im Akkumodus.
Quantisierung wählen (Q4, Q5, Q8, FP16)
Um je nach dem Rechner, den Sie mitnehmen, zwischen Dateigröße auf dem Datenträger, Speicherbedarf und Qualität abzuwägen.
Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.