Einsteiger 12 Min.Installation

Ein LLM lokal installieren: Schritt-für-Schritt-Anleitung (2026)

Direkte Antwort

Um ein LLM lokal zu installieren, benötigen Sie drei Dinge: einen Rechner mit genügend RAM oder VRAM für die angestrebte Modellgröße, ein Werkzeug zum Ausführen des Modells – LM Studio ohne Terminal, Ollama über die Befehlszeile oder llama.cpp für Experten – und ein erstes quantisiertes Modell, das zu dieser Hardware passt. Planen Sie auf einem neueren Rechner 10 bis 15 Minuten bis zum ersten funktionierenden lokalen Chat ein. Sobald das Modell heruntergeladen ist, benötigen Sie keine Internetverbindung mehr.

Sie möchten eine KI direkt auf Ihrem PC oder Mac ausführen, aber die Namen der Tools und Modelle ähneln sich und Sie wissen nicht, wo Sie anfangen sollen? Dieser Leitfaden bietet den fehlenden Überblick vor der Auswahl: Prüfen Sie, ob Ihr Gerät leistungsfähig genug ist, vergleichen Sie die drei Installationsmethoden, finden Sie Ihr erstes Modell und vermeiden Sie Fehler, die den ersten Versuch beeinträchtigen. Jeder Schritt verweist auf einen ausführlicheren Leitfaden, wenn Sie sich mit einem bestimmten Punkt näher befassen möchten.

Von Mohamed Meguedmi·Aktualisierung 2026-08-24·Unter Windows, macOS und Linux getestet

#Den eigenen Rechner prüfen: RAM, VRAM und Modellgröße

Bevor Sie ein Tool auswählen, lautet die entscheidende Frage: Wie viel Speicher kann Ihr Gerät einem Modell zur Verfügung stellen? Die Bezeichnungen „7B“ und „32B“ geben die Parameterzahl an. Entscheidend für den tatsächlichen Speicherbedarf ist jedoch die quantisierte Version: Sie wird komprimiert, damit sie in den Speicher passt, wobei ein wenig Genauigkeit verloren geht. Die Q4-Quantisierung (häufig als Q4_K_M bezeichnet) ist ein gängiger Kompromiss für den Einstieg: Sie reduziert den benötigten Speicher gegenüber den nativen Modellgewichten deutlich, während der Qualitätsverlust im Alltag meist kaum wahrnehmbar ist.

8 GB RAM, keine dedizierte GPU
Leichte Modelle mit etwa 3–4B Parametern in Q4: für einfache Anwendungen, mit langsameren, aber brauchbaren Antworten.
16 GB RAM (CPU) oder 8 GB VRAM (GPU)
der komfortabelste Einstieg, mit 7–8B-Modellen in Q4 — dem gängigsten Format für einen ersten richtigen Einsatz.
12 GB VRAM
Spielraum, um ohne besondere Probleme auf ein Modell mit 14 Milliarden Parametern umzusteigen.
24 GB VRAM (oder 32–48 GB vereinheitlichter Speicher auf einem Mac)
Ein 32B-Modell mit Q4-Quantisierung läuft problemlos.
64 GB oder mehr RAM oder Unified Memory
Modelle mit rund 70B werden nutzbar, mit teilweisem Offloading zwischen CPU und GPU und einem deutlich geringeren Durchsatz.
i
Das sind nur Orientierungspunkte, keine Garantien
Die verwendete Kontextlänge, das Betriebssystem und andere geöffnete Anwendungen beeinflussen die tatsächlich verfügbare Speicherreserve. Planen Sie stets etwa 20 bis 30 % zusätzlichen Speicher über den reinen Speicherbedarf des Modells hinaus ein, bevor Sie eine Konfiguration als komfortabel betrachten.

#Die Methode wählen: LM Studio, Ollama oder llama.cpp

Das Lokale-KI-Paket

Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.

  • Lebenslanger Online-Zugang
  • PDF + Dateien
  • Erstattung binnen 30 Tagen

Drei große Wege ermöglichen es, ein LLM lokal zu betreiben. Sie schließen einander nicht aus, sondern beruhen auf unterschiedlichen Ansätzen. Die Wahl hängt vor allem davon ab, wie sicher Sie sich mit einem Terminal fühlen und was Sie nach der Installation mit dem Modell vorhaben.

LM Studio — ganz ohne Terminal
Desktop-Anwendung mit vollständiger grafischer Oberfläche, integrierter Modellsuche und grafischen GPU-Einstellungen. Die unkomplizierteste Wahl für den ersten Einstieg, verfügbar unter Windows, macOS (Apple Silicon) und Linux.
Ollama — Terminal und API
Installation mit einem einzigen Befehl, über die Kommandozeile verwaltete Modellbibliothek, standardmäßig aktiver lokaler API-Server mit OpenAI-Kompatibilität. Die naheliegende Wahl, wenn Sie Skripte schreiben, automatisieren oder ein Tool eines Drittanbieters anbinden möchten.
llama.cpp — für Experten
die Inferenz-Engine, die viele andere Tools im Hintergrund verwenden, darunter LM Studio. Kompilierung aus dem Quellcode, präzise Kontrolle über jeden Parameter, keine Benutzeroberfläche — für alle, die jedes Detail verstehen oder optimieren wollen.

Zusammengefasst: Sie möchten kein Terminal öffnen → LM Studio. Sie möchten Ihr Modell aus einem Skript, einer Automatisierung oder einer Anwendung aufrufen → Ollama. Sie möchten jeden Compilerparameter verstehen oder anpassen oder das Modell auf ungewöhnlicher Hardware ausführen → llama.cpp.


#Schnelle Installation, Schritt für Schritt

Hier finden Sie eine kompakte Installationsanleitung für jeden der drei Wege. Sie soll Ihnen einen Überblick geben, damit Sie in wenigen Minuten loslegen können. Für jedes Tool gibt es einen eigenen Leitfaden mit allen Details, einschließlich Screenshots.

Mit LM Studio (ohne Terminal):

  1. 01
    1. Installer herunterladen
    Laden Sie von der offiziellen Website von LM Studio die Version herunter, die zu Ihrem System passt.
  2. 02
    2. Die Modellsuche öffnen
    Öffnen Sie beim ersten Start den Suchtab (Tastenkombination Strg/Cmd+Umschalt+M), um den Katalog zu durchsuchen.
  3. 03
    3. Ein passendes Modell auswählen
    Die Anwendung zeigt vor dem Download eine Einschätzung der VRAM-Kompatibilität an: Bevorzugen Sie ein Modell, das als mit Ihrem Rechner kompatibel gekennzeichnet ist.
  4. 04
    4. Das Modell laden und chatten
    Öffnen Sie den Tab Chat, laden Sie das heruntergeladene Modell über das obere Menü und stellen Sie Ihre erste Frage.

Mit Ollama (Terminal und API) :

  1. 01
    1. Ollama installieren
    Offizielles Skript unter Linux, .exe- oder .dmg-Installer unter Windows und macOS. Die Desktop-Anwendung startet nach der Installation automatisch.
  2. 02
    2. Ein erstes Modell starten
    Im Terminal führt der Befehl ollama run suivie mit dem Namen eines Modells das Herunterladen und den Start eines direkten Chats im Terminal aus.
  3. 03
    3. Chatten oder ein Drittanbieter-Tool anbinden
    Fahren Sie im Terminal fort oder konfigurieren Sie eine OpenAI-kompatible Anwendung so, dass sie den lokalen API-Server verwendet (Standardport 11434).
  4. 04
    4. Ihre installierten Modelle verwalten
    Listen Sie Ihre Modelle jederzeit auf, ändern oder löschen Sie sie mit den dedizierten Verwaltungsbefehlen.

Mit llama.cpp (für Experten):

  1. 01
    1. Das Binärprogramm kompilieren
    Klonen Sie das Repository und kompilieren Sie es für Ihre Hardware (CPU, CUDA, Metal oder ROCm, je nach Ihrer Konfiguration).
  2. 02
    2. Ein GGUF-Modell herunterladen
    Laden Sie eine GGUF-Datei von Hugging Face herunter und wählen Sie die entsprechende Quantisierung für die verfügbare Speichergröße.
  3. 03
    3. Das Chat-Binärprogramm starten
    Geben Sie den Pfad zur heruntergeladenen GGUF-Datei an und verwenden Sie die Kontext- und GPU-Offloading-Einstellungen Ihrer Wahl.
  4. 04
    4. GPU/CPU-Offload anpassen
    Passen Sie die Verteilung zwischen GPU und CPU Schicht für Schicht an, um für Ihre Konfiguration den besten Kompromiss zwischen Geschwindigkeit und Speicherbedarf zu finden.
i
Für alle Details
Jeder dieser drei Wege verdient einen eigenen Schritt-für-Schritt-Leitfaden mit Screenshots und erweiterten Optionen. Diese Kurzfassung reicht aus, um ein erstes Modell zum Antworten zu bringen; kehren Sie zum jeweiligen Leitfaden zurück, sobald Sie einen bestimmten Punkt vertiefen möchten, etwa die Unterstützung für AMD-GPUs oder die Netzwerkkonfiguration eines Servers.

#Erstes Modell herunterladen

Welches Modell sich für den Einstieg eignet, hängt vor allem davon ab, welches Ihre Maschine problemlos im Speicher halten kann, nicht vom Ruf des Modells. Hier finden Sie verlässliche Orientierungshilfen für Ihre Konfiguration.

Einfacher Rechner (8–16 GB RAM, keine dedizierte GPU)
ein kleines Allzweckmodell mit etwa 3–4B in Q4: schnell auch im reinen CPU-Betrieb und mehr als ausreichend, um zu chatten, einen kurzen Text zusammenzufassen oder zu übersetzen.
8 bis 12 GB VRAM
ein Modell mit 7–8 Milliarden Parametern in Q4_K_M, wie Qwen3 8B oder Mistral: der häufigste Kompromiss zwischen Qualität und Geschwindigkeit für den täglichen Gebrauch.
16–24 GB VRAM
ein 14B-Modell oder, wenn Sie am oberen Ende dieser Spanne liegen, ein 32B-Modell in Q4, etwa Gemma in seiner größten Version: mehr Spielraum für logisches Denken oder Programmieren.
Sie wissen noch nicht, wofür Sie es verwenden möchten
Beginnen Sie klein. Zu prüfen, ob ein leichtgewichtiges Modell korrekt antwortet, dauert nur wenige Minuten; nach einem erfolgreichen ersten Versuch können Sie zu einem größeren Modell wechseln.
→
Die Quantisierungsbezeichnung ist nicht bloß Kosmetik
Ein Tag wie Q4_K_M, Q5_K_M oder Q8_0 gibt die Kompressionsstufe des Modells an. Je niedriger die Zahl, desto kleiner und schneller, aber auch ungenauer ist das Modell. Q4_K_M bleibt der beste Ausgangspunkt für einen ersten Versuch.

#Häufige Fehler, die zu vermeiden sind

Die meisten schlechten ersten Eindrücke von lokaler KI entstehen durch eine falsche Einstellung und nicht durch ein tatsächliches Problem mit dem Tool oder dem Modell. Hier sind die häufigsten Stolperfallen bei der Installation des ersten lokalen LLM und Hinweise dazu, wie Sie sie schnell erkennen.

Modell zu groß für den VRAM
Das Modell wird teilweise in den System-RAM ausgelagert oder stürzt sogar beim Laden ab. Die Antworten werden sehr langsam oder es erscheint eine Speicherfehlermeldung. Wählen Sie ein Modell eine Größenstufe kleiner oder gehen Sie bei der Quantisierung eine Stufe herunter.
Zufällig gewählte Quantisierung
Die größte verfügbare Version herunterzuladen, „um das Beste zu haben“, führt oft dazu, dass sie nicht in den Speicher passt. Beginnen Sie mit Q4_K_M und wechseln Sie nur zu einer höheren Präzision, wenn der verfügbare Speicherspielraum es wirklich zulässt.
Hochdrehender Lüfter und langsame Antwort
Normal, wenn Sie zum ersten Mal ein großes Modell ausführen: Die Inferenz beansprucht die GPU oder CPU stark. Wenn Ihnen das zu langsam ist, deutet das auf ein für Ihren Rechner zu großes Modell hin, nicht auf einen Fehler, den Sie beheben müssen.
Alles herunterladen, bevor man etwas testet
Es ist besser, zuerst zu überprüfen, ob ein kleines Modell ordnungsgemäß funktioniert und korrekt antwortet, bevor man ein Modell von mehreren Dutzend GB herunterlädt.

#Und danach? RAG, Code-Assistent, API

Sobald ein erstes Modell installiert ist und funktioniert, bieten sich je nach Ihrem Einsatzzweck mehrere sinnvolle nächste Schritte an: mit Ihren eigenen Dokumenten chatten, einen Code-Copiloten in Ihren Editor einbinden oder den lokalen API-Server für Ihre eigenen Skripte und Anwendungen zugänglich machen.

Mit Ihren Dokumenten chatten (RAG)
LM Studio bietet eine integrierte, sofort einsatzbereite RAG-Funktion. Für ein gleichwertiges Ergebnis müssen Sie Ollama mit einem Drittanbieter-Tool wie Open WebUI oder einer speziellen Pipeline kombinieren.
Ihren Code-Editor mit KI-Unterstützung nutzen
Der OpenAI-kompatible API-Server von Ollama oder LM Studio kann an Erweiterungen wie Cline angeschlossen werden, um mit 100 % lokaler Unterstützung zu coden.
Über die API automatisieren
Die beiden Tools stellen einen lokalen, OpenAI-kompatiblen Server bereit, der sich in jedem Skript und jeder Anwendung nutzen lässt, die bereits für diese API ausgelegt sind, ohne auf Clientseite etwas ändern zu müssen.
→
Schritt für Schritt
Sie müssen nicht schon am ersten Tag RAG, einen Code-Assistenten und Automatisierung anstreben. Prüfen Sie zunächst, ob ein lokaler Chat Ihre Fragen korrekt beantwortet; weiterführende Anwendungen lassen sich ganz natürlich darauf aufbauen, sobald diese Grundlage solide ist.

#Häufig gestellte Fragen

Ist es legal und kostenlos, ein LLM lokal zu installieren?+
Ja: Werkzeuge wie Ollama, LM Studio oder llama.cpp sind kostenlos, und Open-Weight-Modelle (Llama, Qwen, Mistral, Gemma...) werden unter Lizenzen veröffentlicht, die eine private Nutzung erlauben. Einige Lizenzen sehen besondere Bedingungen für eine kommerzielle Nutzung in großem Umfang vor; prüfen Sie diese für jedes Modell einzeln auf der Modellseite.
Welche minimale Konfiguration ist erforderlich, um zu starten?+
In der Praxis reichen 16 GB RAM und ein moderner Prozessor für ein erstes Modell mit einigen Milliarden Parametern. Eine GPU mit mindestens 8 GB VRAM oder ein Apple-Silicon-Chip mit ausreichend gemeinsam genutztem Speicher macht die Nutzung deutlich komfortabler, sobald Sie zu größeren Modellen wechseln.
Kann man ein LLM lokal ohne Grafikkarte installieren?+
Ja, die drei hier vorgestellten Methoden laufen ausschließlich auf der CPU. Modelle mit 3 bis 8 Milliarden Parametern bleiben ohne GPU nutzbar, aber die Antworten sind langsamer als mit einer dedizierten Grafikkarte.
Wie viel Speicherplatz muss vorgesehen werden?+
Quantisierte Modelle benötigen je nach Größe zwischen einigen Hundert MB für die kleinsten und mehreren Dutzend GB für die größten. Planen Sie eine großzügige Speicherreserve auf einer SSD ein, wenn Sie mehrere Modelle testen möchten, bevor Sie sich festlegen.
Welches Modell sollte man für den Start wählen?+
Ein Allzweckmodell mit 7 bis 8 Milliarden Parametern, etwa Qwen3 8B oder Mistral, in der Quantisierung Q4_K_M ist auf den meisten neueren Rechnern ein solider Ausgangspunkt. Passen Sie anschließend die Modellgröße an Ihren tatsächlich verfügbaren RAM oder VRAM und die Ergebnisse Ihrer ersten Versuche an.
Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.