Ein LLM lokal installieren: Schritt-für-Schritt-Anleitung (2026)
Um ein LLM lokal zu installieren, benötigen Sie drei Dinge: einen Rechner mit genügend RAM oder VRAM für die angestrebte Modellgröße, ein Werkzeug zum Ausführen des Modells – LM Studio ohne Terminal, Ollama über die Befehlszeile oder llama.cpp für Experten – und ein erstes quantisiertes Modell, das zu dieser Hardware passt. Planen Sie auf einem neueren Rechner 10 bis 15 Minuten bis zum ersten funktionierenden lokalen Chat ein. Sobald das Modell heruntergeladen ist, benötigen Sie keine Internetverbindung mehr.
Sie möchten eine KI direkt auf Ihrem PC oder Mac ausführen, aber die Namen der Tools und Modelle ähneln sich und Sie wissen nicht, wo Sie anfangen sollen? Dieser Leitfaden bietet den fehlenden Überblick vor der Auswahl: Prüfen Sie, ob Ihr Gerät leistungsfähig genug ist, vergleichen Sie die drei Installationsmethoden, finden Sie Ihr erstes Modell und vermeiden Sie Fehler, die den ersten Versuch beeinträchtigen. Jeder Schritt verweist auf einen ausführlicheren Leitfaden, wenn Sie sich mit einem bestimmten Punkt näher befassen möchten.
#Den eigenen Rechner prüfen: RAM, VRAM und Modellgröße
Bevor Sie ein Tool auswählen, lautet die entscheidende Frage: Wie viel Speicher kann Ihr Gerät einem Modell zur Verfügung stellen? Die Bezeichnungen „7B“ und „32B“ geben die Parameterzahl an. Entscheidend für den tatsächlichen Speicherbedarf ist jedoch die quantisierte Version: Sie wird komprimiert, damit sie in den Speicher passt, wobei ein wenig Genauigkeit verloren geht. Die Q4-Quantisierung (häufig als Q4_K_M bezeichnet) ist ein gängiger Kompromiss für den Einstieg: Sie reduziert den benötigten Speicher gegenüber den nativen Modellgewichten deutlich, während der Qualitätsverlust im Alltag meist kaum wahrnehmbar ist.
- 8 GB RAM, keine dedizierte GPU
- Leichte Modelle mit etwa 3–4B Parametern in Q4: für einfache Anwendungen, mit langsameren, aber brauchbaren Antworten.
- 16 GB RAM (CPU) oder 8 GB VRAM (GPU)
- der komfortabelste Einstieg, mit 7–8B-Modellen in Q4 — dem gängigsten Format für einen ersten richtigen Einsatz.
- 12 GB VRAM
- Spielraum, um ohne besondere Probleme auf ein Modell mit 14 Milliarden Parametern umzusteigen.
- 24 GB VRAM (oder 32–48 GB vereinheitlichter Speicher auf einem Mac)
- Ein 32B-Modell mit Q4-Quantisierung läuft problemlos.
- 64 GB oder mehr RAM oder Unified Memory
- Modelle mit rund 70B werden nutzbar, mit teilweisem Offloading zwischen CPU und GPU und einem deutlich geringeren Durchsatz.
#Die Methode wählen: LM Studio, Ollama oder llama.cpp
Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.
- Lebenslanger Online-Zugang
- PDF + Dateien
- Erstattung binnen 30 Tagen
Drei große Wege ermöglichen es, ein LLM lokal zu betreiben. Sie schließen einander nicht aus, sondern beruhen auf unterschiedlichen Ansätzen. Die Wahl hängt vor allem davon ab, wie sicher Sie sich mit einem Terminal fühlen und was Sie nach der Installation mit dem Modell vorhaben.
- LM Studio — ganz ohne Terminal
- Desktop-Anwendung mit vollständiger grafischer Oberfläche, integrierter Modellsuche und grafischen GPU-Einstellungen. Die unkomplizierteste Wahl für den ersten Einstieg, verfügbar unter Windows, macOS (Apple Silicon) und Linux.
- Ollama — Terminal und API
- Installation mit einem einzigen Befehl, über die Kommandozeile verwaltete Modellbibliothek, standardmäßig aktiver lokaler API-Server mit OpenAI-Kompatibilität. Die naheliegende Wahl, wenn Sie Skripte schreiben, automatisieren oder ein Tool eines Drittanbieters anbinden möchten.
- llama.cpp — für Experten
- die Inferenz-Engine, die viele andere Tools im Hintergrund verwenden, darunter LM Studio. Kompilierung aus dem Quellcode, präzise Kontrolle über jeden Parameter, keine Benutzeroberfläche — für alle, die jedes Detail verstehen oder optimieren wollen.
Zusammengefasst: Sie möchten kein Terminal öffnen → LM Studio. Sie möchten Ihr Modell aus einem Skript, einer Automatisierung oder einer Anwendung aufrufen → Ollama. Sie möchten jeden Compilerparameter verstehen oder anpassen oder das Modell auf ungewöhnlicher Hardware ausführen → llama.cpp.
#Schnelle Installation, Schritt für Schritt
Hier finden Sie eine kompakte Installationsanleitung für jeden der drei Wege. Sie soll Ihnen einen Überblick geben, damit Sie in wenigen Minuten loslegen können. Für jedes Tool gibt es einen eigenen Leitfaden mit allen Details, einschließlich Screenshots.
Mit LM Studio (ohne Terminal):
- 011. Installer herunterladenLaden Sie von der offiziellen Website von LM Studio die Version herunter, die zu Ihrem System passt.
- 022. Die Modellsuche öffnenÖffnen Sie beim ersten Start den Suchtab (Tastenkombination Strg/Cmd+Umschalt+M), um den Katalog zu durchsuchen.
- 033. Ein passendes Modell auswählenDie Anwendung zeigt vor dem Download eine Einschätzung der VRAM-Kompatibilität an: Bevorzugen Sie ein Modell, das als mit Ihrem Rechner kompatibel gekennzeichnet ist.
- 044. Das Modell laden und chattenÖffnen Sie den Tab Chat, laden Sie das heruntergeladene Modell über das obere Menü und stellen Sie Ihre erste Frage.
Mit Ollama (Terminal und API) :
- 011. Ollama installierenOffizielles Skript unter Linux, .exe- oder .dmg-Installer unter Windows und macOS. Die Desktop-Anwendung startet nach der Installation automatisch.
- 022. Ein erstes Modell startenIm Terminal führt der Befehl ollama run suivie mit dem Namen eines Modells das Herunterladen und den Start eines direkten Chats im Terminal aus.
- 033. Chatten oder ein Drittanbieter-Tool anbindenFahren Sie im Terminal fort oder konfigurieren Sie eine OpenAI-kompatible Anwendung so, dass sie den lokalen API-Server verwendet (Standardport 11434).
- 044. Ihre installierten Modelle verwaltenListen Sie Ihre Modelle jederzeit auf, ändern oder löschen Sie sie mit den dedizierten Verwaltungsbefehlen.
Mit llama.cpp (für Experten):
- 011. Das Binärprogramm kompilierenKlonen Sie das Repository und kompilieren Sie es für Ihre Hardware (CPU, CUDA, Metal oder ROCm, je nach Ihrer Konfiguration).
- 022. Ein GGUF-Modell herunterladenLaden Sie eine GGUF-Datei von Hugging Face herunter und wählen Sie die entsprechende Quantisierung für die verfügbare Speichergröße.
- 033. Das Chat-Binärprogramm startenGeben Sie den Pfad zur heruntergeladenen GGUF-Datei an und verwenden Sie die Kontext- und GPU-Offloading-Einstellungen Ihrer Wahl.
- 044. GPU/CPU-Offload anpassenPassen Sie die Verteilung zwischen GPU und CPU Schicht für Schicht an, um für Ihre Konfiguration den besten Kompromiss zwischen Geschwindigkeit und Speicherbedarf zu finden.
#Erstes Modell herunterladen
Welches Modell sich für den Einstieg eignet, hängt vor allem davon ab, welches Ihre Maschine problemlos im Speicher halten kann, nicht vom Ruf des Modells. Hier finden Sie verlässliche Orientierungshilfen für Ihre Konfiguration.
- Einfacher Rechner (8–16 GB RAM, keine dedizierte GPU)
- ein kleines Allzweckmodell mit etwa 3–4B in Q4: schnell auch im reinen CPU-Betrieb und mehr als ausreichend, um zu chatten, einen kurzen Text zusammenzufassen oder zu übersetzen.
- 8 bis 12 GB VRAM
- ein Modell mit 7–8 Milliarden Parametern in Q4_K_M, wie Qwen3 8B oder Mistral: der häufigste Kompromiss zwischen Qualität und Geschwindigkeit für den täglichen Gebrauch.
- 16–24 GB VRAM
- ein 14B-Modell oder, wenn Sie am oberen Ende dieser Spanne liegen, ein 32B-Modell in Q4, etwa Gemma in seiner größten Version: mehr Spielraum für logisches Denken oder Programmieren.
- Sie wissen noch nicht, wofür Sie es verwenden möchten
- Beginnen Sie klein. Zu prüfen, ob ein leichtgewichtiges Modell korrekt antwortet, dauert nur wenige Minuten; nach einem erfolgreichen ersten Versuch können Sie zu einem größeren Modell wechseln.
#Häufige Fehler, die zu vermeiden sind
Die meisten schlechten ersten Eindrücke von lokaler KI entstehen durch eine falsche Einstellung und nicht durch ein tatsächliches Problem mit dem Tool oder dem Modell. Hier sind die häufigsten Stolperfallen bei der Installation des ersten lokalen LLM und Hinweise dazu, wie Sie sie schnell erkennen.
- Modell zu groß für den VRAM
- Das Modell wird teilweise in den System-RAM ausgelagert oder stürzt sogar beim Laden ab. Die Antworten werden sehr langsam oder es erscheint eine Speicherfehlermeldung. Wählen Sie ein Modell eine Größenstufe kleiner oder gehen Sie bei der Quantisierung eine Stufe herunter.
- Zufällig gewählte Quantisierung
- Die größte verfügbare Version herunterzuladen, „um das Beste zu haben“, führt oft dazu, dass sie nicht in den Speicher passt. Beginnen Sie mit Q4_K_M und wechseln Sie nur zu einer höheren Präzision, wenn der verfügbare Speicherspielraum es wirklich zulässt.
- Hochdrehender Lüfter und langsame Antwort
- Normal, wenn Sie zum ersten Mal ein großes Modell ausführen: Die Inferenz beansprucht die GPU oder CPU stark. Wenn Ihnen das zu langsam ist, deutet das auf ein für Ihren Rechner zu großes Modell hin, nicht auf einen Fehler, den Sie beheben müssen.
- Alles herunterladen, bevor man etwas testet
- Es ist besser, zuerst zu überprüfen, ob ein kleines Modell ordnungsgemäß funktioniert und korrekt antwortet, bevor man ein Modell von mehreren Dutzend GB herunterlädt.
#Und danach? RAG, Code-Assistent, API
Sobald ein erstes Modell installiert ist und funktioniert, bieten sich je nach Ihrem Einsatzzweck mehrere sinnvolle nächste Schritte an: mit Ihren eigenen Dokumenten chatten, einen Code-Copiloten in Ihren Editor einbinden oder den lokalen API-Server für Ihre eigenen Skripte und Anwendungen zugänglich machen.
- Mit Ihren Dokumenten chatten (RAG)
- LM Studio bietet eine integrierte, sofort einsatzbereite RAG-Funktion. Für ein gleichwertiges Ergebnis müssen Sie Ollama mit einem Drittanbieter-Tool wie Open WebUI oder einer speziellen Pipeline kombinieren.
- Ihren Code-Editor mit KI-Unterstützung nutzen
- Der OpenAI-kompatible API-Server von Ollama oder LM Studio kann an Erweiterungen wie Cline angeschlossen werden, um mit 100 % lokaler Unterstützung zu coden.
- Über die API automatisieren
- Die beiden Tools stellen einen lokalen, OpenAI-kompatiblen Server bereit, der sich in jedem Skript und jeder Anwendung nutzen lässt, die bereits für diese API ausgelegt sind, ohne auf Clientseite etwas ändern zu müssen.
#Häufig gestellte Fragen
Ist es legal und kostenlos, ein LLM lokal zu installieren?+
Welche minimale Konfiguration ist erforderlich, um zu starten?+
Kann man ein LLM lokal ohne Grafikkarte installieren?+
Wie viel Speicherplatz muss vorgesehen werden?+
Welches Modell sollte man für den Start wählen?+
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.