Der Entwickler — « Copilot lokal, 100% offline, 0 Cloud-Latenz. »
Qwen2.5 Coder 32B, über Continue.dev mit VSCode verbunden. Autovervollständigung, Chat und Refactoring einer ganzen Datei – ohne dass eine Zeile Ihres Codes an Microsoft, OpenAI oder Anthropic gelangt. Ihr PR enthält einen API-Schlüssel? Er bleibt darin.
Am Ende dieses Lernpfads verfügen Sie über einen llama.cpp-Server, der im Hintergrund mit Qwen2.5 Coder 32B in Q4-Quantisierung läuft. Continue.dev wird an VSCode angebunden sein, mit Autovervollständigung (FIM) und Chat in der Seitenleiste. Die Latenz wird unter 100 ms liegen, und die Qualität der Autovervollständigung wird mit Copilot vergleichbar sein, bei neuerem Code manchmal sogar besser.
Für wen dieser Lernpfad gedacht ist
Wir sagen es Ihnen lieber frühzeitig, als Sie 30 Minuten umsonst verschwenden zu lassen.
- ✓Sie programmieren täglich und haben es satt, Ihre Snippets in eine Web-UI zu kopieren.
- ✓Ihr Arbeitgeber verbietet GitHub Copilot, ChatGPT, Cursor — aus gutem Grund.
- ✓Sie arbeiten an proprietärem Code, unter einer Geheimhaltungsvereinbarung (NDA) oder mit API-Geheimnissen im Klartext.
- ✓Sie verfügen über eine RTX 4070 Ti+, RTX 4090, RTX 5090 oder ein MacBook Pro M2/M3/M4 mit mindestens 32 GB.
- ✓Der Ping von 200 ms zu den Cloud-APIs stört Ihren Ablauf.
- ·Sie haben 8 GB VRAM: Das ist machbar, allerdings mit einem 7B-Modell und einer Qualität deutlich unter der von Copilot.
- ·Sie programmieren 1 Stunde pro Woche: ein kostenloses Konto bei einem Cloud-Anbieter wird weniger Aufwand bedeuten.
- ·Sie möchten einen allgemeinen Chat-Assistenten nutzen: Sehen Sie sich den einfacheren Lernpfad für Neugierige an.
Der Lernpfad in 4 Schritten
Jeder Schritt verweist auf einen detaillierten Leitfaden, den Sie parallel lesen können. Die Reihenfolge ist optimiert: Überspringen Sie beim ersten Mal keinen Schritt.
- 1Schritt 01·12 Min.·Fortgeschritten
llama.cpp mit GPU-Beschleunigung kompilieren
Aus dem Quellcode kompilieren, um die maximale Tokenrate zu erreichen. Auf NVIDIA: CUDA. Auf Apple Silicon: Metal. Auf AMD: ROCm. Das ist 15 bis 30 % schneller als Ollama.
Die ausführbare Datei llama-server ist bereit und kann eine OpenAI-kompatible API bereitstellen.Leitfaden lesen → - 2Schritt 02·6 Min.·Mittelstufe
Qwen2.5 Coder 32B (Q4) herunterladen
Das beste Open-Weights-Modell für Code in seiner Kategorie. Q4_K_M passt in etwa 19 GB VRAM und bewahrt 95 % der Qualität von FP16. Download von Hugging Face.
Das Modell wird unter localhost:8080 im Chat-Completions-Format bereitgestellt.Leitfaden lesen → - 3Schritt 03·8 min·Mittelstufe
Continue.dev mit VSCode verbinden
Die Continue-Erweiterung aus dem Marketplace installieren, ~/.continue/config.json bearbeiten, sodass die Konfiguration auf Ihren lokalen Endpunkt verweist, und das FIM-Modell für die Autovervollständigung konfigurieren.
Tab, um einen Vorschlag anzunehmen, Cmd+L, um den Chat zur Auswahl zu öffnen.Leitfaden lesen → - +Schritt bonus·4 Min.·Fortgeschritten
Bonus — Aider auf der Kommandozeile
Für umfangreichere Aufgaben (Refactoring eines Moduls, Generierung von Tests) ermöglicht Aider das Bearbeiten von Dateien in natürlicher Sprache über das Terminal, mit automatischen Git-Commits.
Eine agentische CLI, die an dasselbe Backend angebunden ist und Continue ergänzt.Leitfaden lesen →
Empfohlene Modelle
Drei getestete Optionen für diesen Lernpfad – von der leichtesten bis zur leistungsfähigsten. Klicken Sie für die ausführliche Modellübersicht (VRAM, Kontext, Benchmarks).
Der Vielseitige. 14B = 9 GB bei Q4, hervorragende Codequalität, passt in 12 GB VRAM.
Guter Kompromiss, wenn Sie 16 GB VRAM haben, vielseitiger einsetzbar.
Zur Detailseite →Die Top-Lösung, wenn Sie einen Mac mit 64 GB oder eine GPU mit 48 GB haben. Höhere Latenz, aber erstklassige Qualität.
Häufig gestellte Fragen
Die echten Fragen, die uns per E-Mail und auf Mastodon gestellt werden. Wenn Ihre Frage fehlt, öffnen Sie ein Ticket.
Der Profi mit vertraulichen Unterlagen — « Meine Akten verlassen meinen Rechner nicht. »
Juriste, médecin, RH, consultant, expert-comptable, notaire — vos documents sont sous secret professionnel ou NDA. Un LLM local couplé à un RAG vous laisse les interroger, résumer,…
Ersetzen Sie GitHub Copilot und Cursor durch einen 100 % lokalen Code-Copiloten — der Referenzleitfaden, inklusive Konfigurationen.
- Lebenslanger Online-Zugang
- PDF + Dateien
- Erstattung binnen 30 Tagen
Eine Frage, ein Tippfehler, ein Bug?
Dieser Lernpfad entwickelt sich mit jeder Modellveröffentlichung weiter. Ihre Rückmeldungen bilden die Grundlage.