Pfad 02 · Zum Programmieren

Der Entwickler — « Copilot lokal, 100% offline, 0 Cloud-Latenz. »

Qwen2.5 Coder 32B, über Continue.dev mit VSCode verbunden. Autovervollständigung, Chat und Refactoring einer ganzen Datei – ohne dass eine Zeile Ihres Codes an Microsoft, OpenAI oder Anthropic gelangt. Ihr PR enthält einen API-Schlüssel? Er bleibt darin.

Gesamtdauer
~30 min
Erforderliches Kompetenzniveau
Sicher im Umgang mit einem Terminal
Kosten
0 €
Maschinentyp
GPU mit 16 GB VRAM oder Mac der M-Serie mit mindestens 32 GB
↑
Unser Versprechen

Am Ende dieses Lernpfads verfügen Sie über einen llama.cpp-Server, der im Hintergrund mit Qwen2.5 Coder 32B in Q4-Quantisierung läuft. Continue.dev wird an VSCode angebunden sein, mit Autovervollständigung (FIM) und Chat in der Seitenleiste. Die Latenz wird unter 100 ms liegen, und die Qualität der Autovervollständigung wird mit Copilot vergleichbar sein, bei neuerem Code manchmal sogar besser.

Für wen dieser Lernpfad gedacht ist

Wir sagen es Ihnen lieber frühzeitig, als Sie 30 Minuten umsonst verschwenden zu lassen.

✓ Das passt zu Ihnen, wenn
  • ✓Sie programmieren täglich und haben es satt, Ihre Snippets in eine Web-UI zu kopieren.
  • ✓Ihr Arbeitgeber verbietet GitHub Copilot, ChatGPT, Cursor — aus gutem Grund.
  • ✓Sie arbeiten an proprietärem Code, unter einer Geheimhaltungsvereinbarung (NDA) oder mit API-Geheimnissen im Klartext.
  • ✓Sie verfügen über eine RTX 4070 Ti+, RTX 4090, RTX 5090 oder ein MacBook Pro M2/M3/M4 mit mindestens 32 GB.
  • ✓Der Ping von 200 ms zu den Cloud-APIs stört Ihren Ablauf.
✕ Sehen Sie sich anderweitig um, wenn
  • ·Sie haben 8 GB VRAM: Das ist machbar, allerdings mit einem 7B-Modell und einer Qualität deutlich unter der von Copilot.
  • ·Sie programmieren 1 Stunde pro Woche: ein kostenloses Konto bei einem Cloud-Anbieter wird weniger Aufwand bedeuten.
  • ·Sie möchten einen allgemeinen Chat-Assistenten nutzen: Sehen Sie sich den einfacheren Lernpfad für Neugierige an.

Der Lernpfad in 4 Schritten

Jeder Schritt verweist auf einen detaillierten Leitfaden, den Sie parallel lesen können. Die Reihenfolge ist optimiert: Überspringen Sie beim ersten Mal keinen Schritt.

Kumulativ · ~30 min
  1. 1
    Schritt 01·12 Min.·Fortgeschritten

    llama.cpp mit GPU-Beschleunigung kompilieren

    Aus dem Quellcode kompilieren, um die maximale Tokenrate zu erreichen. Auf NVIDIA: CUDA. Auf Apple Silicon: Metal. Auf AMD: ROCm. Das ist 15 bis 30 % schneller als Ollama.

    Die ausführbare Datei llama-server ist bereit und kann eine OpenAI-kompatible API bereitstellen.
    Leitfaden lesen →
  2. 2
    Schritt 02·6 Min.·Mittelstufe

    Qwen2.5 Coder 32B (Q4) herunterladen

    Das beste Open-Weights-Modell für Code in seiner Kategorie. Q4_K_M passt in etwa 19 GB VRAM und bewahrt 95 % der Qualität von FP16. Download von Hugging Face.

    Das Modell wird unter localhost:8080 im Chat-Completions-Format bereitgestellt.
    Leitfaden lesen →
  3. 3
    Schritt 03·8 min·Mittelstufe

    Continue.dev mit VSCode verbinden

    Die Continue-Erweiterung aus dem Marketplace installieren, ~/.continue/config.json bearbeiten, sodass die Konfiguration auf Ihren lokalen Endpunkt verweist, und das FIM-Modell für die Autovervollständigung konfigurieren.

    Tab, um einen Vorschlag anzunehmen, Cmd+L, um den Chat zur Auswahl zu öffnen.
    Leitfaden lesen →
  4. +
    Schritt bonus·4 Min.·Fortgeschritten

    Bonus — Aider auf der Kommandozeile

    Für umfangreichere Aufgaben (Refactoring eines Moduls, Generierung von Tests) ermöglicht Aider das Bearbeiten von Dateien in natürlicher Sprache über das Terminal, mit automatischen Git-Commits.

    Eine agentische CLI, die an dasselbe Backend angebunden ist und Continue ergänzt.
    Leitfaden lesen →

Empfohlene Modelle

Drei getestete Optionen für diesen Lernpfad – von der leichtesten bis zur leistungsfähigsten. Klicken Sie für die ausführliche Modellübersicht (VRAM, Kontext, Benchmarks).

Aufgeführtes Modell
qwen2.5-14b

Der Vielseitige. 14B = 9 GB bei Q4, hervorragende Codequalität, passt in 12 GB VRAM.

Der Vielseitige
Mistral Small 3
Mistral AI · 24B · 14 GB in Q4

Guter Kompromiss, wenn Sie 16 GB VRAM haben, vielseitiger einsetzbar.

Zur Detailseite →
Aufgeführtes Modell
llama-3.3-70b

Die Top-Lösung, wenn Sie einen Mac mit 64 GB oder eine GPU mit 48 GB haben. Höhere Latenz, aber erstklassige Qualität.

Häufig gestellte Fragen

Die echten Fragen, die uns per E-Mail und auf Mastodon gestellt werden. Wenn Ihre Frage fehlt, öffnen Sie ein Ticket.

Bei der zeilenweisen Autovervollständigung kommt Qwen2.5 Coder 32B sehr nahe heran und ist bei neuerem Code (nach 2024) manchmal sogar besser. Im Chat liegt Copilot Chat (mit GPT-4o im Hintergrund) weiterhin eine Stufe höher. Aber Sie behalten die Kontrolle über Ihre Daten.
Nach Abschluss dieses Parcours
Nächster Lernpfad

Der Profi mit vertraulichen Unterlagen — « Meine Akten verlassen meinen Rechner nicht. »

Juriste, médecin, RH, consultant, expert-comptable, notaire — vos documents sont sous secret professionnel ou NDA. Un LLM local couplé à un RAG vous laisse les interroger, résumer,…

→
Das Kit „Copilote Local“

Ersetzen Sie GitHub Copilot und Cursor durch einen 100 % lokalen Code-Copiloten — der Referenzleitfaden, inklusive Konfigurationen.

  • Lebenslanger Online-Zugang
  • PDF + Dateien
  • Erstattung binnen 30 Tagen

Eine Frage, ein Tippfehler, ein Bug?

Dieser Lernpfad entwickelt sich mit jeder Modellveröffentlichung weiter. Ihre Rückmeldungen bilden die Grundlage.