Kostenloser Copilot lokal: Cline, Tabby & CodeGeeX in VS Code (2026)
GitHub Copilot kostet 10 €/Monat und sendet jedes Zeichen, das Sie eingeben, an einen Microsoft-Server. Drei kostenlose VS-Code-Erweiterungen lösen beide Probleme, indem sie Chat und Autovervollständigung an ein lokales LLM anbinden: Cline, Tabby und CodeGeeX. Dieser Leitfaden zeigt, wie Sie alle drei installieren und welche Modelle Sie verwenden sollten, und vergleicht, was die Erweiterungen tatsächlich leisten, damit Sie einen kostenlosen lokalen Copiloten für VS Code auswählen können.
#Warum ein kostenloser lokaler Copilot für VS Code?
Copilot und Cursor senden Ihren Code an OpenAI oder Anthropic. Bei einem Kundenprojekt unter NDA, bei proprietärem Code oder einfach aus Prinzip ist das nicht immer akzeptabel. Ein lokaler Copilot löst drei Probleme auf einmal: keine Datenlecks (nichts verlässt den Laptop), kein Abonnement, keine Netzwerklatenz.
Die Einschränkung muss man offen benennen: Die Qualität eines lokal betriebenen Qwen 3.5 9B erreicht nicht die des allerneuesten Modells von Copilot Pro. Doch für alltägliche Aufgaben – eine Schleife vervollständigen, einen Test schreiben, eine Funktion mit 30 Zeilen refaktorieren – erfüllt ein Modell mit 9 bis 24 Milliarden Parametern in Q4 seinen Zweck. Für Aufgaben, die das lokale Modell nicht bewältigen kann, nutzen Sie Copilot weiterhin parallel.
#Voraussetzungen
Dieser Guide führt Sie zum Modell. Das Kit führt Sie zum Copiloten, der in Ihrem Editor Code schreibt.
- Lebenslanger Online-Zugang
- PDF + Dateien
- Lebenslange Updates
- Aktuelle VS-Code-Version
- Version 1.85+ für die Inline-Completion-API. Die JetBrains-Erweiterungen sind auch für die drei Tools verfügbar.
- Ollama installiert
- Dient als Inferenz-Backend für Cline. Lauscht standardmäßig unter http://localhost:11434. Bei Tabby ist die Laufzeitumgebung enthalten; CodeGeeX kann auf Ollama verweisen.
- GPU mit mindestens 8 GB VRAM
- RTX 3060 mit 12 GB, 4060 Ti mit 16 GB, Mac M2/M3 mit 16 GB gemeinsamem Speicher. Bei geringerer Speicherausstattung bleiben Sie für die Codevervollständigung bei Modellen mit 1,5 Milliarden Parametern (qwen2.5-coder:1.5b), die weiterhin schnell reagieren.
- 20 GB Festplattenspeicher
- Ein 7B-Coding-Modell in Q4 = 4–5 GB. Planen Sie großzügig, wenn Sie mehrere Modelle oder mehrere Tools testen.
#1. Cline (Chat + Agent)
Cline ist die umfassendste Option für die Programmierassistenz: ein Chat in der Seitenleiste und ein Agentenmodus, der wie Cursor mehrere Dateien lesen und bearbeiten kann – alles lokal über Ollama. Als Open-Source-Lösung unter MIT-Lizenz mit BYO-LLM ist Cline der naheliegende Ersatz für Continue.dev. Auch Roo Code, ein Fork von Cline, wird eingestellt: Damit wird Cline zum zentralen Anlaufpunkt dieses Ökosystems. Die Einschränkung: Cline bietet keine Inline-Autovervollständigung – diese decken wir weiter unten mit Tabby ab.
- 01Die Erweiterung installierenÖffnen Sie in VS Code die Erweiterungsansicht (Ctrl+Shift+X), suchen Sie nach Cline und installieren Sie die Erweiterung. In der linken Seitenleiste erscheint ein Cline-Symbol.
- 02Ein Modell herunterladenQwen 3.5 9B schlägt sich im Chat und als Agent mit 8 GB VRAM ordentlich. Wechseln Sie zu Devstral 24B oder Qwen 3.6 35B-A3B, wenn Sie genügend Speicherreserve haben; Devstral ist speziell auf agentische Aufgaben zugeschnitten.
- 03Den Ollama-Provider konfigurierenÖffnen Sie die Einstellungen von Cline, wählen Sie den Anbieter Ollama, geben Sie die lokale URL ein und wählen Sie das Modell aus.
- 04Den Chat testenStellen Sie eine Frage, fügen Sie Code ein, bitten Sie um eine Korrektur. Die Antwort erscheint im Panel, ohne dass etwas an die Cloud gesendet wird.
- 05Agent testenBeschreiben Sie eine Aufgabe, die mehrere Dateien betrifft. Cline schlägt einen Plan vor und wendet anschließend die Änderungen in Form von Diffs an, die Sie einzeln bestätigen.
#2. Tabby (selbst gehostete Autovervollständigung)
Tabby (TabbyML) deckt genau das ab, was Cline nicht bietet: die Inline-Autovervollständigung. Es ist für Teams konzipiert – ein einzelner Server hostet das Modell, und alle Entwickler verbinden sich aus ihrer IDE heraus mit ihm. Der Server bringt seine eigene Laufzeitumgebung mit; dafür ist Ollama nicht erforderlich.
- 01Tabby-Server startenDie Docker-Methode ist die einfachste. Der Server stellt einen HTTP-Endpunkt auf :8080 und eine webbasierte Administrationsoberfläche bereit.
- 02Ein Admin-Konto erstellenÖffnen Sie http://localhost:8080 im Browser. Erstellen Sie beim ersten Anmelden das Eigentümerkonto. Gehen Sie zu Settings → Information, um ein Authentifizierungstoken abzurufen.
- 03Die VS Code-Erweiterung installierenSuchen Sie in der Erweiterungsansicht nach Tabby (Herausgeber: TabbyML). Installieren Sie die Erweiterung.
- 04Die Erweiterung verbindenÖffnen Sie die Einstellungen (Ctrl+,) und suchen Sie nach tabby. Setzen Sie Endpoint = http://localhost:8080 und fügen Sie den Token ein. Die Statusleiste von VS Code zeigt Tabby: ready an; die Vervollständigung erscheint während der Eingabe in Grau.
#3. CodeGeeX
CodeGeeX (Tsinghua KEG / Zhipu AI) ist die „All-in-one“-Lösung: Die Erweiterung bietet bereits Codevervollständigung und Chat mit einem kostenlosen proprietären Modell, das bei den Anbietern gehostet wird. Sie lässt sich aber auch mit einem lokalen Modell verbinden, und genau das interessiert uns hier.
- 01Die Erweiterung installierenSuchen Sie in VS Code nach CodeGeeX (Herausgeber: aminer). Installieren Sie die Erweiterung. In der Seitenleiste erscheint ein CodeGeeX-Symbol.
- 02In den lokalen Modus wechselnÖffnen Sie die Einstellungen von CodeGeeX (Zahnradsymbol in der Seitenleiste). Suchen Sie den Abschnitt Local mode und aktivieren Sie ihn.
- 03Ollama als Ziel festlegenGeben Sie die URL des lokalen Modells ein. CodeGeeX spricht einen OpenAI-kompatiblen Endpoint an – der Endpoint von Ollama auf http://localhost:11434/v1 passt.
- 04Das Modell auswählencodegeex4 (9B) ist das eigene Modell, das in Ollama verfügbar ist. Andernfalls reicht jedes aktuelle Code-Modell aus (qwen3-coder, devstral).
#Vergleichstabelle
| Tool | Was es tut | Lokales Backend | Lizenz | Ideal für |
|---|---|---|---|---|
| Cline | Chat mit Multi-Datei-Agent | Ollama (1 pro Arbeitsplatzrechner) | MIT, open-source | Einzelnutzer, Power-User |
| Tabby | Inline-Vervollständigung | Integrierte Laufzeitumgebung (Server) | Self-hosted | Team, Ergänzung zu Cline |
| CodeGeeX | Vervollständigung + Chat | OpenAI-kompatibler Endpunkt | Kostenlos (Cloud als Standard) | Schlankes All-in-one-Setup |
- Abdeckung der Anwendungsfälle
- Cline: Chat + Agent (keine Codevervollständigung). Tabby: Codevervollständigung (kein fortgeschrittener Chat). CodeGeeX: Codevervollständigung + einfacher Chat. Die Kombination aus Cline und Tabby deckt alles ab.
- Setupaufwand
- CodeGeeX (5 min) < Cline + Ollama (10 min) < Tabby self-hosted (15-20 min).
- Multi-utilisateurs
- Nur Tabby ist von Haus aus dafür ausgelegt. Cline/CodeGeeX = ein Arbeitsplatzrechner = eine Ollama-Instanz.
- Datenschutz
- Cline und Tabby bleiben standardmäßig lokal. CodeGeeX nutzt die Cloud, solange der lokale Modus nicht aktiviert wurde – darauf sollten Sie achten.
#Fehlerbehebung
- Cline antwortet nicht
- Prüfen Sie die Ausgabe von ollama ps: Das Modell muss dort erscheinen, wenn Sie eine Anfrage starten. Wenn Ollama nicht antwortet, testen Sie curl http://localhost:11434/api/tags im Terminal. Prüfen Sie außerdem, ob in Cline tatsächlich Ollama als Anbieter ausgewählt ist.
- Keine grauen Vervollständigungen
- Cline bietet keine Inline-Autovervollständigung: Das ist normal. Installieren Sie Tabby (oder Twinny) für die zeilenweise Autovervollständigung und überprüfen Sie editor.inlineSuggest.enabled in VS Code.
- Tabby zeigt "Connection refused"
- Der Container läuft nicht oder der Port ist nicht freigegeben. docker ps muss tabby auflisten. docker logs tabby zeigt die Ursache (häufig: Das Modell ist beim ersten Start noch nicht heruntergeladen; warten Sie 5–10 Minuten).
- CodeGeeX gibt Antworten auf Chinesisch
- Geben Sie die Sprache im System-Prompt an (Settings CodeGeeX → Custom system prompt → „Immer auf Französisch antworten“), oder verwenden Sie Qwen 3.5 9B, das auf Französisch antwortet, wenn Sie es auf Französisch ansprechen.
- VRAM voll belegt, wenn alles läuft
- Möglicherweise haben Sie zwei Modelle geladen (Tabby-Autovervollständigung + Cline-Chat). Bei 8 GB verwenden Sie ein leichtes FIM-Modell für die Vervollständigung und ein Qwen 3.5 9B für den Chat. ollama ps zeigt den Speicherverbrauch an.
#FAQ
Was ist die beste kostenlose, lokal ausführbare Alternative zu Copilot?+
Warum spricht dieser Leitfaden nicht mehr von Continue.dev?+
Bietet Cline wie Copilot Autovervollständigung?+
Welches lokale Modell sollten Sie zum Programmieren wählen?+
Braucht man dafür eine leistungsstarke GPU?+
#Weiterführende Informationen
Ihr lokaler Copilot läuft. Je nach Ihrem Profil gibt es drei sinnvolle nächste Schritte:
- Mehr über Cline erfahren
- Der eigene Leitfaden zu lokalem Copilot mit Cline behandelt die Konfiguration ausführlicher: Ollama als Anbieter, Agentenmodus, Autovervollständigung über Tabby/Twinny und die Feineinstellungen für agentische Arbeitsabläufe.
- Sie haben zuvor Continue.dev verwendet
- Die Migrationshilfe Continue → Cline erklärt den Übergang (äquivalente Einstellungen, Modelle, lokale Daten).
- Ihr Hardware-Setup wählen
- Bevor Sie auf ein Modell mit 14B oder 32B umsteigen, hilft Ihnen die Anleitung „Eine GPU für lokale KI auswählen“, den Kauf einer GPU mit zu knapp bemessenem VRAM zu vermeiden.
Wenn Sie Zeit bei der Einrichtung sparen möchten, bietet der kostenpflichtige Leitfaden „Lokaler Code-Copilot“ ein vollständiges Paket sofort einsatzbereiter Konfigurationen für Ollama + Cline + Aider zum Einfügen – sowohl für einen Einzelarbeitsplatz als auch für ein Team.
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.