Mittelstufe 15 minIDE

Kostenloser Copilot lokal: Cline, Tabby & CodeGeeX in VS Code (2026)

GitHub Copilot kostet 10 €/Monat und sendet jedes Zeichen, das Sie eingeben, an einen Microsoft-Server. Drei kostenlose VS-Code-Erweiterungen lösen beide Probleme, indem sie Chat und Autovervollständigung an ein lokales LLM anbinden: Cline, Tabby und CodeGeeX. Dieser Leitfaden zeigt, wie Sie alle drei installieren und welche Modelle Sie verwenden sollten, und vergleicht, was die Erweiterungen tatsächlich leisten, damit Sie einen kostenlosen lokalen Copiloten für VS Code auswählen können.

Von Mohamed Meguedmi·Aktualisierung 2026-08-27·Unter Windows, macOS und Linux getestet
i
Continue wird nicht mehr gepflegt (Juni 2026)
Continue wurde am 18. Juni 2026 von Cursor (Anysphere) übernommen: Das Repository ist archiviert (v2.0.0 ist die letzte Version) und die Erweiterung wird nicht mehr gepflegt — sie lässt sich weiterhin über Community-Forks installieren, und diese Anleitung funktioniert weiterhin unverändert. Für eine neue Einrichtung empfehlen wir eher Cline (Open Source, MIT, mit Ollama kompatibel): Lesen Sie unsere Anleitung „Von Continue zu Cline migrieren“.

#Warum ein kostenloser lokaler Copilot für VS Code?

Copilot und Cursor senden Ihren Code an OpenAI oder Anthropic. Bei einem Kundenprojekt unter NDA, bei proprietärem Code oder einfach aus Prinzip ist das nicht immer akzeptabel. Ein lokaler Copilot löst drei Probleme auf einmal: keine Datenlecks (nichts verlässt den Laptop), kein Abonnement, keine Netzwerklatenz.

Die Einschränkung muss man offen benennen: Die Qualität eines lokal betriebenen Qwen 3.5 9B erreicht nicht die des allerneuesten Modells von Copilot Pro. Doch für alltägliche Aufgaben – eine Schleife vervollständigen, einen Test schreiben, eine Funktion mit 30 Zeilen refaktorieren – erfüllt ein Modell mit 9 bis 24 Milliarden Parametern in Q4 seinen Zweck. Für Aufgaben, die das lokale Modell nicht bewältigen kann, nutzen Sie Copilot weiterhin parallel.

i
Was diese 3 Werkzeuge tun
Cline = Chat + Agent für mehrere Dateien (keine Inline-Autovervollständigung). Tabby = nur Autovervollständigung, mit Schwerpunkt auf selbst gehostetem Betrieb für Teams. CodeGeeX = Vervollständigung + Chat, mit integriertem eigenem Modell. Alle funktionieren in VS Code und JetBrains.
→
Und Continue.dev?
Continue.dev war bis 2026 in Übersichten vertreten, wurde jedoch von Cursor übernommen (angekündigt am 18. Juni 2026). Version 2.0.0 ist die letzte veröffentlichte stabile Version, und die Zukunft der eigenständigen Erweiterung ist ungewiss. Wir haben sie durch Cline ersetzt, eine aktiv weiterentwickelte Open-Source-Alternative mit vergleichbarer Funktionalität. Falls Sie Continue.dev noch genutzt haben: Die Frist für den Export der gehosteten Daten endete am 15. Juli 2026.

#Voraussetzungen

Das Kit „Lokaler Copilot“

Dieser Guide führt Sie zum Modell. Das Kit führt Sie zum Copiloten, der in Ihrem Editor Code schreibt.

  • Lebenslanger Online-Zugang
  • PDF + Dateien
  • Lebenslange Updates
Aktuelle VS-Code-Version
Version 1.85+ für die Inline-Completion-API. Die JetBrains-Erweiterungen sind auch für die drei Tools verfügbar.
Ollama installiert
Dient als Inferenz-Backend für Cline. Lauscht standardmäßig unter http://localhost:11434. Bei Tabby ist die Laufzeitumgebung enthalten; CodeGeeX kann auf Ollama verweisen.
GPU mit mindestens 8 GB VRAM
RTX 3060 mit 12 GB, 4060 Ti mit 16 GB, Mac M2/M3 mit 16 GB gemeinsamem Speicher. Bei geringerer Speicherausstattung bleiben Sie für die Codevervollständigung bei Modellen mit 1,5 Milliarden Parametern (qwen2.5-coder:1.5b), die weiterhin schnell reagieren.
20 GB Festplattenspeicher
Ein 7B-Coding-Modell in Q4 = 4–5 GB. Planen Sie großzügig, wenn Sie mehrere Modelle oder mehrere Tools testen.
→
Tatsächlicher VRAM-Bedarf nach Größe des Coding-Modells
Qwen 3.5 9B Q4 ≈ 6,6 GB · Gemma 4 12B ≈ 7,6 GB · Devstral 24B Q4 ≈ 14 GB · Qwen 3.6 35B-A3B ≈ 23 GB. Für die Inline-Vervollständigung (FIM) ist die Latenz wichtiger als die Qualität: Ein kleines FIM-Modell wie Qwen2.5-Coder reicht aus. Behalten Sie einen Qwen 3.5 9B für den Chat und einen Devstral 24B für den Agenten, wenn Sie genügend VRAM haben.

#1. Cline (Chat + Agent)

Cline ist die umfassendste Option für die Programmierassistenz: ein Chat in der Seitenleiste und ein Agentenmodus, der wie Cursor mehrere Dateien lesen und bearbeiten kann – alles lokal über Ollama. Als Open-Source-Lösung unter MIT-Lizenz mit BYO-LLM ist Cline der naheliegende Ersatz für Continue.dev. Auch Roo Code, ein Fork von Cline, wird eingestellt: Damit wird Cline zum zentralen Anlaufpunkt dieses Ökosystems. Die Einschränkung: Cline bietet keine Inline-Autovervollständigung – diese decken wir weiter unten mit Tabby ab.

  1. 01
    Die Erweiterung installieren
    Öffnen Sie in VS Code die Erweiterungsansicht (Ctrl+Shift+X), suchen Sie nach Cline und installieren Sie die Erweiterung. In der linken Seitenleiste erscheint ein Cline-Symbol.
  2. 02
    Ein Modell herunterladen
    Qwen 3.5 9B schlägt sich im Chat und als Agent mit 8 GB VRAM ordentlich. Wechseln Sie zu Devstral 24B oder Qwen 3.6 35B-A3B, wenn Sie genügend Speicherreserve haben; Devstral ist speziell auf agentische Aufgaben zugeschnitten.
  3. 03
    Den Ollama-Provider konfigurieren
    Öffnen Sie die Einstellungen von Cline, wählen Sie den Anbieter Ollama, geben Sie die lokale URL ein und wählen Sie das Modell aus.
  4. 04
    Den Chat testen
    Stellen Sie eine Frage, fügen Sie Code ein, bitten Sie um eine Korrektur. Die Antwort erscheint im Panel, ohne dass etwas an die Cloud gesendet wird.
  5. 05
    Agent testen
    Beschreiben Sie eine Aufgabe, die mehrere Dateien betrifft. Cline schlägt einen Plan vor und wendet anschließend die Änderungen in Form von Diffs an, die Sie einzeln bestätigen.
Modell herunterladen
ollama pull qwen3.5:9b
# Plus de VRAM ? Devstral, spécialiste agent de code, suit mieux le mode agent
ollama pull devstral:24b
Provider-Einstellungen in Cline
Provider : Ollama
Base URL : http://localhost:11434
Modèle   : qwen3.5:9b
→
Instruct-Variante für den Agenten
Für den Chat und den Agenten von Cline verwenden Sie die instruct/chat-Variante des Modells (nicht die -base-Variante, die ausschließlich für Autocompletion vorgesehen ist). Sie folgt besser mehrstufigen Anweisungen.

#2. Tabby (selbst gehostete Autovervollständigung)

Tabby (TabbyML) deckt genau das ab, was Cline nicht bietet: die Inline-Autovervollständigung. Es ist für Teams konzipiert – ein einzelner Server hostet das Modell, und alle Entwickler verbinden sich aus ihrer IDE heraus mit ihm. Der Server bringt seine eigene Laufzeitumgebung mit; dafür ist Ollama nicht erforderlich.

  1. 01
    Tabby-Server starten
    Die Docker-Methode ist die einfachste. Der Server stellt einen HTTP-Endpunkt auf :8080 und eine webbasierte Administrationsoberfläche bereit.
  2. 02
    Ein Admin-Konto erstellen
    Öffnen Sie http://localhost:8080 im Browser. Erstellen Sie beim ersten Anmelden das Eigentümerkonto. Gehen Sie zu Settings → Information, um ein Authentifizierungstoken abzurufen.
  3. 03
    Die VS Code-Erweiterung installieren
    Suchen Sie in der Erweiterungsansicht nach Tabby (Herausgeber: TabbyML). Installieren Sie die Erweiterung.
  4. 04
    Die Erweiterung verbinden
    Öffnen Sie die Einstellungen (Ctrl+,) und suchen Sie nach tabby. Setzen Sie Endpoint = http://localhost:8080 und fügen Sie den Token ein. Die Statusleiste von VS Code zeigt Tabby: ready an; die Vervollständigung erscheint während der Eingabe in Grau.
Tabby starten (NVIDIA-GPU)
docker run -d --name tabby \
  --gpus all -p 8080:8080 \
  -v $HOME/.tabby:/data \
  registry.tabbyml.com/tabbyml/tabby \
  serve --model StarCoder-1B --device cuda
i
Cline + Tabby: das vollständige Duo
Cline übernimmt Chat und Agent, Tabby die Inline-Autovervollständigung. Gemeinsam bilden sie das vollständige Copilot-Erlebnis nach — lokal und kostenlos. Diese Kombination wird sowohl für einen Einzelarbeitsplatz als auch für ein Team empfohlen. Twinny ist eine Alternative zu Tabby, wenn Sie auch für die Vervollständigung lieber bei Ollama bleiben möchten.

#3. CodeGeeX

CodeGeeX (Tsinghua KEG / Zhipu AI) ist die „All-in-one“-Lösung: Die Erweiterung bietet bereits Codevervollständigung und Chat mit einem kostenlosen proprietären Modell, das bei den Anbietern gehostet wird. Sie lässt sich aber auch mit einem lokalen Modell verbinden, und genau das interessiert uns hier.

  1. 01
    Die Erweiterung installieren
    Suchen Sie in VS Code nach CodeGeeX (Herausgeber: aminer). Installieren Sie die Erweiterung. In der Seitenleiste erscheint ein CodeGeeX-Symbol.
  2. 02
    In den lokalen Modus wechseln
    Öffnen Sie die Einstellungen von CodeGeeX (Zahnradsymbol in der Seitenleiste). Suchen Sie den Abschnitt Local mode und aktivieren Sie ihn.
  3. 03
    Ollama als Ziel festlegen
    Geben Sie die URL des lokalen Modells ein. CodeGeeX spricht einen OpenAI-kompatiblen Endpoint an – der Endpoint von Ollama auf http://localhost:11434/v1 passt.
  4. 04
    Das Modell auswählen
    codegeex4 (9B) ist das eigene Modell, das in Ollama verfügbar ist. Andernfalls reicht jedes aktuelle Code-Modell aus (qwen3-coder, devstral).
CodeGeeX-Modell in Ollama
ollama pull codegeex4
!
Cloud-Modus standardmäßig aktiv
Standardmäßig verwendet CodeGeeX die Server von Zhipu in China. Solange Sie nicht explizit im Einstellungsdialog auf den lokalen Modus umgeschaltet haben, wird Ihr Code an diese Server gesendet. Prüfen Sie das Symbol in der Statusleiste von VS Code: Es muss « Local » angezeigt werden, nicht « Cloud ».

#Vergleichstabelle

Die 3 kostenlosen lokalen Alternativen zu Copilot in VS Code
ToolWas es tutLokales BackendLizenzIdeal für
ClineChat mit Multi-Datei-AgentOllama (1 pro Arbeitsplatzrechner)MIT, open-sourceEinzelnutzer, Power-User
TabbyInline-VervollständigungIntegrierte Laufzeitumgebung (Server)Self-hostedTeam, Ergänzung zu Cline
CodeGeeXVervollständigung + ChatOpenAI-kompatibler EndpunktKostenlos (Cloud als Standard)Schlankes All-in-one-Setup
Abdeckung der Anwendungsfälle
Cline: Chat + Agent (keine Codevervollständigung). Tabby: Codevervollständigung (kein fortgeschrittener Chat). CodeGeeX: Codevervollständigung + einfacher Chat. Die Kombination aus Cline und Tabby deckt alles ab.
Setupaufwand
CodeGeeX (5 min) < Cline + Ollama (10 min) < Tabby self-hosted (15-20 min).
Multi-utilisateurs
Nur Tabby ist von Haus aus dafür ausgelegt. Cline/CodeGeeX = ein Arbeitsplatzrechner = eine Ollama-Instanz.
Datenschutz
Cline und Tabby bleiben standardmäßig lokal. CodeGeeX nutzt die Cloud, solange der lokale Modus nicht aktiviert wurde – darauf sollten Sie achten.
→
Praktische Empfehlung
Um allein zu starten: Cline + Qwen 3.5 9B auf Ollama für Chat und Agent, plus Tabby für die Vervollständigung. Für ein Team von 3+ Entwicklern, die einen GPU teilen: Tabby für die gemeinsame Vervollständigung, Cline auf dem Arbeitsplatz. CodeGeeX bleibt eine leichte, einheitliche Alternative.

#Fehlerbehebung

Cline antwortet nicht
Prüfen Sie die Ausgabe von ollama ps: Das Modell muss dort erscheinen, wenn Sie eine Anfrage starten. Wenn Ollama nicht antwortet, testen Sie curl http://localhost:11434/api/tags im Terminal. Prüfen Sie außerdem, ob in Cline tatsächlich Ollama als Anbieter ausgewählt ist.
Keine grauen Vervollständigungen
Cline bietet keine Inline-Autovervollständigung: Das ist normal. Installieren Sie Tabby (oder Twinny) für die zeilenweise Autovervollständigung und überprüfen Sie editor.inlineSuggest.enabled in VS Code.
Tabby zeigt "Connection refused"
Der Container läuft nicht oder der Port ist nicht freigegeben. docker ps muss tabby auflisten. docker logs tabby zeigt die Ursache (häufig: Das Modell ist beim ersten Start noch nicht heruntergeladen; warten Sie 5–10 Minuten).
CodeGeeX gibt Antworten auf Chinesisch
Geben Sie die Sprache im System-Prompt an (Settings CodeGeeX → Custom system prompt → „Immer auf Französisch antworten“), oder verwenden Sie Qwen 3.5 9B, das auf Französisch antwortet, wenn Sie es auf Französisch ansprechen.
VRAM voll belegt, wenn alles läuft
Möglicherweise haben Sie zwei Modelle geladen (Tabby-Autovervollständigung + Cline-Chat). Bei 8 GB verwenden Sie ein leichtes FIM-Modell für die Vervollständigung und ein Qwen 3.5 9B für den Chat. ollama ps zeigt den Speicherverbrauch an.

#FAQ

Was ist die beste kostenlose, lokal ausführbare Alternative zu Copilot?+
Es gibt keine allgemeingültige Antwort, da die Tools unterschiedliche Anforderungen abdecken. Für Chat und einen Agenten, der mit mehreren Dateien arbeitet, bietet Cline den größten Funktionsumfang. Für die Inline-Autovervollständigung eignet sich Tabby (oder Twinny). In der Praxis bildet das Duo Cline + Tabby das vollständige Copilot-Erlebnis nach, kostenlos und lokal. CodeGeeX ist die All-in-one-Option, die sich am schnellsten installieren lässt.
Warum spricht dieser Leitfaden nicht mehr von Continue.dev?+
Continue.dev wurde von Cursor übernommen (Acqui-Hire am 18. Juni 2026 angekündigt). Version 2.0.0 ist die letzte veröffentlichte stabile Version, und die Zukunft der eigenständigen Erweiterung ist ungewiss. Der Code steht weiterhin unter Apache 2.0, sodass auf eine bestimmte Version festgelegte Builds weiterhin funktionieren; für eine aktiv gepflegte Grundlage ist jedoch ein Wechsel zu Cline ratsam. Die Frist für den Export der gehosteten Daten war der 15. Juli 2026 (inzwischen verstrichen).
Bietet Cline wie Copilot Autovervollständigung?+
Nein. Cline konzentriert sich auf den Chat und den Agentenmodus (Lesen und Ändern mehrerer Dateien). Es bietet keine zeilenweise, grau dargestellte Codevervollständigung. Fügen Sie für diese Funktion Tabby oder Twinny zusätzlich hinzu – die beiden Erweiterungen lassen sich in VS Code ohne Konflikte nebeneinander verwenden.
Welches lokale Modell sollten Sie zum Programmieren wählen?+
Für die Inline-Autovervollständigung (FIM) bleibt Qwen2.5-Coder dank seiner geringen Latenz eine bewährte Wahl. Für Chat und Agenten: Qwen 3.5 9B bei 8 GB Speicher, Devstral 24B oder gpt-oss 20B bei 16 GB, Qwen 3.6 35B-A3B, wenn Sie genügend Speicherreserven haben. Devstral, ein Spezialist für Code-Agenten, ist eine hervorragende Alternative. Einfache Regel: ein leichtgewichtiges Modell für die Vervollständigung, ein größeres Modell für das Schlussfolgern.
Braucht man dafür eine leistungsstarke GPU?+
Nein. 8 GB VRAM reichen aus, um Qwen 3.5 9B in Q4 (Chat) und ein kleines FIM-Modell für die Codevervollständigung zu betreiben. Bleiben Sie bei weniger VRAM bei leichten FIM-Modellen, die weiterhin schnell reagieren. Ein Mac M2/M3 mit 16 GB gemeinsamem Arbeitsspeicher erledigt die Aufgabe ebenfalls sehr gut.

#Weiterführende Informationen

Ihr lokaler Copilot läuft. Je nach Ihrem Profil gibt es drei sinnvolle nächste Schritte:

Mehr über Cline erfahren
Der eigene Leitfaden zu lokalem Copilot mit Cline behandelt die Konfiguration ausführlicher: Ollama als Anbieter, Agentenmodus, Autovervollständigung über Tabby/Twinny und die Feineinstellungen für agentische Arbeitsabläufe.
Sie haben zuvor Continue.dev verwendet
Die Migrationshilfe Continue → Cline erklärt den Übergang (äquivalente Einstellungen, Modelle, lokale Daten).
Ihr Hardware-Setup wählen
Bevor Sie auf ein Modell mit 14B oder 32B umsteigen, hilft Ihnen die Anleitung „Eine GPU für lokale KI auswählen“, den Kauf einer GPU mit zu knapp bemessenem VRAM zu vermeiden.

Wenn Sie Zeit bei der Einrichtung sparen möchten, bietet der kostenpflichtige Leitfaden „Lokaler Code-Copilot“ ein vollständiges Paket sofort einsatzbereiter Konfigurationen für Ollama + Cline + Aider zum Einfügen – sowohl für einen Einzelarbeitsplatz als auch für ein Team.

Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.