Mittelstufe 20 Min.Dev

Lokaler Copilot mit Cline: KI-Agent in VS Code (Ollama)

GitHub Copilot sendet Ihren Code an Microsoft. Für einen freiberuflichen Entwickler, der Geheimhaltungsvereinbarungen (NDAs) unterzeichnet, oder ein Team in einem regulierten Sektor ist das ein Ausschlusskriterium. Cline ist die Erweiterung für VS Code und JetBrains, die Copilot durch ein lokales Modell (über Ollama) ersetzt, mit einem Chat und einem Agentenmodus, der mehrere Dateien lesen und bearbeiten kann. Diese Anleitung zeigt, wie Sie Cline installieren, ein aktuelles Modell für Code (Qwen 3.5, Devstral) konfigurieren und die wesentlichen Aspekte der Copilot-Bedienung wiederbekommen — während Ihr Code zu Hause bleibt.

Von Mohamed Meguedmi·Aktualisierung 2026-08-27·Unter Windows, macOS und Linux getestet
i
Continue wird nicht mehr gepflegt (Juni 2026)
Continue wurde am 18. Juni 2026 von Cursor (Anysphere) übernommen: Das Repository ist archiviert (v2.0.0 ist die letzte Version) und die Erweiterung wird nicht mehr gepflegt — sie lässt sich weiterhin über Community-Forks installieren, und diese Anleitung funktioniert weiterhin unverändert. Für eine neue Einrichtung empfehlen wir eher Cline (Open Source, MIT, mit Ollama kompatibel): Lesen Sie unsere Anleitung „Von Continue zu Cline migrieren“.

#Warum ein lokaler Copilot?

Datenschutz
Kein Codeausschnitt verlässt Ihren Rechner. NDA, Betriebsgeheimnisse, Kundencode: Alles bleibt lokal.
Offline
Im Flugzeug, tief in einem Labor ohne Internet, im Urlaub. Das Modell liegt auf Ihrem Datenträger.
Kosten
Nach dem Kauf einer GPU kostenlos. Die Kosten für zwei Jahre Copilot-Nutzung entsprechen für einen Entwickler dem Preis einer Mittelklasse-Grafikkarte.
Modellwahl
Sie können Qwen 3.5 je nach Programmiersprache und verfügbarem VRAM durch Devstral, Qwen3-Coder oder GLM 4.7 Flash ersetzen.

#Warum dieser Leitfaden auf Cline umgestellt wurde

Dieser Leitfaden basierte ursprünglich auf Continue.dev. Continue wurde im Juni 2026 von Cursor übernommen, sein Repository ist inzwischen archiviert und das eigenständige Produkt wird nicht mehr gepflegt. Deshalb haben wir den Leitfaden für Cline aktualisiert, einen gleichwertigen, aktiv weiterentwickelten Open-Source-Assistenten, der über Ollama ebenfalls zu 100 % lokal läuft.

Das Kit „Copilote Local“

Dieser Guide führt Sie zum Modell. Das Kit führt Sie zum Copiloten, der in Ihrem Editor Code schreibt.

  • Lebenslanger Online-Zugang
  • PDF + Dateien
  • Lebenslange Updates
i
Haben Sie bisher Continue genutzt?
Der Wechsel ist problemlos: Ihr Ollama-Backend bleibt unverändert, Sie ersetzen lediglich die Erweiterung. Ihre auf eine bestimmte Version festgelegten Continue-Forks dürfen Sie weiterhin legal ausführen (Code unter Apache 2.0). Beachten Sie jedoch, dass das Zeitfenster für den Export gehosteter Daten am 15. Juli 2026 geschlossen wurde. Ein eigener Leitfaden erläutert bei Bedarf die Migration Schritt für Schritt.

#Zu verwendende Modelle

⭐ Qwen 3.5 9B
DIE Wahl für 8 GB im Jahr 2026. Mehrsprachig (einschließlich Französisch), 256k Kontext, Bildverarbeitung, Apache 2.0. Gut im Chat und als Agent für Python, TypeScript und Rust. ~6,6 GB in Q4.
Devstral 24B (Mistral AI)
Spezialist für agentengestütztes Programmieren, Apache 2.0. DIE Wahl bei 16 GB für Änderungen an mehreren Dateien mit Cline. ~14 GB in Q4.
Qwen3-Coder 30B-A3B
MoE-Modell für Code (3B aktive Parameter, daher schnell), 256k Kontext. Für 24 GB: Chat + leistungsstarker Agent, der mit Copilot mithalten kann. ~19 GB in Q4.
Qwen 3.8 27B
Das „Copilot-ähnliche“ Modell von 2026 (veröffentlicht am 14.08.2026), 262k Kontext, Bildverarbeitung, Apache 2.0. Für 24 GB – die Reasoning-Stufe auf „low“ setzen, damit das Modell nicht übermäßig lange nachdenkt.
Empfohlenes Modell je nach verfügbarem VRAM
VRAMCline-Modell (Chat + Agent)Quantisierung
6 GBgranite4.2:8bQ4_K_M (~5,3 GB)
8 GBqwen3.5:9bQ4_K_M (~6,6 GB)
16 GBdevstral:24b / gpt-oss:20bQ4 / MXFP4 (~14 GB)
24 GB+qwen3-coder:30b / qwen3.8:27bQ4 (~18-19 GB)
→
Cline bevorzugt ein Modell, das Anweisungen befolgt
Im Gegensatz zur reinen Autovervollständigung sendet der Agentenmodus Anweisungen mit mehreren Schritten. Bevorzugen Sie die instruct/chat-Variante des Modells (nicht die -base-Variante) und wechseln Sie für mehr Zuverlässigkeit zu einem größeren Modell (Devstral 24B, Qwen3-Coder 30B), sofern Ihr VRAM dies erlaubt.

#1. Cline installieren

  1. 01
    Ollama installieren
    Falls noch nicht geschehen, lesen Sie die Anleitung „Ollama unter Windows/macOS/Linux installieren“. Ollama ist die Laufzeit, die das Modell im Hintergrund ausführt.
  2. 02
    Modell herunterladen
    Laden Sie mit dem folgenden Befehl ein zu Ihrem VRAM passendes Coding-Modell herunter.
  3. 03
    Die Cline-Erweiterung installieren
    In VS Code: Erweiterungen (Ctrl+Shift+X) → Cline suchen → Install. Bei JetBrains nutzen Sie den Plugin-Marktplatz.
  4. 04
    Panel öffnen
    Ein Cline-Icon erscheint in der linken Seitenleiste. Klicken Sie darauf, um das Chat- und Agentenpanel zu öffnen.
Modell zum Herunterladen
# Modèle principal (chat + agent)
ollama pull qwen3.5:9b

# Plus de VRAM ? Devstral, le spécialiste du mode agent (16 Go)
ollama pull devstral:24b

#2. Den Ollama-Provider konfigurieren

Cline muss wissen, wo das Modell zu finden ist. Öffnen Sie seine Einstellungen (Zahnradsymbol im Panel), wählen Sie den Anbieter Ollama, geben Sie die lokale Adresse des Daemons ein und wählen Sie das Modell aus der Liste der erkannten Modelle aus.

Anbieter-Einstellungen
Provider     : Ollama
Base URL     : http://localhost:11434
Modèle       : qwen3.5:9b
!
Achten Sie darauf, beim lokalen Provider zu bleiben
Cline kann auch mit Cloud-APIs kommunizieren. Für eine 100 % lokale Nutzung stellen Sie sicher, dass der aktive Provider Ollama und kein entfernter Anbieter ist – das ist die einzige Einstellung, die eine private Nutzung von der Übermittlung von Code an einen fremden Server trennt.

#3. Chat-Modus

Der Chat-Modus ist das direkte lokale Gegenstück zu einem Copilot-Chat-Panel. Stellen Sie eine Frage, fügen Sie Code ein oder bitten Sie um eine Erklärung oder eine Fehlerbehebung.

Chat öffnen
Klicken Sie auf das Cline-Symbol in der Seitenleiste. Die Unterhaltung wird im Panel angezeigt.
Code beifügen
Wählen Sie einen Block im Editor aus und senden Sie ihn anschließend in den Chatkontext, damit das Modell darüber nachdenken kann.
Dateien erwähnen
Cline kann Dateien aus Ihrem Projekt referenzieren, um mit dem richtigen Kontext zu antworten, ohne dass Sie alles kopieren und einfügen müssten.
Historie lokal speichern
Ihre Gespräche bleiben auf Ihrem Gerät. Nichts wird in eine Cloud synchronisiert.

#4. Agent-Modus

Hier geht Cline über einen einfachen Chat hinaus. Im Agentenmodus kann Cline die Verzeichnisstruktur lesen, Dateien öffnen, Änderungen an mehreren Dateien vorschlagen und Befehle ausführen — jede Aktion erfordert Ihre Zustimmung.

Erst planen, dann ausführen
Beschreiben Sie eine Aufgabe auf Französisch („ajoute un endpoint /health et son test“). Cline schlägt einen Plan vor und setzt die Änderungen anschließend Schritt für Schritt um.
Validierter Diff
Jede Änderung wird als Diff dargestellt, den Sie akzeptieren oder ablehnen können. Sie behalten jederzeit die Kontrolle.
Kontrollierte Befehlsausführung
Der Agent kann vorschlagen, einen Befehl auszuführen (Tests, Build). Ohne Ihre ausdrückliche Zustimmung wird nichts ausgeführt.
Beispiele für Anweisungen an den Agenten
- Ajoute du logging pour tracer les entrées/sorties
- Convertis cette fonction en async/await
- Extrais ce bloc dans un fichier util.ts et mets à jour les imports
- Écris des tests unitaires pour les cas limites
→
Geben Sie dem Agenten Kontext
Je präziser die Anweisung ist (betroffene Datei, erwartetes Verhalten, Stilvorgabe), desto besser ist das Ergebnis. Ein 24B-Modell (Devstral) befolgt mehrstufige Anweisungen zuverlässiger als ein 9B-Modell.

#5. Autovervollständigung: Tabby oder Twinny

Wichtiger Punkt: Cline ist ein Chat-Assistent und Agent; es bietet beim Tippen keine Inline-Autovervollständigung als „ausgegrauten Text“. Um diesen Komfort wie bei Copilot wiederzubekommen, installieren Sie eine dafür vorgesehene Erweiterung, die ebenfalls mit Ollama verbunden ist.

Tabby
Selbst gehostete Erweiterung zur Autovervollständigung, ideal, wenn mehrere Entwickler dieselbe GPU gemeinsam nutzen. Die zeilenweise Vervollständigung wird grau angezeigt; mit Tab übernehmen.
Twinny
Schlanke VS-Code-Erweiterung mit Autovervollständigung und Chat, die sich direkt mit Ollama verbindet. Eine gute Ergänzung zu Cline für die Einzelarbeit, wenn viel Code zu tippen ist.
Das Duo, das funktioniert
Cline für Chat und Agent, Tabby oder Twinny für die Inline-Vervollständigung. Beide greifen auf dieselbe Ollama-Instanz zu, und Ihr Code bleibt bei beiden lokal.
→
Dediziertes Modell für die Autovervollständigung
Für die Autovervollständigung (Fill-In-the-Middle) bleibt qwen2.5-coder:7b-base auch 2026 die Referenz (~4,7 GB) und reagiert weiterhin sehr schnell — einer der wenigen Fälle, in denen ein Modell von 2024 noch immer an der Spitze steht. Verwenden Sie Ihr Chat-/Agentenmodell (Qwen 3.5 9B, Devstral 24B) weiterhin für Cline.

#Leistung und erweiterte Einstellungen

Hohes num_ctx
In Ollama setzen Sie num_ctx auf 16384, damit der Agent viel Kontext (Dateien, Diffs) übermitteln kann. Per Modelfile.
Flash Attention
Auf RTX 30/40/50 aktivieren Sie FA in Ollama (Variable OLLAMA_FLASH_ATTENTION=1). Ca. +20 % Geschwindigkeit.
Quantisierter KV-Cache
OLLAMA_KV_CACHE_TYPE=q8_0 halbiert den VRAM-Bedarf für den Kontext. Entscheidend, wenn der Agent große Dateien verarbeitet.
Ein Modell pro Rolle
Ein dediziertes FIM-Modell (qwen2.5-coder:7b-base, ~4,7 GB) für die Autovervollständigung (Tabby/Twinny), ein 24B/30B-Modell (Devstral, Qwen3-Coder) für den Chat und den Agenten von Cline. Ollama lädt das jeweils angeforderte Modell.
Das Kontextfenster vergrößern
# Modelfile : devstral-16k
FROM devstral:24b
PARAMETER num_ctx 16384
Das Modell mit erweitertem Kontext erstellen
ollama create devstral-16k -f Modelfile
# puis sélectionnez devstral-16k comme modèle dans Cline

#Häufig gestellte Fragen

FAQ
Ersetzt Cline wirklich GitHub Copilot?+
Für den Chat und den Agentenmodus (mehrere Dateien lesen oder ändern, Befehle ausführen): ja. Für die Inline-Autovervollständigung mit „grauem Text“ während des Tippens: nein, diese bietet Cline nicht. Ergänzen Sie Tabby oder Twinny und verbinden Sie sie mit derselben Ollama-Instanz, um diesen Komfort wieder zu erhalten.
Warum nicht bei Continue.dev bleiben?+
Continue wurde im Juni 2026 von Cursor übernommen; die Entwicklung wird bei Cursor fortgesetzt (v2.0.0 = letzte stabile Version), aber die Zukunft des eigenständigen Produkts ist ungewiss. Die Erweiterung lässt sich weiterhin installieren, und der Code unter Apache 2.0 darf weiterhin legal ausgeführt werden, allerdings ohne Updates oder Fehlerbehebungen. Cline ist Open Source unter der MIT-Lizenz, wird aktiv weiterentwickelt und ist die empfohlene Wahl für die Konsolidierung.
Welches Modell wählen, wenn ich nur 8 GB VRAM habe?+
Qwen 3.5 9B in Q4_K_M (~6,6 GB) passt bequem in 8 GB und bleibt 2026 die beste Wahl in dieser Größenklasse (256k Kontext, mehrsprachig, mit Bildverarbeitung). Wenn der VRAM wirklich knapp ist, ist Granite 4.2 8B (~5,3 GB) noch sparsamer. Beide reichen für den Chat aus; für einen zuverlässigeren Agentenmodus mit mehreren Schritten wechseln Sie zu Devstral 24B, sobald Ihr VRAM (16 GB) dies zulässt.
Wird mein Code mit Cline ins Internet übertragen?+
Nein, solange der aktive Anbieter Ollama ist (http://localhost:11434). Cline kann auch Cloud-APIs nutzen: Überprüfen Sie in den Einstellungen, ob tatsächlich der lokale Ollama-Anbieter ausgewählt ist. Dies ist die einzige Einstellung, die eine zu 100 % private Nutzung von einer Übertragung an einen Server eines Drittanbieters unterscheidet.
Funktioniert Cline auch in JetBrains-IDEs, nicht nur in VS Code?+
Ja. Cline ist für VS Code und für JetBrains-IDEs (über den Plugin-Marktplatz) verfügbar. Die Konfiguration des Providers Ollama sowie die Auswahl des Modells sind auf beiden Seiten identisch.

#Fazit

In etwa zwanzig Minuten haben Sie einen 100 % lokalen Code-Copilot: Cline für den Chat und den Agentenmodus, ein aktuelles Code-Modell (Qwen 3.5 9B, oder Devstral 24B für den Agenten) über Ollama als Engine, sowie Tabby oder Twinny (mit qwen2.5-coder:7b-base) für die Inline-Autovervollständigung. Ihr Code verlässt nie Ihr Gerät, Sie arbeiten offline und behalten die Freiheit, das Modell je nach Programmiersprache zu wechseln. Wenn Sie die Stunden für die Einstellungen sparen und von einer bewährten Basis ausgehen möchten, bietet der kostenpflichtige Leitfaden „Copilote de code local“ ein komplettes, sofort einsatzbereites Konfigurationspaket für Ollama + Cline + Aider.

Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.