Lokaler Copilot mit Cline: KI-Agent in VS Code (Ollama)
GitHub Copilot sendet Ihren Code an Microsoft. Für einen freiberuflichen Entwickler, der Geheimhaltungsvereinbarungen (NDAs) unterzeichnet, oder ein Team in einem regulierten Sektor ist das ein Ausschlusskriterium. Cline ist die Erweiterung für VS Code und JetBrains, die Copilot durch ein lokales Modell (über Ollama) ersetzt, mit einem Chat und einem Agentenmodus, der mehrere Dateien lesen und bearbeiten kann. Diese Anleitung zeigt, wie Sie Cline installieren, ein aktuelles Modell für Code (Qwen 3.5, Devstral) konfigurieren und die wesentlichen Aspekte der Copilot-Bedienung wiederbekommen — während Ihr Code zu Hause bleibt.
#Warum ein lokaler Copilot?
- Datenschutz
- Kein Codeausschnitt verlässt Ihren Rechner. NDA, Betriebsgeheimnisse, Kundencode: Alles bleibt lokal.
- Offline
- Im Flugzeug, tief in einem Labor ohne Internet, im Urlaub. Das Modell liegt auf Ihrem Datenträger.
- Kosten
- Nach dem Kauf einer GPU kostenlos. Die Kosten für zwei Jahre Copilot-Nutzung entsprechen für einen Entwickler dem Preis einer Mittelklasse-Grafikkarte.
- Modellwahl
- Sie können Qwen 3.5 je nach Programmiersprache und verfügbarem VRAM durch Devstral, Qwen3-Coder oder GLM 4.7 Flash ersetzen.
#Warum dieser Leitfaden auf Cline umgestellt wurde
Dieser Leitfaden basierte ursprünglich auf Continue.dev. Continue wurde im Juni 2026 von Cursor übernommen, sein Repository ist inzwischen archiviert und das eigenständige Produkt wird nicht mehr gepflegt. Deshalb haben wir den Leitfaden für Cline aktualisiert, einen gleichwertigen, aktiv weiterentwickelten Open-Source-Assistenten, der über Ollama ebenfalls zu 100 % lokal läuft.
Dieser Guide führt Sie zum Modell. Das Kit führt Sie zum Copiloten, der in Ihrem Editor Code schreibt.
- Lebenslanger Online-Zugang
- PDF + Dateien
- Lebenslange Updates
#Zu verwendende Modelle
- ⭐ Qwen 3.5 9B
- DIE Wahl für 8 GB im Jahr 2026. Mehrsprachig (einschließlich Französisch), 256k Kontext, Bildverarbeitung, Apache 2.0. Gut im Chat und als Agent für Python, TypeScript und Rust. ~6,6 GB in Q4.
- Devstral 24B (Mistral AI)
- Spezialist für agentengestütztes Programmieren, Apache 2.0. DIE Wahl bei 16 GB für Änderungen an mehreren Dateien mit Cline. ~14 GB in Q4.
- Qwen3-Coder 30B-A3B
- MoE-Modell für Code (3B aktive Parameter, daher schnell), 256k Kontext. Für 24 GB: Chat + leistungsstarker Agent, der mit Copilot mithalten kann. ~19 GB in Q4.
- Qwen 3.8 27B
- Das „Copilot-ähnliche“ Modell von 2026 (veröffentlicht am 14.08.2026), 262k Kontext, Bildverarbeitung, Apache 2.0. Für 24 GB – die Reasoning-Stufe auf „low“ setzen, damit das Modell nicht übermäßig lange nachdenkt.
| VRAM | Cline-Modell (Chat + Agent) | Quantisierung |
|---|---|---|
| 6 GB | granite4.2:8b | Q4_K_M (~5,3 GB) |
| 8 GB | qwen3.5:9b | Q4_K_M (~6,6 GB) |
| 16 GB | devstral:24b / gpt-oss:20b | Q4 / MXFP4 (~14 GB) |
| 24 GB+ | qwen3-coder:30b / qwen3.8:27b | Q4 (~18-19 GB) |
#1. Cline installieren
- 01Ollama installierenFalls noch nicht geschehen, lesen Sie die Anleitung „Ollama unter Windows/macOS/Linux installieren“. Ollama ist die Laufzeit, die das Modell im Hintergrund ausführt.
- 02Modell herunterladenLaden Sie mit dem folgenden Befehl ein zu Ihrem VRAM passendes Coding-Modell herunter.
- 03Die Cline-Erweiterung installierenIn VS Code: Erweiterungen (Ctrl+Shift+X) → Cline suchen → Install. Bei JetBrains nutzen Sie den Plugin-Marktplatz.
- 04Panel öffnenEin Cline-Icon erscheint in der linken Seitenleiste. Klicken Sie darauf, um das Chat- und Agentenpanel zu öffnen.
#2. Den Ollama-Provider konfigurieren
Cline muss wissen, wo das Modell zu finden ist. Öffnen Sie seine Einstellungen (Zahnradsymbol im Panel), wählen Sie den Anbieter Ollama, geben Sie die lokale Adresse des Daemons ein und wählen Sie das Modell aus der Liste der erkannten Modelle aus.
#3. Chat-Modus
Der Chat-Modus ist das direkte lokale Gegenstück zu einem Copilot-Chat-Panel. Stellen Sie eine Frage, fügen Sie Code ein oder bitten Sie um eine Erklärung oder eine Fehlerbehebung.
- Chat öffnen
- Klicken Sie auf das Cline-Symbol in der Seitenleiste. Die Unterhaltung wird im Panel angezeigt.
- Code beifügen
- Wählen Sie einen Block im Editor aus und senden Sie ihn anschließend in den Chatkontext, damit das Modell darüber nachdenken kann.
- Dateien erwähnen
- Cline kann Dateien aus Ihrem Projekt referenzieren, um mit dem richtigen Kontext zu antworten, ohne dass Sie alles kopieren und einfügen müssten.
- Historie lokal speichern
- Ihre Gespräche bleiben auf Ihrem Gerät. Nichts wird in eine Cloud synchronisiert.
#4. Agent-Modus
Hier geht Cline über einen einfachen Chat hinaus. Im Agentenmodus kann Cline die Verzeichnisstruktur lesen, Dateien öffnen, Änderungen an mehreren Dateien vorschlagen und Befehle ausführen — jede Aktion erfordert Ihre Zustimmung.
- Erst planen, dann ausführen
- Beschreiben Sie eine Aufgabe auf Französisch („ajoute un endpoint /health et son test“). Cline schlägt einen Plan vor und setzt die Änderungen anschließend Schritt für Schritt um.
- Validierter Diff
- Jede Änderung wird als Diff dargestellt, den Sie akzeptieren oder ablehnen können. Sie behalten jederzeit die Kontrolle.
- Kontrollierte Befehlsausführung
- Der Agent kann vorschlagen, einen Befehl auszuführen (Tests, Build). Ohne Ihre ausdrückliche Zustimmung wird nichts ausgeführt.
#5. Autovervollständigung: Tabby oder Twinny
Wichtiger Punkt: Cline ist ein Chat-Assistent und Agent; es bietet beim Tippen keine Inline-Autovervollständigung als „ausgegrauten Text“. Um diesen Komfort wie bei Copilot wiederzubekommen, installieren Sie eine dafür vorgesehene Erweiterung, die ebenfalls mit Ollama verbunden ist.
- Tabby
- Selbst gehostete Erweiterung zur Autovervollständigung, ideal, wenn mehrere Entwickler dieselbe GPU gemeinsam nutzen. Die zeilenweise Vervollständigung wird grau angezeigt; mit Tab übernehmen.
- Twinny
- Schlanke VS-Code-Erweiterung mit Autovervollständigung und Chat, die sich direkt mit Ollama verbindet. Eine gute Ergänzung zu Cline für die Einzelarbeit, wenn viel Code zu tippen ist.
- Das Duo, das funktioniert
- Cline für Chat und Agent, Tabby oder Twinny für die Inline-Vervollständigung. Beide greifen auf dieselbe Ollama-Instanz zu, und Ihr Code bleibt bei beiden lokal.
#Leistung und erweiterte Einstellungen
- Hohes num_ctx
- In Ollama setzen Sie num_ctx auf 16384, damit der Agent viel Kontext (Dateien, Diffs) übermitteln kann. Per Modelfile.
- Flash Attention
- Auf RTX 30/40/50 aktivieren Sie FA in Ollama (Variable OLLAMA_FLASH_ATTENTION=1). Ca. +20 % Geschwindigkeit.
- Quantisierter KV-Cache
- OLLAMA_KV_CACHE_TYPE=q8_0 halbiert den VRAM-Bedarf für den Kontext. Entscheidend, wenn der Agent große Dateien verarbeitet.
- Ein Modell pro Rolle
- Ein dediziertes FIM-Modell (qwen2.5-coder:7b-base, ~4,7 GB) für die Autovervollständigung (Tabby/Twinny), ein 24B/30B-Modell (Devstral, Qwen3-Coder) für den Chat und den Agenten von Cline. Ollama lädt das jeweils angeforderte Modell.
#Häufig gestellte Fragen
Ersetzt Cline wirklich GitHub Copilot?+
Warum nicht bei Continue.dev bleiben?+
Welches Modell wählen, wenn ich nur 8 GB VRAM habe?+
Wird mein Code mit Cline ins Internet übertragen?+
Funktioniert Cline auch in JetBrains-IDEs, nicht nur in VS Code?+
#Fazit
In etwa zwanzig Minuten haben Sie einen 100 % lokalen Code-Copilot: Cline für den Chat und den Agentenmodus, ein aktuelles Code-Modell (Qwen 3.5 9B, oder Devstral 24B für den Agenten) über Ollama als Engine, sowie Tabby oder Twinny (mit qwen2.5-coder:7b-base) für die Inline-Autovervollständigung. Ihr Code verlässt nie Ihr Gerät, Sie arbeiten offline und behalten die Freiheit, das Modell je nach Programmiersprache zu wechseln. Wenn Sie die Stunden für die Einstellungen sparen und von einer bewährten Basis ausgehen möchten, bietet der kostenpflichtige Leitfaden „Copilote de code local“ ein komplettes, sofort einsatzbereites Konfigurationspaket für Ollama + Cline + Aider.
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.