Cline + Ollama : 100 % lokaler Code-Agent in VS Code
Cline verwandelt VS Code in einen autonomen Programmieragenten: Er liest Ihre Dateien, schlägt Diffs vor, führt Befehle aus und arbeitet iterativ weiter, bis die Aufgabe abgeschlossen ist. Mit Ollama bleibt diese gesamte Arbeit auf Ihrem Rechner — kein Token wird an einen Server eines Drittanbieters gesendet. Dieser Leitfaden richtet ein vollständiges, funktionsfähiges Setup mit Cline + Ollama ein: welches Modell Sie je nach verfügbarem VRAM wählen sollten, welche Ollama-Konfiguration böse Überraschungen beim Kontext vermeidet und welche Einstellungen den Unterschied zwischen einem brauchbaren Agenten und einem Agenten ausmachen, der sich im Kreis dreht.
#Warum ein lokaler Cline-Agent?
Cline (ehemals Claude Dev) ist eine VS-Code-Erweiterung, die ein LLM in einer Agentenschleife steuert: Es plant, bearbeitet mehrere Dateien, führt Befehle im Terminal aus, liest die Ausgabe und nimmt Korrekturen vor. Anders als eine einfache Inline-Vervollständigung übernimmt es als ausführender Agent ganze Aufgaben – eine Funktion schreiben, ein Modul migrieren oder einen Stacktrace debuggen.
Die Kombination mit Ollama statt mit einer Cloud-API hat drei konkrete Vorteile: Ihr proprietärer Code verlässt den Rechner nie, es fallen keine Kosten pro Token an (Cline verbraucht enorm viel Kontext, was in der Cloud schnell teuer wird), und der Agent funktioniert offline. Der Preis dafür: Ein gutes lokales Modell für Code benötigt VRAM, und die Standardeinstellungen von Ollama eignen sich nicht für den Einsatz mit einem Agenten.
#Voraussetzungen
Dieser Guide führt Sie zum Modell. Das Kit führt Sie zum Copiloten, der in Ihrem Editor Code schreibt.
- Lebenslanger Online-Zugang
- PDF + Dateien
- Erstattung binnen 30 Tagen
- VS Code
- Aktuelle Version (1.90+). Cline funktioniert auch in Open VSX-kompatiblen Forks (VSCodium, Cursor), aber dieser Leitfaden richtet sich an die Standardversion von VS Code.
- Ollama installiert
- Der Daemon muss laufen und unter http://localhost:11434 auf Anfragen lauschen. Falls dies noch nicht der Fall ist, siehe unsere Installationsanleitung für Ollama.
- Eine GPU mit ausreichend VRAM
- Mindestens 16 GB für einen komfortabel nutzbaren Agenten, 24 GB für die leistungsfähigsten Modelle. Ein reiner CPU-Betrieb ist weiterhin möglich, aber für die Agentenschleife zu langsam.
- Ein in VS Code geöffnetes Projekt
- Cline arbeitet im aktuellen Workspace-Verzeichnis: Öffnen Sie ein echtes Repository, keine einzelne Datei.
#Modell nach VRAM wählen
Die Wahl des Modells hat Vorrang vor allem anderen: Ein Cline-Agent führt nacheinander Tool-Aufrufe, das Lesen von Dateien und Diffs aus. Daher braucht er ein Modell, das Anweisungen befolgt und das Tool-Format einhält. Drei Profile decken 2026 die meisten Grafikkarten ab.
- 24 GB (RTX 4090, 3090, RX 7900 XTX) — Qwen3-Coder 32B
- Der derzeit beste lokale Agent. In Q4_K_M belegt er etwa 19 GB und lässt damit Spielraum für einen Kontext von 32k. Dieses Modell sollten Sie anstreben, wenn Ihre Grafikkarte damit zurechtkommt.
- 16 GB (RTX 4080, 5070 Ti, 4060 Ti 16GB) — Devstral Small 2
- Ein auf Code-Agenten spezialisiertes Mistral-Modell, das in Q4_K_M mit einem brauchbaren Kontextfenster in 16 GB passt. Der beste Kompromiss für diese Grafikkartenklasse.
- Solider Generalist — Qwen 3.6 27B
- Wenn Sie ein einziges Modell für Code und alles andere möchten, passt die 27B-Variante in Q4 in 24 GB und schlägt sich als Agent sehr gut. Bei reinen Programmieraufgaben liegt sie eine Stufe unter Qwen3-Coder, ist aber vielseitiger.
Vermeiden Sie Modelle unter 14B für den Einsatz als Agent: Sie halten das Format der Tool-Aufrufe nicht ein, geraten in Schleifen oder schlagen Diffs vor, die sich nicht anwenden lassen. Ein kleines, schnelles Modell eignet sich hervorragend für die Inline-Vervollständigung (über Tabby oder Continue), aber nicht zum Steuern von Cline.
#1. Ollama vorbereiten
Prüfen Sie zunächst, ob Ollama läuft, und laden Sie dann das gewählte Modell herunter. Hier verwenden wir Qwen3-Coder 32B als Beispiel – ersetzen Sie den Tag durch einen, der zum verfügbaren VRAM passt.
#2. Den Kontext in Ollama einstellen
Das ist der Schritt, den alle übersehen. Standardmäßig stellt Ollama Modelle mit einem Kontextfenster von 4096 Tokens bereit. Allerdings sendet Cline den Inhalt mehrerer Dateien, den Aufgabenverlauf und die Werkzeugdefinitionen: Bei 4k vergisst der Agent in jeder Runde den Anfang seiner eigenen Aufgabe und wird unbrauchbar.
num_ctx muss erhöht werden. Die saubere Lösung besteht darin, über ein Modelfile ein abgeleitetes Modell zu erstellen, damit die Einstellung dauerhaft und unabhängig von Cline ist.
#3. Cline installieren
- 01Marktplatz öffnenÖffnen Sie in VS Code den Bereich „Erweiterungen“ (Strg+Umschalt+X).
- 02Nach Cline suchenGeben Sie „Cline“ in die Suchleiste ein. Die offizielle Erweiterung wird von „Cline Bot Inc.“ veröffentlicht – prüfen Sie den Herausgeber, um Klone zu vermeiden.
- 03Installieren und anheftenKlicken Sie auf Installieren. Ein Cline-Symbol erscheint in der Aktivitätsleiste; heften Sie es an, um schnell darauf zugreifen zu können.
#4. Cline mit Ollama verbinden
Cline unterstützt Ollama nativ: Sie müssen keine OpenAI-kompatible API-URL zurechtbasteln. Öffnen Sie das Cline-Panel, klicken Sie auf das Einstellungssymbol und konfigurieren Sie dann den Anbieter.
- 01API Provider → OllamaWählen Sie in der Dropdown-Liste „API Provider“ die Option „Ollama“ aus.
- 02Base URLVerwenden Sie standardmäßig http://localhost:11434 (Standardwert). Ändern Sie dies nur dann, wenn Ollama auf einem anderen Gerät oder in einem Container läuft.
- 03ModelWählen Sie qwen3-coder-agent (das in Schritt 2 erstellte abgeleitete Modell), nicht das unveränderte Modell mit 4k Kontext.
- 04Das Kontextfenster prüfenCline zeigt ein Feld „Context Window“. Stellen Sie es auf den Wert von num_ctx im Modelfile (32768) ein. Eine Abweichung führt dazu, dass Cline die Prompts kürzt, noch bevor sie Ollama erreichen.
#5. Erster Lauf im Agentenmodus
Öffnen Sie ein echtes Projekt und geben Sie Cline dann eine konkrete, klar begrenzte Aufgabe. Gute erste Tests betreffen nur wenige Dateien: einen Test hinzufügen, einen identifizierten Fehler beheben, eine kleine Hilfsfunktion schreiben.
Cline wird den Ordner lesen, einen Diff vorschlagen und Sie bitten, jede Änderung und jeden Befehl zu bestätigen. Genehmigen Sie beim ersten Mal alles Schritt für Schritt, um das Verhalten von Cline zu verstehen. Sobald Sie Vertrauen gefasst haben, können Sie in den Einstellungen die automatische Genehmigung bestimmter Aktionen aktivieren, etwa das Lesen von Dateien und nicht destruktive Befehle.
#Häufige Fallstricke
- Der Agent vergisst seine Aufgabe
- Fast immer ein Problem mit dem Kontext: num_ctx ist in Ollama zu niedrig oder Context Window in Cline falsch eingestellt. Stimmen Sie die beiden Werte wieder aufeinander ab.
- Die Diffs lassen sich nicht anwenden
- Das Modell ist zu klein oder zu stark quantisiert, um das Bearbeitungsformat einzuhalten. Wechseln Sie zu einem größeren Modell (14B → 27B/32B) oder von Q3 zu Q4_K_M.
- Die Inferenz wechselt auf die CPU
- Modell und Kontext überschreiten die VRAM-Kapazität. Prüfen Sie `ollama ps`; verringern Sie num_ctx oder wählen Sie ein kleineres Modell. Ein Agent, der teilweise auf der CPU läuft, wird unbrauchbar.
- Endlosschleifen bei Tool-Aufrufen
- Einige Modelle führen denselben Befehl erneut aus. Wechseln Sie zunächst in den Plan Mode und teilen Sie die Aufgabe in kleinere Teilaufgaben auf.
- Verbindung abgelehnt
- Ollama lauscht nicht oder ist nicht unter der erwarteten URL erreichbar. Testen Sie `curl http://localhost:11434/api/version`. Bei einem Container geben Sie den Port frei und konfigurieren Cline für die richtige Adresse.
#Weiterführende Informationen
Sie verfügen über einen lokal installierten Cline-100%-Agent, der Ihr Code bearbeitet, ohne irgendetwas zu offenlegen. Zwei natürliche Erweiterungen: die Feinabstimmung des Modells und die Ergänzung durch Inline-Vervollständigung, die Cline nicht bereitstellt.
- Bestes lokales LLM zum Coden 2026
- Der Vergleich von Devstral / Qwen3-Coder und Alternativen mit Angaben zu VRAM und Codequalität – um die Wahl des an Cline angebundenen Modells zu verfeinern.
- Continue.dev wurde von Cursor übernommen: Migration zu Cline
- Wenn Sie von Continue.dev wechseln, finden Sie im entsprechenden Leitfaden Informationen zum Export und zur Migration Ihrer Konfiguration in dieses Setup.
- Quantisierung wählen (Q4, Q5, Q8, FP16)
- Die Kompromisse zwischen Qualität und VRAM-Bedarf verstehen, damit das größtmögliche Modell in den Speicher Ihrer Grafikkarte passt.
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.