Mittelstufe 14 Min.Agenten

Cline + Ollama : 100 % lokaler Code-Agent in VS Code

Cline verwandelt VS Code in einen autonomen Programmieragenten: Er liest Ihre Dateien, schlägt Diffs vor, führt Befehle aus und arbeitet iterativ weiter, bis die Aufgabe abgeschlossen ist. Mit Ollama bleibt diese gesamte Arbeit auf Ihrem Rechner — kein Token wird an einen Server eines Drittanbieters gesendet. Dieser Leitfaden richtet ein vollständiges, funktionsfähiges Setup mit Cline + Ollama ein: welches Modell Sie je nach verfügbarem VRAM wählen sollten, welche Ollama-Konfiguration böse Überraschungen beim Kontext vermeidet und welche Einstellungen den Unterschied zwischen einem brauchbaren Agenten und einem Agenten ausmachen, der sich im Kreis dreht.

Von Mohamed Meguedmi·Aktualisierung 2026-08-27·Unter Windows, macOS und Linux getestet

#Warum ein lokaler Cline-Agent?

Cline (ehemals Claude Dev) ist eine VS-Code-Erweiterung, die ein LLM in einer Agentenschleife steuert: Es plant, bearbeitet mehrere Dateien, führt Befehle im Terminal aus, liest die Ausgabe und nimmt Korrekturen vor. Anders als eine einfache Inline-Vervollständigung übernimmt es als ausführender Agent ganze Aufgaben – eine Funktion schreiben, ein Modul migrieren oder einen Stacktrace debuggen.

Die Kombination mit Ollama statt mit einer Cloud-API hat drei konkrete Vorteile: Ihr proprietärer Code verlässt den Rechner nie, es fallen keine Kosten pro Token an (Cline verbraucht enorm viel Kontext, was in der Cloud schnell teuer wird), und der Agent funktioniert offline. Der Preis dafür: Ein gutes lokales Modell für Code benötigt VRAM, und die Standardeinstellungen von Ollama eignen sich nicht für den Einsatz mit einem Agenten.

i
Dieser Leitfaden ist kein Migrationsleitfaden.
Wenn Sie bisher Continue.dev verwendet haben und Ihre Konfiguration übernehmen möchten, folgen Sie stattdessen unserem speziellen Leitfaden „Continue.dev von Cursor übernommen: zu Cline migrieren“ – er behandelt den Datenexport und die Zuordnung der Einstellungen. Hier beginnen wir bei null, um eine saubere Konfiguration für Cline + Ollama aufzubauen.

#Voraussetzungen

Das Kit „Copilote Local“

Dieser Guide führt Sie zum Modell. Das Kit führt Sie zum Copiloten, der in Ihrem Editor Code schreibt.

  • Lebenslanger Online-Zugang
  • PDF + Dateien
  • Erstattung binnen 30 Tagen
VS Code
Aktuelle Version (1.90+). Cline funktioniert auch in Open VSX-kompatiblen Forks (VSCodium, Cursor), aber dieser Leitfaden richtet sich an die Standardversion von VS Code.
Ollama installiert
Der Daemon muss laufen und unter http://localhost:11434 auf Anfragen lauschen. Falls dies noch nicht der Fall ist, siehe unsere Installationsanleitung für Ollama.
Eine GPU mit ausreichend VRAM
Mindestens 16 GB für einen komfortabel nutzbaren Agenten, 24 GB für die leistungsfähigsten Modelle. Ein reiner CPU-Betrieb ist weiterhin möglich, aber für die Agentenschleife zu langsam.
Ein in VS Code geöffnetes Projekt
Cline arbeitet im aktuellen Workspace-Verzeichnis: Öffnen Sie ein echtes Repository, keine einzelne Datei.

#Modell nach VRAM wählen

Die Wahl des Modells hat Vorrang vor allem anderen: Ein Cline-Agent führt nacheinander Tool-Aufrufe, das Lesen von Dateien und Diffs aus. Daher braucht er ein Modell, das Anweisungen befolgt und das Tool-Format einhält. Drei Profile decken 2026 die meisten Grafikkarten ab.

24 GB (RTX 4090, 3090, RX 7900 XTX) — Qwen3-Coder 32B
Der derzeit beste lokale Agent. In Q4_K_M belegt er etwa 19 GB und lässt damit Spielraum für einen Kontext von 32k. Dieses Modell sollten Sie anstreben, wenn Ihre Grafikkarte damit zurechtkommt.
16 GB (RTX 4080, 5070 Ti, 4060 Ti 16GB) — Devstral Small 2
Ein auf Code-Agenten spezialisiertes Mistral-Modell, das in Q4_K_M mit einem brauchbaren Kontextfenster in 16 GB passt. Der beste Kompromiss für diese Grafikkartenklasse.
Solider Generalist — Qwen 3.6 27B
Wenn Sie ein einziges Modell für Code und alles andere möchten, passt die 27B-Variante in Q4 in 24 GB und schlägt sich als Agent sehr gut. Bei reinen Programmieraufgaben liegt sie eine Stufe unter Qwen3-Coder, ist aber vielseitiger.
→
VRAM-Richtwert bei Q4
Bei Q4_K_M-Quantisierung (der empfohlenen Standardeinstellung): ein 14B-Modell ≈ 9 GB, ein 27B-Modell ≈ 16–17 GB, ein 32B-Modell ≈ 19 GB. Rechnen Sie den VRAM-Bedarf für den Kontext hinzu: Je größer das Kontextfenster, desto größer wird der KV-Cache. Lassen Sie immer 2–3 GB Reserve.

Vermeiden Sie Modelle unter 14B für den Einsatz als Agent: Sie halten das Format der Tool-Aufrufe nicht ein, geraten in Schleifen oder schlagen Diffs vor, die sich nicht anwenden lassen. Ein kleines, schnelles Modell eignet sich hervorragend für die Inline-Vervollständigung (über Tabby oder Continue), aber nicht zum Steuern von Cline.

#1. Ollama vorbereiten

Prüfen Sie zunächst, ob Ollama läuft, und laden Sie dann das gewählte Modell herunter. Hier verwenden wir Qwen3-Coder 32B als Beispiel – ersetzen Sie den Tag durch einen, der zum verfügbaren VRAM passt.

Terminal
# Vérifier que le daemon répond
curl http://localhost:11434/api/version

# Tirer le modèle de code (adapter au tag exact affiché sur ollama.com)
ollama pull qwen3-coder:32b

# Alternatives selon la VRAM
ollama pull devstral-small-2   # 16 Go
ollama pull qwen3.6:27b        # généraliste 24 Go

# Lister ce qui est installé
ollama list
!
Prüfen Sie den genauen Tag
Die Namen der Ollama-Tags ändern sich (Quantisierungssuffixe, Versionen). Kopieren Sie den Tag von der offiziellen Modellseite auf ollama.com, statt ihn zu erraten: Ein nicht existierender Tag führt zu einem stillen Fehler beim Pull.

#2. Den Kontext in Ollama einstellen

Das ist der Schritt, den alle übersehen. Standardmäßig stellt Ollama Modelle mit einem Kontextfenster von 4096 Tokens bereit. Allerdings sendet Cline den Inhalt mehrerer Dateien, den Aufgabenverlauf und die Werkzeugdefinitionen: Bei 4k vergisst der Agent in jeder Runde den Anfang seiner eigenen Aufgabe und wird unbrauchbar.

num_ctx muss erhöht werden. Die saubere Lösung besteht darin, über ein Modelfile ein abgeleitetes Modell zu erstellen, damit die Einstellung dauerhaft und unabhängig von Cline ist.

Modelfile
# Fichier : Modelfile
FROM qwen3-coder:32b

# Contexte élargi pour l'usage agent (32k)
PARAMETER num_ctx 32768

# Un peu de déterminisme pour le code
PARAMETER temperature 0.2
Terminal
# Créer le modèle dérivé
ollama create qwen3-coder-agent -f Modelfile

# Il apparaît désormais dans la liste
ollama list
!
num_ctx kostet VRAM
Der Wechsel von 4k auf 32k vergrößert den KV-Cache um mehrere GB. Bleiben Sie bei 16 GB bei 16k (num_ctx 16384) statt 32k, sonst lagert Ollama Teile des Modells in den Arbeitsspeicher aus und der Agent wird langsam. Behalten Sie `ollama ps` im Auge: Wenn in der Spalte PROCESSOR CPU angezeigt wird, reduzieren Sie den Kontext oder die Quantisierung.

#3. Cline installieren

  1. 01
    Marktplatz öffnen
    Öffnen Sie in VS Code den Bereich „Erweiterungen“ (Strg+Umschalt+X).
  2. 02
    Nach Cline suchen
    Geben Sie „Cline“ in die Suchleiste ein. Die offizielle Erweiterung wird von „Cline Bot Inc.“ veröffentlicht – prüfen Sie den Herausgeber, um Klone zu vermeiden.
  3. 03
    Installieren und anheften
    Klicken Sie auf Installieren. Ein Cline-Symbol erscheint in der Aktivitätsleiste; heften Sie es an, um schnell darauf zugreifen zu können.

#4. Cline mit Ollama verbinden

Cline unterstützt Ollama nativ: Sie müssen keine OpenAI-kompatible API-URL zurechtbasteln. Öffnen Sie das Cline-Panel, klicken Sie auf das Einstellungssymbol und konfigurieren Sie dann den Anbieter.

  1. 01
    API Provider → Ollama
    Wählen Sie in der Dropdown-Liste „API Provider“ die Option „Ollama“ aus.
  2. 02
    Base URL
    Verwenden Sie standardmäßig http://localhost:11434 (Standardwert). Ändern Sie dies nur dann, wenn Ollama auf einem anderen Gerät oder in einem Container läuft.
  3. 03
    Model
    Wählen Sie qwen3-coder-agent (das in Schritt 2 erstellte abgeleitete Modell), nicht das unveränderte Modell mit 4k Kontext.
  4. 04
    Das Kontextfenster prüfen
    Cline zeigt ein Feld „Context Window“. Stellen Sie es auf den Wert von num_ctx im Modelfile (32768) ein. Eine Abweichung führt dazu, dass Cline die Prompts kürzt, noch bevor sie Ollama erreichen.
i
Plan Mode und Act Mode
Cline unterscheidet zwischen dem Plan-Modus (Cline denkt nach und schlägt eine Strategie vor, ohne Dateien anzufassen) und dem Act-Modus (Cline führt sie aus). Beginnen Sie bei einem lokalen Modell im Plan-Modus, um den Ansatz zu prüfen: So vermeiden Sie, dass ein etwas schwaches Modell zehn Dateien nach einem falschen Ansatz bearbeitet.

#5. Erster Lauf im Agentenmodus

Öffnen Sie ein echtes Projekt und geben Sie Cline dann eine konkrete, klar begrenzte Aufgabe. Gute erste Tests betreffen nur wenige Dateien: einen Test hinzufügen, einen identifizierten Fehler beheben, eine kleine Hilfsfunktion schreiben.

Cline-Prompt
Ajoute une fonction `slugify(texte)` dans src/utils/strings.js qui met en minuscules, remplace les accents et les espaces par des tirets. Écris aussi un test unitaire dans le fichier de tests existant à côté.

Cline wird den Ordner lesen, einen Diff vorschlagen und Sie bitten, jede Änderung und jeden Befehl zu bestätigen. Genehmigen Sie beim ersten Mal alles Schritt für Schritt, um das Verhalten von Cline zu verstehen. Sobald Sie Vertrauen gefasst haben, können Sie in den Einstellungen die automatische Genehmigung bestimmter Aktionen aktivieren, etwa das Lesen von Dateien und nicht destruktive Befehle.

→
Projektregeldatei
Fügen Sie im Stammverzeichnis des Repositorys eine Datei `.clinerules` hinzu, um dem Agenten klare Vorgaben zu machen: Namenskonventionen, den auszuführenden Testbefehl und Ordner, die niemals verändert werden dürfen. Ein lokales Modell hält sich besser an die Vorgaben, wenn sie ausdrücklich formuliert und kurz sind.

#Häufige Fallstricke

Der Agent vergisst seine Aufgabe
Fast immer ein Problem mit dem Kontext: num_ctx ist in Ollama zu niedrig oder Context Window in Cline falsch eingestellt. Stimmen Sie die beiden Werte wieder aufeinander ab.
Die Diffs lassen sich nicht anwenden
Das Modell ist zu klein oder zu stark quantisiert, um das Bearbeitungsformat einzuhalten. Wechseln Sie zu einem größeren Modell (14B → 27B/32B) oder von Q3 zu Q4_K_M.
Die Inferenz wechselt auf die CPU
Modell und Kontext überschreiten die VRAM-Kapazität. Prüfen Sie `ollama ps`; verringern Sie num_ctx oder wählen Sie ein kleineres Modell. Ein Agent, der teilweise auf der CPU läuft, wird unbrauchbar.
Endlosschleifen bei Tool-Aufrufen
Einige Modelle führen denselben Befehl erneut aus. Wechseln Sie zunächst in den Plan Mode und teilen Sie die Aufgabe in kleinere Teilaufgaben auf.
Verbindung abgelehnt
Ollama lauscht nicht oder ist nicht unter der erwarteten URL erreichbar. Testen Sie `curl http://localhost:11434/api/version`. Bei einem Container geben Sie den Port frei und konfigurieren Cline für die richtige Adresse.

#Weiterführende Informationen

Sie verfügen über einen lokal installierten Cline-100%-Agent, der Ihr Code bearbeitet, ohne irgendetwas zu offenlegen. Zwei natürliche Erweiterungen: die Feinabstimmung des Modells und die Ergänzung durch Inline-Vervollständigung, die Cline nicht bereitstellt.

→
Lokales Copilot-Kit
Die vollständige Kombination, um GitHub Copilot lokal zu ersetzen: Cline (Chat + Agent) für die Aufgaben, Tabby für die grau dargestellten Vervollständigungsvorschläge während des Tippens und ein auf Ihre GPU abgestimmtes Code-Modell. Jeder Baustein bleibt auf Ihrem Rechner.
Bestes lokales LLM zum Coden 2026
Der Vergleich von Devstral / Qwen3-Coder und Alternativen mit Angaben zu VRAM und Codequalität – um die Wahl des an Cline angebundenen Modells zu verfeinern.
Continue.dev wurde von Cursor übernommen: Migration zu Cline
Wenn Sie von Continue.dev wechseln, finden Sie im entsprechenden Leitfaden Informationen zum Export und zur Migration Ihrer Konfiguration in dieses Setup.
Quantisierung wählen (Q4, Q5, Q8, FP16)
Die Kompromisse zwischen Qualität und VRAM-Bedarf verstehen, damit das größtmögliche Modell in den Speicher Ihrer Grafikkarte passt.
Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.