Ollama in Claude Code und Cursor verwenden (Modelle locaux)
Claude Code und Cursor sind zu Standardwerkzeugen für das Programmieren mit einem LLM geworden, aber beide senden Ihren Code an Anthropic oder OpenAI und kosten mindestens 20 $/Monat. Ollama stellt unter localhost:11434/v1 einen OpenAI-kompatiblen Endpunkt bereit, über den sich diese beiden IDEs – und jeder Assistent, der die OpenAI-API unterstützt – mit einem lokalen Modell verbinden lassen. Dieser Leitfaden zeigt die genaue Konfiguration für Cursor (nativ) und Claude Code (über einen Proxy), welche Modelle zum Programmieren 2026 zu bevorzugen sind und wo lokale Modelle gegenüber der Cloud zurückfallen.
#Warum Ollama in Claude Code oder Cursor verwenden?
Drei Gründe, die immer wieder genannt werden. Zuerst die Vertraulichkeit: ein Kundenprojekt unter NDA, proprietärer Code, Geheimnisse im Klartext in den Dateien – nichts davon sollte an Dritte gelangen. Dann die Kosten: Cursor Pro kostet 20 $/Monat, Claude Code verbraucht Anthropic-Tokens, deren Kosten bei intensiver Nutzung schnell 50–100 $/Monat erreichen. Mit Ollama fallen nach dem Kauf der GPU keine Kosten mehr an. Schließlich die Ausfallsicherheit: Ihr Assistent stellt seine Arbeit nicht ein, wenn es bei der Anthropic-API eine Störung gibt oder Ihre ADSL-Verbindung abbricht.
Der Kompromiss ist ehrlich: Ein lokal laufender Qwen3-Coder 30B kommt bei komplexen Agentenaufgaben über mehrere Dateien hinweg nicht an Claude Sonnet 4.6 oder GPT-5 heran. Aber für 80 % der alltäglichen Aufgaben – Code vervollständigen, refaktorieren, einen Test schreiben, einen Codeblock erklären, einen Commit generieren – reicht ein Coding-Modell mit 9 bis 30 Milliarden Parametern in Q4 mehr als aus. Und für die großen Aufgaben können Sie weiterhin parallel die Cloud nutzen.
#Der OpenAI-kompatible Endpoint von Ollama
Dieser Guide führt Sie zum Modell. Das Kit führt Sie zum Copiloten, der in Ihrem Editor Code schreibt.
- Lebenslanger Online-Zugang
- PDF + Dateien
- Lebenslange Updates
Seit Version 0.1.24 stellt Ollama neben seiner nativen API einen Endpunkt bereit, der mit der OpenAI-ChatCompletions-API kompatibel ist. Das macht alles Weitere möglich: Jeder OpenAI-Client (Python-SDK, Node-SDK, Cursor, Cline, Aider, Continue usw.) kann Ollama ohne weitere Änderungen ansprechen – lediglich die Basis-URL muss geändert werden.
Das Antwortformat ist identisch mit dem von OpenAI: choices[0].message.content, usage mit prompt_tokens und completion_tokens sowie Streaming-Unterstützung über stream: true. Der API-Schlüssel wird ignoriert — Sie können im Authorization-Header einen beliebigen Wert senden, Ollama akzeptiert ihn. Viele Clients akzeptieren jedoch kein leeres Feld: Geben Sie ollama oder anything ein, damit sie zufrieden sind.
#Voraussetzungen
- Ollama 0.5+
- ollama --version muss eine Ausgabe liefern. Unter Windows muss das Symbol im Infobereich aktiv sein. Wenn Sie bei null anfangen, lesen Sie die Ollama-Installationsanleitung für Ihr Betriebssystem.
- GPU mit 12 GB VRAM oder Mac der M-Serie mit mindestens 16 GB Speicher
- Qwen 3.5 9B Q4 benötigt etwa 6,6 GB, Devstral 24B Q4 etwa 14 GB und Qwen3-Coder 30B-A3B Q4 etwa 19 GB. RTX 3060 mit 12 GB = sinnvolle Mindestkonfiguration (Qwen 3.5 9B); RTX 4070/4080 mit 16 GB oder Mac M3/M4 = Devstral 24B und Qwen3-Coder 30B vollständig laden.
- Cursor 0.40+ oder Claude Code CLI
- Cursor von cursor.com (integrierter Modus für eine benutzerdefinierte OpenAI-Verbindung). Claude Code über npm install -g @anthropic-ai/claude-code.
- Minimale Vertrautheit mit Umgebungsvariablen
- Für Claude Code werden ANTHROPIC_BASE_URL und ANTHROPIC_AUTH_TOKEN verwendet.
#1. Cursor an Ollama anbinden
Cursor bietet eine offizielle Option, um einen OpenAI-kompatiblen Endpunkt einzustellen. Das funktioniert sehr gut für den Chat (Ctrl+L) und die Inline-Bearbeitung (Ctrl+K). Der Composer-Agent und die Tab-Autovervollständigung bleiben hingegen auf die Cloud-Modelle von Cursor beschränkt – eine Produktbeschränkung, zu der Anthysphere ausdrücklich steht.
- 01Ein Code-Modell herunterladenMit 12 GB VRAM ist Qwen 3.5 9B (qwen3.5:9b) ein hervorragender Ausgangspunkt: brauchbares Französisch, Tool-Calling und ein Kontextfenster von 256k. Mit 16 GB wechseln Sie zu Devstral 24B (devstral:24b); mit 24 GB zu Qwen3-Coder 30B-A3B (qwen3-coder:30b), dem Referenz-MoE für Code.
- 02Einstellungen von Cursor öffnenCtrl+Shift+J (Cmd+, auf dem Mac) → Registerkarte Models. Sie sehen die Liste der Cursor-Modelle (claude-3.5-sonnet, gpt-5 usw.) mit Ein-/Aus-Schaltern.
- 03Ein benutzerdefiniertes Modell hinzufügenKlicken Sie unten auf Add Model. Geben Sie den exakten Namen des Ollama-Modells ein: qwen3-coder:30b. Setzen Sie das Häkchen, um das Modell zu aktivieren.
- 04Die Basis-URL konfigurierenKlappen Sie im Abschnitt OpenAI API Key die Option Override OpenAI Base URL auf. Geben Sie http://localhost:11434/v1 ein und klicken Sie anschließend auf Save. Geben Sie unter API Key einen beliebigen Wert ein (ollama reicht), da Cursor ein leeres Feld nicht akzeptiert.
- 05Die Verbindung prüfenKlicken Sie auf Verify. Cursor sendet eine Testanfrage an Ihre Ollama-Instanz. Wenn sie mit Status 200 beantwortet wird, wird die Schaltfläche grün und das Modell erscheint in der Modellauswahl des Chats.
Nach der Einrichtung funktionieren der Cursor-Chat (Ctrl+L) und die Inline-Bearbeitung (Ctrl+K) mit Ihrem lokalen Modell. Die Modellauswahl oben im Chatbereich führt qwen3-coder:30b auf; die Cloud-Modelle von Cursor bleiben verfügbar, falls Sie gelegentlich zu ihnen wechseln möchten.
#2. Claude Code mit Ollama verbinden
Claude Code (das CLI von Anthropic) nutzt nativ die Messages-API von Anthropic, nicht die Chat-Completions-API von OpenAI. Die beiden Protokolle unterscheiden sich (Rollen, Format der Tool-Calls, Streaming). Damit Claude Code mit Ollama kommunizieren kann, ist daher ein kleiner Übersetzer nötig – ein Proxy, der auf der einen Seite Anfragen im Format Anthropic Messages empfängt und auf der anderen Seite Anfragen im Format OpenAI Chat Completions ausgibt.
Das Referenzprojekt dafür heißt claude-code-router (musistudio/claude-code-router auf GitHub). Es lässt sich mit einem einzigen Befehl installieren, läuft lokal auf einem Port und unterstützt Routing-Regeln pro Modell (z. B. haiku an Ollama und sonnet an das echte Claude weiterleiten).
- 01Claude Code installierennpm install -g @anthropic-ai/claude-code, falls noch nicht geschehen. claude --version muss eine Antwort liefern.
- 02claude-code-router installierennpm install -g @musistudio/claude-code-router. Le binaire ccr est ajouté au PATH.
- 03Modell-Download in OllamaBevorzugen Sie ein Modell, das Tool-Aufrufe unterstützt: qwen3-coder:30b, devstral:24b oder glm-4.7-flash. Ohne Tool-Unterstützung kann Claude Code seine internen Tools (Read, Edit, Bash usw.) nicht aufrufen und verliert 90 % seines Nutzens.
- 04Den Router konfigurierenErstellen Sie ~/.claude-code-router/config.json mit einem Eintrag Providers, der auf Ollama zeigt, und einer Regel Router, die die Claude-Modelle auf Ihr lokales Modell abbildet.
- 05Über ccr startenccr code statt claude. Der Wrapper startet den Proxy im Hintergrund, exportiert ANTHROPIC_BASE_URL so, dass die Variable auf diesen Proxy verweist, und startet dann Claude Code. Dort können Sie mit /model zwischen den Routen wechseln.
Minimalistischer Ansatz ohne Router: Sie können ANTHROPIC_BASE_URL und ANTHROPIC_AUTH_TOKEN auch direkt als Umgebungsvariablen für einen Anthropic-kompatiblen Proxy exportieren, etwa LiteLLM im Modus --anthropic oder y-router. Das ist schlanker, bietet aber nicht die Flexibilität aufgabenspezifischer Regeln.
#3. Welches Modell zum Programmieren wählen: Qwen3-Coder vs. Devstral im lokalen Betrieb
In Ollama dominieren im Sommer 2026 einige Modellfamilien beim Programmieren: Qwen3-Coder (Alibaba), Devstral (Mistral AI) und vielseitige MoE-Modelle wie GLM 4.7 Flash (Z.ai) oder gpt-oss (OpenAI). Alle sind Open-Weight-Modelle und laufen in Q4 auf handelsüblicher Hardware.
- Qwen3-Coder 30B-A3B (Alibaba, Apache 2.0)
- Das vielseitige Referenzmodell im Jahr 2026. Solide Unterstützung für Tool Calling, mehrsprachig (ordentliches Französisch), gut in Python/JS/Go/Rust, 256k Kontext. Es ist ein MoE mit 3B aktiven Parametern: so schnell wie ein dichtes 14B-Modell bei der Qualität eines 30B-Modells. ≈ 19 GB in Q4. Pull: qwen3-coder:30b.
- Devstral 24B (Mistral AI, Apache 2.0)
- Speziell für SWE-Agenten entwickelt (Bearbeitung mehrerer Dateien, Navigation in der Codebasis). Hervorragend in Aider, OpenHands und – entsprechend – auch in Claude Code. Dichtes 24B-Modell ≈ 14 GB in Q4, passt in 16 GB. Pull: devstral:24b.
- GLM 4.7 Flash (Z.ai, MIT) / gpt-oss 20B (OpenAI)
- Zwei MoE-Modelle sind im Agentenmodus sehr gut geeignet. GLM 4.7 Flash (30B-A3B, ≈ 19 GB) ist ein hervorragender Orchestrator für Tool-Aufrufe; gpt-oss 20B (≈ 14 GB, MXFP4, 131k Kontext) ist schneller und passt auf 16 GB. Pull: glm-4.7-flash oder gpt-oss:20b.
- Qwen 3.5 9B (Ausweichoption für GPUs mit 8–12 GB)
- Nur 6,6 GB, ein Allround-Modell mit soliden Programmierfähigkeiten, 256k Kontext und Bildverarbeitung. Eine gute Ausweichoption bei knappem VRAM, bevor Sie zu Modellen mit 24B oder mehr wechseln. Pull: qwen3.5:9b.
VRAM pro Größe bei Q4_K_M (empfohlene Quantisierung): 7B ≈ 5 GB, 14B ≈ 9 GB, 24B ≈ 14 GB, 32B ≈ 19 GB, 70B ≈ 40 GB. Der Kontext verbraucht zusätzlich: Rechnen Sie für 32k Tokens Kontext je nach Modell +2 bis +4 GB ein.
#Grenzen gegenüber der Cloud: Wo lokale Modelle nicht mehr mithalten
Seien wir ehrlich darüber, was lokale Modelle nicht so gut wie Claude Sonnet 4.6 oder GPT-5 leisten:
- Kontextfenster
- Ollama begrenzt num_ctx standardmäßig auf 4096 Tokens; je nach Modell lässt sich der Wert auf 32k oder sogar 128k erhöhen, allerdings auf Kosten des VRAM-Bedarfs. Cursor mit Sonnet in der Cloud verarbeitet 200k Tokens problemlos. Bei einem großen Monorepo liest das Cloud-Modell alles, während das lokale Modell auswählen muss.
- Mehrstufiges Schlussfolgern
- Ein Modell mit 9–14 Milliarden Parametern verliert den Überblick, wenn der Agent 10 Tool-Aufrufe mit Abhängigkeiten untereinander aneinanderreiht. Sonnet behält den roten Faden. Bei wirklich komplexer Agentenorchestrierung liegt die Cloud weiterhin vorne – und zwar mit großem Abstand.
- Kenntnis neuerer APIs
- Open-Weight-Modelle haben einen Wissensstichtag (häufig 2025) und kennen danach veröffentlichte APIs nicht. Cursor in der Cloud profitiert von kontinuierlichen Updates und Werkzeugen zur Websuche.
- Latenz zum ersten Token
- Paradoxerweise kann die Cloud schneller starten (kein Laden des Modells). Lokal bleibt das Modell zwischen zwei Aufrufen geladen – nach dem ersten Prompt liegt der Vorteil wieder auf der lokalen Seite.
- Stromkosten
- Eine RTX 4090 verbraucht unter Last 350 W. 8 Stunden intensives Programmieren pro Tag = ~70 kWh/Monat = ~15 € in Frankreich. Das liegt weiterhin deutlich unter 20 $/Monat für Cursor plus 50 $/Monat für Claude, ist aber nicht kostenlos.
#Tipps und Fehlerbehebung
- Cursor gibt "OpenAI API key invalid" zurück
- Das Feld API Key muss einen Wert enthalten und darf nicht leer sein. Geben Sie ollama, sk-anything oder irgendeinen plausiblen Wert ein. Das ist reine Formsache: Ollama ignoriert den Header.
- Cursor erkennt das Modell nicht
- Der Modellname in Cursor (Add Model) muss EXAKT dem von ollama list ausgegebenen Namen entsprechen (einschließlich Tag, z. B. qwen3-coder:30b). Nicht nur qwen3-coder, auch nicht Qwen3 Coder.
- Claude Code gerät in eine Schleife oder fragt erneut nach demselben
- Oft scheitert das lokale Modell bei seinen Tool-Aufrufen. Prüfen Sie, ob das Modell Function Calling unterstützt (ollama show qwen3-coder:30b → suchen Sie unter capabilities nach tools). Wechseln Sie zu einem größeren Modell oder vereinfachen Sie die Aufgabe.
- Abgebrochene Antworten nach 2–3 Sätzen
- Standardwert für num_ctx = 4096. Für Claude Code und Cursor mit einem Codebase-Kontext erhöhen Sie den Wert auf 16384 oder 32768. Mit Ollama: Erstellen Sie ein benutzerdefiniertes Modelfile mit PARAMETER num_ctx 32768 und führen Sie ollama create coder-32k -f Modelfile aus. Der zusätzliche Speicherbedarf ist real (+ 2–4 GB für den KV-Cache).
- VRAM voll, OOM
- Prüfen Sie während der Nutzung ollama ps. Wenn Sie >100% loaded bei einer Aufteilung zwischen GPU und CPU sehen, wird ein Teil des Modells in den RAM ausgelagert und das Modell wird sehr langsam. Lösungen: stärkere Quantisierung (Q3_K_M), ein kleineres Modell oder num_ctx reduzieren.
- Latenz > 5 s pro Antwort
- Entweder wird ein Teil des Modells auf der CPU ausgeführt (siehe vorherigen Punkt), oder Ollama lädt das Modell bei jeder Anfrage neu. Prüfen Sie OLLAMA_KEEP_ALIVE (Standardwert: 5 Minuten). Setzen Sie OLLAMA_KEEP_ALIVE=2h, damit das Modell geladen bleibt.
#Weiterführende Informationen
Ollama stellt nun ein Coding-Modell für Cursor oder Claude Code bereit. Die naheliegenden nächsten Schritte:
- Im Editor ergänzen (FIM inline)
- Der Leitfaden „Kostenloser lokaler Copilot“ zeigt die Installation von Continue.dev / Tabby / CodeGeeX für die Inline-Codevervollständigung nach Copilot-Art – eine natürliche Ergänzung zum Chat in Cursor.
- Die richtige Quantisierung wählen
- Q4_K_M, Q5_K_M, Q8_0: Der Leitfaden „Die passende Quantisierung wählen“ vergleicht den tatsächlichen Qualitätsverlust bei Code-Modellen und erklärt, wann Q3 noch nutzbar ist.
- Ein Code-Modell anpassen
- Der Leitfaden „Ein Modell mit Ollama Modelfile anpassen“ zeigt, wie Sie num_ctx, den System-Prompt und die Temperatur festlegen, um ein auf Ihren Stack zugeschnittenes Coding-Modell zu erhalten.
Kann Ollama wirklich mit Claude Code verwendet werden?+
Ollama + Claude Code: Ist das wirklich kostenlos?+
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.