Mittelstufe 10 Min.IDE

Ollama in Claude Code und Cursor verwenden (Modelle locaux)

Claude Code und Cursor sind zu Standardwerkzeugen für das Programmieren mit einem LLM geworden, aber beide senden Ihren Code an Anthropic oder OpenAI und kosten mindestens 20 $/Monat. Ollama stellt unter localhost:11434/v1 einen OpenAI-kompatiblen Endpunkt bereit, über den sich diese beiden IDEs – und jeder Assistent, der die OpenAI-API unterstützt – mit einem lokalen Modell verbinden lassen. Dieser Leitfaden zeigt die genaue Konfiguration für Cursor (nativ) und Claude Code (über einen Proxy), welche Modelle zum Programmieren 2026 zu bevorzugen sind und wo lokale Modelle gegenüber der Cloud zurückfallen.

Von Mohamed Meguedmi·Aktualisierung 2026-09-01·Unter Windows, macOS und Linux getestet

#Warum Ollama in Claude Code oder Cursor verwenden?

Drei Gründe, die immer wieder genannt werden. Zuerst die Vertraulichkeit: ein Kundenprojekt unter NDA, proprietärer Code, Geheimnisse im Klartext in den Dateien – nichts davon sollte an Dritte gelangen. Dann die Kosten: Cursor Pro kostet 20 $/Monat, Claude Code verbraucht Anthropic-Tokens, deren Kosten bei intensiver Nutzung schnell 50–100 $/Monat erreichen. Mit Ollama fallen nach dem Kauf der GPU keine Kosten mehr an. Schließlich die Ausfallsicherheit: Ihr Assistent stellt seine Arbeit nicht ein, wenn es bei der Anthropic-API eine Störung gibt oder Ihre ADSL-Verbindung abbricht.

Der Kompromiss ist ehrlich: Ein lokal laufender Qwen3-Coder 30B kommt bei komplexen Agentenaufgaben über mehrere Dateien hinweg nicht an Claude Sonnet 4.6 oder GPT-5 heran. Aber für 80 % der alltäglichen Aufgaben – Code vervollständigen, refaktorieren, einen Test schreiben, einen Codeblock erklären, einen Commit generieren – reicht ein Coding-Modell mit 9 bis 30 Milliarden Parametern in Q4 mehr als aus. Und für die großen Aufgaben können Sie weiterhin parallel die Cloud nutzen.

i
Was dieser Leitfaden abdeckt
Ollama (lokales Modell) über die OpenAI-kompatible API mit Cursor und Claude Code verbinden. Auswahl des Code-Modells. Der Leitfaden behandelt keine Inline-Vervollständigung im Stil von Copilot – dazu den Leitfaden zu Continue.dev / Tabby / CodeGeeX ansehen.

#Der OpenAI-kompatible Endpoint von Ollama

Das Kit „Lokaler Copilot“

Dieser Guide führt Sie zum Modell. Das Kit führt Sie zum Copiloten, der in Ihrem Editor Code schreibt.

  • Lebenslanger Online-Zugang
  • PDF + Dateien
  • Lebenslange Updates

Seit Version 0.1.24 stellt Ollama neben seiner nativen API einen Endpunkt bereit, der mit der OpenAI-ChatCompletions-API kompatibel ist. Das macht alles Weitere möglich: Jeder OpenAI-Client (Python-SDK, Node-SDK, Cursor, Cline, Aider, Continue usw.) kann Ollama ohne weitere Änderungen ansprechen – lediglich die Basis-URL muss geändert werden.

Prüfen, ob eine Antwort kommt
curl http://localhost:11434/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen3-coder:30b",
    "messages": [{"role": "user", "content": "Bonjour"}]
  }'

Das Antwortformat ist identisch mit dem von OpenAI: choices[0].message.content, usage mit prompt_tokens und completion_tokens sowie Streaming-Unterstützung über stream: true. Der API-Schlüssel wird ignoriert — Sie können im Authorization-Header einen beliebigen Wert senden, Ollama akzeptiert ihn. Viele Clients akzeptieren jedoch kein leeres Feld: Geben Sie ollama oder anything ein, damit sie zufrieden sind.

→
Drei Endpunkte, ein einziger Daemon
Ollama lauscht parallel auf /api/* (native API, für native Ollama-Clients empfohlen) und auf /v1/* (OpenAI-Kompatibilität). Für die Aktivierung von /v1 ist keine Konfiguration nötig; es ist schon nach der Installation verfügbar. Der Port bleibt in beiden Fällen 11434.

#Voraussetzungen

Ollama 0.5+
ollama --version muss eine Ausgabe liefern. Unter Windows muss das Symbol im Infobereich aktiv sein. Wenn Sie bei null anfangen, lesen Sie die Ollama-Installationsanleitung für Ihr Betriebssystem.
GPU mit 12 GB VRAM oder Mac der M-Serie mit mindestens 16 GB Speicher
Qwen 3.5 9B Q4 benötigt etwa 6,6 GB, Devstral 24B Q4 etwa 14 GB und Qwen3-Coder 30B-A3B Q4 etwa 19 GB. RTX 3060 mit 12 GB = sinnvolle Mindestkonfiguration (Qwen 3.5 9B); RTX 4070/4080 mit 16 GB oder Mac M3/M4 = Devstral 24B und Qwen3-Coder 30B vollständig laden.
Cursor 0.40+ oder Claude Code CLI
Cursor von cursor.com (integrierter Modus für eine benutzerdefinierte OpenAI-Verbindung). Claude Code über npm install -g @anthropic-ai/claude-code.
Minimale Vertrautheit mit Umgebungsvariablen
Für Claude Code werden ANTHROPIC_BASE_URL und ANTHROPIC_AUTH_TOKEN verwendet.

#1. Cursor an Ollama anbinden

Cursor bietet eine offizielle Option, um einen OpenAI-kompatiblen Endpunkt einzustellen. Das funktioniert sehr gut für den Chat (Ctrl+L) und die Inline-Bearbeitung (Ctrl+K). Der Composer-Agent und die Tab-Autovervollständigung bleiben hingegen auf die Cloud-Modelle von Cursor beschränkt – eine Produktbeschränkung, zu der Anthysphere ausdrücklich steht.

  1. 01
    Ein Code-Modell herunterladen
    Mit 12 GB VRAM ist Qwen 3.5 9B (qwen3.5:9b) ein hervorragender Ausgangspunkt: brauchbares Französisch, Tool-Calling und ein Kontextfenster von 256k. Mit 16 GB wechseln Sie zu Devstral 24B (devstral:24b); mit 24 GB zu Qwen3-Coder 30B-A3B (qwen3-coder:30b), dem Referenz-MoE für Code.
  2. 02
    Einstellungen von Cursor öffnen
    Ctrl+Shift+J (Cmd+, auf dem Mac) → Registerkarte Models. Sie sehen die Liste der Cursor-Modelle (claude-3.5-sonnet, gpt-5 usw.) mit Ein-/Aus-Schaltern.
  3. 03
    Ein benutzerdefiniertes Modell hinzufügen
    Klicken Sie unten auf Add Model. Geben Sie den exakten Namen des Ollama-Modells ein: qwen3-coder:30b. Setzen Sie das Häkchen, um das Modell zu aktivieren.
  4. 04
    Die Basis-URL konfigurieren
    Klappen Sie im Abschnitt OpenAI API Key die Option Override OpenAI Base URL auf. Geben Sie http://localhost:11434/v1 ein und klicken Sie anschließend auf Save. Geben Sie unter API Key einen beliebigen Wert ein (ollama reicht), da Cursor ein leeres Feld nicht akzeptiert.
  5. 05
    Die Verbindung prüfen
    Klicken Sie auf Verify. Cursor sendet eine Testanfrage an Ihre Ollama-Instanz. Wenn sie mit Status 200 beantwortet wird, wird die Schaltfläche grün und das Modell erscheint in der Modellauswahl des Chats.
Modell-Download in Ollama
ollama pull qwen3-coder:30b
!
Der Privacy-Modus reicht nicht aus
Wenn Sie Privacy Mode in Cursor aktivieren, wird Ihr Code nicht zum Trainieren von Modellen verwendet. Das ändert jedoch nichts daran, dass der Code über die Server von Cursor läuft, um das Modell aufzurufen. Nur der Wechsel zu einem lokalen Endpunkt (diese Konfiguration) garantiert, dass nichts den Rechner verlässt – überprüfbar mit tcpdump oder einer Firewall für ausgehende Verbindungen.

Nach der Einrichtung funktionieren der Cursor-Chat (Ctrl+L) und die Inline-Bearbeitung (Ctrl+K) mit Ihrem lokalen Modell. Die Modellauswahl oben im Chatbereich führt qwen3-coder:30b auf; die Cloud-Modelle von Cursor bleiben verfügbar, falls Sie gelegentlich zu ihnen wechseln möchten.

i
Was mit einem benutzerdefinierten Modell nicht funktioniert
Der Composer Agent (Ctrl+I im Agentenmodus), Tab autocomplete und die Funktion Cursor Predicts nutzen weiterhin die Cloud-Modelle von Cursor – sie verwenden intern feinabgestimmte Modelle und lassen sich nicht auf andere Modelle umstellen. Für die lokale Inline-Vervollständigung verwenden Sie parallel Continue.dev.

#2. Claude Code mit Ollama verbinden

Claude Code (das CLI von Anthropic) nutzt nativ die Messages-API von Anthropic, nicht die Chat-Completions-API von OpenAI. Die beiden Protokolle unterscheiden sich (Rollen, Format der Tool-Calls, Streaming). Damit Claude Code mit Ollama kommunizieren kann, ist daher ein kleiner Übersetzer nötig – ein Proxy, der auf der einen Seite Anfragen im Format Anthropic Messages empfängt und auf der anderen Seite Anfragen im Format OpenAI Chat Completions ausgibt.

Das Referenzprojekt dafür heißt claude-code-router (musistudio/claude-code-router auf GitHub). Es lässt sich mit einem einzigen Befehl installieren, läuft lokal auf einem Port und unterstützt Routing-Regeln pro Modell (z. B. haiku an Ollama und sonnet an das echte Claude weiterleiten).

  1. 01
    Claude Code installieren
    npm install -g @anthropic-ai/claude-code, falls noch nicht geschehen. claude --version muss eine Antwort liefern.
  2. 02
    claude-code-router installieren
    npm install -g @musistudio/claude-code-router. Le binaire ccr est ajouté au PATH.
  3. 03
    Modell-Download in Ollama
    Bevorzugen Sie ein Modell, das Tool-Aufrufe unterstützt: qwen3-coder:30b, devstral:24b oder glm-4.7-flash. Ohne Tool-Unterstützung kann Claude Code seine internen Tools (Read, Edit, Bash usw.) nicht aufrufen und verliert 90 % seines Nutzens.
  4. 04
    Den Router konfigurieren
    Erstellen Sie ~/.claude-code-router/config.json mit einem Eintrag Providers, der auf Ollama zeigt, und einer Regel Router, die die Claude-Modelle auf Ihr lokales Modell abbildet.
  5. 05
    Über ccr starten
    ccr code statt claude. Der Wrapper startet den Proxy im Hintergrund, exportiert ANTHROPIC_BASE_URL so, dass die Variable auf diesen Proxy verweist, und startet dann Claude Code. Dort können Sie mit /model zwischen den Routen wechseln.
Ein für Tool-Calling geeignetes Modell herunterladen
ollama pull qwen3-coder:30b
# ou pour du pur agent de code
ollama pull devstral:24b
~/.claude-code-router/config.json
{
  "Providers": [
    {
      "name": "ollama",
      "api_base_url": "http://localhost:11434/v1/chat/completions",
      "api_key": "ollama",
      "models": ["qwen3-coder:30b", "devstral:24b"]
    }
  ],
  "Router": {
    "default": "ollama,qwen3-coder:30b",
    "background": "ollama,qwen3-coder:30b",
    "think": "ollama,devstral:24b",
    "longContext": "ollama,qwen3-coder:30b"
  }
}
Start
ccr code
# Claude Code démarre, mais les requêtes filent vers Ollama
# Vérifier : /model affiche qwen3-coder:30b
!
Die Nutzung interner Werkzeuge kann unzuverlässig sein
Claude Code setzt intensiv Tool-Aufrufe für Read, Edit, Bash, Glob und Grep ein. Nicht alle Ollama-Modelle handhaben sie so zuverlässig wie Claude Sonnet – Qwen3-Coder und Devstral kommen gut damit zurecht, manche kleineren Modelle vergessen Argumente oder halluzinieren Dateien. Wenn Claude Code in einer Schleife hängen bleibt oder mehrmals dasselbe anfordert, liegt das wahrscheinlich daran, dass das Modell seine Tool-Aufrufe fehlerhaft ausführt.

Minimalistischer Ansatz ohne Router: Sie können ANTHROPIC_BASE_URL und ANTHROPIC_AUTH_TOKEN auch direkt als Umgebungsvariablen für einen Anthropic-kompatiblen Proxy exportieren, etwa LiteLLM im Modus --anthropic oder y-router. Das ist schlanker, bietet aber nicht die Flexibilität aufgabenspezifischer Regeln.

#3. Welches Modell zum Programmieren wählen: Qwen3-Coder vs. Devstral im lokalen Betrieb

In Ollama dominieren im Sommer 2026 einige Modellfamilien beim Programmieren: Qwen3-Coder (Alibaba), Devstral (Mistral AI) und vielseitige MoE-Modelle wie GLM 4.7 Flash (Z.ai) oder gpt-oss (OpenAI). Alle sind Open-Weight-Modelle und laufen in Q4 auf handelsüblicher Hardware.

Qwen3-Coder 30B-A3B (Alibaba, Apache 2.0)
Das vielseitige Referenzmodell im Jahr 2026. Solide Unterstützung für Tool Calling, mehrsprachig (ordentliches Französisch), gut in Python/JS/Go/Rust, 256k Kontext. Es ist ein MoE mit 3B aktiven Parametern: so schnell wie ein dichtes 14B-Modell bei der Qualität eines 30B-Modells. ≈ 19 GB in Q4. Pull: qwen3-coder:30b.
Devstral 24B (Mistral AI, Apache 2.0)
Speziell für SWE-Agenten entwickelt (Bearbeitung mehrerer Dateien, Navigation in der Codebasis). Hervorragend in Aider, OpenHands und – entsprechend – auch in Claude Code. Dichtes 24B-Modell ≈ 14 GB in Q4, passt in 16 GB. Pull: devstral:24b.
GLM 4.7 Flash (Z.ai, MIT) / gpt-oss 20B (OpenAI)
Zwei MoE-Modelle sind im Agentenmodus sehr gut geeignet. GLM 4.7 Flash (30B-A3B, ≈ 19 GB) ist ein hervorragender Orchestrator für Tool-Aufrufe; gpt-oss 20B (≈ 14 GB, MXFP4, 131k Kontext) ist schneller und passt auf 16 GB. Pull: glm-4.7-flash oder gpt-oss:20b.
Qwen 3.5 9B (Ausweichoption für GPUs mit 8–12 GB)
Nur 6,6 GB, ein Allround-Modell mit soliden Programmierfähigkeiten, 256k Kontext und Bildverarbeitung. Eine gute Ausweichoption bei knappem VRAM, bevor Sie zu Modellen mit 24B oder mehr wechseln. Pull: qwen3.5:9b.
→
Praktische Empfehlung
Wenn Sie unsicher sind: qwen3.5:9b auf 12 GB VRAM, devstral:24b oder gpt-oss:20b auf 16 GB, qwen3-coder:30b oder glm-4.7-flash auf 24 GB. Devstral und GLM 4.7 Flash sind besonders stark, wenn die IDE im Agentenmodus (Claude Code, Aider) arbeitet; Qwen3-Coder ist beim direkten dialogorientierten Chat in Cursor vielseitiger.

VRAM pro Größe bei Q4_K_M (empfohlene Quantisierung): 7B ≈ 5 GB, 14B ≈ 9 GB, 24B ≈ 14 GB, 32B ≈ 19 GB, 70B ≈ 40 GB. Der Kontext verbraucht zusätzlich: Rechnen Sie für 32k Tokens Kontext je nach Modell +2 bis +4 GB ein.

#Grenzen gegenüber der Cloud: Wo lokale Modelle nicht mehr mithalten

Seien wir ehrlich darüber, was lokale Modelle nicht so gut wie Claude Sonnet 4.6 oder GPT-5 leisten:

Kontextfenster
Ollama begrenzt num_ctx standardmäßig auf 4096 Tokens; je nach Modell lässt sich der Wert auf 32k oder sogar 128k erhöhen, allerdings auf Kosten des VRAM-Bedarfs. Cursor mit Sonnet in der Cloud verarbeitet 200k Tokens problemlos. Bei einem großen Monorepo liest das Cloud-Modell alles, während das lokale Modell auswählen muss.
Mehrstufiges Schlussfolgern
Ein Modell mit 9–14 Milliarden Parametern verliert den Überblick, wenn der Agent 10 Tool-Aufrufe mit Abhängigkeiten untereinander aneinanderreiht. Sonnet behält den roten Faden. Bei wirklich komplexer Agentenorchestrierung liegt die Cloud weiterhin vorne – und zwar mit großem Abstand.
Kenntnis neuerer APIs
Open-Weight-Modelle haben einen Wissensstichtag (häufig 2025) und kennen danach veröffentlichte APIs nicht. Cursor in der Cloud profitiert von kontinuierlichen Updates und Werkzeugen zur Websuche.
Latenz zum ersten Token
Paradoxerweise kann die Cloud schneller starten (kein Laden des Modells). Lokal bleibt das Modell zwischen zwei Aufrufen geladen – nach dem ersten Prompt liegt der Vorteil wieder auf der lokalen Seite.
Stromkosten
Eine RTX 4090 verbraucht unter Last 350 W. 8 Stunden intensives Programmieren pro Tag = ~70 kWh/Monat = ~15 € in Frankreich. Das liegt weiterhin deutlich unter 20 $/Monat für Cursor plus 50 $/Monat für Claude, ist aber nicht kostenlos.
i
Die pragmatische hybride Strategie
Der Ansatz, der sich in der Praxis bewährt: Ollama als Standard für die 80 % der alltäglichen Aufgaben (Code vervollständigen, erklären, kleinere Refactorings). Cloud-Modelle (Claude Sonnet oder GPT-5) bei Bedarf für die 20 %, die anspruchsvolles Schlussfolgern oder einen langen Kontext erfordern. Cursor unterstützt dies direkt über die Modellauswahl; bei Claude Code ermöglicht claude-code-router den Wechsel über /model während der Sitzung.

#Tipps und Fehlerbehebung

Cursor gibt "OpenAI API key invalid" zurück
Das Feld API Key muss einen Wert enthalten und darf nicht leer sein. Geben Sie ollama, sk-anything oder irgendeinen plausiblen Wert ein. Das ist reine Formsache: Ollama ignoriert den Header.
Cursor erkennt das Modell nicht
Der Modellname in Cursor (Add Model) muss EXAKT dem von ollama list ausgegebenen Namen entsprechen (einschließlich Tag, z. B. qwen3-coder:30b). Nicht nur qwen3-coder, auch nicht Qwen3 Coder.
Claude Code gerät in eine Schleife oder fragt erneut nach demselben
Oft scheitert das lokale Modell bei seinen Tool-Aufrufen. Prüfen Sie, ob das Modell Function Calling unterstützt (ollama show qwen3-coder:30b → suchen Sie unter capabilities nach tools). Wechseln Sie zu einem größeren Modell oder vereinfachen Sie die Aufgabe.
Abgebrochene Antworten nach 2–3 Sätzen
Standardwert für num_ctx = 4096. Für Claude Code und Cursor mit einem Codebase-Kontext erhöhen Sie den Wert auf 16384 oder 32768. Mit Ollama: Erstellen Sie ein benutzerdefiniertes Modelfile mit PARAMETER num_ctx 32768 und führen Sie ollama create coder-32k -f Modelfile aus. Der zusätzliche Speicherbedarf ist real (+ 2–4 GB für den KV-Cache).
VRAM voll, OOM
Prüfen Sie während der Nutzung ollama ps. Wenn Sie >100% loaded bei einer Aufteilung zwischen GPU und CPU sehen, wird ein Teil des Modells in den RAM ausgelagert und das Modell wird sehr langsam. Lösungen: stärkere Quantisierung (Q3_K_M), ein kleineres Modell oder num_ctx reduzieren.
Latenz > 5 s pro Antwort
Entweder wird ein Teil des Modells auf der CPU ausgeführt (siehe vorherigen Punkt), oder Ollama lädt das Modell bei jeder Anfrage neu. Prüfen Sie OLLAMA_KEEP_ALIVE (Standardwert: 5 Minuten). Setzen Sie OLLAMA_KEEP_ALIVE=2h, damit das Modell geladen bleibt.
→
Keine Kosten, aber nicht ohne Latenz
Ein lokales Coding-Modell ist nicht wie durch Zauberhand schneller als ein Cloud-Modell – es läuft einfach auf Ihrem Rechner. Auf einer RTX 4090 generiert qwen3-coder:30b (MoE, 3B aktive Parameter) ~60 Tokens/s, also eine durchschnittliche Antwort in ~2–3 Sekunden. Das ist mit Claude Sonnet vergleichbar. Auf einem Mac M3 Max oder einer RTX 3090 mit 24 GB sollten Sie eher mit 25–30 Tokens/s rechnen, also 5–7 Sekunden – spürbar, aber brauchbar.

#Weiterführende Informationen

Ollama stellt nun ein Coding-Modell für Cursor oder Claude Code bereit. Die naheliegenden nächsten Schritte:

Im Editor ergänzen (FIM inline)
Der Leitfaden „Kostenloser lokaler Copilot“ zeigt die Installation von Continue.dev / Tabby / CodeGeeX für die Inline-Codevervollständigung nach Copilot-Art – eine natürliche Ergänzung zum Chat in Cursor.
Die richtige Quantisierung wählen
Q4_K_M, Q5_K_M, Q8_0: Der Leitfaden „Die passende Quantisierung wählen“ vergleicht den tatsächlichen Qualitätsverlust bei Code-Modellen und erklärt, wann Q3 noch nutzbar ist.
Ein Code-Modell anpassen
Der Leitfaden „Ein Modell mit Ollama Modelfile anpassen“ zeigt, wie Sie num_ctx, den System-Prompt und die Temperatur festlegen, um ein auf Ihren Stack zugeschnittenes Coding-Modell zu erhalten.
Häufig gestellte Fragen
Kann Ollama wirklich mit Claude Code verwendet werden?+
Ja: Claude Code akzeptiert einen OpenAI-kompatiblen Endpunkt, und Ollama stellt einen unter localhost:11434/v1 bereit. Wenn Sie Claude Code auf diesen Endpunkt ausrichten (Abschnitt 2 dieses Leitfadens), gehen Ihre Anfragen an Ihren eigenen Rechner statt in die Cloud. Die Fähigkeiten hängen dann vom gewählten lokalen Modell ab — Qwen3-Coder 30B-A3B ist derzeit der beste Kompromiss zwischen Geschwindigkeit und Qualität.
Ollama + Claude Code: Ist das wirklich kostenlos?+
Ja: Ollama ist kostenlos, ebenso die Open-Weight-Modelle, und das Abonnement für 20 $/Monat entfällt. Die einzigen Kosten entstehen durch Ihre Hardware und den Strom. Ein nicht zu unterschätzender Vorteil: Ihr Code verlässt Ihren Rechner nie mehr.
Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.