Bester lokaler LLM zum Programmieren: Devstral, Qwen3-Coder
Die Frage nach dem besten lokalen LLM zum Programmieren im Jahr 2026 ist keine rhetorische Frage mehr: Devstral, Qwen3-Coder und die neue Generation Qwen 3.5 / 3.8 konkurrieren inzwischen ernsthaft mit Cloud-Assistenten, auch bei agentenbasierten Aufgaben. Dieser Leitfaden vergleicht die verfügbaren Open-Weight-Modelle zum Programmieren, ihren VRAM-Bedarf und die tatsächliche Qualität ihrer generierten Ergebnisse und gibt eine klare Empfehlung je nach Ihrer GPU. Keine abstrakte Rangliste: konkrete Empfehlungen für den Rechner, der Ihnen zur Verfügung steht.
#Warum 2026 einen lokalen LLM zum Programmieren nutzen?
Das Programmieren mit einem KI-Assistenten ist zur Gewohnheit geworden. Doch proprietären Code, Geheimnisse, interne Pfade oder schlicht geistiges Eigentum an einen Cloud-Dienst zu senden, bleibt ein Problem – für Freiberufler mit Geheimhaltungsvereinbarung, für Unternehmen, die der DSGVO unterliegen, und für Solo-Entwickler, die einfach die Kontrolle behalten wollen.
Die gute Nachricht: Seit 2025 haben Open-Weight-Modelle für Programmieraufgaben einen großen Teil ihres Rückstands aufgeholt. Devstral erreicht SWE-bench-Werte auf dem Niveau der besten Cloud-Modelle, Qwen3-Coder kann beim Refactoring mit Claude mithalten, und selbst Qwen 3.5 9B auf einer RTX 3060 leistet im Alltag nützliche Arbeit. Die Kosten für den Hardware-Einstieg sind gesunken, die Qualität ist gestiegen.
#Gute Auswahlkriterien
Devstral oder Qwen3-Coder: Ihre Wahl steht fest. Das Local Copilot-Kit bringt das gewählte Modell in dreißig Minuten zum Laufen (Kap. 2), prüft, ob es zu Ihrem Videospeicher passt (Kap. 5), und lässt Sie Ihren Rechner vermessen, statt sich auf das Datenblatt zu verlassen (Kap. 18).
- Lebenslanger Online-Zugang
- PDF + Dateien
- Erstattung binnen 30 Tagen
Ein Benchmark auf dem Leaderboard sagt nicht alles. Für den tatsächlichen Einsatz ist Folgendes entscheidend.
- Qualität des generierten Codes
- Fähigkeit, einen Patch zu schreiben, der kompiliert und die Tests besteht, statt nur Code, der „richtig aussieht“. HumanEval/MBPP geben einen Anhaltspunkt; SWE-bench Verified ist repräsentativer für reale Aufgaben.
- Unterstützung des Fill-in-the-Middle (FIM)
- Unverzichtbar für die automatische Vervollständigung in der IDE. Nicht alle Modelle unterstützen dies — Devstral ist hier schwach, und für reines FIM bleibt qwen2.5-coder:7b-base die Referenz für 2026.
- Kontextfenster
- Um eine Datei mit 2000 Zeilen oder ein ganzes Projekt zu verstehen, sollten Sie mit mindestens 32.000 Tokens rechnen. Qwen3-Coder unterstützt bis zu 256.000, Devstral bis zu 128.000 Tokens.
- Inferenzgeschwindigkeit
- Ein dichtes 30B-Modell erzeugt auf einer RTX 4090 15–25 Tokens/s. Ein MoE wie Qwen3-Coder 30B-A3B erzeugt bei gleichwertiger Qualität 60–80 Tokens/s – dieser Unterschied erleichtert die Arbeit an der Tastatur enorm.
- Lizenz
- Apache 2.0 und MIT erlauben Ihnen die kommerzielle Nutzung ohne Probleme. Vorsicht bei Codestral (nicht kommerziell) oder älteren Code-Llama-Modellen (restriktive Meta-Lizenz).
- Unterstützte Programmiersprachen
- Die meisten guten Modelle kommen mit Python, JS/TS, Go, Rust, Java und C/C++ gut zurecht. Für PHP, Ruby oder Swift prüfen Sie die Benchmarks für die jeweilige Programmiersprache.
#Devstral, der Spezialist für agentische Systeme (Mistral AI)
Devstral ist das Code-Modell von Mistral, speziell für die Arbeit mit Agenten trainiert – also mit einem Agenten wie Aider, OpenHands oder SWE-agent, der den Code iterativ bearbeitet, Tests ausführt, die Ausgabe liest und Korrekturen vornimmt. Auf SWE-bench Verified zählt Devstral Small zu den besten Open-Weight-Modellen und erreicht einen Rang, der vor einem Jahr noch unerreichbar gewesen wäre.
- Empfohlene Variante
- Devstral Small (~24B, dichte Architektur). Apache 2.0. Verfügbar auf Hugging Face und Ollama.
- VRAM in Q4_K_M
- Etwa 14 GB. Passt problemlos auf eine RTX 4080 mit 16 GB oder einen Mac der M-Serie mit 24 GB. Mit 12 GB bei reduziertem Kontext möglich, aber knapp.
- Kontextfenster
- 128k Tokens. Mehr als ausreichend, um ein mittelgroßes Repository einzulesen.
- Stärke
- Hervorragend für mehrstufige agentenbasierte Workflows: einen Bugreport lesen, im Code navigieren, einen Patch schreiben, die Tests zum Bestehen bringen.
- Schwäche
- Nicht für FIM (zeilenweise Autovervollständigung) konzipiert. Wenn Sie das Modell in Continue.dev zur Vervollständigung verwenden möchten, wechseln Sie für diesen Teil zu qwen2.5-coder:7b-base.
#Qwen3-Coder, das Allrounder-Tool (Alibaba)
Qwen3-Coder ist die 2025er-Generation der Coder-Familie von Alibaba und nutzt eine Mixture-of-Experts-Architektur (MoE). Viele betrachten es 2026 als das führende Open-Weight-Modell für die Codegenerierung, über alle Formate hinweg. Verfügbar unter der Apache-2.0-Lizenz.
- Variante für ein breites Publikum
- Qwen3-Coder 30B-A3B: insgesamt 30 Milliarden Parameter, aber nur 3 Milliarden pro Token aktiviert. In der Praxis liefert das die Qualität eines dichten Modells mit 14–22 Milliarden Parametern bei der Geschwindigkeit eines Modells mit 3 Milliarden Parametern.
- VRAM in Q4_K_M
- Etwa 18 GB für die 30B-A3B. Passt genau auf eine RTX 4090 mit 24 GB oder auf einen Mac mit M-Pro/M-Max und 24–32 GB Speicher.
- Frontier-Variante
- Qwen3-Coder 480B-A35B. Beim Programmieren auf dem Niveau von Claude/GPT-5, aber nur auf Mac Studio Ultra mit 256–512 GB oder Multi-GPU-Setups mit H100 nutzbar.
- Kontext
- Nativ 256k Tokens, erweiterbar. Sie können tatsächlich ein ganzes Repository hineinkopieren.
- Stärken
- Hervorragend beim Refactoring über mehrere Dateien hinweg, kommt gut mit „Nischen“-Programmiersprachen (Elixir, Zig, OCaml) zurecht, ist sehr gut bei agentenbasierten Aufgaben und dank MoE außergewöhnlich schnell.
- Schwäche
- Das 30B-A3B bleibt ein MoE-Modell: Wenn Ihr VRAM knapp ist, macht sich der zusätzliche Speicherbedarf gegenüber einem dichten 9B-Modell bemerkbar. Bleiben Sie bei 12 GB bei einem Qwen 3.5 9B (bei Bedarf in Q8).
#Qwen 3.5, die verlässliche Wahl für kleine Konfigurationen
Die Qwen-3.5-Familie (2B, 4B, 9B) ist 2026 die vielseitigste Option für Rechner mit bescheidener Ausstattung. Apache 2.0, großer Kontext (bis zu 256k), multimodal bei mittleren Modellgrößen und in Varianten verfügbar, die in 4 bis 12 GB VRAM passen. Für die reine Inline-Autovervollständigung (FIM) führen wir qwen2.5-coder:7b-base separat weiter, das für diesen speziellen Anwendungsfall nach wie vor die Referenz ist.
- Qwen 3.5 4B
- VRAM bei Q4 ≈ 3,4 GB (ollama run qwen3.5:4b). Ideal für RTX 3060 mit 8 GB, RTX 4060 und MacBook Air der M-Serie mit 16 GB. Das neue kleine Standardmodell, ordentlich bei Code-Chats.
- Qwen 3.5 9B
- VRAM in Q4 ≈ 6,6 GB (ollama run qwen3.5:9b). DIE Wahl für 8 GB im Jahr 2026: 256k Kontextlänge, Bildverarbeitung, deutlich höhere Qualität als das 4B-Modell. Das Modell für den täglichen Einsatz auf Karten mit 8–12 GB.
- Qwen 3.5 9B in Q8
- VRAM ≈ 11 GB (ollama run qwen3.5:9b-q8_0). Die höchste Qualität in dieser Größenklasse, passend für 12 GB VRAM (RTX 3060 12 GB, RTX 4070).
- Autovervollständigung (FIM)
- Qwen2.5-Coder 7B base bleibt 2026 DIE Referenz für FIM: ollama run qwen2.5-coder:7b-base (≈ 4,7 GB). Für tabAutocomplete in VS Code (Continue.dev, Tabby) beibehalten.
#Bedeutende Alternativen
- gpt-oss 20B (OpenAI)
- Open-Weight-Modell von OpenAI, in MXFP4 quantisiert, sehr schnell, mit einem Kontextfenster von 131.000 Tokens. VRAM ≈ 14 GB (ollama run gpt-oss:20b). Guter Kompromiss bei 16 GB, wenn Sie ein schnell reagierendes Allround-Modell mit Schwerpunkt auf Code möchten.
- GLM 4.7 Flash (Zhipu AI)
- MoE 30B-A3B, MIT-Lizenz, ≈ 19 GB in Q4 (ollama run glm-4.7-flash). Sehr stark bei technischen Chats, beim Debugging und beim Einsatz als Agent. Sinnvoll, wenn Sie Französisch und Code kombinieren — die Erklärungen werden dabei ganz natürlich auf Französisch formuliert.
- Mistral Small 24B
- Dichtes Allzweckmodell, ≈ 14 GB in Q4 (ollama run mistral-small). Gut auf Französisch, als Ergänzung für Dokumentation und Erklärungen auf einem System mit 16 GB nützlich.
- Codestral 22B (Mistral)
- Technisch in Ordnung, aber unter der Mistral-Non-Production-Lizenz: in Arbeitsumgebungen verboten. Außer für rein persönliche Zwecke oder für die Forschung ausschließen.
- DeepSeek-Coder V2, Code Llama, StarCoder 2
- Diese Basismodelle aus den Jahren 2023–2024 werden qualitativ von allen zuvor genannten Modellen übertroffen. Überspringen: Ein Qwen 3.5 9B oder ein Granite 4.2 8B liefert bessere Ergebnisse und benötigt weniger VRAM.
#Welches Modell wählen Sie je nach Ihrer GPU?
Pragmatische Empfehlung je nach verfügbarem VRAM. Die genannten Modelle sind in Q4_K_M quantisiert, dem besten Kompromiss zwischen Qualität und Speicherbedarf für Code.
- 8 GB (RTX 3060 8 GB, 4060, 5050, 5060)
- Qwen 3.5 9B (256k Kontext, Bildverarbeitung). Bereits sehr gut für Autovervollständigung und technische Chats nutzbar. Für reines FIM fügen Sie qwen2.5-coder:7b-base hinzu. Kontext 16–32k.
- 12 GB (RTX 3060 12 GB, 4070, 5070)
- Qwen 3.5 9B in Q8 (11 GB) im täglichen Gebrauch, oder Gemma 4 12B (7,6 GB, multimodal). Devstral in Q4 funktioniert mit reduziertem Kontext.
- 16 GB (RTX 4080, 4070 Ti Super, 5070 Ti, 5080)
- Devstral 24B für agentenbasierte Aufgaben, gpt-oss 20B oder Mistral Small 24B als Allrounder und qwen2.5-coder:7b-base für FIM. Das ist die erste Konfiguration, bei der Sie wirklich die Wahl haben.
- 24 GB (RTX 3090, 4090, RX 7900 XTX)
- Qwen3-Coder 30B-A3B (Code) oder Qwen 3.8 27B (Allrounder, einem Copilot am ähnlichsten) als Modell für den täglichen Einsatz. Devstral als Reserve für agentische Aufgaben, GLM 4.7 Flash für Agenten. Mit dieser Konfiguration können lokale Modelle im Alltag mit Cloud-Modellen mithalten.
- 32 GB (RTX 5090) oder Mac M-Serie mit 36 bis 48 GB
- Qwen3-Coder 30B-A3B in Q8 (32 GB) oder Qwen 3.6 35B-A3B (23 GB, schnelles MoE-Modell, die bewährte Wahl in dieser Klasse). Sehr komfortable Nutzung, Kontextfenster von 128k und mehr. Ziel ist Spitzenleistung ohne Kompromisse.
- Mac Studio Ultra 128 GB+
- Qwen3-Coder 30B-A3B in Q8 mit voller Qualität und dem vollständigen 256k-Kontext, oder die Frontier-Varianten von Qwen3-Coder (480B-A35B), wenn Sie das Niveau von API-Modellen anstreben. Das ist die einzige zugängliche Möglichkeit außerhalb eines Rechenzentrums, ein Frontier-Coding-Modell lokal zu betreiben.
#Alles in VS Code einbinden
Der einfachste Weg: Ollama lauscht auf http://localhost:11434, und Continue.dev (VS Code-Erweiterung) kann diesen Endpoint nativ nutzen. Hier ist eine minimale Konfiguration, die qwen2.5-coder:7b-base für die Autovervollständigung (schnell, FIM) und Qwen3-Coder für den Chat (leistungsfähig) kombiniert.
Bei agentenbasierten Workflows (Refactoring über mehrere Dateien hinweg, Fehlerbehebung) spielt Aider in der CLI besonders in Kombination mit Devstral seine Stärken aus:
#Tipps und häufige Fallstricke
- Standardmäßig zu kurzes Kontextfenster in Ollama
- Ollama begrenzt den Kontext standardmäßig auf 2048 Tokens. Für Code ist das lächerlich. Konfigurieren Sie num_ctx über ein Modelfile oder über die Einstellungen von Continue.dev und erhöhen Sie den Kontext auf mindestens 16k oder 32k.
- FIM vs. Chat – verwechseln Sie die beiden nicht
- Devstral und Qwen3-Coder sind nicht für FIM optimiert. Wenn Sie sie zur Autovervollständigung einsetzen, erhalten Sie seltsame Ergebnisse (Antworten im Chat-Stil mitten in einer Funktion). Verwenden Sie für tabAutocomplete immer ein FIM-taugliches Modell (qwen2.5-coder:7b-base).
- Zu aggressive Quantisierung
- Bei Code verschlechtern Q3 und niedrigere Quantisierungsstufen die Qualität sichtbar (fehlerhafte Syntax, erfundene Bezeichner). Bleiben Sie mindestens bei Q4_K_M. Q5_K_M, wenn Sie genügend VRAM haben.
- Leistung, die nach einigen Minuten zusammenbricht
- Ollama entlädt inaktive Modelle nach 5 Minuten. Wenn Sie mit Unterbrechungen programmieren, starten Sie Ollama mit OLLAMA_KEEP_ALIVE=1h, damit das Modell geladen bleibt.
- Modell, das immer auf Englisch antwortet
- Fügen Sie in Continue.dev oder im Modelfile einen System-Prompt hinzu: „Antworte immer auf Französisch, Code und Kommentare auf Englisch.“ Qwen 3.5 / 3.8 und Devstral befolgen diese Anweisung ohne Weiteres.
- Qwen 3.8 27B, das zu viel nachdenkt
- Mit der Standardeinstellung für das Reasoning neigt Qwen 3.8 27B dazu, bei einfachen Aufgaben zu lange nachzudenken und die Latenz zu erhöhen. Stellen Sie für das tägliche Programmieren den Reasoning-Aufwand auf low (oder deaktivieren Sie das Thinking): So reagiert das Modell schneller, ohne nennenswerte Einbußen bei üblichen Aufgaben.
#Weiterführende Informationen
Sie haben Ihr Modell zum Programmieren ausgewählt, und es läuft. Hier sind einige Anregungen, um noch weiterzugehen:
- Lokaler Copilot mit Continue.dev
- Der ausführliche Leitfaden zum Einrichten von Continue.dev in VS Code mit Ollama, separaten Modellen für Autovervollständigung und Chat sowie Tastenkombinationen.
- Ollama in Claude Code und Cursor verwenden
- Um Devstral oder Qwen3-Coder über den OpenAI-kompatiblen Endpunkt von Ollama in Cursor oder Claude Code einzubinden und diese hochwertigen IDEs ohne Cloud zu nutzen.
- Quantisierung wählen (Q4, Q5, Q8, FP16)
- Um genau zu verstehen, was Sie beim Wechsel von Q4_K_M zu Q5_K_M bei einem Code-Modell verlieren oder gewinnen und wann eine höhere Quantisierungspräzision sinnvoll ist.
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.