Startseite › Katalog › Bestes lokales LLM zum Coden 2026

Bestes lokales LLM zum Coden 2026

Rangliste aktualisiert am 09/10/2026

Rangliste der Open-Weights-LLM, die auf Codegenerierung, Refactoring und Autovervollständigung spezialisiert sind oder darin gute Leistungen erzielen. Wir bevorzugen Modelle, die anhand von HumanEval/MBPP evaluiert wurden, mit einem Kontext von ≥ 32k Tokens, um ganze Dateien abzudecken, und einer permissiven Lizenz.

⚡ Das vollständige Setup, das funktioniertCline + Aider + konfigurierte Modelfiles, in 30 Minuten einsatzbereit — das lokale Copilote-Paket →

Rangliste

1

🇺🇸 Laguna XS.2

Poolside · 33 Milliarden Parameter · Apache 2.0 · Kontext: 131 072 Tokens

MoE mit 33B/3B aktiven Parametern unter Apache 2.0, Spezialist für agentisches Programmieren. 68,2 % SWE-Bench Verified, 128k ctx. Läuft auf einem Mac mit 36 GB. Veröffentlichung am 28. April 2026.

Warum dieser Rang Auf Code spezialisiertes Modell, Kontext von 131.072 Tokens. Freie Lizenz, die kommerzielle Nutzung erlaubt.
ollama run laguna-xs.2
VRAM Q4
19 GB
35 GB bei Q8-Quantisierung
2

🇫🇷 Devstral Small 2 24B

Mistral AI · 24 Milliarden Parameter · Apache 2.0 · 256 000 Tokens ctx

Coding-Spezialist mit 24B unter Apache 2.0. 72,2 % SWE-Bench. 256k ctx, französisches Labor.

Warum dieser Rang Auf Code spezialisiertes Modell, Kontext mit 256.000 Tokens. Freie Lizenz für kommerzielle Nutzung.
ollama run devstral-small2:24b
VRAM Q4
14 GB
26 GB in Q8
3

🇺🇸 Laguna XS 2.1

Poolside · 33 Milliarden Parameter · OpenMDW 1.1 · 256 000 Tokens ctx

MoE mit 33 Milliarden Parametern / 3 Milliarden aktiven Parametern (Poolside), mehrsprachiges agentisches Programmieren. 256k Kontext, offene OpenMDW-Lizenz. Läuft auf einem Mac mit 43 GB. Veröffentlichung im Juni 2026.

Warum dieser Rang Spezialmodell für Code, Kontextgröße 256.000 Tokens. Lizenzprüfung für die Produktionsnutzung erforderlich.
ollama run laguna-xs-2.1
VRAM Q4
19 GB
35 GB bei Q8-Quantisierung
4

🇨🇳 Qwen3-Coder 30B-A3B

Alibaba · 30B Parameter · Apache 2.0 · 262 144 tokens ctx

MoE 30B (3,3B aktive Parameter), spezialisiert auf agentisches Coding. Sehr schnell lokal, 256k nativer Kontext, die Referenz für 16–24 GB via Ollama.

Warum dieser Rang Auf Code spezialisiertes Modell, Kontextfenster mit 262.144 Tokens. Freie Lizenz, die kommerzielle Nutzung erlaubt.
ollama run qwen3-coder:30b
VRAM Q4
19 GB
35 GB bei Q8-Quantisierung
5

🇨🇳 Qwen 2.5 Coder 32B

Alibaba · 32 Milliarden Parameter · Apache 2.0 · Kontext: 131 072 Tokens

Ende 2024 die Referenz unter den Open-Weight-Modellen für Code, heute von der Generation Qwen3-Coder / Devstral überholt.

Warum dieser Rang Auf Code spezialisiertes Modell, Kontext von 131.072 Tokens. Freie Lizenz, die kommerzielle Nutzung erlaubt.
ollama run qwen2.5-coder:32b
VRAM Q4
19 GB
35 GB bei Q8-Quantisierung
6

🇨🇳 Qwen 2.5 Coder 14B Instruct

Alibaba · 14 Mrd. Parameter · Apache 2.0 · Kontext: 131 072 Tokens

Coder 14B. HumanEval 89,6, LiveCodeBench 37,1. Optimaler VRAM-Kompromiss für ein selbst gehostetes Code-Modell.

Warum dieser Rang Auf Code spezialisiertes Modell, Kontext von 131.072 Tokens. Freie Lizenz, die kommerzielle Nutzung erlaubt.
ollama run qwen2.5-coder:14b
VRAM Q4
9 GB
16 GB in Q8
7

🇨🇳 Qwen 3.6 27B

Alibaba · 27B Parameter · Apache 2.0 · 262 144 tokens ctx

Dichtes multimodales 27B-Modell, veröffentlicht am 22. April 2026. 262k ctx (1M YaRN). SWE-bench Verified 77.2%.

Warum dieser Rang Auf Code spezialisiertes Modell, Kontextfenster mit 262.144 Tokens. Freie Lizenz, die kommerzielle Nutzung erlaubt.
ollama run qwen3.6:27b
VRAM Q4
16 GB
29 GB in Q8

Vergleichstabelle

Rang Modell Params VRAM Q4 Kontext Lizenz
#1 Laguna XS.2 33B 19 GB 131 072 Apache 2.0
#2 Devstral Small 2 24B 24B 14 GB 256 000 Apache 2.0
#3 Laguna XS 2.1 33B 19 GB 256 000 OpenMDW 1.1
#4 Qwen3-Coder 30B-A3B 30B 19 GB 262 144 Apache 2.0
#5 Qwen 2.5 Coder 32B 32B 19 GB 131 072 Apache 2.0
#6 Qwen 2.5 Coder 14B Instruct 14B 9 GB 131 072 Apache 2.0
#7 Qwen 3.6 27B 27B 16 GB 262 144 Apache 2.0

Zwei Optionen je nach benötigtem Speicher und Ihrer Software: Radeon RX 9070 XT 16 GB · GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) — Hardware für KI vergleichen →

Das Kit „Copilote Local“

Sie haben Ihr Modell. Jetzt gilt es, dieses in Ihrem Editor einzusetzen: Das Copilote-Local-Kit bindet es über Cline in VS Code ein (Kap. 7), über Aider im Terminal (Kap. 8) und für die Autovervollständigung während des Tippens (Kap. 9) – mit einem Modelfile, das auf genau dieses Modell abgestimmt ist (Kap. 11).

  • Lebenslanger Online-Zugang
  • PDF + Dateien
  • Lebenslange Updates

Kostenloses Memo

Welches Code-Modell lässt sich auf IHREM Rechner ausführen?

Memo erhalten VRAM → bestes Code-Modell → Ollama-Befehl (alles auf einem Bildschirm, zum Kopieren und Einfügen). Und wechseln Sie zum Kit Copilote Local, um daraus ein wirklich funktionierendes Setup zu machen.

Das Kit „Copilote Local“ — die Ollama- + Cline- + Aider-Configs zum direkten Einfügen, angepasste Modelfiles, Hilfe bei Problemen, lebenslanger Zugang zum Onlinebereich →

Kein Spam. Abmeldung mit 1 Klick. Ihre Daten bleiben bei uns (werden nie weiterverkauft).

Methodik des Rankings

Wir filtern nach Modellen, deren Tags „code“ enthalten und die höchstens 100B Parameter haben (darüber hinaus ist es nicht mehr „lokal“). Die Rangliste kombiniert: Code-Spezialisierung (der Name enthält „coder“, „codestral“, „devstral“ oder „laguna“), langen Kontext, eine permissive Lizenz und eine optimale Größe von 7–32B.

Berücksichtigte Kriterien:

  • HumanEval / MBPP
  • Kontext ≥ 32k Tokens
  • Permissive Lizenz
  • IDE-Unterstützung (Cline, Aider)

Die Bewertung ist vollständig transparent: konsultieren Sie unsere Methodik für Details zur Berechnung des VRAM-Bedarfs und der Tokens pro Sekunde.

Häufige Fragen

Welches Open-Source-LLM eignet sich 2026 am besten zum Programmieren?

Unsere Nr. 1 ist Laguna XS.2 (33B, Apache 2.0). Es kombiniert eine hohe Genauigkeit bei HumanEval, ein Kontextfenster von 131.072 Tokens und eine permissive Lizenz.

Wie viel VRAM benötigt man für einen guten LLM für Code?

Für ein 7B-Coder-Modell in Q4_K_M reichen 6–8 GB VRAM. Für ein 32B-Coder-Modell in Q4 planen Sie 20–24 GB (RTX 4090, 3090, 7900 XTX) ein. In Q5 oder Q8 steigt der Bedarf schnell an – nutzen Sie den Konfigurator.

Kann ich es kommerziell im Produktionsumfeld verwenden?

Ja, wenn die Lizenz Apache 2.0 oder MIT ist. Codestral steht unter Mistral Non-Production License — ausschließlich für persönliche Nutzung/Forschung. Qwen und DeepSeek sind frei.

Wie kann ein lokaler LLM in VS Code integriert werden?

Über die Erweiterung Cline, der sich an Ihren lokalen Server Ollama oder LM Studio anschließt. Aider funktioniert über die CLI für Multi-Datei-Refactoring.

Weiterführende Informationen

Die QuelLLM-Pakete Der maßgebliche Leitfaden für jeden Anwendungsfall
Alle Kits lebenslang — 49 €