🇺🇸 Laguna XS.2
MoE mit 33B/3B aktiven Parametern unter Apache 2.0, Spezialist für agentisches Programmieren. 68,2 % SWE-Bench Verified, 128k ctx. Läuft auf einem Mac mit 36 GB. Veröffentlichung am 28. April 2026.
ollama run laguna-xs.2
Rangliste aktualisiert am 09/10/2026
Rangliste der Open-Weights-LLM, die auf Codegenerierung, Refactoring und Autovervollständigung spezialisiert sind oder darin gute Leistungen erzielen. Wir bevorzugen Modelle, die anhand von HumanEval/MBPP evaluiert wurden, mit einem Kontext von ≥ 32k Tokens, um ganze Dateien abzudecken, und einer permissiven Lizenz.
⚡ Das vollständige Setup, das funktioniertCline + Aider + konfigurierte Modelfiles, in 30 Minuten einsatzbereit — das lokale Copilote-Paket →MoE mit 33B/3B aktiven Parametern unter Apache 2.0, Spezialist für agentisches Programmieren. 68,2 % SWE-Bench Verified, 128k ctx. Läuft auf einem Mac mit 36 GB. Veröffentlichung am 28. April 2026.
ollama run laguna-xs.2
Coding-Spezialist mit 24B unter Apache 2.0. 72,2 % SWE-Bench. 256k ctx, französisches Labor.
ollama run devstral-small2:24b
MoE mit 33 Milliarden Parametern / 3 Milliarden aktiven Parametern (Poolside), mehrsprachiges agentisches Programmieren. 256k Kontext, offene OpenMDW-Lizenz. Läuft auf einem Mac mit 43 GB. Veröffentlichung im Juni 2026.
ollama run laguna-xs-2.1
MoE 30B (3,3B aktive Parameter), spezialisiert auf agentisches Coding. Sehr schnell lokal, 256k nativer Kontext, die Referenz für 16–24 GB via Ollama.
ollama run qwen3-coder:30b
Ende 2024 die Referenz unter den Open-Weight-Modellen für Code, heute von der Generation Qwen3-Coder / Devstral überholt.
ollama run qwen2.5-coder:32b
Coder 14B. HumanEval 89,6, LiveCodeBench 37,1. Optimaler VRAM-Kompromiss für ein selbst gehostetes Code-Modell.
ollama run qwen2.5-coder:14b
Dichtes multimodales 27B-Modell, veröffentlicht am 22. April 2026. 262k ctx (1M YaRN). SWE-bench Verified 77.2%.
ollama run qwen3.6:27b
| Rang | Modell | Params | VRAM Q4 | Kontext | Lizenz |
|---|---|---|---|---|---|
| #1 | Laguna XS.2 | 33B | 19 GB | 131 072 | Apache 2.0 |
| #2 | Devstral Small 2 24B | 24B | 14 GB | 256 000 | Apache 2.0 |
| #3 | Laguna XS 2.1 | 33B | 19 GB | 256 000 | OpenMDW 1.1 |
| #4 | Qwen3-Coder 30B-A3B | 30B | 19 GB | 262 144 | Apache 2.0 |
| #5 | Qwen 2.5 Coder 32B | 32B | 19 GB | 131 072 | Apache 2.0 |
| #6 | Qwen 2.5 Coder 14B Instruct | 14B | 9 GB | 131 072 | Apache 2.0 |
| #7 | Qwen 3.6 27B | 27B | 16 GB | 262 144 | Apache 2.0 |
Zwei Optionen je nach benötigtem Speicher und Ihrer Software: Radeon RX 9070 XT 16 GB · GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) — Hardware für KI vergleichen →
Sie haben Ihr Modell. Jetzt gilt es, dieses in Ihrem Editor einzusetzen: Das Copilote-Local-Kit bindet es über Cline in VS Code ein (Kap. 7), über Aider im Terminal (Kap. 8) und für die Autovervollständigung während des Tippens (Kap. 9) – mit einem Modelfile, das auf genau dieses Modell abgestimmt ist (Kap. 11).
Kostenloses Memo
Memo erhalten VRAM → bestes Code-Modell → Ollama-Befehl (alles auf einem Bildschirm, zum Kopieren und Einfügen). Und wechseln Sie zum Kit Copilote Local, um daraus ein wirklich funktionierendes Setup zu machen.
Das Kit „Copilote Local“ — die Ollama- + Cline- + Aider-Configs zum direkten Einfügen, angepasste Modelfiles, Hilfe bei Problemen, lebenslanger Zugang zum Onlinebereich →Kein Spam. Abmeldung mit 1 Klick. Ihre Daten bleiben bei uns (werden nie weiterverkauft).
Ihre Karte → das beste Code-Modell für die lokale Ausführung und der exakte Ollama-Befehl:
| Ihr VRAM | Typische GPUs / Macs | Empfohlenes Code-Modell | Ollama-Befehl |
|---|---|---|---|
| 8 GB | RTX 4060 / 3060 · M1-M2 16 GB | Qwen 3.5 9B (Q4, 6,6 GB — 256k ctx) | ollama run qwen3.5:9b |
| 12 GB | RTX 3060 12 GB / 4070 / 5070 | Qwen 3.5 9B (Q8, 11 GB) oder Gemma 4 12B (7,6 GB) | ollama run qwen3.5:9b-q8_0 |
| 16 GB | RTX 5070 Ti / 4080 / 5080 · RX 9070 XT · M4 24 GB | Devstral 24B (Q4, 14 GB) — Code-Agent-Spezialist | ollama run devstral:24b |
| 24 GB | RTX 3090 / 4090 · RX 7900 XTX · M4 Pro 48 GB | Qwen 3.8 27B (Q4, 18 GB) — „nahe an Copilot“ | ollama run qwen3.8:27b |
| 32 GB | RTX 5090 | Qwen 3.6 35B-A3B (Q4, 23 GB) — schnelles MoE | ollama run qwen3.6:35b |
| 48 GB+ | Mac M4 Max 64 GB · M2 Ultra 128 GB | Qwen3-Coder 30B-A3B (Q8, 32 GB — 256k ctx) | ollama run qwen3-coder:30b-a3b-q8_0 |
-base : ollama run qwen2.5-coder:7b-base — das ist in diesem speziellen Fall immer noch der Referenzstandard. ⚠️ Qwen 3.8: sein Reasoning ist standardmäßig sehr hoch eingestellt, und es „denkt“ bei einfachen Anfragen zu viel nach — stellen Sie es auf low (oder schalten Sie es ab) beim ersten Start. ⚠️ Lizenzfalle: Codestral 22B = Mistral Non-Production License → zum Programmieren bei der Arbeit verboten. Qwen 3.5/3.8, Gemma 4 und Devstral sind unter Apache 2.0 lizenziert. 💡 Abstürze wegen Speicherproblemen? Halten Sie ca. 1,5 GB VRAM für den Kontext frei oder gehen Sie eine Quantisierungsstufe herunter.🔌 Zum Einbinden in VS Code: Cline (Agent für mehrere Dateien), Aider (CLI) oder Tabby/Twinny (FIM-Autovervollständigung) — alle verbinden sich lokal mit Ollama. Das Kit Lokaler Copilot — Configs zum Einfügen + getestetes Setup — ist verfügbar: /copilote-local.
Wir filtern nach Modellen, deren Tags „code“ enthalten und die höchstens 100B Parameter haben (darüber hinaus ist es nicht mehr „lokal“). Die Rangliste kombiniert: Code-Spezialisierung (der Name enthält „coder“, „codestral“, „devstral“ oder „laguna“), langen Kontext, eine permissive Lizenz und eine optimale Größe von 7–32B.
Berücksichtigte Kriterien:
Die Bewertung ist vollständig transparent: konsultieren Sie unsere Methodik für Details zur Berechnung des VRAM-Bedarfs und der Tokens pro Sekunde.
Welches Open-Source-LLM eignet sich 2026 am besten zum Programmieren?
Unsere Nr. 1 ist Laguna XS.2 (33B, Apache 2.0). Es kombiniert eine hohe Genauigkeit bei HumanEval, ein Kontextfenster von 131.072 Tokens und eine permissive Lizenz.
Wie viel VRAM benötigt man für einen guten LLM für Code?
Für ein 7B-Coder-Modell in Q4_K_M reichen 6–8 GB VRAM. Für ein 32B-Coder-Modell in Q4 planen Sie 20–24 GB (RTX 4090, 3090, 7900 XTX) ein. In Q5 oder Q8 steigt der Bedarf schnell an – nutzen Sie den Konfigurator.
Kann ich es kommerziell im Produktionsumfeld verwenden?
Ja, wenn die Lizenz Apache 2.0 oder MIT ist. Codestral steht unter Mistral Non-Production License — ausschließlich für persönliche Nutzung/Forschung. Qwen und DeepSeek sind frei.
Wie kann ein lokaler LLM in VS Code integriert werden?
Über die Erweiterung Cline, der sich an Ihren lokalen Server Ollama oder LM Studio anschließt. Aider funktioniert über die CLI für Multi-Datei-Refactoring.