🇨🇳 Qwen 3 14B
Dichtes 14B-Modell mit Hybrid-Thinking. Gleichauf mit Qwen 2.5 32B Base bei STEM/Code.
ollama run qwen3:14b
Ranking aktualisiert am 22.09.2026
Die Radeon RX 9070 (16 GB GDDR6, 644 GB/s) ist die jüngere Schwester der 9070 XT. Gleiche VRAM-Kapazität und Bandbreite, etwa 10 % weniger leistungsfähig. Neu etwa 550 €, eine hervorragende AMD-Option im Einstiegs- bis Mittelklassebereich.
Radeon RX 9070 : Kaufalternative für lokale KI verfügbar — Radeon RX 9070 XT 16 GB :
Warum diese Wahl? Unser vollständiger Artikel zur Radeon RX 9070 XT 16 GB →
Welchen PC sollten Sie je nach Budget wählen? Unsere Auswahl von 800 bis 3 500 € →
Affiliate-Links — QuelLLM kann bei Käufen eine Provision erhalten, ohne dass Ihnen Mehrkosten entstehen. Dies beeinflusst die unabhängig erstellte Rangliste nicht. Als Amazon-Partner verdient QuelLLM an qualifizierten Käufen.
Dichtes 14B-Modell mit Hybrid-Thinking. Gleichauf mit Qwen 2.5 32B Base bei STEM/Code.
ollama run qwen3:14b
14B-Reasoning-Modell unter MIT-Lizenz. Übertrifft R1-Distill-Llama-70B in Microsofts AIME-24/25-Evaluierungen mit einem Fünftel der Parameterzahl.
ollama run phi4-reasoning:14b
Hervorragende Reasoning-Fähigkeiten für seine Größe. STEM-orientiert.
ollama run phi4:14b
Coder 14B. HumanEval 89,6, LiveCodeBench 37,1. Optimaler VRAM-Kompromiss für ein selbst gehostetes Code-Modell.
ollama run qwen2.5-coder:14b
Aus R1 destilliertes Modell auf Basis von Qwen 14B. AIME24 69,7, MATH-500 93,9. Übertrifft o1-mini in vielen Benchmarks.
ollama run deepseek-r1:14b
Denses 14B-Modell unter Apache 2.0. MMLU 79,7, HumanEval 83,5. 29+ Sprachen. Guter Kompromiss.
ollama run qwen2.5:14b
Dense 8B Apache 2.0, 12 Sprachen inkl. FR, 131k ctx, GQA 32Q/8KV. MMLU 73.84, HumanEval 85.37. Veröffentlichung 29. April 2026.
# HuggingFace : ibm-granite/granite-4.1-8b
| Rang | Modell | Params | VRAM Q4 | Kontext | Lizenz | auf Radeon RX 9070 |
|---|---|---|---|---|---|---|
| #1 | Qwen 3 14B | 14B | 9 GB | 131 072 | Apache 2.0 | 6 tok/s · Q8 |
| #2 | Phi-4 Reasoning 14B | 14B | 9 GB | 32 768 | MIT | 6 tok/s · Q8 |
| #3 | Phi-4 14B | 14B | 9 GB | 16 384 | MIT | 6 tok/s · Q8 |
| #4 | Qwen 2.5 Coder 14B Instruct | 14B | 9 GB | 131 072 | Apache 2.0 | 6 tok/s · Q8 |
| #5 | DeepSeek R1 Distill Qwen 14B | 14B | 9 GB | 131 072 | MIT | 6 tok/s · Q8 |
| #6 | Qwen 2.5 14B Instruct | 14B | 9 GB | 131 072 | Apache 2.0 | 6 tok/s · Q8 |
| #7 | Granite 4.1 8B Instruct | 8B | 5 GB | 131 072 | Apache 2.0 | 12 Tok/s · FP16 |
Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.
Kostenloses Memo
Memo erhalten VRAM → bestes Code-Modell → Ollama-Befehl (alles auf einem Bildschirm, zum Kopieren und Einfügen). Und wechseln Sie zum Kit Copilote Local, um daraus ein wirklich funktionierendes Setup zu machen.
Das Kit „Copilote Local“ — die Ollama- + Cline- + Aider-Configs zum direkten Einfügen, angepasste Modelfiles, Hilfe bei Problemen, lebenslanger Zugang zum Onlinebereich →Kein Spam. Abmeldung mit 1 Klick. Ihre Daten bleiben bei uns (werden nie weiterverkauft).
Ihre Karte → das beste Code-Modell für die lokale Ausführung und der exakte Ollama-Befehl:
| Ihr VRAM | Typische GPUs / Macs | Empfohlenes Code-Modell | Ollama-Befehl |
|---|---|---|---|
| 8 GB | RTX 4060 / 3060 · M1-M2 16 GB | Qwen 3.5 9B (Q4, 6,6 GB — 256k ctx) | ollama run qwen3.5:9b |
| 12 GB | RTX 3060 12 GB / 4070 / 5070 | Qwen 3.5 9B (Q8, 11 GB) oder Gemma 4 12B (7,6 GB) | ollama run qwen3.5:9b-q8_0 |
| 16 GB | RTX 5070 Ti / 4080 / 5080 · RX 9070 XT · M4 24 GB | Devstral 24B (Q4, 14 GB) — Code-Agent-Spezialist | ollama run devstral:24b |
| 24 GB | RTX 3090 / 4090 · RX 7900 XTX · M4 Pro 48 GB | Qwen 3.8 27B (Q4, 18 GB) — „nahe an Copilot“ | ollama run qwen3.8:27b |
| 32 GB | RTX 5090 | Qwen 3.6 35B-A3B (Q4, 23 GB) — schnelles MoE | ollama run qwen3.6:35b |
| 48 GB+ | Mac M4 Max 64 GB · M2 Ultra 128 GB | Qwen3-Coder 30B-A3B (Q8, 32 GB — 256k ctx) | ollama run qwen3-coder:30b-a3b-q8_0 |
-base : ollama run qwen2.5-coder:7b-base — das ist in diesem speziellen Fall immer noch der Referenzstandard. ⚠️ Qwen 3.8: sein Reasoning ist standardmäßig sehr hoch eingestellt, und es „denkt“ bei einfachen Anfragen zu viel nach — stellen Sie es auf low (oder schalten Sie es ab) beim ersten Start. ⚠️ Lizenzfalle: Codestral 22B = Mistral Non-Production License → zum Programmieren bei der Arbeit verboten. Qwen 3.5/3.8, Gemma 4 und Devstral sind unter Apache 2.0 lizenziert. 💡 Abstürze wegen Speicherproblemen? Halten Sie ca. 1,5 GB VRAM für den Kontext frei oder gehen Sie eine Quantisierungsstufe herunter.🔌 Zum Einbinden in VS Code: Cline (Agent für mehrere Dateien), Aider (CLI) oder Tabby/Twinny (FIM-Autovervollständigung) — alle verbinden sich lokal mit Ollama. Das Kit Lokaler Copilot — Configs zum Einfügen + getestetes Setup — ist verfügbar: /copilote-local.
Filter: Q4_K_M ≤ 14 GB. Bonus für 7-14B und 13-24B. 644 GB/s + ROCm 6.
Berücksichtigte Kriterien:
Die Bewertung ist vollständig transparent: konsultieren Sie unsere Methodik für Details zur Berechnung des VRAM-Bedarfs und der Tokens pro Sekunde.
RX 9070 vs 9070 XT?
Dieselben 16 GB + 644 GB/s. XT = ~10 % mehr CUDA-Kerne. Der Unterschied ist für LLMs marginal. Bevorzugen Sie die günstigere Karte. Siehe RX 9070 XT.
RX 9070 gegen RTX 5070?
9070 = 16 GB + 644 GB/s GDDR6 vs. 5070 = 12 GB + 672 GB/s GDDR7. AMD bietet 4 GB mehr VRAM (24B-Modelle nutzbar). NVIDIA ist bei 12 GB etwas schneller. Siehe RTX 5070.
ROCm 6 im Vergleich zu CUDA bei Ollama?
Ollama 0.x unterstützt beide. Mit Ollama erreicht die RX 9070 bei Mistral 7B Q4 ≈ 80–85 % der Leistung einer RTX 5070. Akzeptabel. Siehe guide.
LLM-Sweet-Spot für die 9070?
Mistral Small 24B Q4 (~13 GB) bei 22 Tok/s, Qwen 3 14B Q5 (~10 GB) bei 35 Tok/s.
Vertiefen Sie Ihr Wissen mit unseren detaillierten Direktvergleichen der Finalisten: