🇨🇳 Qwen 3 14B
Dichtes 14B-Modell mit Hybrid-Thinking. Gleichauf mit Qwen 2.5 32B Base bei STEM/Code.
ollama run qwen3:14b
Ranking aktualisiert am 22.09.2026
Die RTX 4070 Ti Super (16 GB GDDR6X, 672 GB/s) hat den VRAM der 4070 Ti verdoppelt. Ideal, um Modelle mit 24B in Q4 auszuführen, ohne auf die 4080 umzusteigen.
RTX 4070 Ti Super : Kaufalternative für lokale KI verfügbar — RTX 5070 Ti 16 GB :
Welchen PC sollten Sie je nach Budget wählen? Unsere Auswahl von 800 bis 3 500 € →
Affiliate-Links — QuelLLM kann bei Käufen eine Provision erhalten, ohne dass Ihnen Mehrkosten entstehen. Dies beeinflusst die unabhängig erstellte Rangliste nicht. Als Amazon-Partner verdient QuelLLM an qualifizierten Käufen.
Dichtes 14B-Modell mit Hybrid-Thinking. Gleichauf mit Qwen 2.5 32B Base bei STEM/Code.
ollama run qwen3:14b
14B-Reasoning-Modell unter MIT-Lizenz. Übertrifft R1-Distill-Llama-70B in Microsofts AIME-24/25-Evaluierungen mit einem Fünftel der Parameterzahl.
ollama run phi4-reasoning:14b
Hervorragende Reasoning-Fähigkeiten für seine Größe. STEM-orientiert.
ollama run phi4:14b
Coder 14B. HumanEval 89,6, LiveCodeBench 37,1. Optimaler VRAM-Kompromiss für ein selbst gehostetes Code-Modell.
ollama run qwen2.5-coder:14b
Aus R1 destilliertes Modell auf Basis von Qwen 14B. AIME24 69,7, MATH-500 93,9. Übertrifft o1-mini in vielen Benchmarks.
ollama run deepseek-r1:14b
Denses 14B-Modell unter Apache 2.0. MMLU 79,7, HumanEval 83,5. 29+ Sprachen. Guter Kompromiss.
ollama run qwen2.5:14b
Dense 8B Apache 2.0, 12 Sprachen inkl. FR, 131k ctx, GQA 32Q/8KV. MMLU 73.84, HumanEval 85.37. Veröffentlichung 29. April 2026.
# HuggingFace : ibm-granite/granite-4.1-8b
| Rang | Modell | Params | VRAM Q4 | Kontext | Lizenz | Auf der RTX 4070 Ti Super |
|---|---|---|---|---|---|---|
| #1 | Qwen 3 14B | 14B | 9 GB | 131 072 | Apache 2.0 | 20 tok/s · Q8 |
| #2 | Phi-4 Reasoning 14B | 14B | 9 GB | 32 768 | MIT | 20 tok/s · Q8 |
| #3 | Phi-4 14B | 14B | 9 GB | 16 384 | MIT | 20 tok/s · Q8 |
| #4 | Qwen 2.5 Coder 14B Instruct | 14B | 9 GB | 131 072 | Apache 2.0 | 20 tok/s · Q8 |
| #5 | DeepSeek R1 Distill Qwen 14B | 14B | 9 GB | 131 072 | MIT | 20 tok/s · Q8 |
| #6 | Qwen 2.5 14B Instruct | 14B | 9 GB | 131 072 | Apache 2.0 | 20 tok/s · Q8 |
| #7 | Granite 4.1 8B Instruct | 8B | 5 GB | 131 072 | Apache 2.0 | 35 tok/s · FP16 |
Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.
Kostenloses Memo
Memo erhalten VRAM → bestes Code-Modell → Ollama-Befehl (alles auf einem Bildschirm, zum Kopieren und Einfügen). Und wechseln Sie zum Kit Copilote Local, um daraus ein wirklich funktionierendes Setup zu machen.
Das Kit „Copilote Local“ — die Ollama- + Cline- + Aider-Configs zum direkten Einfügen, angepasste Modelfiles, Hilfe bei Problemen, lebenslanger Zugang zum Onlinebereich →Kein Spam. Abmeldung mit 1 Klick. Ihre Daten bleiben bei uns (werden nie weiterverkauft).
Ihre Karte → das beste Code-Modell für die lokale Ausführung und der exakte Ollama-Befehl:
| Ihr VRAM | Typische GPUs / Macs | Empfohlenes Code-Modell | Ollama-Befehl |
|---|---|---|---|
| 8 GB | RTX 4060 / 3060 · M1-M2 16 GB | Qwen 3.5 9B (Q4, 6,6 GB — 256k ctx) | ollama run qwen3.5:9b |
| 12 GB | RTX 3060 12 GB / 4070 / 5070 | Qwen 3.5 9B (Q8, 11 GB) oder Gemma 4 12B (7,6 GB) | ollama run qwen3.5:9b-q8_0 |
| 16 GB | RTX 5070 Ti / 4080 / 5080 · RX 9070 XT · M4 24 GB | Devstral 24B (Q4, 14 GB) — Code-Agent-Spezialist | ollama run devstral:24b |
| 24 GB | RTX 3090 / 4090 · RX 7900 XTX · M4 Pro 48 GB | Qwen 3.8 27B (Q4, 18 GB) — „nahe an Copilot“ | ollama run qwen3.8:27b |
| 32 GB | RTX 5090 | Qwen 3.6 35B-A3B (Q4, 23 GB) — schnelles MoE | ollama run qwen3.6:35b |
| 48 GB+ | Mac M4 Max 64 GB · M2 Ultra 128 GB | Qwen3-Coder 30B-A3B (Q8, 32 GB — 256k ctx) | ollama run qwen3-coder:30b-a3b-q8_0 |
-base : ollama run qwen2.5-coder:7b-base — das ist in diesem speziellen Fall immer noch der Referenzstandard. ⚠️ Qwen 3.8: sein Reasoning ist standardmäßig sehr hoch eingestellt, und es „denkt“ bei einfachen Anfragen zu viel nach — stellen Sie es auf low (oder schalten Sie es ab) beim ersten Start. ⚠️ Lizenzfalle: Codestral 22B = Mistral Non-Production License → zum Programmieren bei der Arbeit verboten. Qwen 3.5/3.8, Gemma 4 und Devstral sind unter Apache 2.0 lizenziert. 💡 Abstürze wegen Speicherproblemen? Halten Sie ca. 1,5 GB VRAM für den Kontext frei oder gehen Sie eine Quantisierungsstufe herunter.🔌 Zum Einbinden in VS Code: Cline (Agent für mehrere Dateien), Aider (CLI) oder Tabby/Twinny (FIM-Autovervollständigung) — alle verbinden sich lokal mit Ollama. Das Kit Lokaler Copilot — Configs zum Einfügen + getestetes Setup — ist verfügbar: /copilote-local.
Filter: Q4_K_M ≤ 14 GB. Bonus 7-14B und 13-24B (Mistral Small 24B). Bandbreite 672 GB/s.
Berücksichtigte Kriterien:
Die Bewertung ist vollständig transparent: konsultieren Sie unsere Methodik für Details zur Berechnung des VRAM-Bedarfs und der Tokens pro Sekunde.
4070 Ti Super gegen 4070 Ti?
16 GB gegenüber 12 GB. Das ist für LLMs ENTSCHEIDEND: Die 4070 Ti Super ermöglicht den Einsatz von Mistral Small 24B Q4, während die 4070 Ti auf 14B Q4 begrenzt ist. Siehe RTX 4070 Ti.
4070 Ti Super vs 5070 Ti?
Dieselben 16 GB. 5070 Ti GDDR7 896 GB/s = ca. 30 % schneller als 4070 Ti Super GDDR6X 672 GB/s. Beim Neukauf: 5070 Ti. Beim Gebrauchtkauf bleibt die 4070 Ti Super hervorragend. Siehe RTX 5070 Ti.
Welches LLM bietet den besten Kompromiss auf der 4070 Ti Super?
Qwen 3 14B Q6 (~12 GB) oder Mistral Small 24B Q4 (~13 GB). 30-50 Tok/s je nach Modell. Für Code: Qwen 2.5 Coder 14B Q6.
Kann man auf einer 4070 Ti Super fine-tunen?
QLoRA 7B komfortabel (~10 GB). QLoRA 14B knapp (~14 GB). Für wirklich ernsthaftes Fine-Tuning 24 GB (RTX 4090/3090) anpeilen. Siehe guide.
Vertiefen Sie Ihr Wissen mit unseren detaillierten Direktvergleichen der Finalisten: