Startseite › Katalog › Bestes LLM auf der RTX 3090 Ti (24 GB) im Jahr 2026

Bestes LLM auf der RTX 3090 Ti (24 GB) im Jahr 2026

◆ Lokale KI — Ihr privates und kostenloses ChatGPT, auf Ihrem Rechner, in 1 h · 24 € · oder alle Kits für 49 € →

Rangliste aktualisiert am 09/10/2026

Die RTX 3090 Ti (24 GB GDDR6X, 1008 GB/s) ist das Ampere-Flaggschiff. 24 GB + 1 TB/s Bandbreite = dieselbe VRAM-Kapazität wie bei einer 4090 zu 60 % des Neupreises, gebraucht etwa 700 €.

Angebote und Alternativen für lokale KI

RTX 3090 Ti : Kaufalternative für lokale KI verfügbar — GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) :

Ein Mini-PC ist ein vollständiges System: Prüfen Sie die benötigte Speicherkapazität und die Softwarekompatibilität. Er ersetzt weder macOS/MLX noch CUDA.

Warum diese Wahl? Unser vollständiger Bericht zu GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) →

Welchen PC sollten Sie je nach Budget wählen? Unsere Auswahl von 800 bis 3 500 € →

Affiliate-Links — WelchesLLM kann an Käufen eine Provision erhalten, ohne zusätzliche Kosten für Sie; dies beeinflusst die unabhängig erstellte Rangliste nicht. Als Amazon-Partner verdient WelchesLLM an qualifizierten Käufen.

Rangliste

1

🇺🇸 Gemma 4 26B-A4B MoE

Google · 26B Parameter · Apache 2.0 · Kontext: 128 000 Tokens

MoE-Variante von Gemma 4. 26B Parameter, davon 4B aktiv. Vollständig multimodal (Text+Bild+Audio).

Warum dieser Rang MoE-Variante von Gemma 4. 26B Parameter, davon 4B aktiv. Vollständig multimodal (Text+Bild+Audio).
ollama run gemma4:26b
Auf RTX 3090 Ti
Q5_K_M
19 GB · 22 tok/s
2

🇨🇳 LLaDA 2.0 Uni 16B

Ant Group / inclusionAI · 16 Milliarden Parameter · Apache 2.0 · 8 192 Tokens ctx

Erstes offenes dLLM unter Apache 2.0: MoE 16B/1B + Diffusionsdecoder mit 6,2B Parametern. Text und Vision in einem einheitlichen Modell. Veröffentlicht am 22. April 2026.

Warum dieser Rang Erstes offenes dLLM unter Apache 2.0: MoE 16B/1B + Diffusionsdecoder mit 6,2B Parametern. Text und Vision in einem einheitlichen Modell. Veröffentlicht am 22. April 2026.
# HuggingFace : inclusionAI/LLaDA2.0-Uni (Flash Attn 2 + CUDA 12.4 requis)
Auf RTX 3090 Ti
Q5_K_M
22 GB · 60 tok/s
3

🇨🇳 Qwen 3.6 27B

Alibaba · 27B Parameter · Apache 2.0 · 262 144 tokens ctx

Dichtes multimodales 27B-Modell, veröffentlicht am 22. April 2026. 262k ctx (1M YaRN). SWE-bench Verified 77.2%.

Warum dieser Rang Dichtes multimodales 27B-Modell, veröffentlicht am 22. April 2026. 262k ctx (1M YaRN). SWE-bench Verified 77.2%.
ollama run qwen3.6:27b
Auf RTX 3090 Ti
Q5_K_M
19 GB · 13 tok/s
4

🇨🇳 Qwen 3.8 27B

Alibaba · 27B Parameter · Apache 2.0 · 262 144 tokens ctx

Qwen 3.8 27B: dichtes multimodales Modell (Text + Vision), 262k Kontext, ca. 16 GB VRAM bei Q4 (18 GB Ollama-Gewichte). Apache 2.0, agentisches Programmieren und Vision.

Warum dieser Rang Qwen 3.8 27B: dichtes multimodales Modell (Text + Vision), 262k Kontext, ca. 16 GB VRAM bei Q4 (18 GB Ollama-Gewichte). Apache 2.0, agentisches Programmieren und Vision.
ollama run qwen3.8:27b
Auf RTX 3090 Ti
Q5_K_M
19 GB · 14 Tok/s
5

🇨🇳 GLM 4.7 Flash

Zhipu AI · 31B Parameter · MIT · Kontext: 128 000 Tokens

GLM-4.7-Flash (MoE mit 31B Parametern, davon ~3B aktiv): das beste Verhältnis von Code-Leistung zu VRAM-Bedarf in der 30B-Klasse. MIT, 128k ctx, sehr schnell auf 3090/4090.

Warum dieser Rang GLM-4.7-Flash (MoE mit 31B Parametern, davon ~3B aktiv): das beste Verhältnis von Code-Leistung zu VRAM-Bedarf in der 30B-Klasse. MIT, 128k ctx, sehr schnell auf 3090/4090.
ollama run glm-4.7-flash
Auf RTX 3090 Ti
Q5_K_M
23 GB · 40 tok/s
6

🇺🇸 Gemma 4 31B

Google · 31B Parameter · Apache 2.0 · 256 000 Tokens ctx

Dichtes multimodales 31B-Modell (Text+Bild+Audio). 140+ Sprachen, 256k Kontext. Platz 3 in der Chatbot Arena unter den offenen Modellen.

Warum dieser Rang Dichtes multimodales 31B-Modell (Text+Bild+Audio). 140+ Sprachen, 256k Kontext. Platz 3 in der Chatbot Arena unter den offenen Modellen.
ollama run gemma4:31b
Auf RTX 3090 Ti
Q5_K_M
22 GB · 12 tok/s
7

🇺🇸 Granite 4.1 30B Instruct

IBM · 30B Parameter · Apache 2.0 · Kontext: 131 072 Tokens

Dichtes 30B-Modell unter Apache 2.0, 12 Sprachen einschließlich Französisch, 131k ctx, GQA 32Q/8KV. OpenAI-kompatibles Tool Calling. Veröffentlicht am 29. April 2026.

Warum dieser Rang Dichtes 30B-Modell unter Apache 2.0, 12 Sprachen einschließlich Französisch, 131k ctx, GQA 32Q/8KV. OpenAI-kompatibles Tool Calling. Veröffentlicht am 29. April 2026.
ollama run granite4.1:30b
Auf RTX 3090 Ti
Q5_K_M
21 GB · 12 tok/s
8

🇺🇸 Nemotron Cascade 2 30B-A3B

NVIDIA · 30B Parameter · NVIDIA Open Model License · Kontext: 128 000 Tokens

MoE mit 30B/3B aktiven Parametern: Thinking-Modus + Instruct. Goldmedaille bei der IMO 2025 und der IOI 2025. Schnelle Inferenz dank 3B aktiver Parameter, Reasoning-Fähigkeiten auf 30B-Niveau. Veröffentlichung im April 2026.

Warum dieser Rang MoE mit 30B/3B aktiven Parametern: Thinking-Modus + Instruct. Goldmedaille bei der IMO 2025 und der IOI 2025. Schnelle Inferenz dank 3B aktiver Parameter, Reasoning-Fähigkeiten auf 30B-Niveau. Veröffentlichung im April 2026.
ollama run nemotron-cascade-2
Auf RTX 3090 Ti
Q5_K_M
21 GB · 30 tok/s

Vergleichstabelle

Rang Modell Params VRAM Q4 Kontext Lizenz Auf RTX 3090 Ti
#1 Gemma 4 26B-A4B MoE 26B 16 GB 128 000 Apache 2.0 22 tok/s · Q5_K_M
#2 LLaDA 2.0 Uni 16B 16B 18 GB 8 192 Apache 2.0 60 Tok/s · Q5_K_M
#3 Qwen 3.6 27B 27B 16 GB 262 144 Apache 2.0 13 Tok/s · Q5_K_M
#4 Qwen 3.8 27B 27B 16 GB 262 144 Apache 2.0 14 Tok/s · Q5_K_M
#5 GLM 4.7 Flash 31B 19 GB 128 000 MIT 40 tok/s · Q5_K_M
#6 Gemma 4 31B 31B 18 GB 256 000 Apache 2.0 12 tok/s · Q5_K_M
#7 Granite 4.1 30B Instruct 30B 17 GB 131 072 Apache 2.0 12 tok/s · Q5_K_M
#8 Nemotron Cascade 2 30B-A3B 30B 17 GB 128 000 NVIDIA Open Model License 30 tok/s · Q5_K_M
Das Kit Lokale KI

Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.

  • Lebenslanger Online-Zugang
  • PDF + Dateien
  • Lebenslange Updates

Kostenloses Memo

Welches Code-Modell lässt sich auf IHREM Rechner ausführen?

Memo erhalten VRAM → bestes Code-Modell → Ollama-Befehl (alles auf einem Bildschirm, zum Kopieren und Einfügen). Und wechseln Sie zum Kit Lokaler Copilot, um daraus ein wirklich funktionierendes Setup zu machen.

Das Kit „Lokaler Copilot“ — die Ollama- + Cline- + Aider-Configs zum direkten Einfügen, angepasste Modelfiles, Hilfe bei Problemen, lebenslanger Zugang zum Onlinebereich →

Kein Spam. Abmeldung mit 1 Klick. Ihre Daten bleiben bei uns (werden nie weiterverkauft).

Methodik des Rankings

Filter: Q4_K_M ≤ 22 GB. Bonus 13–32B (Spitzenwert 24 GB) und 7–32B. Bandbreite: 1008 GB/s — Ampere-Rekord.

Berücksichtigte Kriterien:

  • Q4_K_M ≤ 22 GB
  • Qwen 3 32B Q5 komfortabel
  • Fine-tuning LoRA 7-13B
  • 24 GB + 1 TB/s

Die Bewertung ist vollständig transparent: konsultieren Sie unsere Methodik für Details zur Berechnung des VRAM-Bedarfs und der Tokens pro Sekunde.

Häufige Fragen

RTX 3090 Ti gegen 3090?

Ebenfalls 24 GB. 3090 Ti = +7 % CUDA-Kerne + GDDR6X mit 1008 GB/s gegenüber der 3090 mit GDDR6X und 936 GB/s. Unterschied ~5–8 % bei LLMs. Die 3090 ist gebraucht oft das bessere Angebot. Siehe RTX 3090.

3090 Ti gegenüber 4090?

Ebenfalls 24 GB. 4090 = ebenfalls 1008 GB/s + 16384 CUDA-Kerne gegenüber 10752 bei der 3090 Ti. Etwa 40–50 % schneller für LLMs. Bei einem Neukauf: 4090. Gebraucht ist die 3090 Ti bei etwa 700 € gegenüber etwa 1100 € eine ausgezeichnete Wahl. Siehe RTX 4090.

Llama 70B auf 3090 Ti?

Q3_K_M (~32 GB) passt nicht auf eine einzelne Karte. Q2_K (~24 GB) passt gerade noch, allerdings mit Qualitätseinbußen. Für einen komfortablen Betrieb von 70B: 2× 3090 Ti oder eine RTX 5090 mit 32 GB. Siehe RTX 5090.

Setup mit 2× gebrauchten 3090 Ti?

Ausgezeichnet: 48 GB VRAM verteilt auf die beiden Karten für insgesamt etwa 1.400 €. Llama 70B Q4 (~40 GB) passt in den Speicher und erreicht per Tensor-Parallelismus etwa 30 Tokens/s. Beim Preis-Leistungs-Verhältnis für LLMs 2026 schwer zu schlagen.

Weiterführende Informationen

Die QuelLLM-Pakete Der maßgebliche Leitfaden für jeden Anwendungsfall
Alle Kits lebenslang — 49 €