Magistral Small 24B gegen Qwen 3 32B: mini-Mistral 2026
Le Magistral Small 24B ist der kompakte Reasoning-Modell von Mistral AI, konzipiert für den lokalen Betrieb auf einer einzigen GPU eines allgemeinen Verbrauchers. Im Vergleich dazu ist der Qwen 3 32B von Alibaba hat sich seit seiner Einführung im Jahr 2025 als eines der führenden Open-Weights-Modelle unter den mittelgroßen dichten Modellen etabliert. Dieser Artikel vergleicht beide im Detail: VRAM-Anforderungen je nach Quantisierung, Inferenzgeschwindigkeit auf realer Hardware, Lizenzen, Ergebnisse auf öffentlichen Benchmarks und konkrete Anwendungsszenarien. Ob Sie eine auf Reasoning ausgerichtete Workstation zusammenstellen oder ein vielseitiges Modell zur Verarbeitung langer Texte suchen – diese Seite liefert Ihnen die nötigen Informationen für Ihre Wahl.
Präsentation der beiden Modelle
Magistral Small 24B
Magistral Small 24B gehört zur Magistral-Familie von Mistral AI, ebenso wie eine größere Variante (Magistral Medium, ~123 Milliarden Parameter). Sein Hauptmerkmal ist seine Ausrichtung auf strukturiertes Schlussfolgern : Das Modell erzeugt eine Zwischenkette von Gedankenschritten (chain-of-thought), bevor es seine endgültige Antwort ausgibt. Das unterscheidet es von den Mistral-Modellen früherer Generationen. Mit 24 Milliarden Parametern gehört es zur Kategorie der LLM, die in Q4-Quantisierung auf einer GPU mit 24 GB ausgeführt werden können.
Das offizielle technische Datenblatt finden Sie auf HuggingFace — mistralai/Magistral-Small-2506 und in derMitteilung von Mistral AI.
Qwen 3 32B
Qwen 3 32B ist ein Modell dense (kein MoE-Modell), entwickelt von Alibaba Research und Teil der dritten Generation der Qwen-Familie. Seine dichte Architektur macht seinen VRAM-Verbrauch vorhersehbarer als den der MoE-Varianten derselben Familie, wie etwa beim Qwen 3 235B-A22B bei dem während der Inferenz trotz insgesamt 235 Milliarden Parametern nur 22 Milliarden aktiviert werden. Qwen 3 32B deckt ein breites Spektrum ab: Programmierung, mathematisches Schlussfolgern, mehrsprachige Verarbeitung und lange Kontexte.
Offizielle Dokumentation auf HuggingFace — Qwen/Qwen3-32B und auf dem Qwen-Blog.
Technische Spezifikationen und VRAM
Für die VRAM-Schätzungen gilt die empirische Regel: Parameter × 0,5 bis 0,55 GB in Q4, × 1 GB in Q8, × 2 GB in FP16. Die folgenden Werte sind Schätzungen aus dieser Methode und aus Community-Feedback – prüfen Sie sie entsprechend Ihrem Backend (llama.cpp, llamafile, LM Studio).
Magistral Small 24B
- Parameter : 24 Milliarden
- Architektur : Dense-Architektur, Transformer-Decoder (Architekturdetails noch zu bestätigen)
- Q4_K_M : ca. 13 GB VRAM
- Q5_K_M : ~16 GB VRAM (geschätzt)
- Q8_0 : ~24 GB VRAM
- FP16 : ~48 GB VRAM
- Kontext : je nach veröffentlichter Variante noch zu bestätigen; neuere Mistral-Modelle zielen auf 32.768 bis 128.000 Tokens ab
In Q4_K_M passt das Modell problemlos in den Speicher einer RTX 4090 (24 GB), mit Spielraum für den KV-Cache bei kurzen Kontexten. In Q8 erreicht die Karte ihre Grenze; eine RTX 6000 Ada (48 GB) oder eine A5000 ist für lange Sitzungen vorzuziehen.
Qwen 3 32B
- Parameter : 32 Milliarden
- Architektur : dichtes Modell, Transformer-Decoder
- Q4_K_M : ~18 GB VRAM
- Q5_K_M : ~22 GB VRAM (geschätzt)
- Q8_0 : ~32 GB VRAM
- FP16 : ~64 GB VRAM
- Kontext : 128 000 Tokens
Qwen 3 32B passt in Q4 auf eine RTX 4090, aber bei einem langen Kontext (64 K Tokens oder mehr) treibt der KV-Cache den gesamten Speicherbedarf über die verfügbaren 24 GB hinaus. Für eine komfortable Nutzung mit erweitertem Kontext wird eine Karte mit 48 GB (RTX 6000 Ada, A40) empfohlen.
Für weitere Informationen zu VRAM-Berechnungen je nach Quantisierung konsultieren Sie den VRAM-Guide von WelchesLLM.
Inferenzgeschwindigkeit
Die folgenden Zahlen sind Schätzungen auf Grundlage von Erfahrungsberichten aus der Community zu llama.cpp und LM Studio. Sie variieren je nach Hardware, Promptlänge, Backend und der konkret verwendeten Quantisierung.
auf RTX 4090 (24 GB, Q4_K_M)
Magistral Small 24B - Generierung : ~25–40 Tokens/pro Sekunde (geschätzt, kurzer Prompt) - Prefill : ~1 500–2 500 Tokens/s (geschätzt)
Qwen 3 32B - Generierung : ~18–28 Tokens/sec (geschätzt, kurzer Prompt) - Prefill : ~1.000–1.800 Token pro Sekunde (geschätzt)
Das kleinere Modell (24B) generiert auf derselben GPU deutlich schneller — in Q4 etwa 30 bis 50 % mehr Tokens pro Sekunde (geschätzt). Der Unterschied verringert sich auf GPUs mit 48 GB oder bei einer Batch-Konfiguration mit mehreren Anfragen.
Auf einem Apple M3 Max (128 GB vereinheitlichter Arbeitsspeicher)
- Magistral Small 24B Q4 : ~20–30 Tokens/sec (geschätzt)
- Qwen 3 32B Q4 : ~14–22 Tokens pro Sekunde (geschätzt)
Auf Macs mit Apple Silicon lassen sich beide Modelle komfortabel betreiben, das 24B-Modell mit 64 GB RAM auch in Q8.
Lizenzen
Magistral Small 24B Mistral AI hat seine offenen Modelle je nach Version unter Apache 2.0 oder der Modified-MIT-Lizenz veröffentlicht. Die genaue Lizenz von Magistral Small 24B ist vor jeder kommerziellen Nutzung oder Weiterverbreitung auf der offiziellen HuggingFace-Modellseite zu prüfen. Leiten Sie die Lizenz nicht allein aus der Modellfamilie ab.
Qwen 3 32B Veröffentlicht unter Apache 2.0, was die kommerzielle Nutzung, die Änderung und die Weiterverbreitung ohne Lizenzgebühren erlaubt, sofern die rechtlichen Hinweise erhalten bleiben. Das ist einer der konkreten Vorteile von Qwen 3 32B gegenüber Modellen mit restriktiveren Community-Lizenzen.
Um Modelle aus dem Katalog nach Lizenztyp zu filtern, gehen Sie zu quelllm.fr/catalogue.
Benchmarks und Leistungsvergleich
Die Benchmark-Zahlen variieren je nach Modellversion, Evaluationsumgebung und Generierungseinstellungen. Die folgenden Werte stammen aus öffentlichen Berichten oder sind geschätzt – überprüfen Sie sie auf offiziellen Leaderboards wie demOpen LLM Leaderboard HuggingFace bevor Sie darauf Entscheidungen über den Einsatz stützen.
MMLU (allgemeine Kenntnisse)
- Magistral Small 24B : ~70–76 % (zu bestätigen)
- Qwen 3 32B : ~80–85 % (noch zu bestätigen, Instruct-Version)
Qwen 3 32B profitiert von der großen Menge an Trainingsdaten von Alibaba, die besonders reich an akademischen und mehrsprachigen Inhalten sind, was sich in den MMLU-Ergebnissen widerspiegelt.
HumanEval (Programmieren)
- Magistral Small 24B : ~60–72 % (geschätzt, mit aktiviertem Reasoning-Modus)
- Qwen 3 32B : ~75–85 % (geschätzt)
Bei reinen Programmieraufgaben in Standardbenchmarks behält Qwen 3 32B den Vorteil. Der Reasoning-Modus von Magistral Small kann diesen jedoch bei komplexen algorithmischen Problemen ausgleichen, die eine Zerlegung in mehreren Schritten erfordern.
AIME (mathematisches Schlussfolgern)
Magistral Small 24B versucht, sich bei Benchmarks für logisches Denken wie AIME abzuheben. Sein auf Chain-of-Thought ausgerichtetes Design ermöglicht es ihm, mathematische Wettbewerbsaufgaben mit einer strukturierten Methodik statt durch Musterabgleich anzugehen. Die genauen Ergebnisse müssen noch auf öffentlichen Leaderboards bestätigt werden.
Position im Katalog WelchesLLM
Zur Einordnung dieser beiden Modelle in das Ökosystem:
- Le Mistral Medium 3.5 128B (128B, ~74 GB Q4) ist in der Mistral-Modellreihe eine Stufe höher angesiedelt und lässt sich auf einer einzelnen Consumer-GPU nicht betreiben.
- Le Mistral Small 4 (119B, ~72 GB Q4) bietet mehr Mistral-Leistung, benötigt aber ebenfalls einen Cluster oder eine professionelle Grafikkarte mit 80 GB.
- Le Qwen 2.5 72B Instruct bleibt eine bewährte Referenz innerhalb der Qwen-Familie für alle, die für Q4 über ~42 GB VRAM verfügen.
Konkrete Anwendungsfälle
Wann Magistral Small 24B wählen
- Schrittweises Schlussfolgern : mehrstufige Codeanalyse, Debugging, logische oder mathematische Problemlösung.
- Leichter autonomer Agent : seine Fähigkeit zum strukturierten Denken macht ihn zu einem guten Motor für Agenten-Pipelines, die ihre Entscheidungen rechtfertigen müssen.
- Knappes VRAM-Budget : Auf einem Rechner mit 16–24 GB ist dies die zugänglichste Mistral-Option mit fortgeschrittenen Fähigkeiten zum logischen Schlussfolgern.
- Geschwindigkeit hat Priorität : schnell generieren (geschätzt ~30 Tokens/s), mit einer für die Modellgröße überdurchschnittlichen Reasoning-Qualität.
Wann Sie Qwen 3 32B wählen sollten
- Programmierung und Code-Review : seine HumanEval-Scores machen es zur besseren Wahl für die tägliche Unterstützung bei der Softwareentwicklung.
- Mehrsprachige Verarbeitung : Die Qwen-Familie ist von Haus aus stark in Chinesisch, Japanisch, Koreanisch und den europäischen Sprachen.
- Langer Kontext : nativ 128 K Tokens zur Verarbeitung ganzer Dokumente oder langer Gesprächsverläufe.
- Eindeutige Apache-2.0-Lizenz : Direkter kommerzieller Einsatz ohne vorherige Prüfung.
- Allgemeine Vielseitigkeit : Texte verfassen, Zusammenfassungen erstellen, Q&A, Datenanalyse — das Spektrum ist breit.
FAQ
F: Funktioniert Magistral Small 24B auf einer RTX 4090?
Ja. In Q4_K_M benötigt das Modell etwa 13 GB VRAM – auf einer RTX 4090 (24 GB) läuft es bei kurzen Kontexten mit Reserve für den KV-Cache. In Q8 werden die verfügbaren 24 GB vollständig ausgenutzt; sehr lange Kontexte (voll ausgeschöpfte 32 K Tokens) können den Speicher vollständig belegen. In der Praxis bietet Q5_K_M auf dieser Karte einen guten Kompromiss zwischen Qualität und VRAM-Bedarf.
F: Welche Lizenz gilt für Qwen 3 32B?
Qwen 3 32B wird unter Apache 2.0, einer permissiven Lizenz, die die kommerzielle Nutzung, Änderungen und Weiterverteilung erlaubt. Für die Integration des Modells in ein Produkt oder einen Dienst fallen keine Lizenzgebühren an, sofern die ursprünglichen rechtlichen Hinweise erhalten bleiben. Sie gehört zu den vorteilhaftesten Lizenzen im Open-Weights-Ökosystem.
Q: Magistral Small 24B oder Qwen 3 32B für RAG (Retrieval-Augmented Generation)?
Für RAG hat Qwen 3 32B dank seines nativen Kontextfensters von 128 K Tokens und seiner hohen Leistung beim Dokumentverständnis einen Vorteil. Magistral Small 24B kann dank seines Reasoning-Modus bei komplexen Anfragen besser strukturierte und begründete Antworten erzeugen. Die Wahl hängt hauptsächlich von der Länge der eingelesenen Dokumente und der Komplexität der gestellten Fragen ab.
Q: Gibt es eine signifikante Geschwindigkeitsdifferenz zwischen den beiden Modellen?
Ja. Mit 8 Milliarden Parametern weniger ist Magistral Small 24B bei der Generierung auf derselben GPU spürbar schneller – etwa 30 bis 50 % mehr Tokens pro Sekunde in Q4 auf einer RTX 4090 (geschätzt). Dieser Unterschied wird auf GPUs mit 80 GB oder bei Batch-Bereitstellungen geringer, bei denen die Speicherbandbreite nicht mehr der wichtigste begrenzende Faktor ist.
Q: Unterstützt der Magistral Small 24B den Modus „thinking“?
Ja, das ist seine wesentliche Eigenschaft im Vergleich zu den LLM Mistral der vorherigen Generations. Er erzeugt einen Zwischenschritt des Denkens vor der endgültigen Antwort. Die Aktivierung erfolgt über den Promptformat oder eine spezielle Option entsprechend dem verwendeten Backend (llama.cpp, LM Studio, usw.). Die Implementierungsdetails sind in der offizielle HuggingFace-Dokumentation.
Q: Wie können diese Modelle mit anderen LLMs aus dem Katalog WelchesLLM verglichen werden?
Le Katalog WelchesLLM Liste von 249 Modellen mit ihren VRAM-Spezifikationen, Lizenzen und filterbaren Token pro Sekunde. Für eine direkte Vergleich mit einem anderen Modell ähnlicher Größe, der integriertes Vergleichsmodul ermöglicht es, die Modellprofile nach Ihren Kriterien (verfügbarer VRAM, Lizenz, Einsatzzweck) nebeneinander zu vergleichen.
Fazit
Le Magistral Small 24B und Qwen 3 32B verkörpern bei ähnlicher Modellgröße zwei Philosophien: strukturiertes Denken auf der einen Seite, Vielseitigkeit mit dichter Architektur auf der anderen. Wenn Ihre Priorität die Inferenzgeschwindigkeit und die Qualität des schrittweisen Denkens auf einer GPU mit 24 GB ist, lohnt es sich, Magistral Small 24B ernsthaft zu evaluieren. Wenn Sie Programmieren, einen langen Kontext und eine eindeutige Apache-2.0-Lizenz bevorzugen, ist Qwen 3 32B eine solide Wahl. Entdecken Sie alle nach VRAM und Lizenz gefilterten Modelle auf quelllm.fr/catalogue, oder lassen Sie den Konfigurator die Auswahl anhand Ihrer genauen Konfiguration treffen.