Magistral Small 24B gegen Qwen 3 32B: mini-Mistral 2026

Le Magistral Small 24B ist der kompakte Reasoning-Modell von Mistral AI, konzipiert für den lokalen Betrieb auf einer einzigen GPU eines allgemeinen Verbrauchers. Im Vergleich dazu ist der Qwen 3 32B von Alibaba hat sich seit seiner Einführung im Jahr 2025 als eines der führenden Open-Weights-Modelle unter den mittelgroßen dichten Modellen etabliert. Dieser Artikel vergleicht beide im Detail: VRAM-Anforderungen je nach Quantisierung, Inferenzgeschwindigkeit auf realer Hardware, Lizenzen, Ergebnisse auf öffentlichen Benchmarks und konkrete Anwendungsszenarien. Ob Sie eine auf Reasoning ausgerichtete Workstation zusammenstellen oder ein vielseitiges Modell zur Verarbeitung langer Texte suchen – diese Seite liefert Ihnen die nötigen Informationen für Ihre Wahl.


Präsentation der beiden Modelle

Magistral Small 24B

Magistral Small 24B gehört zur Magistral-Familie von Mistral AI, ebenso wie eine größere Variante (Magistral Medium, ~123 Milliarden Parameter). Sein Hauptmerkmal ist seine Ausrichtung auf strukturiertes Schlussfolgern : Das Modell erzeugt eine Zwischenkette von Gedankenschritten (chain-of-thought), bevor es seine endgültige Antwort ausgibt. Das unterscheidet es von den Mistral-Modellen früherer Generationen. Mit 24 Milliarden Parametern gehört es zur Kategorie der LLM, die in Q4-Quantisierung auf einer GPU mit 24 GB ausgeführt werden können.

Das offizielle technische Datenblatt finden Sie auf HuggingFace — mistralai/Magistral-Small-2506 und in derMitteilung von Mistral AI.

Qwen 3 32B

Qwen 3 32B ist ein Modell dense (kein MoE-Modell), entwickelt von Alibaba Research und Teil der dritten Generation der Qwen-Familie. Seine dichte Architektur macht seinen VRAM-Verbrauch vorhersehbarer als den der MoE-Varianten derselben Familie, wie etwa beim Qwen 3 235B-A22B bei dem während der Inferenz trotz insgesamt 235 Milliarden Parametern nur 22 Milliarden aktiviert werden. Qwen 3 32B deckt ein breites Spektrum ab: Programmierung, mathematisches Schlussfolgern, mehrsprachige Verarbeitung und lange Kontexte.

Offizielle Dokumentation auf HuggingFace — Qwen/Qwen3-32B und auf dem Qwen-Blog.


Technische Spezifikationen und VRAM

Für die VRAM-Schätzungen gilt die empirische Regel: Parameter × 0,5 bis 0,55 GB in Q4, × 1 GB in Q8, × 2 GB in FP16. Die folgenden Werte sind Schätzungen aus dieser Methode und aus Community-Feedback – prüfen Sie sie entsprechend Ihrem Backend (llama.cpp, llamafile, LM Studio).

Magistral Small 24B

In Q4_K_M passt das Modell problemlos in den Speicher einer RTX 4090 (24 GB), mit Spielraum für den KV-Cache bei kurzen Kontexten. In Q8 erreicht die Karte ihre Grenze; eine RTX 6000 Ada (48 GB) oder eine A5000 ist für lange Sitzungen vorzuziehen.

Qwen 3 32B

Qwen 3 32B passt in Q4 auf eine RTX 4090, aber bei einem langen Kontext (64 K Tokens oder mehr) treibt der KV-Cache den gesamten Speicherbedarf über die verfügbaren 24 GB hinaus. Für eine komfortable Nutzung mit erweitertem Kontext wird eine Karte mit 48 GB (RTX 6000 Ada, A40) empfohlen.

Für weitere Informationen zu VRAM-Berechnungen je nach Quantisierung konsultieren Sie den VRAM-Guide von WelchesLLM.


Inferenzgeschwindigkeit

Die folgenden Zahlen sind Schätzungen auf Grundlage von Erfahrungsberichten aus der Community zu llama.cpp und LM Studio. Sie variieren je nach Hardware, Promptlänge, Backend und der konkret verwendeten Quantisierung.

auf RTX 4090 (24 GB, Q4_K_M)

Magistral Small 24B - Generierung : ~25–40 Tokens/pro Sekunde (geschätzt, kurzer Prompt) - Prefill : ~1 500–2 500 Tokens/s (geschätzt)

Qwen 3 32B - Generierung : ~18–28 Tokens/sec (geschätzt, kurzer Prompt) - Prefill : ~1.000–1.800 Token pro Sekunde (geschätzt)

Das kleinere Modell (24B) generiert auf derselben GPU deutlich schneller — in Q4 etwa 30 bis 50 % mehr Tokens pro Sekunde (geschätzt). Der Unterschied verringert sich auf GPUs mit 48 GB oder bei einer Batch-Konfiguration mit mehreren Anfragen.

Auf einem Apple M3 Max (128 GB vereinheitlichter Arbeitsspeicher)

Auf Macs mit Apple Silicon lassen sich beide Modelle komfortabel betreiben, das 24B-Modell mit 64 GB RAM auch in Q8.


Lizenzen

Magistral Small 24B Mistral AI hat seine offenen Modelle je nach Version unter Apache 2.0 oder der Modified-MIT-Lizenz veröffentlicht. Die genaue Lizenz von Magistral Small 24B ist vor jeder kommerziellen Nutzung oder Weiterverbreitung auf der offiziellen HuggingFace-Modellseite zu prüfen. Leiten Sie die Lizenz nicht allein aus der Modellfamilie ab.

Qwen 3 32B Veröffentlicht unter Apache 2.0, was die kommerzielle Nutzung, die Änderung und die Weiterverbreitung ohne Lizenzgebühren erlaubt, sofern die rechtlichen Hinweise erhalten bleiben. Das ist einer der konkreten Vorteile von Qwen 3 32B gegenüber Modellen mit restriktiveren Community-Lizenzen.

Um Modelle aus dem Katalog nach Lizenztyp zu filtern, gehen Sie zu quelllm.fr/catalogue.


Benchmarks und Leistungsvergleich

Die Benchmark-Zahlen variieren je nach Modellversion, Evaluationsumgebung und Generierungseinstellungen. Die folgenden Werte stammen aus öffentlichen Berichten oder sind geschätzt – überprüfen Sie sie auf offiziellen Leaderboards wie demOpen LLM Leaderboard HuggingFace bevor Sie darauf Entscheidungen über den Einsatz stützen.

MMLU (allgemeine Kenntnisse)

Qwen 3 32B profitiert von der großen Menge an Trainingsdaten von Alibaba, die besonders reich an akademischen und mehrsprachigen Inhalten sind, was sich in den MMLU-Ergebnissen widerspiegelt.

HumanEval (Programmieren)

Bei reinen Programmieraufgaben in Standardbenchmarks behält Qwen 3 32B den Vorteil. Der Reasoning-Modus von Magistral Small kann diesen jedoch bei komplexen algorithmischen Problemen ausgleichen, die eine Zerlegung in mehreren Schritten erfordern.

AIME (mathematisches Schlussfolgern)

Magistral Small 24B versucht, sich bei Benchmarks für logisches Denken wie AIME abzuheben. Sein auf Chain-of-Thought ausgerichtetes Design ermöglicht es ihm, mathematische Wettbewerbsaufgaben mit einer strukturierten Methodik statt durch Musterabgleich anzugehen. Die genauen Ergebnisse müssen noch auf öffentlichen Leaderboards bestätigt werden.

Position im Katalog WelchesLLM

Zur Einordnung dieser beiden Modelle in das Ökosystem:


Konkrete Anwendungsfälle

Wann Magistral Small 24B wählen

Wann Sie Qwen 3 32B wählen sollten


FAQ

F: Funktioniert Magistral Small 24B auf einer RTX 4090?

Ja. In Q4_K_M benötigt das Modell etwa 13 GB VRAM – auf einer RTX 4090 (24 GB) läuft es bei kurzen Kontexten mit Reserve für den KV-Cache. In Q8 werden die verfügbaren 24 GB vollständig ausgenutzt; sehr lange Kontexte (voll ausgeschöpfte 32 K Tokens) können den Speicher vollständig belegen. In der Praxis bietet Q5_K_M auf dieser Karte einen guten Kompromiss zwischen Qualität und VRAM-Bedarf.

F: Welche Lizenz gilt für Qwen 3 32B?

Qwen 3 32B wird unter Apache 2.0, einer permissiven Lizenz, die die kommerzielle Nutzung, Änderungen und Weiterverteilung erlaubt. Für die Integration des Modells in ein Produkt oder einen Dienst fallen keine Lizenzgebühren an, sofern die ursprünglichen rechtlichen Hinweise erhalten bleiben. Sie gehört zu den vorteilhaftesten Lizenzen im Open-Weights-Ökosystem.

Q: Magistral Small 24B oder Qwen 3 32B für RAG (Retrieval-Augmented Generation)?

Für RAG hat Qwen 3 32B dank seines nativen Kontextfensters von 128 K Tokens und seiner hohen Leistung beim Dokumentverständnis einen Vorteil. Magistral Small 24B kann dank seines Reasoning-Modus bei komplexen Anfragen besser strukturierte und begründete Antworten erzeugen. Die Wahl hängt hauptsächlich von der Länge der eingelesenen Dokumente und der Komplexität der gestellten Fragen ab.

Q: Gibt es eine signifikante Geschwindigkeitsdifferenz zwischen den beiden Modellen?

Ja. Mit 8 Milliarden Parametern weniger ist Magistral Small 24B bei der Generierung auf derselben GPU spürbar schneller – etwa 30 bis 50 % mehr Tokens pro Sekunde in Q4 auf einer RTX 4090 (geschätzt). Dieser Unterschied wird auf GPUs mit 80 GB oder bei Batch-Bereitstellungen geringer, bei denen die Speicherbandbreite nicht mehr der wichtigste begrenzende Faktor ist.

Q: Unterstützt der Magistral Small 24B den Modus „thinking“?

Ja, das ist seine wesentliche Eigenschaft im Vergleich zu den LLM Mistral der vorherigen Generations. Er erzeugt einen Zwischenschritt des Denkens vor der endgültigen Antwort. Die Aktivierung erfolgt über den Promptformat oder eine spezielle Option entsprechend dem verwendeten Backend (llama.cpp, LM Studio, usw.). Die Implementierungsdetails sind in der offizielle HuggingFace-Dokumentation.

Q: Wie können diese Modelle mit anderen LLMs aus dem Katalog WelchesLLM verglichen werden?

Le Katalog WelchesLLM Liste von 249 Modellen mit ihren VRAM-Spezifikationen, Lizenzen und filterbaren Token pro Sekunde. Für eine direkte Vergleich mit einem anderen Modell ähnlicher Größe, der integriertes Vergleichsmodul ermöglicht es, die Modellprofile nach Ihren Kriterien (verfügbarer VRAM, Lizenz, Einsatzzweck) nebeneinander zu vergleichen.


Fazit

Le Magistral Small 24B und Qwen 3 32B verkörpern bei ähnlicher Modellgröße zwei Philosophien: strukturiertes Denken auf der einen Seite, Vielseitigkeit mit dichter Architektur auf der anderen. Wenn Ihre Priorität die Inferenzgeschwindigkeit und die Qualität des schrittweisen Denkens auf einer GPU mit 24 GB ist, lohnt es sich, Magistral Small 24B ernsthaft zu evaluieren. Wenn Sie Programmieren, einen langen Kontext und eine eindeutige Apache-2.0-Lizenz bevorzugen, ist Qwen 3 32B eine solide Wahl. Entdecken Sie alle nach VRAM und Lizenz gefilterten Modelle auf quelllm.fr/catalogue, oder lassen Sie den Konfigurator die Auswahl anhand Ihrer genauen Konfiguration treffen.

Artikel veröffentlicht und aktualisiert am von Mohamed Meguedmi · Quelle der Daten: /api/models.json · Lizenz für den Inhalt: CC BY 4.0.

Möchten Sie einen Fehler oder eine Aktualisierung melden? Mitwirken.