Mittelstufe 10 Min.Ollama

Mistral Magistral: Installieren Sie das Modell von Reasoning

Magistral ist das Reasoning-Modell von Mistral AI: ein Modell, das vor der Antwort „laut denkt“, ähnlich wie DeepSeek R1 oder OpenAI o1, aber mit einer muttersprachlichen Qualität im Französischen, die kein anderes Open-Weight-Reasoning-Modell erreicht. Dieser Leitfaden zeigt, wie Sie Mistral Magistral lokal über Ollama installieren, mit dem richtigen Prompt-Template konfigurieren und fair mit einer destillierten Version von DeepSeek R1 vergleichen.

Von Mohamed Meguedmi·Aktualisierung 2026-08-27·Unter Windows, macOS und Linux getestet

#Warum Magistral statt eines anderen Reasoning-Modells?

Reasoning-Modelle erzeugen vor der endgültigen Antwort eine explizite Gedankenkette. Bei komplexen Problemen – Mathematik, Logik, anspruchsvollem Code, juristischer Analyse – erzielen sie in Benchmarks 10 bis 30 Punkte mehr als ein allgemeines Modell gleicher Größe. Der Preis: Sie sind langsamer und wortreicher.

Bis zur Veröffentlichung von Magistral stammten die Open-Weights-Modelle überwiegend aus China: DeepSeek R1 und seine destillierten Varianten, Qwen3 im Thinking-Modus und GLM. Alle können auf Englisch und Chinesisch hervorragend schlussfolgern, aber ihre Gedankenkette wechselt regelmäßig ins Chinesische, selbst wenn der Prompt auf Französisch ist. Magistral wird speziell darauf trainiert, den aufgezeichneten Gedankengang in der Sprache des Prompts zu halten.

Natives mehrsprachiges Reasoning
Die Gedankenkette bleibt auf Französisch, wenn Sie auf Französisch schreiben. Keine plötzliche Umstellung auf Chinesisch oder Englisch.
Apache 2.0 für die Small-Version
Kommerzielle Nutzung erlaubt, Fine-Tuning ohne Einschränkungen, Weiterverbreitung gestattet. Keine Grauzonen wie bei manchen restriktiven „Open“-Lizenzen.
Basis: Mistral Small 3.1
Gute Schreibqualität auf Französisch, die vom Basismodell übernommen wurde und sich beim Verfassen juristischer oder administrativer Antworten zeigt.
Kontext 40k Tokens
Ausreichend für einen langen Problembeschreibung, mehrere Codeabschnitte oder einen Vertrag mit einigen Dutzend Seiten.
i
Reasoning = zusätzliche Tokens
Rechnen Sie vor jeder endgültigen Antwort mit 500 bis 3000 „Thinking“-Tokens. Bei einer weniger leistungsstarken GPU brauchen Sie Geduld: Bei einer komplexen Frage kann die Generierung 30 bis 60 Sekunden ununterbrochen laufen, bevor die erste nützliche Zeile erscheint.

#Magistral Small im Vergleich zu Magistral Medium

Das Lokale-KI-Paket

Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.

  • Lebenslanger Online-Zugang
  • PDF + Dateien
  • Erstattung binnen 30 Tagen

Mistral AI veröffentlicht Magistral in zwei Versionen, und Verwirrung ist häufig. Um Mistral Magistral lokal zu installieren, ist nur die Small-Version nutzbar – die Medium-Version ist nur über die API verfügbar.

Magistral Small (24B)
Offene Modellgewichte unter Apache 2.0. Genau dieses Modell wird lokal installiert. 24 Milliarden Parameter, abgeleitet von Mistral Small 3.1.
Magistral Medium
Proprietär, nur über die Mistral-API oder Le Chat zugänglich. Höhere Leistung, aber nicht selbst hostbar. Liegt außerhalb des Themas dieses Leitfadens.
→
Ein kleiner Tipp zur Benennung
Auf Ollama Hub heißt das Modell einfach `magistral`. „small“ müssen Sie nicht angeben: Die Medium-Version wird ohnehin nicht für den lokalen Betrieb bereitgestellt.

#Hardware-Voraussetzungen

Magistral Small hat 24 Milliarden Parameter. Bei der Quantisierung Q4_K_M (dem Ollama-Standard) sollten Sie etwa 14 GB VRAM zum Laden des Modells einplanen, dazu je nach Kontextlänge 1 bis 3 GB für den Kontext.

Minimum für einen komfortablen Betrieb
RTX 4080 mit 16 GB, RTX 4090 mit 24 GB, RTX 3090 mit 24 GB oder ein Mac mit Apple Silicon und 24 GB vereinheitlichtem Speicher.
Knapp, aber machbar
RTX 4070 Ti Super mit 16 GB (Q4 passt gerade noch hinein, ein kurzer Kontext ist zwingend erforderlich) oder ein Mac der M-Serie mit 16 GB und teilweisem Offloading.
Unzureichend
Jede GPU mit 12 GB oder weniger. Das Modell wird teilweise in den System-RAM ausgelagert, und die Generierung fällt auf 2–4 Tokens/s ab — unbrauchbar für ein Modell, das vor seiner Antwort Tausende von Tokens erzeugen muss.
Ollama und Treiber
Ollama ≥ 0.5.x, aktuelle NVIDIA-Treiber (CUDA 12) oder Metal auf dem Mac. Prüfen Sie die Version mit `ollama --version`.
!
Keine GPU mit 24 GB? Überdenken Sie Ihre Wahl
Magistral ist kein Modell, das Sie ohne leistungsstarke GPU ausprobieren sollten. Bei 12 GB oder weniger warten Sie mehrere Minuten pro Antwort. Nutzen Sie stattdessen eine 7B–14B-Distillation von DeepSeek R1 – auf Französisch weniger gut, aber auf bescheidener Hardware nutzbar.

#1. Installation über Ollama

Magistral Small ist seit der offiziellen Veröffentlichung durch Mistral auf Ollama Hub verfügbar. Für die Installation genügt ein einziger Befehl.

  1. 01
    Stellen Sie sicher, dass Ollama läuft
    Unter Windows/macOS muss die Anwendung laufen (Symbol in der Taskleiste). Unter Linux bestätigt `systemctl status ollama`, dass der Dienst aktiv ist.
  2. 02
    Modell herunterladen
    Die standardmäßige Quantisierung, die Ollama bereitstellt, ist Q4_K_M. Das ist ein guter Kompromiss für 16–24 GB VRAM.
  3. 03
    Erster Start
    Ollama lädt beim ersten `pull` ~14 GB herunter. Der erste Download kann je nach Ihrer Verbindung 10 bis 30 Minuten dauern.
  4. 04
    Ladetest
    Starten Sie `ollama run magistral` und stellen Sie dann eine kurze Frage. Wenn das Modell nach einer „Warmup“-Phase von 5–10 Sekunden antwortet, ist alles in Ordnung.
Terminal
ollama pull magistral
ollama run magistral

Mit folgendem Kontrollbefehl können Sie überprüfen, ob das Modell tatsächlich die GPU und nicht den CPU-Arbeitsspeicher verwendet:

Laufzeitstatus
ollama ps

In der Spalte PROCESSOR sollte `100% GPU` stehen. Wenn Sie `45% CPU / 55% GPU` sehen, reicht Ihr VRAM nicht aus: Ollama hat einen Teil des Modells in den Arbeitsspeicher ausgelagert. Das Modell läuft, allerdings mit 1–3 Tokens pro Sekunde.

#2. Die offizielle Prompt-Vorlage

Magistral verwendet ein spezielles Prompt-Format, um das Reasoning korrekt zu aktivieren. Ollama enthält diese Vorlage bereits im offiziellen Modelfile, aber es ist besser, sie zu verstehen, damit Sie sie nicht versehentlich durch einen falsch platzierten System-Prompt durcheinanderbringen.

Die erwartete Struktur, vereinfacht:

Rohformat (modellintern)
<s>[SYSTEM_PROMPT]Vous êtes un assistant qui raisonne soigneusement avant de répondre.[/SYSTEM_PROMPT][INST]Question utilisateur[/INST]
<think>
Chaîne de raisonnement interne...
</think>
Réponse finale</s>

In der Praxis schreiben Sie diese Tags nie von Hand: Ollama fügt sie automatisch ein. Wichtig zu wissen: Das Modell erwartet, dass Sie es zum logischen Nachdenken auffordern. Ein kurzer, klarer Systemprompt verbessert die Qualität deutlich.

System-Prompt konfigurieren
ollama run magistral
>>> /set system "Tu es un assistant rigoureux. Avant chaque réponse, analyse le problème étape par étape en français. Réponds de manière concise après ton raisonnement."
→
Die Aufforderung „Denk gründlich nach“ ist unnötig
Im Gegensatz zu einem Allzweckmodell führt Magistral standardmäßig Schlussfolgerungen durch. Sie müssen nicht „Nimm dir Zeit“ oder „Denke Schritt für Schritt“ schreiben: Das ist bereits sein normaler Arbeitsmodus. Eine ausdrückliche Aufforderung im Systemprompt, auf Französisch zu denken, hilft jedoch dabei, die Sprache festzulegen.

#3. Erste praktische Tests auf Französisch

Hier drei Prompts zur schnellen Bewertung von Magistral bei typischen Aufgaben. Beachten Sie, dass die Antworten in zwei Schritten eintreffen: zuerst die Gedankenfolge (`<think>...</think>`), dann die endgültige Antwort.

Test 1 — Logisches Problem
>>> Trois personnes se partagent 17 chevaux selon les proportions 1/2, 1/3, 1/9. Comment faire sans couper aucun cheval ?

Magistral wird den klassischen Gedankengang mit dem geliehenen Kamel Schritt für Schritt durchgehen. Rechnen Sie mit 1500 bis 2500 Thinking-Tokens vor der klaren, nummerierten Schlussantwort.

Test 2 — Python-Code
>>> Écris une fonction Python qui trouve le plus long sous-tableau dont la somme vaut zéro. Complexité O(n).

Eine gute Gelegenheit, die algorithmische Qualität zu beurteilen. Magistral schlägt in der Regel eine Lösung mit einem Dictionary für Präfixsummen vor und kommentiert während des Denkprozesses seine Wahl der Datenstruktur.

Test 3 — Juristische Texte auf Französisch verfassen
>>> Rédige une clause de non-concurrence pour un CDI de développeur en France, conforme au droit du travail français actuel.

Bei dieser Art von Anfrage macht Magistrals sprachliche Qualität im Französischen den Unterschied. Die erzeugte Klausel ist syntaktisch korrekt, nennt die Gültigkeitsbedingungen (zeitliche und räumliche Begrenzung, finanzielle Gegenleistung) und verwendet französische juristische Fachbegriffe – keine unbeholfene Übersetzung aus dem Englischen.

#4. Leistung: AIME, Mathematik, Code

Mistral AI hat offizielle Zahlen zu Magistral Small und Medium veröffentlicht. Die folgenden Werte sind die gerundeten Scores von Small (der einzigen Version, die sich selbst hosten lässt). Sie dienen lediglich als Orientierung – Ihre Ergebnisse variieren je nach Quantisierung und Sampling.

AIME 2024 (Mathematik-Olympiade)
Magistral Small: ca. 70 %, gegenüber ca. 50 % für Mistral Small 3.1 ohne Reasoning. Bei dieser Art von Aufgaben bringt der Reasoning-Modus einen enormen Gewinn.
LiveCodeBench (Code)
Gleiches oder leicht höheres Ergebnis als Qwen3-Coder 30B-A3B bei Aufgaben mittleren Schwierigkeitsgrads, niedrigeres Ergebnis bei schwierigen Aufgaben.
MMLU FR
Vergleichbar mit Mistral Small 3.1 base – das Schlussfolgern bringt bei Multiple-Choice-Fragen zum Allgemeinwissen keinen Vorteil, da die Antwort entweder im Gedächtnis gespeichert ist oder nicht.
GPQA Diamond (wissenschaftliches Schlussfolgern)
Deutliche Verbesserung durch den Thinking-Modus: etwa 50–55 % gegenüber 35–40 % beim Basismodell ohne Reasoning.
i
Quantisierung und Qualitätsverlust
Alle offiziellen Benchmarks werden in FP16 gemessen. Bei Q4_K_M (der Standardeinstellung von Ollama) müssen Sie mit einem Verlust von 1 bis 3 Punkten bei AIME rechnen. Wenn Sie 24 GB VRAM haben, lässt sich dieser Verlust durch einen Wechsel zu Q5_K_M oder Q6_K ausgleichen – auf Kosten eines etwas geringeren Durchsatzes.

#5. Magistral Small vs. DeepSeek R1 in der destillierten 14B-Version

Für französischsprachige Nutzer ist der Vergleich mit DeepSeek-R1-Distill-Qwen-14B sinnvoll, dem direkten Open-Weights-Konkurrenten für alle, die Reasoning lokal nutzen möchten. Beide Modelle haben ihre Stärken – hier erfahren Sie, was die praktischen Tests zeigen.

Speicherbedarf
DeepSeek R1 14B Q4 ≈ 9 GB, Magistral 24B Q4 ≈ 14 GB. Klarer Vorteil für DeepSeek, wenn Ihre GPU auf 12 GB begrenzt ist.
Qualität des Schlussfolgerns auf Französisch
Magistral bleibt von Anfang bis Ende bei Französisch. Das destillierte DeepSeek R1 wechselt in seiner Gedankenkette regelmäßig ins Chinesische oder Englische, selbst bei einem strikten französischen System-Prompt. Vorteil für Magistral.
Qualität der endgültigen Antwort auf Französisch
Magistral erzeugt besseres Französisch (Wortschatz, grammatische Kongruenz, Sprachregister). DeepSeek R1 14B macht typische sprachliche Fehler eines übersetzten Modells. Vorteil für Magistral.
Reine Mathematik (AIME, AMC)
Die destillierte 14B-Version von DeepSeek R1 ist bei sehr formalen Problemen etwas besser als Magistral Small. Vorteil für DeepSeek.
Code
Unentschieden in der Praxis. Beide generieren korrekten Code bei mittleren Aufgaben. Bei französischem Code (Kommentare, Variablennamen) ist Magistral sauberer.
Generationsgeschwindigkeit
DeepSeek 14B ist bei gleicher VRAM-Kapazität etwa 1,7× schneller, allein aufgrund seiner Größe. Bei einer interaktiven Sitzung fällt das ins Gewicht.
→
Das praktische Fazit
Wenn Sie hauptsächlich auf Französisch arbeiten – im Rechtsbereich, beim Schreiben, im Nutzersupport oder mit auf Französisch kommentiertem Code –, ist Magistral Small besser. Wenn Sie mit formaler Mathematik arbeiten oder eine GPU mit 12 GB Grafikspeicher verwenden, bleiben Sie beim destillierten DeepSeek R1 14B.

#6. Anwendungsfall: lokale juristische Analyse

Die Kombination aus hoher Qualität im Französischen, logischem Schlussfolgern und Selbsthosting macht Magistral zu einem hervorragenden Kandidaten für sensible juristische Aufgaben. Die juristischen Inhalte verlassen Ihren Rechner niemals – ein entscheidendes Argument für eine Kanzlei, die ihre Akten nicht an OpenAI senden kann.

Drei konkrete Anwendungsfälle, die gut funktionieren:

Analyse einer Vertragsklausel
Eine Klausel einfügen und die Risiken für die eine oder die andere Vertragspartei ermitteln lassen. Magistral legt seine Überlegungen offen, wodurch die Analyse überprüfbar wird – ein Mensch kann prüfen, wo das Modell ein Problem erkannt hat.
Versionenvergleich
Zwei Versionen eines Vertragsnachtrags einfügen und eine Liste der inhaltlich wesentlichen Unterschiede (keine kosmetischen) sowie ihrer Auswirkungen anfordern. Der Reasoning-Modus hilft, Unwesentliches vom Substanziellen zu trennen.
Interne Notiz verfassen
Eine zusammenfassende Notiz auf Grundlage eines Gesetzestextes oder eines Gerichtsurteils anfordern. Die sprachliche Qualität auf Französisch macht hier den Unterschied.
Beispiel für einen juristischen Prompt
>>> /set system "Tu es un juriste qui analyse les contrats en droit français. Raisonne méthodiquement avant de conclure. Cite les principes juridiques mobilisés."
>>> Analyse cette clause de mobilité géographique : [coller le texte]
!
Der LLM ersetzt einen Anwalt nicht
Magistral kann im französischen Recht halluzinieren – einen nicht existierenden Gesetzesartikel zitieren oder ein Urteil falsch referenzieren. Sein Nutzen besteht darin, juristische Überlegungen zu strukturieren und einen ersten Entwurf zu beschleunigen, nicht darin, eine Schlussfolgerung zu liefern, die unverändert unterschrieben werden kann. Jede Passage, die für einen Mandanten oder einen Richter bestimmt ist, muss von einer fachkundigen Person überprüft und freigegeben werden.

#Fehlerbehebung

Das Modell wechselt beim Nachdenken ins Englische
Ergänzen Sie den Systemprompt um eine ausdrückliche Anweisung: „Denke nach und antworte ausschließlich auf Französisch.“ Falls das nicht ausreicht, fügen Sie vor der eigentlichen Frage eine kurze erste Nachricht auf Französisch hinzu, um die Sprache zu verankern.
Antworten werden vor dem Fazit abgeschnitten
Das Modell hat sein Token-Budget in der Denkphase aufgebraucht. Erweitern Sie das Fenster mit `/set parameter num_ctx 16384` und `/set parameter num_predict 4096`.
Generierung mit 1–2 Tokens pro Sekunde
Das Modell läuft auf der CPU oder ist teilweise dorthin ausgelagert. `ollama ps` bestätigt das. Lösungen: VRAM freigeben (Chrome / Steam schließen), zu einer aggressiveren Quantisierung wie Q3_K_M wechseln oder akzeptieren, dass diese GPU nicht ausreicht.
Die Tags <think> erscheinen in der endgültigen Antwort
Erwartetes Verhalten bei der Rohausgabe. Eine Benutzeroberfläche wie Open WebUI oder LM Studio klappt sie automatisch in einem ein- und ausklappbaren „reasoning“-Block zusammen. In der Ollama-CLI bleiben sie sichtbar – das ist so vorgesehen.
Modell „halluziniert“ bei aktuellen Fakten
Der Wissensstand von Magistral Small ist auf den Zeitpunkt seines Trainings begrenzt. Für aktuelle Faktenfragen (neuere Rechtsprechung, aktuelle Ereignisse) ist eine RAG-Pipeline nötig, nicht nur das Modell allein.

#Weiterführende Informationen

Magistral ist ein hervorragendes französisches Modell für alle, die über die nötige GPU verfügen. Einige Tipps, um Ihre Installation optimal zu nutzen:

Mit DeepSeek R1 auf Ihrem Rechner vergleichen
Die Installationsanleitung DeepSeek R1 zeigt, wie die 14B-Distillation parallel zu Magistral installiert werden kann, um sie an Ihren eigenen Prompts direkt nebeneinander zu testen.
Magistral mit Ihren juristischen PDF-Dateien verknüpfen
Der Guide PrivateGPT v2 beschreibt eine 100 % lokale RAG-Pipeline, die Magistral perfekt für vertrauliche Dokumentenanalyse ergänzt.
Die am besten geeignete Quantisierung wählen
Wenn Sie zwischen Q4_K_M, Q5_K_M und Q6_K schwanken, erläutert der Leitfaden „Quantisierung auswählen“ die jeweiligen Vor- und Nachteile. Bei einem Reasoning-Modell fallen Quantisierungsverluste stärker auf als bei einem Allzweckmodell.
Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.