Bester Open-Source-LLM für Bildung und Lehre
Wählen Sie ein Open-Source-LLM für Bildung bedeutet, zwischen der pädagogischen Qualität der Schlussfolgerungen, der Fähigkeit, ein Konzept Schritt für Schritt zu erklären, und dem sparsamen Hardwareeinsatz abzuwägen, den eine Bereitstellung in Bildungseinrichtungen oder auf dem Rechner einer Lehrkraft erfordert. Das Open-Source-LLM für Bildung bietet einen entscheidenden Vorteil gegenüber proprietären Diensten: Kontrolle über die Schülerdaten, keine Kontingentbegrenzungen, einfachere Einhaltung der DSGVO und keine Grenzkosten nach der Installation. Dieser Artikel vergleicht die relevantesten offenen Modelle für die Lernbetreuung, die Erstellung von Übungen, die Hausaufgabenhilfe, die automatische Korrektur und die Erstellung mehrsprachiger Lehr- und Lerninhalte, einschließlich ihrer VRAM-Anforderungen, Lizenzen und konkreten Anwendungsfälle, um von der Abhängigkeit von Khanmigo zu einem lokalen, souveränen Lerntutor überzugehen.
Welche Kriterien gelten für einen pädagogischen LLM?
Ein Modell für den Unterricht wird nicht wie ein Code-Modell gewählt. Prioritäten:
- Mehrstufiges Schlussfolgern : Fähigkeit, ein mathematisches oder physikalisches Problem in Teilschritte zu zerlegen, ohne logische Übergänge zu überspringen. Die AIME- und MATH-Scores (veröffentlicht auf Papers With Code) sind nützliche Indikatoren.
- Allgemeine Kenntnisse (MMLU) : Abdeckung der Disziplinen (Geschichte, Biologie, Wirtschaft). Modelle mit > 80 % bei MMLU sind seriöse Kandidaten für die Sekundar- und Hochschulbildung.
- Qualität des Französischen : entscheidend für das französischsprachige Publikum. Europäische Modelle wie Mistral Large 3 675B oder Apertus 70B (Swiss AI) haben einen inhärenten Vorteil, ebenso wie Salamandra 40B Instruct auf europäischen multilingualen Korpora trainiert.
- Permissive Lizenz : Apache 2.0 oder MIT erlauben einen reibungslosen Einsatz in Schulen ohne rechtliche Hürden. Die Lizenz Llama Community beschränkt die Anzahl aktiver monatlicher Benutzer.
- Kontextfenster : um ein Lehrbuch oder mehrere Schülerarbeiten zu verarbeiten. Llama 4 Scout 109B kündigt ein Kontextfenster von 10 Millionen Tokens an, Seed-OSS 36B Instruct bietet 524.288 Tokens.
- Halluzinationen unter Kontrolle : Ein Tutor, der eine Formel erfindet, ist schlechter als ein Lehrbuch. Modelle mit einem expliziten „Reasoning“-Modus bevorzugen, etwa DeepSeek R1 671B oder QwQ 32B.
Für eine umfassendere Analyse der Auswahlkriterien siehe den allgemeiner Leitfaden zum Auswählen eines LLM auf quelllm.fr.
Schulische Lernunterstützung in der Sekundarstufe I und II: Modelle mit 30–70 Milliarden Parametern
Für einen Lehrkräfte-Arbeitsplatz mit einer 24-GB-Grafikkarte (RTX 4090, RTX 5090) oder eine Workstation mit zwei GPUs ist die 30–70B-Klasse der optimale Bereich. Sie ermöglicht zufriedenstellende Schlussfolgerungen, ohne den VRAM vollständig auszulasten.
- Qwen 3 32B (Apache 2.0): VRAM bei Q4 ~19 GB, Kontext 131.072 Tokens. Hervorragend in Mathematik und im schriftlichen Französisch, native Unterstützung für Chain-of-Thought. Detailliertes Profil auf HuggingFace Qwen.
- Gemma 4 31B (Gemma-Lizenz): 18 GB in Q4, 256.000 Tokens Kontext. Gut auf ein schulisches Publikum abgestimmte Antworten, maßvoller Ton.
- Llama 3.3 70B Instruct (Llama 3.3 Community): 40 GB in Q4. Ein absoluter Maßstab für Allgemeinwissen, mit hohem MMLU-Wert. Zu vermeiden, wenn die Bildungseinrichtung mehr als 700 Mio. monatlich aktive Nutzer hat – eine Schwelle, die im Bildungsbereich selten erreicht wird.
- DeepSeek R2 32B (MIT): 19 GB in Q4, explizites Reasoning. Ein guter Kandidat für die Unterstützung bei Aufgaben in Mathematik, Physik und Chemie.
- OLMo 3 32B (Apache 2.0, Allen AI): 19 GB in Q4. Besonderheit: vollständig offenes Modell (Gewichte + Daten + Trainingsrezept), wertvoll für akademische Anwendungen, bei denen Reproduzierbarkeit zählt. Siehe das offizielle Repository von Allen AI.
- Apertus 70B (Apache 2.0): 40 GB in Q4. Europäisches mehrsprachiges Modell, von Swiss AI mit Blick auf Souveränität entwickelt.
Für einen numerischen Vergleich siehe die Seite Qwen 3 32B vs Llama 3.3 70B.
Ressourcensparsamkeit: Modelle mit 30–40 Milliarden Parametern lassen sich auf einer Consumer-GPU betreiben
Für eine Schule der Sekundarstufe II mit einer einzigen RTX 4090 oder ein schulisches Dokumentations- und Informationszentrum (CDI), das einen Rechner gemeinsam nutzen lässt, bleibt es notwendig, Modelle mit einem VRAM-Bedarf von unter 24 GB in Q4 anzustreben.
- Qwen 3.6 35B-A3B (Apache 2.0): 21 GB in Q4, MoE-Architektur mit 3 Milliarden aktiven Parametern. Hohe Inferenzgeschwindigkeit, da bei jedem Token nur die relevanten Experten aktiviert werden. Ideal für einen schnell reagierenden Tutor im Unterricht.
- Seed-OSS 36B Instruct (Apache 2.0, ByteDance): 22 GB in Q4, Kontext von 524.288 Tokens. Ermöglicht die Analyse eines kompletten Handbuchs oder einer langen Arbeit ohne Aufteilung.
- Salamandra 40B Instruct (Apache 2.0, Barcelona Supercomputing Center) : 24 GB in Q4. Speziell für europäische Sprachen trainiert, darunter Französisch und Spanisch. Dokumentiert auf HuggingFace BSC-LT.
- Yi 1.5 34B Chat (Apache 2.0, 01.AI): 20 GB in Q4. Vielseitig einsetzbar, aber der Kontext ist auf 4.096 Tokens begrenzt — daher kurzen Interaktionen vorbehalten.
Schätzung der Token pro Sekunde auf RTX 4090 bei Q4: 35–50 Tok/s für dichte 32B-Modelle, 80–120 Tok/s für MoE-Modelle wie Qwen 3.6 35B-A3B. Weitere Informationen finden Sie im Geschwindigkeitsbenchmark auf quelllm.fr.
Anwendungsfälle: Übungen erstellen, Arbeiten korrigieren, ein Konzept erklären
Erstellung differenzierter Übungen. Eine Lehrkraft gibt ein Lernziel und drei Niveaus (Förderung, Standard, Vertiefung) vor. Mistral Small 4 (Apache 2.0, 119B, 72 GB in Q4) erzeugt gut formulierte Aufgabenstellungen auf Französisch und hält die Vorgaben zum Schwierigkeitsgrad ein. Qwen 3.5 122B-A10B (73 GB in Q4) bietet mit seinen 10B aktiven Parametern ein hervorragendes Verhältnis von Geschwindigkeit zu Qualität für die Produktion in großen Mengen.
Korrektur kurzer Schülerarbeiten. Die Funktion-Grille (Aufgabenstellung + Bewertungskriterien + Schülerkopie) erfordert Präzision. DeepSeek R1 Distill 32B (MIT, 19 GB in Q4) oder QwQ 32B (Apache 2.0) kommen gut mit strukturierten Bewertungsrastern zurecht. Eine menschliche Lehrkraft muss für die endgültige Notenvergabe weiterhin eingebunden bleiben.
Dialogbasiertes Tutoring nach dem Vorbild von Khanmigo. Ziel ist es, Orientierung zu geben, ohne die Antwort vorzugeben. Llama 3.3 70B Instruct et Gemma 4 31B zeigen ein Verhalten, das sich an der sokratischen Pädagogik orientiert. Für eine Alternative zu Khanmigo vollständig lokal, diese beiden Modelle kombiniert mit einer dokumentbasierten RAG-Technologie zu den offiziellen Programmen bilden eine solide Grundlage.
Multimodale Wissensvermittlung. Um ein Schaubild aus dem Biologie- oder Geologieunterricht zu erklären oder eine historische Abbildung zu kommentieren, zu einem Bild-Sprach-Modell wechseln: Qwen 3 VL 235B-A22B (142 GB bei Q4) oder LLaVA-OneVision 72B (42 GB in Q4) für Einrichtungen mit ausreichender Ausstattung.
Souveränität, Compliance und Hosting in der Bildungseinrichtung
Der Einsatz eines lokaler KI-Tutor in einer Schule wirft drei konkrete Fragen auf:
- Hosting : ein akademischer oder kommunaler Server ohne ausgehenden Datenverkehr zu einer Cloud im Ausland. Modelle unter MIT- und Apache-2.0-Lizenz (DeepSeek R2 32B, Mistral Small 4, OLMo 3 32B) schränken die interne Weiterverteilung nicht ein.
- DSGVO-Konformität : Kein Prompt eines Schülers wird Dritten offengelegt. Die europäische Verordnung (EUR-Lex 2016/679) lässt sich mit einem On-Premises-Modell leichter einhalten.
- Filterung und Sicherheit : ein vorgeschaltetes Moderationssystem (Klassifikator, Prompt-Blacklist) bleibt erforderlich. Ohne ausdrückliche Schutzmaßnahmen ist kein offenes LLM von sich aus sicher für Minderjährige.
Um die Auswirkungen einer souveränen Architektur zu erkunden, siehe den Leitfaden zur On-Premises-Bereitstellung auf quelllm.fr.
FAQ
F: Welches Open-Source-LLM sollten Sie wählen, wenn Ihr GPU-Budget für eine einzelne RTX 4090 reicht?
auf einer einzigen RTX 4090 (24 GB VRAM) bis zu Qwen 3 32B oder Gemma 4 31B mit Q4-Quantisierung (~19 GB) lässt Spielraum für das Kontextfenster. Für ein besseres Verhältnis von Geschwindigkeit zu Qualität, Qwen 3.6 35B-A3B als MoE dank seiner 3 Milliarden aktiven Parameter schnellere Antworten liefert.
F: Gibt es eine echte lokale Alternative zu Khanmigo?
Ja. Llama 3.3 70B Instruct oder Apertus 70B in Kombination mit einer dokumentarischen Datenbank RAG (Handbücher, offizielle Programme) und einem socratischen Systemprompt simuliert die Funktion des Lehrers von Khanmigo, ohne Schülerdaten an Dritte zu übermitteln. Ca. 40 GB VRAM und eine Station mit 2 GPUs von 24 GB
F: Reichen europäische Modelle für Französisch im schulischen Kontext aus?
Mistral Large 3 675B et Mistral Small 4 (Apache 2.0) zeichnen sich im Französischen aus und halten die typografischen Konventionen ein. Salamandra 40B Instruct (Apache 2.0, BSC) und Apertus 70B (Swiss AI) werden auf mehrsprachigen europäischen Korpora mit einem hohen Anteil französischsprachiger Texte trainiert — relevant für einen souveränen Einsatz.
F: Welche Lizenz sollte für einen Einsatz in einer Schule bevorzugt werden?
Apache 2.0 und MIT sind die sichersten: keine Einschränkung der kommerziellen Nutzung, keine Nutzerschwelle. Die Llama Community-Lizenz stellt bei mehr als 700 Millionen monatlich aktiven Nutzern Bedingungen — für eine Bildungseinrichtung selten einschränkend, aber mit der Rechtsabteilung der zuständigen Schulbehörde zu prüfen.
F: Ist für die Mathematiknachhilfe ein „Reasoning“-Modell erforderlich?
Für die Schule eignet sich ein allgemeiner Modell wie Gemma 4 31B reicht aus. Für die gymnasiale Oberstufe mit naturwissenschaftlichem Schwerpunkt und den Hochschulbereich zu DeepSeek R1 Distill 32B, QwQ 32B oder DeepSeek R2 32B die ihre Denkprozesse offenlegen. Die AIME-Scores, die auf HuggingFace Open LLM Leaderboard bestätigen ihre Überlegenheit bei mehrschrittigen Aufgaben.
Q: Wie kann man Halluzinationen in pädagogischen Anwendungen vermeiden?
Drei kombinierbare Maßnahmen: (1) das Modell mit einer RAG-Wissensbasis aus offiziellen Lehrbüchern und Lehrplänen verbinden, (2) bei Verwendung eines Reasoning-Modells stets die Gedankenkette anzeigen, (3) klare Vorgaben im Systemprompt machen („wenn du dir nicht sicher bist, sage es ausdrücklich“). Keine einzelne Maßnahme beseitigt die Fehler.
Fazit
Die Wahl eines Open-Source-LLM für Bildung hängt von der verfügbaren Hardware, der Zielsprache und der Bildungsstufe ab. Für die Sekundarstufen I und II mit einer einzelnen GPU, Qwen 3 32B, Gemma 4 31B oder Qwen 3.6 35B-A3B sind solide Einstiegsmöglichkeiten; für einen souveränen Einsatz in einer gesamten Bildungseinrichtung Mistral Small 4, Apertus 70B oder Llama 3.3 70B Instruct bieten eine mit proprietären Diensten vergleichbare Qualität. Um die Auswahl auf Ihre konkrete Hardware abzustimmen, verwenden Sie den Konfigurator quelllm.fr oder durchsuchen Sie den vollständiger Katalog der 249 Modelle.