🇺🇸 Laguna XS.2
MoE mit 33B/3B aktiven Parametern unter Apache 2.0, Spezialist für agentisches Programmieren. 68,2 % SWE-Bench Verified, 128k ctx. Läuft auf einem Mac mit 36 GB. Veröffentlichung am 28. April 2026.
ollama run laguna-xs.2
Rangliste aktualisiert am 09/10/2026
Für den kommerziellen Einsatz (SaaS, kostenpflichtiges Produkt, interner Unternehmensdienst) sind nur permissive Lizenzen (Apache 2.0, MIT, BSD) wirklich unproblematisch. Community-Lizenzen mit Nutzergrenzen und Lizenzen, die keinen Produktivbetrieb erlauben, schließen wir aus.
MoE mit 33B/3B aktiven Parametern unter Apache 2.0, Spezialist für agentisches Programmieren. 68,2 % SWE-Bench Verified, 128k ctx. Läuft auf einem Mac mit 36 GB. Veröffentlichung am 28. April 2026.
ollama run laguna-xs.2
MoE-Variante von Gemma 4. 26B Parameter, davon 4B aktiv. Vollständig multimodal (Text+Bild+Audio).
ollama run gemma4:26b
Erstes offenes dLLM unter Apache 2.0: MoE 16B/1B + Diffusionsdecoder mit 6,2B Parametern. Text und Vision in einem einheitlichen Modell. Veröffentlicht am 22. April 2026.
# HuggingFace : inclusionAI/LLaDA2.0-Uni (Flash Attn 2 + CUDA 12.4 requis)
Dichtes multimodales 27B-Modell, veröffentlicht am 22. April 2026. 262k ctx (1M YaRN). SWE-bench Verified 77.2%.
ollama run qwen3.6:27b
Qwen 3.8 27B: dichtes multimodales Modell (Text + Vision), 262k Kontext, ca. 16 GB VRAM bei Q4 (18 GB Ollama-Gewichte). Apache 2.0, agentisches Programmieren und Vision.
ollama run qwen3.8:27b
GLM-4.7-Flash (MoE mit 31B Parametern, davon ~3B aktiv): das beste Verhältnis von Code-Leistung zu VRAM-Bedarf in der 30B-Klasse. MIT, 128k ctx, sehr schnell auf 3090/4090.
ollama run glm-4.7-flash
Dichtes multimodales 31B-Modell (Text+Bild+Audio). 140+ Sprachen, 256k Kontext. Platz 3 in der Chatbot Arena unter den offenen Modellen.
ollama run gemma4:31b
Dichtes 30B-Modell unter Apache 2.0, 12 Sprachen einschließlich Französisch, 131k ctx, GQA 32Q/8KV. OpenAI-kompatibles Tool Calling. Veröffentlicht am 29. April 2026.
ollama run granite4.1:30b
| Rang | Modell | Params | VRAM Q4 | Kontext | Lizenz |
|---|---|---|---|---|---|
| #1 | Laguna XS.2 | 33B | 19 GB | 131 072 | Apache 2.0 |
| #2 | Gemma 4 26B-A4B MoE | 26B | 16 GB | 128 000 | Apache 2.0 |
| #3 | LLaDA 2.0 Uni 16B | 16B | 18 GB | 8 192 | Apache 2.0 |
| #4 | Qwen 3.6 27B | 27B | 16 GB | 262 144 | Apache 2.0 |
| #5 | Qwen 3.8 27B | 27B | 16 GB | 262 144 | Apache 2.0 |
| #6 | GLM 4.7 Flash | 31B | 19 GB | 128 000 | MIT |
| #7 | Gemma 4 31B | 31B | 18 GB | 256 000 | Apache 2.0 |
| #8 | Granite 4.1 30B Instruct | 30B | 17 GB | 131 072 | Apache 2.0 |
Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.
Strenger Filter: Die Lizenz enthält Apache, MIT oder BSD. Keine Llama Community (Schwellenwert: 700 Millionen MAU), keine Mistral NPL, keine Gemma (eigene permissive Lizenz, jedoch mit Klauseln zur zulässigen Nutzung).
Berücksichtigte Kriterien:
Die Bewertung ist vollständig transparent: konsultieren Sie unsere Methodik für Details zur Berechnung des VRAM-Bedarfs und der Tokens pro Sekunde.
Ist Llama 3.3 70B für die kommerzielle Nutzung frei?
Nein, Llama 3.3 steht unter der „Llama 3.3 Community License“ — frei, außer wenn Ihr Produkt 700 Millionen MAU überschreitet. Für ein künftiges Produkt für den Massenmarkt ist das ein Risiko. Bevorzugen Sie Qwen (Apache 2.0) oder Mistral (Apache 2.0 bei den offenen Modellen).
Und Gemma von Google?
Gemma steht unter der „Gemma License“ – einer permissiven Lizenz, allerdings mit einer Klausel zur zulässigen Nutzung (nicht für Waffen, Massenüberwachung usw.). Für die meisten B2B-Anwendungen ist das in Ordnung, aber lesen Sie die Lizenz sorgfältig, wenn Ihr Produkt den Bereich Verteidigung oder Sicherheit betrifft.
Kann ich ein Modell unter Apache 2.0 fine-tunen und weiterverkaufen?
Ja — Apache 2.0 erlaubt die Bearbeitung und Verteilung, einschließlich kommerzieller Nutzung. Sie müssen lediglich die Attribution und die Lizenz bei den neu verteilten Gewichten beibehalten. Ihre eigenen Trainingsdaten bleiben Ihre eigenen.
Qwen stammt aus China — besteht hier ein rechtliches Risiko?
Die Qwen-Modelle werden von Alibaba Cloud unter Apache 2.0 veröffentlicht. Die Lizenz gilt international. Für sehr sensible Anwendungen (Verteidigung, Gesundheit) bevorzugen einige Unternehmen Mistral (🇫🇷) oder IBM Granite (🇺🇸), weil sich deren Herkunft nachvollziehen lässt.