Startseite › Katalog › Bestes freies lokales LLM für den kommerziellen Gebrauch

Bestes freies lokales LLM für den kommerziellen Gebrauch

◆ Lokale KI — Ihr privates und kostenloses ChatGPT, auf Ihrem Rechner, in 1 h · 24 € · oder alle Kits für 49 € →

Rangliste aktualisiert am 09/10/2026

Für den kommerziellen Einsatz (SaaS, kostenpflichtiges Produkt, interner Unternehmensdienst) sind nur permissive Lizenzen (Apache 2.0, MIT, BSD) wirklich unproblematisch. Community-Lizenzen mit Nutzergrenzen und Lizenzen, die keinen Produktivbetrieb erlauben, schließen wir aus.

Rangliste

1

🇺🇸 Laguna XS.2

Poolside · 33 Milliarden Parameter · Apache 2.0 · Kontext: 131 072 Tokens

MoE mit 33B/3B aktiven Parametern unter Apache 2.0, Spezialist für agentisches Programmieren. 68,2 % SWE-Bench Verified, 128k ctx. Läuft auf einem Mac mit 36 GB. Veröffentlichung am 28. April 2026.

Warum dieser Rang Lizenz Apache 2.0 — frei für kommerziellen Gebrauch ohne Beschränkungen. 33B Parameter.
ollama run laguna-xs.2
VRAM Q4
19 GB
35 GB bei Q8-Quantisierung
2

🇺🇸 Gemma 4 26B-A4B MoE

Google · 26B Parameter · Apache 2.0 · Kontext: 128 000 Tokens

MoE-Variante von Gemma 4. 26B Parameter, davon 4B aktiv. Vollständig multimodal (Text+Bild+Audio).

Warum dieser Rang Apache-2.0-Lizenz — frei für die kommerzielle Nutzung ohne Einschränkungen. 26 Milliarden Parameter.
ollama run gemma4:26b
VRAM Q4
16 GB
28 GB in Q8
3

🇨🇳 LLaDA 2.0 Uni 16B

Ant Group / inclusionAI · 16 Milliarden Parameter · Apache 2.0 · 8 192 Tokens ctx

Erstes offenes dLLM unter Apache 2.0: MoE 16B/1B + Diffusionsdecoder mit 6,2B Parametern. Text und Vision in einem einheitlichen Modell. Veröffentlicht am 22. April 2026.

Warum dieser Rang Apache-2.0-Lizenz — ohne Einschränkungen für die kommerzielle Nutzung freigegeben. 16 Milliarden Parameter.
# HuggingFace : inclusionAI/LLaDA2.0-Uni (Flash Attn 2 + CUDA 12.4 requis)
VRAM Q4
18 GB
30 GB in Q8
4

🇨🇳 Qwen 3.6 27B

Alibaba · 27B Parameter · Apache 2.0 · 262 144 tokens ctx

Dichtes multimodales 27B-Modell, veröffentlicht am 22. April 2026. 262k ctx (1M YaRN). SWE-bench Verified 77.2%.

Warum dieser Rang Apache-2.0-Lizenz — frei für die kommerzielle Nutzung ohne Einschränkungen. 27 Milliarden Parameter.
ollama run qwen3.6:27b
VRAM Q4
16 GB
29 GB in Q8
5

🇨🇳 Qwen 3.8 27B

Alibaba · 27B Parameter · Apache 2.0 · 262 144 tokens ctx

Qwen 3.8 27B: dichtes multimodales Modell (Text + Vision), 262k Kontext, ca. 16 GB VRAM bei Q4 (18 GB Ollama-Gewichte). Apache 2.0, agentisches Programmieren und Vision.

Warum dieser Rang Apache-2.0-Lizenz — frei für die kommerzielle Nutzung ohne Einschränkungen. 27 Milliarden Parameter.
ollama run qwen3.8:27b
VRAM Q4
16 GB
29 GB in Q8
6

🇨🇳 GLM 4.7 Flash

Zhipu AI · 31B Parameter · MIT · Kontext: 128 000 Tokens

GLM-4.7-Flash (MoE mit 31B Parametern, davon ~3B aktiv): das beste Verhältnis von Code-Leistung zu VRAM-Bedarf in der 30B-Klasse. MIT, 128k ctx, sehr schnell auf 3090/4090.

Warum dieser Rang Lizenz MIT — frei für kommerziellen Gebrauch ohne Einschränkung. 31B Parameter.
ollama run glm-4.7-flash
VRAM Q4
19 GB
35 GB bei Q8-Quantisierung
7

🇺🇸 Gemma 4 31B

Google · 31B Parameter · Apache 2.0 · 256 000 Tokens ctx

Dichtes multimodales 31B-Modell (Text+Bild+Audio). 140+ Sprachen, 256k Kontext. Platz 3 in der Chatbot Arena unter den offenen Modellen.

Warum dieser Rang Lizenz Apache 2.0 – frei für kommerziellen Gebrauch ohne Einschränkungen. 31B Parameter.
ollama run gemma4:31b
VRAM Q4
18 GB
33 GB in Q8
8

🇺🇸 Granite 4.1 30B Instruct

IBM · 30B Parameter · Apache 2.0 · Kontext: 131 072 Tokens

Dichtes 30B-Modell unter Apache 2.0, 12 Sprachen einschließlich Französisch, 131k ctx, GQA 32Q/8KV. OpenAI-kompatibles Tool Calling. Veröffentlicht am 29. April 2026.

Warum dieser Rang Lizenz Apache 2.0 – frei für kommerziellen Gebrauch ohne Einschränkungen. 30B Parameter.
ollama run granite4.1:30b
VRAM Q4
17 GB
32 GB in Q8

Vergleichstabelle

Rang Modell Params VRAM Q4 Kontext Lizenz
#1 Laguna XS.2 33B 19 GB 131 072 Apache 2.0
#2 Gemma 4 26B-A4B MoE 26B 16 GB 128 000 Apache 2.0
#3 LLaDA 2.0 Uni 16B 16B 18 GB 8 192 Apache 2.0
#4 Qwen 3.6 27B 27B 16 GB 262 144 Apache 2.0
#5 Qwen 3.8 27B 27B 16 GB 262 144 Apache 2.0
#6 GLM 4.7 Flash 31B 19 GB 128 000 MIT
#7 Gemma 4 31B 31B 18 GB 256 000 Apache 2.0
#8 Granite 4.1 30B Instruct 30B 17 GB 131 072 Apache 2.0
Das Lokale-KI-Paket

Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.

  • Lebenslanger Online-Zugang
  • PDF + Dateien
  • Lebenslange Updates

Methodik des Rankings

Strenger Filter: Die Lizenz enthält Apache, MIT oder BSD. Keine Llama Community (Schwellenwert: 700 Millionen MAU), keine Mistral NPL, keine Gemma (eigene permissive Lizenz, jedoch mit Klauseln zur zulässigen Nutzung).

Berücksichtigte Kriterien:

  • Lizenz Apache 2.0 / MIT / BSD
  • Keine einschränkenden Nutzungsklauseln
  • Kompatibel mit SaaS
  • Frei weiterverteilbare Modellgewichte

Die Bewertung ist vollständig transparent: konsultieren Sie unsere Methodik für Details zur Berechnung des VRAM-Bedarfs und der Tokens pro Sekunde.

Häufige Fragen

Ist Llama 3.3 70B für die kommerzielle Nutzung frei?

Nein, Llama 3.3 steht unter der „Llama 3.3 Community License“ — frei, außer wenn Ihr Produkt 700 Millionen MAU überschreitet. Für ein künftiges Produkt für den Massenmarkt ist das ein Risiko. Bevorzugen Sie Qwen (Apache 2.0) oder Mistral (Apache 2.0 bei den offenen Modellen).

Und Gemma von Google?

Gemma steht unter der „Gemma License“ – einer permissiven Lizenz, allerdings mit einer Klausel zur zulässigen Nutzung (nicht für Waffen, Massenüberwachung usw.). Für die meisten B2B-Anwendungen ist das in Ordnung, aber lesen Sie die Lizenz sorgfältig, wenn Ihr Produkt den Bereich Verteidigung oder Sicherheit betrifft.

Kann ich ein Modell unter Apache 2.0 fine-tunen und weiterverkaufen?

Ja — Apache 2.0 erlaubt die Bearbeitung und Verteilung, einschließlich kommerzieller Nutzung. Sie müssen lediglich die Attribution und die Lizenz bei den neu verteilten Gewichten beibehalten. Ihre eigenen Trainingsdaten bleiben Ihre eigenen.

Qwen stammt aus China — besteht hier ein rechtliches Risiko?

Die Qwen-Modelle werden von Alibaba Cloud unter Apache 2.0 veröffentlicht. Die Lizenz gilt international. Für sehr sensible Anwendungen (Verteidigung, Gesundheit) bevorzugen einige Unternehmen Mistral (🇫🇷) oder IBM Granite (🇺🇸), weil sich deren Herkunft nachvollziehen lässt.

Weiterführende Informationen

Die QuelLLM-Pakete Der maßgebliche Leitfaden für jeden Anwendungsfall
Alle Kits lebenslang — 49 €