Mittelstufe 11 Min.Neuigkeiten

Kimi K3 zu Hause: die Wahrheit über die erforderliche Hardware (2,8 T Parameter)

Direkte Antwort

Kimi K3 läuft nicht auf einem Desktop-Rechner: Seine nativen Gewichte sind 1,56 TB groß, und selbst die kleinste veröffentlichte GGUF-Quantisierung (Unsloth, dynamische 1-Bit-Quantisierung) belegt noch 594 GB, bei einem empfohlenen Speicherbedarf von 610 GB. Weder ein Mac Studio mit 512 GB noch eine einzelne RTX 5090 reicht dafür aus. Um das Modell auszuprobieren, nutzen Sie die API von Moonshot oder kimi-k3:cloud über Ollama; für den lokalen Betrieb wählen Sie ein kleineres Modell.

Die Gewichte von Kimi K3 sind seit Ende Juli 2026 offen verfügbar, und die Suchanfragen „ollama kimi k3“, „kimi k3 lmstudio“ oder „kimi k3 on 5090“ zeigen, dass sich viele Leser fragen, ob sie das Modell bei sich zu Hause installieren können. Dieser Leitfaden nennt die von Moonshot und Unsloth veröffentlichten Zahlen, berechnet, was Ihr Rechner laden kann, und zeigt, was Sie stattdessen tun können.

Von Mohamed Meguedmi·Aktualisierung 2026-09-30·Unter Windows, macOS und Linux getestet

#Kimi K3 lokal: genau das, was Moonshot tatsächlich veröffentlicht hat

Die Hugging-Face-Modellseite von Moonshot beschreibt Kimi K3 als ein multimodales Modell mit offenen Gewichten und 2,8 Billionen Parametern sowie einem Kontextfenster von einer Million Tokens. Es handelt sich um ein Mixture-of-Experts-Modell: 896 Experten, von denen für jedes Token 16 ausgewählt werden, wodurch 104 Milliarden Parameter aktiviert werden. Die Gewichte werden in MXFP4 (Gewichte) mit MXFP8-Aktivierungen bereitgestellt; quantisierungsbewusstes Training wurde bereits in der Phase des überwachten Fine-Tunings angewendet. Der Code und die Gewichte unterliegen der „Kimi K3 License“: Lesen Sie diesen Text vor jeder kommerziellen Nutzung, denn es handelt sich nicht um eine übliche MIT- oder Apache-Lizenz. Laut Fachpresse erschien das Modell um den 27. Juli 2026 auf Hugging Face.

Gesamte Parameter / aktive Parameter
2,8 T insgesamt, 104 Md aktive Token pro Token (Fiche Moonshot).
Experten
896 Experten, 16 pro Token ausgewählt, plus 2 gemeinsame Experten
Veröffentlichtes Format
MXFP4 für die Gewichte, MXFP8 für die Aktivierungen. Das ist kein GGUF.
Kontext
1.048.576 Tokens, mit einem KV-Cache, dessen Speicherbedarf zum Speicherbedarf der Modellgewichte hinzukommt.
Empfohlene Inferenz-Engines
vLLM, SGLang und TokenSpeed. llama.cpp nutzt die GGUF-Community-Dateien.
i
Aktiv bedeutet nicht im Speicher vorgehalten
Nur 104 Milliarden Parameter sind pro Token aktiv, aber der Router kann jeden beliebigen Experten auswählen: Daher müssen alle Gewichte zugänglich bleiben. Der Speicherbedarf bestimmt die Hardware, nicht die Rechenleistung. Das Prinzip wird in unserem Leitfaden zu MoE ausführlich erklärt.

#Was die Gewichte wirklich wiegen

Das Lokale-KI-Paket

Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.

  • Lebenslanger Online-Zugang
  • PDF + Dateien
  • Erstattung binnen 30 Tagen

Zwei Zahlen kursieren, die man unterscheiden muss. Einige Artikel schätzen die Größe auf „etwa 1,4 TB“, indem sie 2,8 Billionen Parameter mit einem halben Byte multiplizieren. Die gemessene Dateigröße liegt höher: Unsloth und Runpod geben für die native Version 1,56 TB an, weil die Schichten außerhalb der Experten (Attention, Router, gemeinsam genutzte Experten) in höherer Präzision bleiben. Die nicht quantisierte BF16-Version würde laut Runpod etwa 5,6 TB erreichen. Die Version dieses Leitfadens, die 1,4 TB angab, lag somit um etwa 10 % zu niedrig.

Veröffentlichte Größen für Kimi K3 (Quellen: Unsloth, Runpod)
FormatGrößeEmpfohlener GesamtspeicherGemessene Treue zum Original
Natives MXFP4 / UD-Q8_K_XL1,56 TB1,6 TBOhne Verlust
Unsloth UD-Q2_K_XL (dynamische 2-Bit-Quantisierung)861,3 GB880 GBEtwa 90 % Übereinstimmung bei top-1
Unsloth UD-IQ2_XXS711,1 GB726 GB84,1 % Top-1-Übereinstimmung
Unsloth UD-IQ1_M648,9 GB665 GB81,2 % Top-1-Übereinstimmung
Unsloth UD-IQ1_S (dynamische 1-Bit-Quantisierung)594 GB610 GB78,9 % Top-1-Übereinstimmung
BF16 (theoretisch)etwa 5,6 TBAußer ReichweiteReferenz

Die Tabelle widerlegt eine verbreitete Annahme aus der vorherigen Version: Ein Q2 liegt nicht „immer in der Größenordnung eines Terabytes“. Unsloth bietet tatsächlich GGUF-Dateien unter 900 GB an. Doch 594 GB sind immer noch fast das Fünfzehnfache des Speichers einer RTX 5090 mit 32 GB, und der Qualitätsunterschied ist real: Die dynamische 1-Bit-Quantisierung reproduziert die Entscheidung des ursprünglichen Modells im Testdatensatz von Unsloth nur in 78,9 % der Fälle. Wie sich die Bits auf die Qualität auswirken, erfahren Sie in unserem Leitfaden zur Quantisierung.

#Die Hardware: Was empfohlen wird, was möglich ist

Moonshot veröffentlicht auf der Modellseite keine Mindestkonfiguration: Dort wird auf die Anleitungen für vLLM, SGLang und TokenSpeed sowie auf die eigene API verwiesen. Die dokumentierte Referenz für natives Self-Hosting stammt von Runpod: ein Knoten mit acht B300-GPUs mit jeweils 288 GB, also insgesamt etwa 2,3 TB, oder sechzehn B200-GPUs verteilt auf zwei Knoten. Die Angabe „64 Beschleuniger oder mehr“, die diese Seite zuvor übernommen hatte, findet sich in keiner der konsultierten Primärquellen: Sie wird entfernt.

Bei einer GGUF-Datei von Unsloth ist die in deren Dokumentation genannte Regel einfach: RAM und VRAM müssen zusammen ungefähr der Größe der quantisierten Datei entsprechen. Andernfalls läuft das Modell zwar, weicht aber auf den Datenträger aus und wird deutlich langsamer. Unsloth nennt außerdem etwa 20 Tokens pro Sekunde bei der Generierung, wenn das Modell in den Speicher von B200-Beschleunigern passt. Das ist eine vom Anbieter genannte Generierungsrate auf Rechenzentrumshardware, keine auf einen Heimrechner übertragbare Messung.

#Und auf einem Mac? Berechnungen statt Gerüchte

Für die Angabe „16 Sekunden pro Token auf einem MacBook Pro M1 Max“, über die diese Seite berichtete, ließ sich keine überprüfbare Quelle finden: Wir geben sie daher nicht als Tatsache wieder. Was die Quellen belegen, ist klarer. Kingy AI weist darauf hin, dass bereits der Ausgangspunkt (ein Checkpoint von 1,56 TB) die Speicherkapazität eines Mac Studio mit 512 GB überstieg und dass selbst die 553,2 GiB große Datei der 1-Bit-Version die Kapazität dieses Rechners schon ohne zusätzlichen Speicherbedarf übersteigt. Ein Mac mit 128 GB verfügt über ungefähr ein Fünftel der empfohlenen 610 GB.

Die Größenordnung lässt sich hingegen selbst abschätzen. Wenn der Arbeitsspeicher nicht ausreicht, werden für jeden Token die Experten, die er aktiviert, erneut von der SSD gelesen: 104 Milliarden Parameter mit etwa 4 Bit, also ungefähr 50 GB, die pro Token gelesen werden. Mit einer SSD, die 3 GB/s liefert, ergibt das etwa 17 Sekunden pro Token; bei 7 GB/s etwa 7 Sekunden. Das ist eine theoretische Berechnung einer Obergrenze, keine Messung, erklärt aber, warum Erfahrungsberichte zur Ausführung „von der Festplatte“ Zeiten in Sekunden pro Token nennen und nicht in Tokens pro Sekunde.

!
Was „es läuft“ bedeutet
Bei 10 Sekunden pro Token dauert eine Antwort mit 300 Tokens fast fünfzig Minuten, und der stets aktive Reasoning-Modus von K3 erzeugt vor der Antwort noch zusätzliche Denk-Tokens. Technisch lässt sich das Modell laden, praktisch ist es unbrauchbar.

#Ollama, LM Studio, llama.cpp: Was jedes Tool ermöglicht

Ollama
Die offizielle Bibliothek führt nur eine Variante auf, kimi-k3:cloud: Das Modell läuft auf den Servern von Ollama, nicht auf Ihrem Rechner. Mit dem Befehl ollama run kimi-k3:cloud können Sie das Modell über die gewohnte Oberfläche ausprobieren, wobei die Einschränkungen eines entfernten Dienstes hinsichtlich Datenschutz und Abrechnung gelten.
LM Studio
Es lädt lokale GGUF-Dateien. Für K3 setzt das voraus, mehrere Hundert GB an Unsloth-Dateien herunterzuladen und über die entsprechende Speicherkapazität zu verfügen. Auf einem Rechner für Endkunden lautet die Antwort nein.
llama.cpp
Dies ist die Engine, für die die GGUF-Dateien von Unsloth vorgesehen sind. Diese setzen auf einen Fork von llama.cpp mit Unterstützung für Bildverarbeitung. Die Engine unterstützt das Auslagern der Experten auf die CPU und mehrteilige Dateien: Das ist der realistische Weg für eine Workstation mit mehreren Hundert GB RAM.
vLLM und SGLang
Die beiden von Moonshot empfohlenen Engines für einen Multi-GPU-Dienst mit dem nativen Format.
Ihr Rechner und die Anforderungen von Kimi K3
RechnerVerfügbarer SpeicherFazit
RTX 5090 (32 GB) + 64 GB RAMetwa 96 GBUnmöglich: 6-mal zu wenig, selbst bei 1 Bit
Mac mini oder MacBook, 16 bis 64 GB16 bis 64 GBNicht lokal möglich; nur über API oder Cloud
Mac Studio 128 bis 256 GB128 bis 256 GBNicht ausreichend für die empfohlenen 610 GB
Mac Studio 512 GB512 GBWeniger Speicher als die 1-Bit-Datei benötigt, noch ohne Kontext
Workstation mit 768 GB bis 1 TB RAM + GPU600 bis 900 GBMit GGUF in 1 bis 2 Bit machbar, mäßiger Durchsatz
8 GPU B300 (ca. 2,3 TB)2,3 TBDokumentierte Konfiguration für das native Format

#Realistische Optionen zum Testen von Kimi K3

  1. 01
    1. Die offizielle Moonshot-API
    Auf platform.kimi.ai heißt das Modell kimi-k3 und bietet eine mit OpenAI und Anthropic kompatible API. Das ist der schnellste Weg, die Qualität zu beurteilen. Der Parameter reasoning_effort lässt sich auf low, high oder max einstellen.
  2. 02
    2. Ollama Cloud
    ollama run kimi-k3:cloud utilise vos habitudes Ollama avec l'inférence déportée. La page de la bibliothèque affiche les tarifs par million de tokens : vérifiez-les avant d'automatiser. Notre guide sur Ollama Cloud détaille les limites.
  3. 03
    3. Eine GPU-Miete
    Für die Dauer eines Tests einen Multi-GPU-Knoten mit vLLM stundenweise mieten. Berechnen Sie zunächst die Wirtschaftlichkeit (Stundenkosten geteilt durch die dauerhaft erreichten Tokens pro Sekunde), wie Runpod es in seiner FAQ beschreibt.
  4. 04
    4. Eine Workstation mit viel RAM
    Nur wenn Sie bereits 700 GB Arbeitsspeicher haben: GGUF UD-IQ1_S und llama.cpp, wobei Sie eine geringere Qualität und einen niedrigen Durchsatz in Kauf nehmen müssen.

#Offene Gewichte bedeuten nicht, dass man das Modell lokal ausführen kann

Offene Modellgewichte garantieren das Recht, sie herunterzuladen, zu prüfen, feinzujustieren und, je nach Lizenz, weiterzuverbreiten. Sie garantieren nicht, dass jemand die Modelle auch ausführen kann. Ein Modell mit 30 Milliarden Parametern auf einer Grafikkarte mit 24 GB gehört Ihnen tatsächlich; ein 2,8T-Modell, das nur ein Cluster laden kann, bleibt in der Praxis ein Dienst. Kimi K3 ist eine gute Nachricht für die Prüfbarkeit und für Organisationen, die bereits einen Cluster haben, ohne zu verändern, was eine Privatperson zu Hause tun kann.

#Alternativen, die Ihre Hardware tatsächlich laden kann

Der QuelLLM-Katalog schätzt den Speicherbedarf in Q4, ohne Kontext: DeepSeek V4 Flash 284B etwa 170 GB, GLM 5.2 753B-A40B etwa 437 GB, Kimi K3 etwa 1.624 GB. Für den täglichen Gebrauch bleibt ein Modell mit 30 bis 70 Milliarden Parametern in Q4 der beste Kompromiss zwischen Qualität und Machbarkeit.

DeepSeek V4 Flash 284B
Etwa 170 GB in Q4 laut Katalog: möglich auf einem Mac Studio mit viel Arbeitsspeicher oder einer Workstation. Siehe den entsprechenden Leitfaden.
GLM 5.2 753B-A40B
Etwa 437 GB in Q4: Das ist das Modell, das K3 in seiner Größenordnung am nächsten kommt und noch auf einer gut ausgestatteten Workstation betrieben werden kann.
Kimi K2.5 und K2.7
Etwa 600 GB in Q4: kleiner als K3, aber weiterhin auf Infrastruktur einer Workstation angewiesen.
Modelle mit 30 bis 70 Milliarden Parametern
Auf einer Karte mit 24 bis 32 GB oder einem Mac mit 64 GB: sinnvoller Ansatz für realen Einsatz. Der VRAM-Rechner liefert die genaue Zahl.

#Urteil: Kimi K3 lokal, fast nie

Modellgewichte im Originalformat von 1,56 TB, Quantisierungen von 594 bis 861 GB, 610 GB Speicher für die kleinste Variante: Kimi K3 ist ein Servermodell. Um es zu evaluieren, verwenden Sie die API oder kimi-k3:cloud. Für den tatsächlichen Einsatz zu Hause wählen Sie ein Modell, das in Ihren verfügbaren Speicher passt und noch Spielraum für den Kontext lässt.

FAQ
Kann Kimi K3 mit Ollama installiert werden?+
Nicht lokal. Die Ollama-Bibliothek bietet nur die Variante kimi-k3:cloud an, die auf entfernten Servern läuft und nicht auf Ihrem Rechner. Für ein tatsächlich bei Ihnen lokal geladenes Modell wäre eine GGUF-Datei von mehreren Hundert GB über llama.cpp erforderlich. Damit scheidet ein gewöhnlicher Rechner aus, selbst wenn er sehr gut ausgestattet ist.
Läuft Kimi K3 auf einer RTX 5090?+
Nein. Eine RTX 5090 bietet 32 GB VRAM, während die kleinste GGUF-Datei von Unsloth 594 GB groß ist und insgesamt 610 GB Speicher benötigt. Selbst mit zusätzlichen 128 GB System-RAM würde der Rechner noch weit unter dem benötigten Speicher liegen, und das Auslagern auf den Datenträger würde die Generierung unbrauchbar machen.
Kann ein Mac mini oder ein Mac Studio Kimi K3 ausführen?+
In der Praxis nicht. Selbst die 512 GB Speicher eines Mac Studio reichen nicht für die 1-Bit-Datei (553,2 GiB), noch bevor der Kontext berücksichtigt wird; ein Mac mini liegt noch deutlich weiter darunter. Wählen Sie auf diesen Geräten ein kleineres Modell oder nutzen Sie die API des Modells oder Ollama Cloud.
Kann LM Studio Kimi K3 laden?+
Theoretisch ja: LM Studio kann GGUF-Dateien lesen, und Unsloth veröffentlicht solche Dateien. In der Praxis ist der entsprechende Speicher erforderlich, mindestens 610 GB für die 1-Bit-Version. Auf einem normalen PC kann die Anwendung das Modell nicht laden; wählen Sie daher besser ein kleineres Modell.
Welche Quantisierung für Kimi K3 wählen?+
Unsloth empfiehlt UD-IQ1_S (594 GB) als Kompromiss zwischen Größe und Qualität: 78,9 % Top-1-Übereinstimmung mit dem Original laut ihren Messungen. Die 2-Bit-Variante UD-Q2_K_XL mit 861 GB erreicht etwa 90 %. In beiden Fällen setzt dies bereits eine Workstation mit über 600 GB Arbeitsspeicher voraus.
Warum ist Kimi K3 so groß, obwohl nur 104 Milliarden aktive Parameter vorhanden sind?+
Weil der Router jeden der 896 Experten aktivieren kann: Nur 16 führen bei jedem Token Berechnungen aus, aber alle müssen im Speicher verfügbar bleiben. Der Rechenaufwand pro Token ist moderat; es ist die Speicherkapazität, nicht die Rechenleistung, die Serverhardware erforderlich macht.

#Weiterführende Informationen

Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.