KTransformers installieren: LLM 70B+ auf Consumer-GPU
Das Framework KTransformers-Installation ermöglicht die lokale Ausführung von MoE-Modellen (Mixture of Experts) mit über 600 Milliarden Parametern auf einer einzigen RTX 4090 oder 3090, indem inaktive Experten in den Arbeitsspeicher des Systems ausgelagert werden. Diese KTransformers-Installation basiert auf selektivem Offloading der MoE-Experten und nutzt die AVX-512-/AMX-Instruktionen der CPU, um die GPU zu entlasten. Dieser Leitfaden behandelt die Hardwarevoraussetzungen, die Installation Schritt für Schritt und die kompatiblen Modelle (insbesondere DeepSeek V3 auf Consumer-GPUs), die gemessene Leistung und die häufigen Fallstricke beim Einsatz eines Lokales 671B-LLM.
Warum KTransformers für MoE-LLMs neue Möglichkeiten eröffnet
KTransformers ist ein Python-Framework, das vom KVCache.AI Lab der Tsinghua-Universität entwickelt und unter der Apache-2.0-Lizenz veröffentlicht wurde, auf GitHub. Seine Besonderheit: Während der Inferenz lädt es nur die aktiven MoE-Experten in den VRAM und hält die übrigen im System-RAM. Für ein Modell wie DeepSeek V3 671B das pro Token nur etwa 37B seiner insgesamt 671B Parameter aktiviert, ist die VRAM-Einsparung enorm.
Konkret: Während klassische Inferenz (vLLM, transformers) für DeepSeek V3 in Q4 etwa 400 GB VRAM erfordern würde, ermöglicht KTransformers den Betrieb desselben Modells mit:
- GPU : 24 GB VRAM (RTX 4090 oder 3090)
- CPU-Arbeitsspeicher : 380 bis 512 GB DDR5
- CPU : Intel Xeon mit AMX oder AMD EPYC Genoa (als optimal eingeschätzt)
Dieser Ansatz konkurriert direkt mit llama.cpp und dessen Mechanismus --n-gpu-layers, aber KTransformers geht bei MoE-Architekturen noch weiter, indem es jeden Experten auf das richtige Gerät routet, anstatt ganze Schichten zu offloaden.
Um die Größenordnungen einzuordnen, folgen hier einige MoE-Modelle, die durch diesen Ansatz zugänglich werden:
- DeepSeek V3 671B : VRAM Q4 ~400 GB → ausführbar mit einer GPU mit 24 GB VRAM + 384 GB RAM
- DeepSeek R1 671B : identisches Profil, zusätzliches Reasoning
- Kimi K2.5 : 1000B Parameter, ~32B aktive Parameter
- Qwen 3 235B-A22B : 235B mit 22B aktiven Parametern
Hardware- und Softwarevoraussetzungen
Bevor der Start KTransformers-Installation, prüfen Sie Ihre Konfiguration. Das Framework ist speziell auf MoE-Architekturen ausgerichtet und erfordert ein bestimmtes Verhältnis zwischen RAM und VRAM.
Hardware-Mindestanforderungen für DeepSeek V3 Q4_K_M :
- NVIDIA-GPU : RTX 3090 / 4090 / 5090 (24 GB) oder A6000 (48 GB). Compute capability ≥ 8.0
- DDR5-RAM : Mindestens 384 GB, empfohlen sind 512 GB für lange Kontexte
- CPU : Intel Xeon Sapphire Rapids (AMX), Xeon Emerald Rapids, oder AMD EPYC 9004 (geschätzt). Desktop-CPU-Modelle wie Core i9-14900K funktionieren, aber ohne AMX
- Speicher : 450 GB frei auf NVMe Gen4 für die GGUF-Gewichte
- OS : Ubuntu 22.04 LTS oder Debian 12 (Windows WSL2 wird unterstützt, ist aber 20–30 % langsamer; noch zu bestätigen)
Software-Stack :
- Python 3.11
- CUDA 12.4 oder 12.6
- PyTorch 2.4+ mit CUDA kompiliert
- Mindestens gcc-11 (gcc-13 für AMX)
- CMake 3.25+
Um diesen Ansatz mit einer klassischen Lösung zu vergleichen, die vollständig auf GPUs läuft, lesen Sie unseren Guide vLLM der Tensorparallelismus auf H100-Clustern im Detail erklärt.
Schritt-für-Schritt-Installationsverfahren
La KTransformers-Installation folgt einer strikten Abfolge. Jede Abweichung bei den CUDA-/PyTorch-Versionen lässt die Kompilierung der CPU-Kernels scheitern.
Schritt 1 — Isolierte Python-Umgebung :
conda create -n ktrans python=3.11
conda activate ktrans
conda install -c conda-forge libstdcxx-ng
Schritt 2 — PyTorch mit CUDA :
pip install torch==2.4.0 --index-url https://download.pytorch.org/whl/cu124
pip install packaging ninja cpufeature numpy
Schritt 3 — Klonen und Kompilieren :
git clone https://github.com/kvcache-ai/ktransformers.git
cd ktransformers
git submodule update --init --recursive
bash install.sh
Das Skript install.sh kompiliert die CPU-Kernels (llamafile, AMX, falls erkannt) und installiert das lokale Wheel. Die Kompilierung dauert je nach CPU 10 bis 20 Minuten.
Schritt 4 — Herunterladen der Gewichtsdateien :
KTransformers verarbeitet GGUF-Dateien (Quantisierung von llama.cpp). Laden Sie beispielsweise DeepSeek-V3-Q4_K_M.gguf depuis Hugging Face :
huggingface-cli download unsloth/DeepSeek-V3-GGUF \
--include "DeepSeek-V3-Q4_K_M*" \
--local-dir ./models/deepseek-v3-q4
Schritt 5 – Start der Inferenz :
python -m ktransformers.local_chat \
--model_path deepseek-ai/DeepSeek-V3 \
--gguf_path ./models/deepseek-v3-q4 \
--cpu_infer 48 \
--max_new_tokens 1024
Der Parameter --cpu_infer entspricht der Anzahl der CPU-Threads, die für die ausgelagerten Experten vorgesehen sind. Stellen Sie ihn auf (cores physiques - 2).
Auf Consumer-GPUs gemessene Leistung
Die Zahlen unten stammen aus dem offizieller Benchmark KTransformers v0.2 und aus Rückmeldungen aus der Community. Für ein Lokales 671B-LLM in Q4_K_M quantisiert:
- RTX 4090 + Xeon Gold 6454S (AMX) : 13,6 tok/s Prefill, 14 tok/s Decoding (DeepSeek V3)
- RTX 4090 + i9-14900K (ohne AMX) : geschätzte 8 tok/s beim Decoding
- RTX 3090 + EPYC 9354 : geschätzte 10 tok/s beim Decoding (je nach RAM-Bandbreite noch zu bestätigen)
Zum Vergleich DeepSeek R1 Distill Llama 70B erreicht bei vollständiger Ausführung auf 2× RTX 4090 25–30 tok/s – absolut gesehen schneller, aber das destillierte Modell schneidet bei Reasoning-Benchmarks schlechter ab als das vollständige 671B-Modell.
Qualitätsbenchmarks (offizielle Berichte von DeepSeek) :
- DeepSeek V3 671B : MMLU 88,5, HumanEval 82,6, MATH-500 90,2
- DeepSeek R1 671B : AIME 2024 79,8, MATH-500 97,3, Codeforces 96,3. Perzentil
- Qwen 3 235B-A22B : MMLU-Pro 73 geschätzt, HumanEval 88 zu bestätigen
Weitere Informationen zu den Abwägungen zwischen Qualität und Geschwindigkeit finden Sie unter DeepSeek R1 vs Llama 3.3 70B.
Kompatible Modelle und Einschränkungen
Nicht alle MoE-LLMs werden nativ unterstützt. KTransformers pflegt eine Liste mit YAML-Optimierungen pro Architektur. Im aktuellen Katalog:
Native Unterstützung bestätigt :
- DeepSeek V3 671B (MoE, 37B aktive Parameter)
- DeepSeek R1 671B (MoE, 37B aktive Parameter)
- DeepSeek V3.2 (685B, MoE)
- Mixtral 8x22B Instruct (141B, 8 Experten × 22B)
- Qwen 3 235B-A22B
Unterstützung in Entwicklung oder experimentell :
- Kimi K2.5 et Kimi K2.6 (DeepSeek-ähnliche Architektur, sollten funktionieren)
- GLM-5.1 (744B MoE, noch zu bestätigen)
- ERNIE 4.5 300B-A47B
Nicht unterstützt (dichte Architekturen, kein Vorteil durch Offloading) :
- Llama 3.1 405B Instruct — verwenden Sie stattdessen vLLM mit mehreren GPUs
- Qwen 2.5 72B Instruct — vollständig auf GPUs mit 2× RTX 4090
Die maximal praktisch nutzbare Kontextlänge bleibt durch den verfügbaren Arbeitsspeicher für den KV-Cache begrenzt: Rechnen Sie bei DeepSeek V3 mit etwa 30 GB zusätzlichem Speicher für 32K Tokens. Bei mehr als 64K Tokens sinkt der Durchsatz stark.
FAQ
F: Funktioniert KTransformers auf einem Mac mit Apple Silicon?
Nein. Das Framework ist für GPU-Kernels auf CUDA und für x86-CPU-Kernels auf AVX-512/AMX angewiesen. Auf Macs der M-Serie verwenden Sie stattdessen llama.cpp mit Metal oder MLX. Unser LLM-Leitfaden für Mac erläutert die Alternativen. Ein M3 Ultra 512 GB kann DeepSeek V3 Q4 nativ ohne Offloading ausführen, geschätzt zwischen 18 und 20 Tok/s.
F: Welche Unterschiede gibt es gegenüber llama.cpp im Offload-Modus?
llama.cpp lagert ganze Schichten aus (--n-gpu-layers N), was bei dichten Modellen wie Llama 3.3 70B Instruct. KTransformers verlagert die einzelne Experten eines MoE, was bei DeepSeek V3 wesentlich effizienter ist, da nur 8 von 256 Experten pro Token aktiviert werden. Typischer Geschwindigkeitsgewinn: 3- bis 5-mal schneller als llama.cpp mit DeepSeek V3 bei vergleichbarer Hardware.
F: Kann mit KTransformers Fine-Tuning durchgeführt werden?
Nein, das Framework ist ausschließlich auf Inferenz ausgerichtet. Für das Fine-Tuning eines MoE sehen Sie sich DeepSpeed-MoE oder Unsloth an (auf dichte Modelle < 70B beschränkt). KTransformers unterstützt weder dynamisches LoRA noch QLoRA. Wenn Sie ein 70B-Modell anpassen möchten, empfiehlt sich eher Llama 3.1 Nemotron 70B mit Unsloth und 4-Bit-QLoRA auf einer RTX 4090.
F: Wie viel kostet eine DeepSeek-V3-Konfiguration mit einer Consumer-GPU?
Schätzung des Budgets (2026): RTX 4090 gebraucht 1500€, Server-Mainboard W790 oder EPYC SP5 800€, CPU Xeon w7-2495X 2200€, 384 GB DDR5 ECC 3000€, NVMe 2 TB 200€, Netzteil + Gehäuse 400€. Gesamt: ~8000€, für den Betrieb eines Lokales 671B-LLM. Zum Vergleich: Eine einzelne H100 mit 80 GB kostet etwa 30.000 € und würde für den Betrieb in voller numerischer Präzision nicht einmal ausreichen.
Frage: Ist der OpenAI-kompatible Servermodus verfügbar?
Ja, seit v0.2. Führen Sie ktransformers --server_port 10002 --model_path ... --gguf_path ... und richten Sie Ihren OpenAI-Client auf http://localhost:10002/v1. Kompatibel mit Open WebUI, Continue.dev und LiteLLM. SSE-Streaming funktioniert, Function Calling wird jedoch nur teilweise unterstützt (je nach Version zu bestätigen).
Q: KTransformers vs SGLang für DeepSeek V3?
SGLang ist auf leistungsstarke Multi-GPU-Bereitstellungen (H100/H200) ausgelegt und erreicht mit 8× H100 bei DeepSeek V3 über 60 Tok/s. KTransformers ist auf eine einzelne Consumer-GPU mit Auslagerung in den Arbeitsspeicher ausgelegt und erreicht 10–15 Tok/s. Die Wahl ist einfach: SGLang, wenn Sie einen Cluster haben, KTransformers, wenn Sie eine Workstation haben.
Fazit
La KTransformers-Installation ermöglicht den Zugriff auf führende MoE-Modelle (DeepSeek V3, R1, Kimi K2.5) auf einer Workstation für 8.000 € statt auf einem H100-Cluster für 200.000 €. Der Kompromiss: 10–15 Tok/s statt 60+, aber mit einer Antwortqualität, die der des Modells mit voller Präzision entspricht. Um das passende MoE-Modell für Ihren VRAM und Ihren RAM zu finden, verwenden Sie den Konfigurator quelllm.fr, oder erkunden Sie direkt den Katalog der 249 indexierten LLM um Lizenzen und Größen zu vergleichen.