Wie viel kostet ein GPU-Server für LLM? Kauf, Miete, API
Die Kosten eines GPU-Servers für LLMs beschränken sich nicht auf den Preis einer Grafikkarte. Je nachdem, ob Sie einen dedizierten Rechner kaufen, einen Server bei einem Hosting-Anbieter mieten oder eine Cloud-API aufrufen, unterscheiden sich die Ausgaben grundlegend: hohe Anfangsinvestition gegenüber monatlicher Rechnung, Fixkosten gegenüber variablen Kosten. Dieser Leitfaden erläutert die Größenordnungen für 2026, die Rentabilitätsschwelle beim Vergleich von Selbsthosting und API sowie typische Konfigurationen für verschiedene Budgets.
Wählen Sie einen Rechner? Unsere Empfehlungen nach Budget →
Gutes Preis-Leistungs-Verhältnis für lokale KI: ein GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).
Ein Mini-PC ist ein vollständiges System: Prüfen Sie den verfügbaren Speicher und die Kompatibilität der Engine. Er ersetzt nicht macOS/MLX oder CUDA.
Warum diese Wahl? Unsere vollständige Übersicht zu GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) →
Alle Optionen nach Budget vergleichen, von 800 bis 3 500 € →
Kleines Budget: RTX 5060 · Große Modelle: RTX 5090 · Mac Studio.
Unterwegs: Welcher Laptop für lokale KI →
Affiliate-Links – mögliche Provision ohne Mehrkosten für Sie. Als Amazon-Partner erzielt QuelLLM eine Vergütung für qualifizierte Käufe.
#Die 3 Optionen und ihre Kostenprofile
Bevor wir über Zahlen sprechen, ist es wichtig zu verstehen, dass es für die Kosten eines GPU-Servers für LLMs drei sehr unterschiedliche wirtschaftliche Modelle gibt. Die richtige Wahl hängt nicht nur von Ihrem Budget ab, sondern vor allem vom Umfang Ihrer Nutzung und der Sensibilität Ihrer Daten.
- Anschaffung (CAPEX)
- Sie investieren einen hohen Betrag einmalig, um die Maschine zu besitzen. Der zusätzliche Kostenanteil ist danach praktisch null (nur Strom). Rentabel, wenn die Maschine viel und lang genutzt wird.
- Miete (monatliche OPEX)
- Ein dedizierter GPU-Server oder eine VM bei einem Hosting-Anbieter, mit monatlicher oder stündlicher Abrechnung. Keine Investition, aber eine wiederkehrende Rechnung, solange die Maschine läuft.
- Cloud-API (OPEX pro Token)
- Sie verwalten keinen Rechner und zahlen nach Verbrauch (pro Million Tokens). Keine Fixkosten, aber der Preis steigt linear mit der Nutzung.
#Eine dedizierte Maschine kaufen
Der Kauf ist das klassische Modell für Selbsthosting: ein Rechner bei Ihnen zu Hause oder in Ihrem Technikraum, den Sie über 2 bis 4 Jahre amortisieren. Der größte Kostenanteil entfällt auf die GPU, die oft mehr als die Hälfte des Gesamtbudgets für den Rechner ausmacht.
- Einsteiger-GPU — RTX 3060 12 GB
- Etwa 300 € gebraucht. Führt Modelle mit 7–14 Milliarden Parametern in Q4 problemlos aus. Der Einstieg in den ernsthaften Betrieb eines lokalen LLMs.
- Vielseitige GPU – RTX 4070 / 4080 16 GB
- 700 bis 1.200 €. 14B-Modelle laufen flüssig, 32B-Modelle in Q4 mit etwas Spielraum (19 GB VRAM auf der 4080 … gerade an der Grenze).
- High-End-GPU — RTX 4090 24 GB
- 1.600 bis 2.000 €. Führt ein 32B-Modell in Q4 (≈19 GB) problemlos aus und ein 70B-Modell mit aggressiver Quantisierung. Die Referenz für Workstations.
- Gemeinsamer Speicher — Mac Studio / M4 Pro 48–128 GB
- 2.000 bis 6.000 €. Der gemeinsam genutzte Speicher ermöglicht es, 70B-Modelle oder sogar größere Modelle ohne mehrere GPUs zu laden. Leise und sparsam im Stromverbrauch.
Dazu kommt der Rest des Rechners: Mainboard, CPU, 32 bis 64 GB RAM, ein leistungsstarkes Netzteil (750 W+ für eine 4090) und ein gut belüftetes Gehäuse. Rechnen Sie mit 500 bis 900 € für eine solide PC-Basis zusätzlich zur GPU. Eine vollständige GPU-Workstation, die 32B-Modelle ausführen kann, kostet damit insgesamt zwischen 2.500 und 3.500 €.
#Einen GPU-Server bei einem Hosting-Anbieter mieten
Durch Mieten vermeiden Sie die Anfangsinvestition und das Problem der technischen Veralterung. Es gibt zwei Unterkategorien: einen dedizierten GPU-Server auf Monatsbasis (Sie reservieren die Maschine durchgehend) und eine stundenweise gemietete GPU nach dem Cloud-Prinzip (Sie bezahlen nur die Stunden, in denen Sie Inferenz ausführen).
- Dedizierte GPU zur monatlichen Miete – französischer Hosting-Anbieter
- Bei OVHcloud oder Scaleway lässt sich ein Server mit dedizierter GPU je nach Karte (L4, L40S, H100) für einige Hundert bis über tausend Euro pro Monat mieten. Die Daten werden in Frankreich gehostet – ein Argument im Hinblick auf Datensouveränität und DSGVO.
- GPU stundenweise mieten – Spot-Cloud
- Auf Plattformen wie RunPod, Vast.ai oder Lambda wird ein GPU zwischen 0,20 und 3 €/h gemietet, abhängig von der Karte. Ideal für Batch-Aufgaben oder Fine-Tuning, nicht für 24/7-Operationen.
- GPU-VM bei einem allgemeinen Cloud-Anbieter
- AWS, GCP und Azure rechnen GPU-Instanzen stundenweise ab, oft teurer als spezialisierte Anbieter, dafür aber mit dem Ökosystem und dem SLA eines großen Cloud-Anbieters.
Einfache Regel: Bei zeitweiser Auslastung (einige Stunden pro Tag, Batch-Verarbeitung, Experimente) ist die stundenweise Miete günstiger. Für einen Dienst, der rund um die Uhr antworten muss, lohnen sich die monatliche Miete einer dedizierten GPU oder der Kauf bereits ab dem zweiten oder dritten Monat mehr.
#Eine Cloud-API nutzen
Die API ist die serverlose Option: Sie kaufen und mieten keine GPU, sondern zahlen pro verbrauchtem Token. Das ist der rationalste Ausgangspunkt bei geringem oder unvorhersehbarem Nutzungsvolumen, da keine Fixkosten anfallen.
- Abrechnungsmodell
- Preis pro Million Eingabetokens und Ausgabetokens. Ausgabetokens kosten normalerweise mehr als Eingabetokens.
- Vorteil
- Keine Wartung, keine Obsoleszenz, sofortiger Zugriff auf Modelle mit mindestens 100 Milliarden Parametern, die sich auf einem Arbeitsplatzrechner nicht ausführen lassen.
- Kostennachteil
- Der Preis steigt linear mit der Nutzung. Eine Pipeline, die täglich 100.000 Dokumente verarbeitet, macht aus einer „günstigen“ API eine monatliche Rechnung im vierstelligen Bereich.
- Nachteil hinsichtlich der Vertraulichkeit
- Ihre Prompts verlassen Ihre Infrastruktur. Für sensible Daten (Gesundheit, Recht, proprietärer Code) ist das ohne Vertrag und eine geeignete dedizierte Cloud ein Ausschlusskriterium.
#Der Break-even-Punkt: Selbsthosting vs. API
Das ist die zentrale Berechnung. Eine gekaufte GPU verursacht Fixkosten; eine API verursacht variable Kosten. Es gibt daher ein Tokenvolumen, ab dem der Betrieb eines eigenen Servers günstiger ist als eine nutzungsabhängige Abrechnung. Unterhalb dieser Schwelle ist die API günstiger; oberhalb amortisiert sich der selbst gehostete Server.
Die Überlegung dahinter: Eine RTX 4090 für 1.800 €, deren Anschaffungskosten über 3 Jahre verteilt werden, kostet etwa 50 €/Monat für die Hardware, zuzüglich Strom. Wenn Ihre API-Kosten diesen Betrag jeden Monat übersteigen, lohnt sich der Kauf – bei regelmäßiger Nutzung oft schon ab einigen Millionen Tokens pro Tag. Bei gelegentlicher Nutzung mit wenigen Anfragen pro Tag bleibt die API unschlagbar.
- Geringes Datenvolumen, nicht sensible Daten
- API. Die Fixkosten eines Servers lohnen sich bei einigen Tausend Tokens pro Tag nicht.
- Hohes, regelmäßig anfallendes Volumen
- Kauf. Die GPU amortisiert sich innerhalb weniger Monate, und die Grenzkosten pro Anfrage sinken auf nahezu null.
- Sensible Daten, unabhängig vom Umfang
- Selbst hosten (Kauf oder Miete in Frankreich). Die Vertraulichkeit entscheidet bereits vor der Kostenberechnung.
- Kurzzeitige Lastspitze oder Fine-Tuning
- Stundenweise Miete. Man bezahlt die Rechenleistung nur für die Dauer des Vorgangs.
#Typische Konfigurationen je nach Budget
Hier sind drei Rechnerprofile für das Selbsthosting, die drei Budgetstufen und Anspruchsniveaus entsprechen. Die Preisspannen sind grobe Richtwerte für 2026 und schließen die gesamte Hardware ein.
- 01GPU-Workstation — 2.500 bis 3.500 €Eine RTX 4090 mit 24 GB (oder eine gebrauchte RTX 3090, um den Preis zu halbieren) in einem PC mit 64 GB RAM. Damit läuft ein 32B-Modell in Q4 (≈19 GB VRAM) sehr komfortabel und ein 70B-Modell mit aggressiver Quantisierung. Die Referenz für einen Entwickler oder ein kleines Team.
- 02Dedizierter GPU-Server — 4.000 bis 8.000 € oder monatliche MieteEine professionelle Grafikkarte (L40S 48 GB oder 2× RTX 4090 im tensor-split) in einem Rack-System, konzipiert für 24/7-Operation und die gleichzeitige Nutzung durch mehrere Benutzer über Open WebUI. Kauf- oder Mietmöglichkeit bei einem französischen Hosting-Anbieter, wenn Sie das Hardware-Management nicht selbst übernehmen möchten.
- 03Mini-PC mit Unified Memory — 700 bis 6.000 €Ein Mac mini M4 (ab etwa 700 €) für einen leisen und sparsamen Inferenzserver oder ein Mac Studio M5 Ultra (96 GB und mehr, 512 GB für Ende Oktober 2026 angekündigt), um Modelle mit 70B–123B ohne mehrere GPUs zu betreiben. Der Stromverbrauch ist im Vergleich zu einer NVIDIA-GPU verschwindend gering.
#Versteckte Kosten, die Sie nicht vergessen sollten
Der Kaufpreis ist nur der sichtbare Teil. Drei wiederkehrende Kostenposten werden im Budget für einen GPU-Server für LLM systematisch unterschätzt.
- Strom
- Eine RTX 4090 verbraucht unter Last bis zu 450 W. Bei nahezu kontinuierlicher Inferenz entspricht das je nach Strompreis pro kWh mehreren Dutzend Euro pro Monat. Ein Mac mit gemeinsamem Speicher für CPU und GPU verbraucht nur einen Bruchteil davon – ein echtes Argument für den 24/7-Betrieb.
- Wartung und Verfügbarkeit
- Ein Server, der ständig antworten muss, erfordert Überwachung, Updates und Ausfallmanagement. Das ist menschlicher Aufwand, der auf der Rechnung nicht sichtbar ist, aber real ist.
- Veralterung
- Eine GPU verliert an Wert, und die Modelle entwickeln sich schnell weiter. Eine Abschreibung über 3 Jahre ist angemessen. Da aber ein 14B-Modell von 2026 ein 70B-Modell von 2024 übertrifft, ist das Wettrüsten bei der Hardware nicht immer nötig — manchmal reicht ein neueres, kleineres Modell aus.
- Kühlung und Lärm
- Eine High-End-GPU wird heiß und macht Lärm. Bei professionellem lokalem Betrieb die Belüftung des Raums einplanen; am Arbeitsplatz zählt der akustische Komfort.
#Weiterführende Informationen
Drei ergänzende Leitfäden, die Ihnen bei Ihrer Entscheidung helfen: Der Leitfaden zur GPU-Auswahl erläutert für jede Grafikkarte die Abwägungen zwischen VRAM, Budget und Leistung; der Kostenrechner ermittelt präzise Ihre Rentabilitätsschwelle für Selbsthosting gegenüber API-Nutzung; und der Leitfaden zur PC-Konfiguration mit 32 GB VRAM listet die konkreten Komponenten eines Rechners auf, auf dem 32B-Modelle laufen können.
- GPU für lokale KI auswählen
- Der Kaufleitfaden 2026: RTX 4070 vs. 4090 vs. Mac M-Max, Abwägungen zwischen VRAM und Budget.
- LLM-Kostenrechner
- Berechnen Sie anhand Ihres Tokenvolumens den Schwellenwert für den Wechsel zwischen Self-Hosting und API.
- KI-PC-Konfiguration: Budget für 32 GB VRAM
- Die Auswahl an Komponenten für den Bau eines Rechners, der 32B-Modelle lokal ausführen kann.
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.