Die thermischen Leistungen optimieren in Inferenz
Für kontinuierliche Inferenz ist eine Begrenzung der GPU-Leistungsaufnahme die Maßnahme mit dem besten Aufwand-Nutzen-Verhältnis zur Senkung der Wärmeentwicklung: Laut einer veröffentlichten Messung mit einer RTX 3090 kostet die Reduzierung von 350 W auf 250 W weniger als 3 % der Generierungsgeschwindigkeit, während die Geschwindigkeit unterhalb dieser Schwelle einbricht. Prüfen Sie zunächst mit nvidia-smi, was die Karte tatsächlich begrenzt (Temperatur oder Leistungsaufnahme), bevor Sie Änderungen an den Lüftern, der Spannung oder der Wärmeleitpaste vornehmen.
Ein Rechner, der den ganzen Tag Anfragen beantwortet, wird anders warm als beim Spielen eines Videospiels: konstante Last, stark beanspruchter Speicher, geschlossenes Gehäuse. Diese Seite erklärt, wie Sie feststellen, ob Ihre Grafikkarte langsamer wird, welche Einstellung Sie zuerst ausprobieren sollten, wie viele Tokens pro Sekunde eine Leistungsbegrenzung tatsächlich kostet und wann Wartung (Staub, Wärmeleitpaste, Gehäuse) die eigentliche Lösung ist.
Wählen Sie einen Rechner? Unsere Empfehlungen nach Budget →
Gutes Preis-Leistungs-Verhältnis für lokale KI: ein GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).
Ein Mini-PC ist ein vollständiges System: Prüfen Sie den verfügbaren Speicher und die Kompatibilität der Engine. Er ersetzt nicht macOS/MLX oder CUDA.
Warum diese Wahl? Unsere vollständige Übersicht zu GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) →
Alle Optionen nach Budget vergleichen, von 800 bis 3 500 € →
Kleines Budget: RTX 5060 · Große Modelle: RTX 5090 · Mac Studio.
Unterwegs: Welcher Laptop für lokale KI →
Affiliate-Links – mögliche Provision ohne Mehrkosten für Sie. Als Amazon-Partner erzielt QuelLLM eine Vergütung für qualifizierte Käufe.
#Warum die Kühlung bei einem Inferenzserver wichtig ist
Eine GPU schützt ihren Chip: Wenn die Temperatur oder die Leistungsaufnahme die von ihrer Firmware erlaubten Werte überschreitet, senkt sie ihre Taktraten. Dieser Mechanismus heißt Throttling. Die Dokumentation von nvidia-smi unterscheidet seine Ursachen: eine softwareseitige Drosselung aufgrund der Temperatur („sw thermal slowdown“), eine stärkere hardwareseitige Drosselung, die die Taktraten um den Faktor 2 oder mehr reduziert („hw thermal slowdown“), und eine Leistungsgrenze („sw power cap“). Wenn all diese Gründe als inaktiv angegeben werden, sind die Taktraten so hoch wie möglich.
Der Schwellenwert ist nicht bei allen Karten gleich. NVIDIA bezeichnet ihn als „GPU Slowdown Temp“, die Temperatur, bei der die Hardware beginnt, die Taktfrequenzen zur Kühlung zu optimieren, und zeigt ihn in nvidia-smi an. Verlassen Sie sich daher nicht auf eine allgemeine Zahl wie „83 °C“: Lesen Sie den Wert Ihrer Karte ab. Die Folgen von Throttling sind geringere Geschwindigkeit und, wenn die Lüfter gegensteuern, mehr Lärm; langfristig altert eine Karte, die ständig heiß läuft, schneller, aber wir haben hierzu keine verlässliche Zahl, die wir zitieren könnten.
#Vor dem Einstellen messen: Was die Karte wirklich verrät
Zunächst gilt es herauszufinden, ob die Grafikkarte langsamer wird und warum. Bei einer NVIDIA-Grafikkarte reichen zwei Befehle aus. Der erste zeigt laufend Temperatur, Leistungsaufnahme, Kerntakt und Auslastung an; der zweite liefert Details zu den Ursachen der Verlangsamung und den Temperaturschwellen Ihres Grafikkartenmodells.
Führen Sie diese Befehle während einer mehrminütigen Generierung aus, nicht im Leerlauf. Zwei Befunde sind entscheidend. Wenn die GPU-Kerntaktfrequenz sinkt, während die Temperatur steigt und ein thermischer Begrenzungsgrund aktiv ist, liegt ein Kühlungsproblem vor. Wenn die Kerntaktfrequenz hoch bleibt, aber eine Leistungsobergrenze aktiv ist, wird die Karte durch ihre Leistungsaufnahme begrenzt: Eine weitere Senkung dieser Grenze hat bei der Generierung keine nennenswerten Auswirkungen auf die Geschwindigkeit, reduziert aber die Wärmeentwicklung.
| Beobachtung während einer längeren Generierung | Interpretation | Erste Aktion |
|---|---|---|
| Stabile Temperatur unterhalb der Drosselungsschwelle, stabile Taktfrequenz | Keine thermischen Probleme | Nichts ändern; gegebenenfalls die Leistungsaufnahme begrenzen, um die Geräuschentwicklung zu reduzieren |
| Temperatur erreicht den Schwellenwert, Taktfrequenz sinkt, thermische Ursache wird als aktiv angezeigt | Unzureichende Kühlung | Airflow des Gehäuses, Staub, Lüfterkurve |
| Niedrige Taktfrequenz, „power cap“ als Grund aktiv, Temperatur im normalen Bereich | Leistungsgrenze erreicht | Normal; die Grenze nur erhöhen, wenn der Durchsatz nicht ausreicht |
| Geschwindigkeitsunterschied zwischen dem ersten und dem zehnten Austausch | Schrittweise Temperaturerhöhung | Unter längerer Last messen, nicht beim Start |
#Leistungsgrenze: die Einstellung, die am meisten bringt
Die Leistungsaufnahme zu begrenzen ist einfacher, als die Spannungskurve anzupassen, und lässt sich rückgängig machen. Bei einer durch den Speicher begrenzten Inferenz ist der Geschwindigkeitsverlust bis zu einem bestimmten Schwellenwert gering, danach jedoch abrupt. Der Blog runaihome, der eine RTX 3090 mit einem dichten Modell mit 27 Milliarden Parametern vermessen hat, berichtet, dass die Karte bei einer Reduzierung von 350 W auf 250 W weniger als 3 % ihrer Geschwindigkeit verliert und dabei 100 W weniger verbraucht. Bei 200 W bricht dagegen der Kerntakt ein, und die Geschwindigkeit sinkt um 35 %.
| Grenze | Gemessener Effekt auf die Generierung |
|---|---|
| 350 W (Standard) | Referenz |
| 300 W | Weniger als 3 % Abweichung von der Referenz |
| 250 W | 31,7 t/s, weniger als 3 % unter der Referenz |
| 200 W | 20,6 Tokens/s, also 35 % weniger: die Grenze, die man nicht überschreiten sollte |
Für eine RTX 4090 zitiert derselbe Blog Tom's Hardware: Demnach bleiben bei einer Begrenzung der Leistungsaufnahme auf 70 % (etwa 315 W) rund 94 % der Rechenleistung erhalten. Diese Zahlen stammen aus Sekundärquellen und beziehen sich auf eine bestimmte Karte: Übertragen Sie sie nicht unverändert auf Ihre eigene. Die zuverlässige Methode besteht darin, Ihren Durchsatz während einer längeren Textgenerierung zu messen, die Leistungsgrenze in Schritten von 25 bis 50 W zu senken und vor dem Leistungseinbruch aufzuhören.
Die Dokumentation von nvidia-smi gibt an, dass der Wert zwischen der von der Grafikkarte gemeldeten Mindest- und Höchstgrenze liegen muss und dass der Befehl Root-Rechte erfordert. Prüfen Sie nach einem Neustart, ob die Grenze weiterhin gilt: Falls sie auf den Standardwert zurückgesetzt wurde, erstellen Sie eine systemd-Unit, die sie beim Start erneut setzt.
Aktivieren Sie sie mit sudo systemctl enable --now nvidia-power-limit.service.
#Lüfterkurve: lieber früh aggressiv hochregeln als spät abrupt
Die werkseitige Lüfterkurve ist auf einen leisen Betrieb ausgelegt: Die Lüfter laufen bis zu einer hohen Temperatur langsam, danach steigt ihre Drehzahl an. Bei Dauerlast hält eine Kurve, die die Drehzahl früher erhöht, die Karte bei vergleichbarem Geräuschpegel kühler, weil sie Drehzahlspitzen vermeidet. Unter Windows lässt sich die Kurve mit MSI Afterburner einstellen; unter Linux ist LACT eine grafische Anwendung zur Steuerung von AMD-, NVIDIA- und Intel-GPUs, die auch eine Lüftersteuerung umfasst.
| Temperatur | Ventilatordrehzahl |
|---|---|
| 50 °C | 40 % |
| 60 °C | 55 % |
| 70 °C | 75 % |
| 78 °C | 90 % |
| Drosselungsschwelle minus 5 °C | 100 % |
Diese Werte dienen als Ausgangspunkt, nicht als Herstellerempfehlung. Legen Sie die letzte Stufe anhand des Werts „GPU Slowdown Temp“ Ihrer Karte fest und beurteilen Sie das Ergebnis danach, welcher Geräuschpegel im Raum erträglich ist. Unter macOS steuert Apple die Lüfter: Die Lüfterkurve lässt sich nicht einstellen.
#Undervolting: feinere Abstimmung, längere Validierung
Undervolting bedeutet, dieselbe Frequenz mit einer niedrigeren Spannung zu erreichen und dadurch weniger Wärme zu erzeugen. Unter Windows wird es in MSI Afterburner eingestellt (Frequenz-Spannungs-Kurve); unter Linux besteht der übliche Ansatz darin, die Frequenzen mit der Option von nvidia-smi festzusetzen, die den Frequenzbereich des GPU-Kerns vorgibt. Der Gewinn hängt von der Karte ab: Jeder Chip hat seinen eigenen Spielraum, und eine zu aggressive Einstellung führt erst später zu Fehlern oder Abstürzen, nicht sofort.
- 01Von einem funktionierenden Leistungslimit ausgehenBeginnen Sie mit dem Leistungslimit: Damit erzielen Sie am sichersten eine Verbesserung. Ergänzen Sie Undervolting nur dann, wenn die Karte weiterhin zu heiß oder zu laut ist.
- 02Eine maximale Frequenz festlegenFixieren Sie den Kerntakt auf einen Wert unterhalb des maximalen Boost-Takts, beispielsweise mit nvidia-smi -lgc gefolgt von einem Frequenzbereich in MHz.
- 03Über längere Zeit testenStarten Sie eine kontinuierige Generierung von mindestens 30 Minuten. Eine Instabilität zeigt sich durch CUDA-Fehler, Treiberabstürze oder inkonsistente Ausgaben.
- 04VergleichenMessen Sie Geschwindigkeit und Temperatur vorher und nachher mit demselben Modell und demselben Prompt. Behalten Sie die Einstellung anschließend nur bei, wenn der Geschwindigkeitsverlust vernachlässigbar ist.
- 05Bei Bedarf rückgängig machenSetzen Sie die Taktfrequenzen zurück (nvidia-smi -rgc) oder starten Sie neu, um zu den Werkseinstellungen zurückzukehren.
#Gehäuse und Luftstrom: Der Vorteil lässt sich in Grad messen
- Luftweg
- Ein ungehinderter Luftstrom von vorne nach hinten, bei dem frische Luft zu den Lüftern der Grafikkarte geleitet wird. Eine Verkabelung, die den Luftstrom behindert, treibt die Temperatur um einige Grad nach oben.
- Filter und Staub
- Ein verschmutzter Filter verringert den Luftstrom: Reinigen Sie ihn regelmäßig und entfernen Sie den Staub vom Kühler der Karte mit Druckluft. Halten Sie dabei die Lüfter fest, damit sie sich nicht mit zu hoher Drehzahl drehen.
- Platz rund um die Karte
- Zwei dicht nebeneinander montierte Karten im Multi-GPU-Betrieb heizen die erste Karte auf; vergrößern Sie den Abstand zwischen ihnen oder bauen Sie einen seitlichen Lüfter ein.
- Umgebung
- Ein Raum mit 30 °C statt 20 °C erhöht die Temperatur der Grafikkarte um diese zehn Grad: Ein Server in einem geschlossenen Schrank ist zunächst ein thermisches Problem, bevor er ein Problem der Grafikkarte ist.
Um eine Einstellung zuverlässig zu beurteilen, halten Sie das Testverfahren konstant: dasselbe Modell, derselbe lange Prompt und dieselbe Generierungsdauer, wobei Sie jeweils nur einen Parameter ändern. Notieren Sie die maximale Temperatur, den GPU-Kerntakt und den durchschnittlichen Durchsatz am Ende der Generierung, nicht am Anfang, da eine kalte Karte immer bessere Werte liefert als dieselbe Karte nach zwanzig Minuten. Wiederholen Sie die Messung bei derselben Umgebungstemperatur, sonst wird der Vergleich durch die Bedingungen im Raum verfälscht und nicht durch die Einstellung.
#Repasting: Letzter Ausweg mit seinen Risiken
Nach mehreren Jahren können die Wärmeleitpaste und die Wärmeleitpads einer gebrauchten Grafikkarte ausgetrocknet sein. Ein Anzeichen dafür ist eine höhere Temperatur als beim Kauf unter derselben Last, trotz eines sauberen Gehäuses. Beim Zerlegen einer Grafikkarte erlischt die Garantie; außerdem können die Pads und der Chip beschädigt werden, und es ist ein methodisches Vorgehen nötig. Gehen Sie diesen Schritt erst an, nachdem Sie einfachere Ursachen ausgeschlossen haben: Staub, Luftstrom, Leistungsbegrenzung, Umgebungstemperatur. Wenn Sie unsicher sind, überlassen Sie die Karte einem Dienstleister; vergleichen Sie die Kosten mit denen einer Ersatzkarte.
#Laptops und Macs: Die Stellschrauben ändern sich
Bei einem Laptop stellen Sie weder die Spannung noch die Wärmeleitpaste ein. Der sinnvolle Ansatzpunkt ist der Energiemodus. Apple beschreibt zwei Modi: den Stromsparmodus, der unter macOS Sequoia 15.1 und neuer auch die Lüftergeräusche bei Modellen mit aktiver Kühlung reduziert, und den Hochleistungsmodus, der die Lüfter schneller drehen lässt, um die Leistung bei sehr intensiven Arbeitslasten aufrechtzuerhalten, allerdings mit zusätzlicher Geräuschentwicklung. Bei einem MacBook Air ohne Lüfter bleiben als einzige Ansatzpunkte eine wärmeableitende Unterlage, der Netzbetrieb und ein kleineres Modell.
- GPU für lokale KI auswählen
- KI-PC-Konfiguration mit 32 GB
- Multi-GPU-Setup mit llama.cpp
- Quelle: nvidia-smi-Dokumentation
- Quelle: Messungen zur Leistungsbegrenzung (runaihome)
- Quelle: Apple, Energiemodi des Mac
#Häufig gestellte Fragen
Ab welcher Temperatur beginnt eine Grafikkarte, langsamer zu werden?+
Verlangsamt eine Begrenzung der Leistungsaufnahme die Inferenz deutlich?+
Wie erkenne ich, ob meine GPU gedrosselt wird?+
Muss die Wärmeleitpaste der Grafikkarte erneuert werden?+
Undervolting oder Leistungsbegrenzung: Was wählen?+
Hat ein MacBook thermische Einstellungen für lokale KI?+
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.