Mittelstufe 11 Min.Leistung

Die thermischen Leistungen optimieren in Inferenz

Direkte Antwort

Für kontinuierliche Inferenz ist eine Begrenzung der GPU-Leistungsaufnahme die Maßnahme mit dem besten Aufwand-Nutzen-Verhältnis zur Senkung der Wärmeentwicklung: Laut einer veröffentlichten Messung mit einer RTX 3090 kostet die Reduzierung von 350 W auf 250 W weniger als 3 % der Generierungsgeschwindigkeit, während die Geschwindigkeit unterhalb dieser Schwelle einbricht. Prüfen Sie zunächst mit nvidia-smi, was die Karte tatsächlich begrenzt (Temperatur oder Leistungsaufnahme), bevor Sie Änderungen an den Lüftern, der Spannung oder der Wärmeleitpaste vornehmen.

Ein Rechner, der den ganzen Tag Anfragen beantwortet, wird anders warm als beim Spielen eines Videospiels: konstante Last, stark beanspruchter Speicher, geschlossenes Gehäuse. Diese Seite erklärt, wie Sie feststellen, ob Ihre Grafikkarte langsamer wird, welche Einstellung Sie zuerst ausprobieren sollten, wie viele Tokens pro Sekunde eine Leistungsbegrenzung tatsächlich kostet und wann Wartung (Staub, Wärmeleitpaste, Gehäuse) die eigentliche Lösung ist.

Wählen Sie einen Rechner? Unsere Empfehlungen nach Budget →

Von Mohamed Meguedmi·Aktualisierung 2026-09-30·Unter Windows, macOS und Linux getestet
Empfohlene Hardware

Gutes Preis-Leistungs-Verhältnis für lokale KI: ein GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).

Ein Mini-PC ist ein vollständiges System: Prüfen Sie den verfügbaren Speicher und die Kompatibilität der Engine. Er ersetzt nicht macOS/MLX oder CUDA.

Warum diese Wahl? Unsere vollständige Übersicht zu GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) →

Alle Optionen nach Budget vergleichen, von 800 bis 3 500 € →

Kleines Budget: RTX 5060 · Große Modelle: RTX 5090 · Mac Studio.

Unterwegs: Welcher Laptop für lokale KI →

Affiliate-Links – mögliche Provision ohne Mehrkosten für Sie. Als Amazon-Partner erzielt QuelLLM eine Vergütung für qualifizierte Käufe.

#Warum die Kühlung bei einem Inferenzserver wichtig ist

Eine GPU schützt ihren Chip: Wenn die Temperatur oder die Leistungsaufnahme die von ihrer Firmware erlaubten Werte überschreitet, senkt sie ihre Taktraten. Dieser Mechanismus heißt Throttling. Die Dokumentation von nvidia-smi unterscheidet seine Ursachen: eine softwareseitige Drosselung aufgrund der Temperatur („sw thermal slowdown“), eine stärkere hardwareseitige Drosselung, die die Taktraten um den Faktor 2 oder mehr reduziert („hw thermal slowdown“), und eine Leistungsgrenze („sw power cap“). Wenn all diese Gründe als inaktiv angegeben werden, sind die Taktraten so hoch wie möglich.

Der Schwellenwert ist nicht bei allen Karten gleich. NVIDIA bezeichnet ihn als „GPU Slowdown Temp“, die Temperatur, bei der die Hardware beginnt, die Taktfrequenzen zur Kühlung zu optimieren, und zeigt ihn in nvidia-smi an. Verlassen Sie sich daher nicht auf eine allgemeine Zahl wie „83 °C“: Lesen Sie den Wert Ihrer Karte ab. Die Folgen von Throttling sind geringere Geschwindigkeit und, wenn die Lüfter gegensteuern, mehr Lärm; langfristig altert eine Karte, die ständig heiß läuft, schneller, aber wir haben hierzu keine verlässliche Zahl, die wir zitieren könnten.

i
Decodierung und Prompt-Verarbeitung: unterschiedlich empfindlich
Die Textgenerierung wird durch die Speicherbandbreite begrenzt und reagiert daher nur wenig auf Änderungen der Kerntaktfrequenz. Die Verarbeitung des Prompts wird durch die Rechenleistung begrenzt und reagiert daher stärker auf jede Senkung der Taktfrequenz. Ein Server, der lange Dokumente oder Agentenschleifen verarbeitet, wird durch eine Begrenzung der Leistungsaufnahme stärker beeinträchtigt als ein interaktiver Chat.

#Vor dem Einstellen messen: Was die Karte wirklich verrät

Zunächst gilt es herauszufinden, ob die Grafikkarte langsamer wird und warum. Bei einer NVIDIA-Grafikkarte reichen zwei Befehle aus. Der erste zeigt laufend Temperatur, Leistungsaufnahme, Kerntakt und Auslastung an; der zweite liefert Details zu den Ursachen der Verlangsamung und den Temperaturschwellen Ihres Grafikkartenmodells.

Unter Last überwachen (eine Zeile pro Sekunde)
nvidia-smi --query-gpu=timestamp,temperature.gpu,power.draw,clocks.current.graphics,clocks.current.memory,utilization.gpu --format=csv -l 1
Gründe für eine Verlangsamung und Temperaturschwellen
nvidia-smi -q -d PERFORMANCE
nvidia-smi -q -d TEMPERATURE
AMD-Karten
rocm-smi --showtemp --showpower --showuse

Führen Sie diese Befehle während einer mehrminütigen Generierung aus, nicht im Leerlauf. Zwei Befunde sind entscheidend. Wenn die GPU-Kerntaktfrequenz sinkt, während die Temperatur steigt und ein thermischer Begrenzungsgrund aktiv ist, liegt ein Kühlungsproblem vor. Wenn die Kerntaktfrequenz hoch bleibt, aber eine Leistungsobergrenze aktiv ist, wird die Karte durch ihre Leistungsaufnahme begrenzt: Eine weitere Senkung dieser Grenze hat bei der Generierung keine nennenswerten Auswirkungen auf die Geschwindigkeit, reduziert aber die Wärmeentwicklung.

Was ablesen, was daraus schließen
Beobachtung während einer längeren GenerierungInterpretationErste Aktion
Stabile Temperatur unterhalb der Drosselungsschwelle, stabile TaktfrequenzKeine thermischen ProblemeNichts ändern; gegebenenfalls die Leistungsaufnahme begrenzen, um die Geräuschentwicklung zu reduzieren
Temperatur erreicht den Schwellenwert, Taktfrequenz sinkt, thermische Ursache wird als aktiv angezeigtUnzureichende KühlungAirflow des Gehäuses, Staub, Lüfterkurve
Niedrige Taktfrequenz, „power cap“ als Grund aktiv, Temperatur im normalen BereichLeistungsgrenze erreichtNormal; die Grenze nur erhöhen, wenn der Durchsatz nicht ausreicht
Geschwindigkeitsunterschied zwischen dem ersten und dem zehnten AustauschSchrittweise TemperaturerhöhungUnter längerer Last messen, nicht beim Start

#Leistungsgrenze: die Einstellung, die am meisten bringt

Die Leistungsaufnahme zu begrenzen ist einfacher, als die Spannungskurve anzupassen, und lässt sich rückgängig machen. Bei einer durch den Speicher begrenzten Inferenz ist der Geschwindigkeitsverlust bis zu einem bestimmten Schwellenwert gering, danach jedoch abrupt. Der Blog runaihome, der eine RTX 3090 mit einem dichten Modell mit 27 Milliarden Parametern vermessen hat, berichtet, dass die Karte bei einer Reduzierung von 350 W auf 250 W weniger als 3 % ihrer Geschwindigkeit verliert und dabei 100 W weniger verbraucht. Bei 200 W bricht dagegen der Kerntakt ein, und die Geschwindigkeit sinkt um 35 %.

Leistungslimit und Generierungsgeschwindigkeit, RTX 3090 (von runaihome veröffentlichte Messung)
GrenzeGemessener Effekt auf die Generierung
350 W (Standard)Referenz
300 WWeniger als 3 % Abweichung von der Referenz
250 W31,7 t/s, weniger als 3 % unter der Referenz
200 W20,6 Tokens/s, also 35 % weniger: die Grenze, die man nicht überschreiten sollte

Für eine RTX 4090 zitiert derselbe Blog Tom's Hardware: Demnach bleiben bei einer Begrenzung der Leistungsaufnahme auf 70 % (etwa 315 W) rund 94 % der Rechenleistung erhalten. Diese Zahlen stammen aus Sekundärquellen und beziehen sich auf eine bestimmte Karte: Übertragen Sie sie nicht unverändert auf Ihre eigene. Die zuverlässige Methode besteht darin, Ihren Durchsatz während einer längeren Textgenerierung zu messen, die Leistungsgrenze in Schritten von 25 bis 50 W zu senken und vor dem Leistungseinbruch aufzuhören.

Leistungsaufnahme begrenzen (Linux, an Ihre Grafikkarte anpassen)
# Lire la limite par défaut, minimale et maximale
nvidia-smi -q -d POWER

# Appliquer 250 W sur la carte 0 (nécessite les droits root)
sudo nvidia-smi -i 0 -pl 250

Die Dokumentation von nvidia-smi gibt an, dass der Wert zwischen der von der Grafikkarte gemeldeten Mindest- und Höchstgrenze liegen muss und dass der Befehl Root-Rechte erfordert. Prüfen Sie nach einem Neustart, ob die Grenze weiterhin gilt: Falls sie auf den Standardwert zurückgesetzt wurde, erstellen Sie eine systemd-Unit, die sie beim Start erneut setzt.

/etc/systemd/system/nvidia-power-limit.service
[Unit]
Description=Limite de puissance GPU
After=multi-user.target

[Service]
Type=oneshot
ExecStart=/usr/bin/nvidia-smi -i 0 -pl 250
RemainAfterExit=yes

[Install]
WantedBy=multi-user.target

Aktivieren Sie sie mit sudo systemctl enable --now nvidia-power-limit.service.

#Lüfterkurve: lieber früh aggressiv hochregeln als spät abrupt

Die werkseitige Lüfterkurve ist auf einen leisen Betrieb ausgelegt: Die Lüfter laufen bis zu einer hohen Temperatur langsam, danach steigt ihre Drehzahl an. Bei Dauerlast hält eine Kurve, die die Drehzahl früher erhöht, die Karte bei vergleichbarem Geräuschpegel kühler, weil sie Drehzahlspitzen vermeidet. Unter Windows lässt sich die Kurve mit MSI Afterburner einstellen; unter Linux ist LACT eine grafische Anwendung zur Steuerung von AMD-, NVIDIA- und Intel-GPUs, die auch eine Lüftersteuerung umfasst.

Beispielkurve für eine kontinuierliche Belastung (auf Ihrer Karte zu überprüfen)
TemperaturVentilatordrehzahl
50 °C40 %
60 °C55 %
70 °C75 %
78 °C90 %
Drosselungsschwelle minus 5 °C100 %

Diese Werte dienen als Ausgangspunkt, nicht als Herstellerempfehlung. Legen Sie die letzte Stufe anhand des Werts „GPU Slowdown Temp“ Ihrer Karte fest und beurteilen Sie das Ergebnis danach, welcher Geräuschpegel im Raum erträglich ist. Unter macOS steuert Apple die Lüfter: Die Lüfterkurve lässt sich nicht einstellen.

#Undervolting: feinere Abstimmung, längere Validierung

Undervolting bedeutet, dieselbe Frequenz mit einer niedrigeren Spannung zu erreichen und dadurch weniger Wärme zu erzeugen. Unter Windows wird es in MSI Afterburner eingestellt (Frequenz-Spannungs-Kurve); unter Linux besteht der übliche Ansatz darin, die Frequenzen mit der Option von nvidia-smi festzusetzen, die den Frequenzbereich des GPU-Kerns vorgibt. Der Gewinn hängt von der Karte ab: Jeder Chip hat seinen eigenen Spielraum, und eine zu aggressive Einstellung führt erst später zu Fehlern oder Abstürzen, nicht sofort.

  1. 01
    Von einem funktionierenden Leistungslimit ausgehen
    Beginnen Sie mit dem Leistungslimit: Damit erzielen Sie am sichersten eine Verbesserung. Ergänzen Sie Undervolting nur dann, wenn die Karte weiterhin zu heiß oder zu laut ist.
  2. 02
    Eine maximale Frequenz festlegen
    Fixieren Sie den Kerntakt auf einen Wert unterhalb des maximalen Boost-Takts, beispielsweise mit nvidia-smi -lgc gefolgt von einem Frequenzbereich in MHz.
  3. 03
    Über längere Zeit testen
    Starten Sie eine kontinuierige Generierung von mindestens 30 Minuten. Eine Instabilität zeigt sich durch CUDA-Fehler, Treiberabstürze oder inkonsistente Ausgaben.
  4. 04
    Vergleichen
    Messen Sie Geschwindigkeit und Temperatur vorher und nachher mit demselben Modell und demselben Prompt. Behalten Sie die Einstellung anschließend nur bei, wenn der Geschwindigkeitsverlust vernachlässigbar ist.
  5. 05
    Bei Bedarf rückgängig machen
    Setzen Sie die Taktfrequenzen zurück (nvidia-smi -rgc) oder starten Sie neu, um zu den Werkseinstellungen zurückzukehren.
!
Undervolting ist nicht garantiert
Anders als eine Leistungsbegrenzung kann zu starkes Undervolting das System zeitweise instabil machen. Beschränken Sie sich bei einem unbeaufsichtigt laufenden Server auf die Leistungsbegrenzung allein, wenn Sie nicht mehrere Stunden lang getestet haben.

#Gehäuse und Luftstrom: Der Vorteil lässt sich in Grad messen

Luftweg
Ein ungehinderter Luftstrom von vorne nach hinten, bei dem frische Luft zu den Lüftern der Grafikkarte geleitet wird. Eine Verkabelung, die den Luftstrom behindert, treibt die Temperatur um einige Grad nach oben.
Filter und Staub
Ein verschmutzter Filter verringert den Luftstrom: Reinigen Sie ihn regelmäßig und entfernen Sie den Staub vom Kühler der Karte mit Druckluft. Halten Sie dabei die Lüfter fest, damit sie sich nicht mit zu hoher Drehzahl drehen.
Platz rund um die Karte
Zwei dicht nebeneinander montierte Karten im Multi-GPU-Betrieb heizen die erste Karte auf; vergrößern Sie den Abstand zwischen ihnen oder bauen Sie einen seitlichen Lüfter ein.
Umgebung
Ein Raum mit 30 °C statt 20 °C erhöht die Temperatur der Grafikkarte um diese zehn Grad: Ein Server in einem geschlossenen Schrank ist zunächst ein thermisches Problem, bevor er ein Problem der Grafikkarte ist.

Um eine Einstellung zuverlässig zu beurteilen, halten Sie das Testverfahren konstant: dasselbe Modell, derselbe lange Prompt und dieselbe Generierungsdauer, wobei Sie jeweils nur einen Parameter ändern. Notieren Sie die maximale Temperatur, den GPU-Kerntakt und den durchschnittlichen Durchsatz am Ende der Generierung, nicht am Anfang, da eine kalte Karte immer bessere Werte liefert als dieselbe Karte nach zwanzig Minuten. Wiederholen Sie die Messung bei derselben Umgebungstemperatur, sonst wird der Vergleich durch die Bedingungen im Raum verfälscht und nicht durch die Einstellung.

#Repasting: Letzter Ausweg mit seinen Risiken

Nach mehreren Jahren können die Wärmeleitpaste und die Wärmeleitpads einer gebrauchten Grafikkarte ausgetrocknet sein. Ein Anzeichen dafür ist eine höhere Temperatur als beim Kauf unter derselben Last, trotz eines sauberen Gehäuses. Beim Zerlegen einer Grafikkarte erlischt die Garantie; außerdem können die Pads und der Chip beschädigt werden, und es ist ein methodisches Vorgehen nötig. Gehen Sie diesen Schritt erst an, nachdem Sie einfachere Ursachen ausgeschlossen haben: Staub, Luftstrom, Leistungsbegrenzung, Umgebungstemperatur. Wenn Sie unsicher sind, überlassen Sie die Karte einem Dienstleister; vergleichen Sie die Kosten mit denen einer Ersatzkarte.

#Laptops und Macs: Die Stellschrauben ändern sich

Bei einem Laptop stellen Sie weder die Spannung noch die Wärmeleitpaste ein. Der sinnvolle Ansatzpunkt ist der Energiemodus. Apple beschreibt zwei Modi: den Stromsparmodus, der unter macOS Sequoia 15.1 und neuer auch die Lüftergeräusche bei Modellen mit aktiver Kühlung reduziert, und den Hochleistungsmodus, der die Lüfter schneller drehen lässt, um die Leistung bei sehr intensiven Arbeitslasten aufrechtzuerhalten, allerdings mit zusätzlicher Geräuschentwicklung. Bei einem MacBook Air ohne Lüfter bleiben als einzige Ansatzpunkte eine wärmeableitende Unterlage, der Netzbetrieb und ein kleineres Modell.

#Häufig gestellte Fragen

FAQ
Ab welcher Temperatur beginnt eine Grafikkarte, langsamer zu werden?+
Das hängt vom Modell ab. NVIDIA definiert in nvidia-smi eine „GPU Slowdown Temp“, also die Temperatur, ab der die Hardware die Taktfrequenzen optimiert, um abzukühlen. Der Befehl nvidia-smi -q -d TEMPERATURE zeigt den Wert Ihrer Karte an. Verlassen Sie sich nicht auf einen allgemeinen Schwellenwert wie 83 °C, ohne ihn zu überprüfen.
Verlangsamt eine Begrenzung der Leistungsaufnahme die Inferenz deutlich?+
Nur wenig, bis zu einem Schwellenwert. Eine veröffentlichte Messung auf einer RTX 3090 zeigt bei der Generierung einen Geschwindigkeitsverlust von weniger als 3 % bei einer Reduzierung von 350 W auf 250 W, dann einen Einbruch von 35 % bei 200 W. Die Promptverarbeitung, die durch die Rechenleistung begrenzt ist, reagiert empfindlicher. Messen Sie auf Ihrer Karte mit Ihrer Arbeitslast.
Wie erkenne ich, ob meine GPU gedrosselt wird?+
Starten Sie eine lange Generierung und beobachten Sie den GPU-Kerntakt mit nvidia-smi. Wenn er sinkt, während die Temperatur steigt, prüfen Sie die Ausgabe von nvidia-smi -q -d PERFORMANCE: Sie zeigt an, ob eine temperatur- oder leistungsbedingte Begrenzung aktiv ist. Wenn alle Begrenzungsgründe inaktiv sind, liegen die Taktfrequenzen so hoch wie möglich.
Muss die Wärmeleitpaste der Grafikkarte erneuert werden?+
Selten. Schließen Sie zunächst Staub, den Luftstrom im Gehäuse, die Umgebungstemperatur und das Leistungslimit als Ursachen aus. Durch die Demontage erlischt die Garantie, und es bestehen Risiken für die Wärmeleitpads und den Chip. Sie ist nur gerechtfertigt, wenn die Temperaturen bei einer sauberen Karte deutlich gestiegen sind und zuvor alles andere überprüft wurde.
Undervolting oder Leistungsbegrenzung: Was wählen?+
Beginnen Sie mit der Leistungsbegrenzung: Sie ist einfach, reversibel und birgt kein Instabilitätsrisiko. Undervolting erfordert langwierige Tests und kann sporadische Abstürze verursachen, besonders auf einem unbeaufsichtigten Server. Setzen Sie es nur zusätzlich ein, wenn die Karte allein mit der Leistungsbegrenzung weiterhin zu heiß oder zu laut ist.
Hat ein MacBook thermische Einstellungen für lokale KI?+
Nur wenige. Apple bietet Energiemodi an: „Stromsparmodus“ und bei bestimmten Modellen „Hochleistungsmodus“, bei dem die Lüfter schneller laufen, aber auch lauter sind. Stellen Sie ein lüfterloses MacBook Air auf eine Unterlage, die Wärme ableitet, schließen Sie es an das Stromnetz an und wählen Sie für längere Generierungsvorgänge ein kleineres Modell.
Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.