Drei Modelle, ein Rechner, Belege
Pilottest vom 12. September 2026 auf einer RTX 5070 Ti Laptop: 12.227 MiB gemessen, Ollama, Kontext 4096, jeweils eine Anfrage. Keine Extrapolation auf die Desktop-Version, eine RTX 5090 oder einen Mac.
Die alten Matrizen für mehrere Rechner wurden entfernt, da Artefakte fehlten, mit denen sie hätten überprüft werden können. Dieses Dossier veröffentlicht die Messungen dieses Piloten, mit einer Aufwärmphase und anschließend fünf Wiederholungen pro Modell; die Messungen der AI-TOP-ATOM-Reihe haben weiter unten einen eigenen Abschnitt.
| Modell | Quantisierung | Median tok/s | Min–max | Code FR | Französische Dokumente |
|---|---|---|---|---|---|
| qwen3:8b | Q4_K_M | 59.71 | 59.45–59.96 | Erfolgreich | Fakten und Format korrekt |
| hermes3:8b | Q4_0 | 71.97 | 71.79–72.15 | Fehlgeschlagen | Gefundene Fakten, unterschiedliche Schlüssel |
| mistral-nemo:12b | Q4_0 | 47.44 | 47.37–47.56 | Erfolgreich | Fakten und Format korrekt |
Was dieser Test aussagen kann
Hermes3 generiert in diesem Test schneller, aber seine Funktion entfernt Duplikate nicht korrekt und sortiert die Werte. Qwen3 und Mistral Nemo lösen diese Aufgabe erfolgreich. Der Durchsatz allein belegt also keine Qualität. Eine Coding-Aufgabe und eine synthetische Extraktionsaufgabe reichen nicht aus, um die Modelle für alle Anwendungsfälle in eine Rangfolge zu bringen; die Ausgabe von Hermes3 erreicht außerdem die Grenze von 256 Tokens.
Die Daten reproduzieren und untersuchen
- Protokoll, Parameter und Grenzen
- Vollständige Antworten und GPU-Platzierungen – Roh-JSON
- Alle Wiederholungen — CSV
- Ergebnisse, Kennungen und Quantisierungen
- Hardware, Versionen und Anfangszustand
- Reproduzierbares Skript
- Vollständiges Material, einschließlich Ein- und Ausgaben
Promptverarbeitung und Generierung sind in den Rohdaten getrennt ausgewiesen. Der Präfix-Cache kann Erstere beeinflussen; der angezeigte Durchsatz bezieht sich ausschließlich auf die Generierung. Es handelt sich weder um eine Energiemessung noch um die Gesamtlatenz der Anwendung.
AI-TOP-ATOM-Serie (GIGABYTE), Oktober 2026
Unsere Serie über AI TOP ATOM (Chip NVIDIA GB10, 128 GB), freundlicherweise von GIGABYTE bereitgestellt, umfasst 7 Guides, die seit dem 8. Oktober 2026 wöchentlich veröffentlicht wurden. Jeder Guide veröffentlicht seine Daten hier: jede Tabelle genau so, wie sie im Guide erscheint, im CSV-Format (Semikolon als Trennzeichen, UTF-8, Überschrift in der ersten Zeile), zusammen mit der Methode und den Modell-Hashes. Daten, Infografiken und Fotos der Serie: Lizenz CC BY 4.0, freie Wiederverwendung unter Angabe von quelllm.fr.
- Messmethode und datierte Nachträge
- SHA-256-Hashes der 27 Modelldateien aus Guide 1, verglichen mit Hugging Face
- Guide 1: Welche LLMs wirklich auf 128 GB laufen : tableau 1 · tableau 2 · tableau 3 · tableau 4 · tableau 5 · tableau 6
Drei Arten von Daten
„Von QuelLLM gemessen“ bezeichnet einen Versuch, der mit den zugehörigen Artefakten verknüpft ist. „Externe Messung“ muss den Urheber und dessen Messprotokoll nennen. „Schätzung“ bezeichnet insbesondere heuristisch ermittelte Geschwindigkeiten und Speicherbudgets des Konfigurators; diese Werte stammen nicht aus diesem neuen Test.
Methodik · Passend zu meinem Rechner auswählen · Eine lokale KI kostenlos installieren