Légende : Plusieurs utilisateurs simultanés, vLLM 26.09 (conteneur NVIDIA), 6 octobre 2026. « Par personne » : vitesse d'écriture une fois la réponse lancée. « Total » : tokens écrits par seconde pour l'ensemble des utilisateurs, attente du premier mot comprise. « Cas les plus lents » : 99e centile, la durée sous laquelle se terminent 99 requêtes sur 100, calculée sur 4 à 64 requêtes par série, donc proche du maximum observé. Modèle;Utilisateurs;Total;Par personne;Premier mot (moyenne);Premier mot (cas les plus lents) gpt-oss 120B;1;35,6 tok/s;36,4 tok/s;0,34 s;0,35 s gpt-oss 120B;8;113,9 tok/s;14,5 tok/s;0,97 s;1,62 s gpt-oss 120B;16;160,3 tok/s;10,2 tok/s;1,07 s;3,71 s gpt-oss 20B;1;49,1 tok/s;50,0 tok/s;0,16 s;0,16 s gpt-oss 20B;8;205,9 tok/s;26,5 tok/s;0,49 s;0,81 s gpt-oss 20B;16;322,4 tok/s;20,7 tok/s;0,52 s;1,73 s