Légende : Temps pour lire d'un bloc un document de 30 000 tokens (llama-server b11430, 6 octobre 2026), puis vitesse d'écriture de la réponse. Modèle;Lecture de 30 000 tokens;Écriture ensuite Gemma 3 4B;4,7 s;60,8 tok/s gpt-oss 20B;8,1 s;61,6 tok/s Qwen2.5-Coder 7B;12,7 s;23,3 tok/s Qwen3.6 35B-A3B;14,2 s;54,4 tok/s Qwen3-Coder 30B-A3B;17,4 s;33,3 tok/s gpt-oss 120B;21,8 s;42,8 tok/s GLM-4.7-Flash;32,7 s;35,6 tok/s Qwen3.8 27B;39,4 s;10,6 tok/s Qwen3.8-Flash-Next 125B;42,9 s;23,0 tok/s Qwen3.5 122B-A10B;43,6 s;21,2 tok/s Nemotron-3 Super 120B-A12B;55,4 s;16,2 tok/s Qwen3-235B-A22B;1 min 33 s;12,1 tok/s Llama 3.3 70B;1 min 44 s;4,0 tok/s