Légende : 13 modèles mesurés sur l'AI TOP ATOM, 6 octobre 2026 (llama.cpp b11430, DGX OS 7.5.0, pilote 580.159.03). Écriture et lecture en tokens par seconde. Modèle;Type;Mémoire occupée;Chargement;Écriture (vide → 32k);Lecture (vide → 32k);Usage Gemma 3 4B (Q4_0);dense;4,6 Go;3 s;80,8 → 63,6;6 239 → 5 409;très fluide Qwen2.5-Coder 7B (Q8_0);dense;10,2 Go;3 s;30,0 → 23,3;3 746 → 2 138;fluide gpt-oss 20B (MXFP4);MoE, 3,6 Md actifs;13,0 Go;4 s;81,4 → 62,5;4 950 → 3 316;très fluide Qwen3.8 27B (Q4_K_XL);dense;19,1 Go;5 s;11,8 → 10,6;865 → 717;correct Qwen3.6 35B-A3B (Q4_K_XL);MoE, 3 Md actifs;22,4 Go;5 s;66,0 → 55,6;2 987 → 2 429;très fluide GLM-4.7-Flash (Q8_0);MoE, 3 Md actifs;32,6 Go;6 s;51,4 → 35,5;2 392 → 608;très fluide Qwen3-Coder 30B-A3B (Q8_0);MoE, 3,3 Md actifs;34,3 Go;6 s;62,6 → 33,2;3 377 → 1 603;très fluide Llama 3.3 70B (Q4_K_M);dense;51,1 Go;8 s;4,8 → 3,9;405 → 269;idéal en traitement par lots gpt-oss 120B (MXFP4);MoE, 5,1 Md actifs;61,7 Go;10 s;58,0 → 42,2;2 609 → 1 832;très fluide Qwen3.5 122B-A10B (Q4_K_XL);MoE, 10 Md actifs;74,5 Go;12 s;23,1 → 21,4;1 126 → 945;fluide Nemotron-3 Super 120B-A12B (Q4_K_XL);MoE, 12 Md actifs;80,4 Go;12 s;16,9 → 16,5;851 → 809;correct Qwen3.8-Flash-Next 125B (IQ4_XS);MoE, environ 6 Md actifs;89,5 Go;21 s;27,3 → 25,2;1 073 → 917;fluide Qwen3-235B-A22B (Q2_K_XL);MoE, 22 Md actifs;90,5 Go;12 s;17,7 → 11,8;588 → 331;"correct ; compression forte (Q2)"