01 — LES PREUVES · 29.08.2026
Presque au niveau des meilleurs modèles du monde.
Deux classements indépendants, relevés ce jour. Nous ne publions pas de scores Numezis : nous publions ce que les tiers mesurent.
L'écart entre le meilleur modèle ouvert et le meilleur modèle fermé, sur 127 modèles mesurés aux mêmes 22 benchmarks. Artificial Analysis, 29.08.2026.
L'écart entre le meilleur modèle ouvert (Kimi K3, 1 674) et le meilleur modèle fermé (Claude Opus 5, 1 691), sur des votes humains anonymes. LMArena, 29.08.2026.
Le rang du modèle le plus puissant qu'une organisation peut réellement faire tourner dans ses murs — GLM-5.3-Flash. Devant la moitié des modèles du marché.
Ce que facture une tâche sur l'API haut de gamme (2,34 $) par rapport à un modèle ouvert installé (0,09 $). Artificial Analysis, 29.08.2026.
02 — LES CLASSEMENTS
Ce que les tiers mesurent.
Chaque rang est vérifiable sur la page source, à la date du relevé. Les classes changent chaque trimestre ; ce qui ne change pas, c'est l'ordre de grandeur.
| Modèle | Score | Type | |
|---|---|---|---|
| 1 | Claude Opus 5 (max)API | 1 691 | |
| 2 | Kimi K3 (max)OUVERT | 1 674 | |
| 3 | Qwen 3.8 MaxOUVERT | 1 669 | |
| 4 | Claude Opus 5 (high)API | 1 663 | |
| 5 | GLM-5.3 (max)OUVERT | 1 599 | |
| 6 | Qwen 3.8 27BOUVERT | 1 595 | |
| 7 | Gemini 3.7 Flash (high)API | 1 587 |
| Modèle | Rang | Score | Machine |
|---|---|---|---|
| Qwen 3.8 27BOUVERT | 30sur 127 modèles | 52 | N1 · N2 · N4 |
| Qwen 3.8 Flash-NextOUVERT | 20sur 127 modèles | 56 | N2 · N4 |
| GLM-5.3-FlashOUVERT | 15sur 127 modèles | 57 | N2 · N4 |
| DeepSeek V4 FlashOUVERT | 31sur 127 modèles | 52 | N4 |
| Claude Opus 5 (high)API | 4sur 127 modèles | 61 | — |
| Claude Opus 5 (max)API | 1sur 127 modèles | 63 | — |
Les versions « max » qui dominent les classements (Kimi K3 : 2 800 milliards de paramètres, Qwen 3.8 Max, GLM-5.3) exigent des grappes de plusieurs dizaines de cartes et restent des services API. Elles servent ici de référence de niveau. Ce que la machine installe est le catalogue ci-dessus — les modèles les plus puissants qu'une organisation peut réellement faire tourner dans ses murs.
Sources : LMArena ↗ · Artificial Analysis ↗ · Deloitte ↗ — relevés le 29.08.2026
03 — LE COÛT
La puissance, ce n'est pas ce qui coûte.
Un modèle ouvert installé a un coût marginal qui tend vers zéro. Le même travail, sur API, se paie à chaque tâche.
Le calculateurLe prix d'une tâche sur GLM-5.3-Flash, installé chez vous. L'API haut de gamme facture 2,34 $ la même tâche.
C'est la facture API évitée pour une organisation de 20 personnes en usage régulier — 73 000 tâches par an. Le calculateur fait la courbe avec vos chiffres.
Des coûts d'inférence économisés sur site par rapport au cloud public, à volume significatif. Deloitte, State of AI in the Enterprise.
04 — CE QUE LA MACHINE TOURNE
Pas des promesses. Des modèles nommés.
Vérifiés sur leurs cartes officielles, le 29 août 2026 : taille, mémoire, licence. C'est ce qui est installé, pas les versions API des classements.
| Modèle | Paramètres | Mémoire (BF16) | Machine | Licence |
|---|---|---|---|---|
| Qwen 3.8 27BAlibaba · 256 k tokens | 27 B · dense | ≈ 56 Go (BF16) | N1 · N2 · N4 | Apache 2.0 |
| GLM-5.3-FlashZ.ai · 256 k tokens | 320 B · 18 B actifs | ≈ 320 Go (BF16) | N2 · N4 | MIT |
| DeepSeek V4 FlashDeepSeek · 1 M tokens | 284 B · 13 B actifs | ≈ 291 Go (BF16) | N4 | MIT |
| Apertus 70BSUISSEEPFL / ETH / CSCS · 131 k tokens | 71 B · dense | ≈ 142 Go (BF16) | N2 · N4 | Apache 2.0 |
| Apertus v1.5 8BSUISSEEPFL / ETH / CSCS · 131 k tokens | 9 B · dense | ≈ 18 Go (BF16) | N1 · N2 · N4 | Apache 2.0 |
Mémoire : taille des poids du modèle en BF16, hors mémoire de contexte. La bascule entre modèles est incluse au service, chaque trimestre. Apertus est le modèle suisse (EPFL / ETH / CSCS), proposé par défaut pour le secteur public et parapublic.
05 — CE QUE LES BENCHMARKS NE MESURENT PAS
100 % ne s'applique qu'à l'architecture.
Un benchmark mesure ce qu'un modèle sait faire. Il ne mesure pas où vos documents sont quand il le fait.
Parler à un ingénieurLa différence de fond : un modèle à 97 % qui tourne dans votre bâtiment bat un modèle à 100 % qui tourne chez quelqu'un d'autre.
Aucun flux sortant de contenu client, par construction — pas par promesse. Attesté chaque année par le rapport annuel, opposable à votre réviseur.
Aucune architecture n'est à l'abri de tout risque. La différence est de savoir ce que l'on peut prouver — et de le produire, devant son ordre.