Édition #8 : Kimi K3 devient le premier modèle à poids ouverts à dominer un classement LMArena. Grok 4.6 et DeepSeek V4 Pro sortent le même jour et déclenchent une guerre des prix.
TL;DR — En résumé
En août 2026, Claude Fable 5 mène l'Arena Elo à 1525 points devant Claude Opus 5 (1522) et GPT-5.6 Sol (1514). Kimi K3 devient le premier modèle à poids ouverts à prendre la tête d'un classement LMArena, avec 1679 points sur le classement Frontend Code. Grok 4.6 (12 août) et DeepSeek V4 Pro (13 août) sortent coup sur coup : le premier mène l'Intelligence Index v4.2 à 60,9, le second coûte 14,9 fois moins cher pour 7,9 points de moins. Gemini 3.7 Flash arrive le 13 août à tarif de lancement réduit de moitié. Le coût par tâche s'impose comme l'indicateur déterminant, devant le prix affiché au million de jetons.
Août 2026 restera le mois où les modèles à poids ouverts ont cessé d'être une alternative de repli.
Kimi K3 a pris la première place du classement Frontend Code de LMArena avec 1679 points d'Elo — le premier modèle ouvert à dominer un classement Arena de bout en bout. Dans le même temps, DeepSeek et xAI ont publié leurs modèles phares le même jour, déclenchant une guerre des prix dont les entreprises sortent gagnantes.
Cette édition couvre les sorties d'août, l'état des classements à la fin du mois, et l'effondrement du coût par tâche.
Les sorties du mois
Grok 4.6 et DeepSeek V4 Pro, le même jour
Le 12 août, xAI publie Grok 4.6. Le 13, DeepSeek met en disponibilité générale DeepSeek-V4-Pro-0813. La quasi-simultanéité n'a rien d'un hasard, et le marché l'a lue comme telle.
Grok 4.6 affiche 95,60 % sur SWE-bench en mesure Vals, soit environ neuf points de mieux que Grok 4.5, à tarif inchangé de 2 $ / 6 $ par million de jetons.
DeepSeek V4 Pro revendique 62,7 sur DeepSWE et 87,9 sur Terminal-Bench 2.1, pour un tarif sur plateformes tierces de 0,435 $ en entrée et 0,87 $ en sortie.
Kimi K3 prend un classement Arena
Moonshot AI place Kimi K3 en tête du classement Frontend Code de LMArena, à 1679 points d'Elo. C'est la première fois qu'un modèle à poids ouverts domine un classement Arena en propre, et non comme meilleur de sa catégorie.
Sur le classement textuel généraliste, K3 se situe autour de 1500 — au niveau du peloton propriétaire. Son tarif en sortie, entre 14 et 15 $ par million de jetons en accès hébergé, reste en revanche élevé pour un modèle ouvert.
Gemini 3.7 Flash et la pression sur les tarifs
Google publie Gemini 3.7 Flash le 13 août avec un tarif de lancement réduit de moitié — 0,75 $ / 3,75 $ par million de jetons. Trois modèles majeurs en quarante-huit heures, tous positionnés sur le prix : la séquence dit assez où se joue la concurrence en août 2026.
Les classements à la fin du mois
Arena Elo — la préférence humaine
| Modèle | Éditeur | Elo |
|---|---|---|
| Claude Fable 5 | Anthropic | 1525 |
| Claude Opus 5 | Anthropic | 1522 |
| GPT-5.6 Sol | OpenAI | 1514 |
| Claude Opus 4.8 | Anthropic | 1512 |
| Gemini 3.1 Pro (preview) | 1500 | |
| Kimi K3 | Moonshot AI | ~1500 |
| Grok 4.5 | xAI | 1499 |
Relevé d'août 2026. Claude Opus 5 est sorti le 24 juillet. LMArena a procédé à un recalibrage le 12 juillet 2026, ce qui décale l'échelle par rapport aux éditions antérieures.
Vingt-six points séparent le premier du septième. C'est un écart faible : sur le classement textuel généraliste, Kimi K3, modèle ouvert, se tient au niveau de Gemini 3.1 Pro et de Grok 4.5. La hiérarchie ouvert/propriétaire, encore nette au printemps, ne se lit plus dans ces chiffres.
Intelligence Index v4.2
| Modèle | Index v4.2 | Poids ouverts |
|---|---|---|
| Grok 4.6 | 60,9 | non |
| Kimi K3 | 60,0 | oui |
| DeepSeek V4 Pro | 53,0 | oui |
Ces scores ne se comparent pas à ceux de notre édition de septembre. Artificial Analysis a publié la version 4.3 de son indice le 7 septembre, avec une refonte de fond : Terminal-Bench v4.0 à la place de la v2.1, AutomationBench-AA à la place de τ³-Banking, et la part du jeu de test privé portée de 40 à 45 %. La recalibration est massive — Grok 4.6 passe de 60,9 en v4.2 à 44 en v4.3, Kimi K3 de 60 à 44, DeepSeek V4 Pro de 53 à 36. Aucun de ces modèles n'a régressé : l'instrument de mesure a changé d'échelle.
La guerre des prix, et le coût réel par tâche
Le fait économique du mois tient dans une comparaison publiée par Artificial Analysis à la mi-août.
Grok 4.6 face à DeepSeek V4 Pro : sept virgule neuf points d'indice d'écart, pour un coût 14,9 fois supérieur. Grok 4.6 revient à 0,8367 $ par tâche accomplie.
La question que cela pose à tout décideur est simple : ces huit points valent-ils quinze fois le prix ? Sur un assistant de rédaction interne, presque certainement non. Sur un agent qui modifie du code en production, la réponse peut s'inverser — le coût d'une erreur y dépasse de loin le coût du modèle.
C'est cette mesure — le coût par tâche plutôt que le prix affiché au million de jetons — qui est devenue l'indicateur déterminant en 2026. Un modèle deux fois moins cher qui raisonne trois fois plus longtemps coûte plus cher à l'arrivée. Le tarif seul ne dit rien.
| Modèle | Entrée /M | Sortie /M |
|---|---|---|
| Claude Fable 5 | 10,00 $ | 50,00 $ |
| Kimi K3 | — | 14 à 15 $ |
| Grok 4.6 | 2,00 $ | 6,00 $ |
| Gemini 3.7 Flash | 0,75 $ | 3,75 $ |
| DeepSeek V4 Pro | 0,435 $ | 0,87 $ |
Tarifs publics en dollars par million de jetons, relevés en août 2026. Gemini 3.7 Flash à tarif de lancement, réduit de 50 %. DeepSeek V4 Pro sur plateformes tierces type OpenRouter ; DeepSeek a annoncé une hausse à venir.
Entre Claude Fable 5 et DeepSeek V4 Pro, le rapport en sortie est de 57 pour 1. Aucun écart de qualité ne justifie mécaniquement un tel facteur — mais aucun écart de prix ne dispense non plus de vérifier que le modèle bon marché fait le travail.
Ce qu'il faut en retenir pour une entreprise
Les modèles ouverts sont sortis du banc d'essai
Kimi K3 en tête d'un classement Arena, DeepSeek V4 Pro à 87,9 sur Terminal-Bench 2.1 pour moins d'un dollar par million de jetons en sortie. Pour des données sensibles ou un budget contraint, ces options méritent désormais d'être évaluées en premier, pas en dernier.
Le coût par tâche prime sur le tarif affiché
Quinze fois le prix pour huit points d'indice : la comparaison Grok 4.6 / DeepSeek V4 Pro doit servir de grille de lecture. Mesurez ce que coûte une tâche accomplie chez vous, pas ce qu'annonce la page tarifaire.
Les écarts en haut de classement ne discriminent plus
Vingt-six points d'Elo entre le premier et le septième. Choisir sur le rang n'a plus de sens à ce niveau de resserrement — c'est l'adéquation à votre usage qui tranche.
Les échelles de mesure bougent
Recalibrage de LMArena le 12 juillet, refonte de l'Intelligence Index le 7 septembre. Un score n'a de sens qu'accompagné de sa version et de sa date. Méfiez-vous des comparaisons entre relevés d'époques différentes.
Sur le volet sécurité, l'évaluation de GLM-5.3 sur CyberGym, publiée à la mi-août, mérite une lecture attentive : elle documente les capacités offensives d'un modèle à poids ouverts, donc librement déployable. Nous y consacrons une analyse dédiée.
Note de méthodologie. Cette édition est la dernière publiée avant la refonte de notre protocole. À partir de l'édition #9 de septembre 2026, nous avons abandonné notre score composite maison — devenu inapplicable, trois de ses quatre benchmarks n'étant plus publiés par les éditeurs — au profit de six mesures tierces affichées côte à côte. Le détail est exposé dans l'édition de septembre et sur notre page de classement.
Questions fréquentes
Quel était le meilleur modèle en août 2026 ?
Sur la préférence humaine, Claude Fable 5 menait l'Arena à 1525 points d'Elo, suivi de près par Claude Opus 5 à 1522. Sur l'Intelligence Index v4.2, Grok 4.6 arrivait en tête à 60,9. Les deux mesures ne disent pas la même chose : l'une évalue ce que les utilisateurs préfèrent, l'autre la justesse sur des épreuves fermées.
Un modèle à poids ouverts peut-il remplacer une API propriétaire ?
En août 2026, c'est devenu défendable sur une partie des usages. Kimi K3 a pris la tête du classement Frontend Code de LMArena, et DeepSeek V4 Pro atteint 87,9 sur Terminal-Bench 2.1 pour moins d'un dollar par million de jetons en sortie. Les réserves restent les mêmes : licences à vérifier, jeux d'entraînement non publiés, et origine juridictionnelle à intégrer dans votre analyse de risque si les données sont sensibles.
Pourquoi les scores d'août diffèrent-ils autant de ceux de septembre ?
Parce que l'instrument a changé. Artificial Analysis a refondu son indice le 7 septembre : Grok 4.6 passe de 60,9 à 44, Kimi K3 de 60 à 44, DeepSeek V4 Pro de 53 à 36. Aucun de ces modèles n'a régressé. C'est la raison pour laquelle nous datons et versionnons systématiquement chaque relevé.
Comment choisir entre un modèle à 0,87 $ et un modèle à 50 $ en sortie ?
Par le coût d'une erreur. Sur une tâche où une réponse imparfaite se corrige sans conséquence — classification, extraction, reformulation — le modèle bon marché gagne largement. Sur un agent qui modifie du code en production ou produit un document engageant, le coût d'une erreur dépasse de très loin l'écart de facture. Commencez par qualifier ce coût, le choix du modèle en découle.
À propos de l'auteur
Ayi NEDJIMI
Auditeur Senior Cybersécurité & Consultant IA
Expert Judiciaire — Cour d'Appel de Paris
Habilitation Confidentiel Défense
ayi@ayinedjimi-consultants.fr
Ayi NEDJIMI est un vétéran de la cybersécurité avec plus de 25 ans d'expérience sur des missions critiques. Ancien développeur Microsoft à Redmond sur le module GINA (Windows NT4) et co-auteur de la version française du guide de sécurité Windows NT4 pour la NSA.
À la tête d'Ayi NEDJIMI Consultants, il réalise des audits Lead Auditor ISO 42001 et ISO 27001, des pentests d'infrastructures critiques, du forensics et des missions de conformité NIS2 / AI Act.
Conférencier international (Europe & US), il a formé plus de 10 000 professionnels.
Domaines d'expertise
Ressources & Outils de l'auteur
Testez vos connaissances
Mini-quiz de certification lié à cet article — propulsé par CertifExpress
Articles connexes
Benchmark LLM Septembre 2026 : le classement complet des 18 meilleurs modèles
Classement complet de 18 modèles sur six benchmarks croisés : Intelligence Index v4.3, Arena Elo, SWE-Bench, Terminal-Bench, HLE et coût réel par tâche. Fable 5.1 et GPT-6 Astra à égalité.
MCP vs A2A vs OpenAI Agents SDK : choisir son protocole d'orchestration 2026
MCP, A2A et OpenAI Agents SDK sont les trois protocoles d'orchestration d'agents IA qui dominent l'écosystème en 2026. Ce guide compare leur architecture, leurs cas d'usage et propose un arbre de décision pour choisir le bon protocole.
Créer un serveur MCP en Python : guide complet SDK officiel
Guide pratique pour créer un serveur MCP en Python avec le SDK officiel : Tools, Resources, Prompts, transports stdio/SSE, intégration Claude Desktop, tests MCP Inspector et publication Smithery.
Sécurisez vos systèmes d'IA & LLM
Red teaming LLM, audit RAG, détection shadow AI, gouvernance des usages IA en entreprise. Expertise technique et réglementaire (EU AI Act).
Commentaires
Aucun commentaire pour le moment. Soyez le premier à commenter !
Laisser un commentaire