Août 2026 restera le mois où les modèles à poids ouverts ont cessé d'être une alternative de repli.

Kimi K3 a pris la première place du classement Frontend Code de LMArena avec 1679 points d'Elo — le premier modèle ouvert à dominer un classement Arena de bout en bout. Dans le même temps, DeepSeek et xAI ont publié leurs modèles phares le même jour, déclenchant une guerre des prix dont les entreprises sortent gagnantes.

Cette édition couvre les sorties d'août, l'état des classements à la fin du mois, et l'effondrement du coût par tâche.

Les sorties du mois

Grok 4.6 et DeepSeek V4 Pro, le même jour

Le 12 août, xAI publie Grok 4.6. Le 13, DeepSeek met en disponibilité générale DeepSeek-V4-Pro-0813. La quasi-simultanéité n'a rien d'un hasard, et le marché l'a lue comme telle.

Grok 4.6 affiche 95,60 % sur SWE-bench en mesure Vals, soit environ neuf points de mieux que Grok 4.5, à tarif inchangé de 2 $ / 6 $ par million de jetons.

DeepSeek V4 Pro revendique 62,7 sur DeepSWE et 87,9 sur Terminal-Bench 2.1, pour un tarif sur plateformes tierces de 0,435 $ en entrée et 0,87 $ en sortie.

Kimi K3 prend un classement Arena

Moonshot AI place Kimi K3 en tête du classement Frontend Code de LMArena, à 1679 points d'Elo. C'est la première fois qu'un modèle à poids ouverts domine un classement Arena en propre, et non comme meilleur de sa catégorie.

Sur le classement textuel généraliste, K3 se situe autour de 1500 — au niveau du peloton propriétaire. Son tarif en sortie, entre 14 et 15 $ par million de jetons en accès hébergé, reste en revanche élevé pour un modèle ouvert.

Gemini 3.7 Flash et la pression sur les tarifs

Google publie Gemini 3.7 Flash le 13 août avec un tarif de lancement réduit de moitié — 0,75 $ / 3,75 $ par million de jetons. Trois modèles majeurs en quarante-huit heures, tous positionnés sur le prix : la séquence dit assez où se joue la concurrence en août 2026.

Les classements à la fin du mois

Arena Elo — la préférence humaine

Modèle Éditeur Elo
Claude Fable 5Anthropic1525
Claude Opus 5Anthropic1522
GPT-5.6 SolOpenAI1514
Claude Opus 4.8Anthropic1512
Gemini 3.1 Pro (preview)Google1500
Kimi K3Moonshot AI~1500
Grok 4.5xAI1499

Relevé d'août 2026. Claude Opus 5 est sorti le 24 juillet. LMArena a procédé à un recalibrage le 12 juillet 2026, ce qui décale l'échelle par rapport aux éditions antérieures.

Vingt-six points séparent le premier du septième. C'est un écart faible : sur le classement textuel généraliste, Kimi K3, modèle ouvert, se tient au niveau de Gemini 3.1 Pro et de Grok 4.5. La hiérarchie ouvert/propriétaire, encore nette au printemps, ne se lit plus dans ces chiffres.

Intelligence Index v4.2

Modèle Index v4.2 Poids ouverts
Grok 4.660,9non
Kimi K360,0oui
DeepSeek V4 Pro53,0oui

Ces scores ne se comparent pas à ceux de notre édition de septembre. Artificial Analysis a publié la version 4.3 de son indice le 7 septembre, avec une refonte de fond : Terminal-Bench v4.0 à la place de la v2.1, AutomationBench-AA à la place de τ³-Banking, et la part du jeu de test privé portée de 40 à 45 %. La recalibration est massive — Grok 4.6 passe de 60,9 en v4.2 à 44 en v4.3, Kimi K3 de 60 à 44, DeepSeek V4 Pro de 53 à 36. Aucun de ces modèles n'a régressé : l'instrument de mesure a changé d'échelle.

La guerre des prix, et le coût réel par tâche

Le fait économique du mois tient dans une comparaison publiée par Artificial Analysis à la mi-août.

Grok 4.6 face à DeepSeek V4 Pro : sept virgule neuf points d'indice d'écart, pour un coût 14,9 fois supérieur. Grok 4.6 revient à 0,8367 $ par tâche accomplie.

La question que cela pose à tout décideur est simple : ces huit points valent-ils quinze fois le prix ? Sur un assistant de rédaction interne, presque certainement non. Sur un agent qui modifie du code en production, la réponse peut s'inverser — le coût d'une erreur y dépasse de loin le coût du modèle.

C'est cette mesure — le coût par tâche plutôt que le prix affiché au million de jetons — qui est devenue l'indicateur déterminant en 2026. Un modèle deux fois moins cher qui raisonne trois fois plus longtemps coûte plus cher à l'arrivée. Le tarif seul ne dit rien.

Modèle Entrée /M Sortie /M
Claude Fable 510,00 $50,00 $
Kimi K314 à 15 $
Grok 4.62,00 $6,00 $
Gemini 3.7 Flash0,75 $3,75 $
DeepSeek V4 Pro0,435 $0,87 $

Tarifs publics en dollars par million de jetons, relevés en août 2026. Gemini 3.7 Flash à tarif de lancement, réduit de 50 %. DeepSeek V4 Pro sur plateformes tierces type OpenRouter ; DeepSeek a annoncé une hausse à venir.

Entre Claude Fable 5 et DeepSeek V4 Pro, le rapport en sortie est de 57 pour 1. Aucun écart de qualité ne justifie mécaniquement un tel facteur — mais aucun écart de prix ne dispense non plus de vérifier que le modèle bon marché fait le travail.

Ce qu'il faut en retenir pour une entreprise

Les modèles ouverts sont sortis du banc d'essai

Kimi K3 en tête d'un classement Arena, DeepSeek V4 Pro à 87,9 sur Terminal-Bench 2.1 pour moins d'un dollar par million de jetons en sortie. Pour des données sensibles ou un budget contraint, ces options méritent désormais d'être évaluées en premier, pas en dernier.

Le coût par tâche prime sur le tarif affiché

Quinze fois le prix pour huit points d'indice : la comparaison Grok 4.6 / DeepSeek V4 Pro doit servir de grille de lecture. Mesurez ce que coûte une tâche accomplie chez vous, pas ce qu'annonce la page tarifaire.

Les écarts en haut de classement ne discriminent plus

Vingt-six points d'Elo entre le premier et le septième. Choisir sur le rang n'a plus de sens à ce niveau de resserrement — c'est l'adéquation à votre usage qui tranche.

Les échelles de mesure bougent

Recalibrage de LMArena le 12 juillet, refonte de l'Intelligence Index le 7 septembre. Un score n'a de sens qu'accompagné de sa version et de sa date. Méfiez-vous des comparaisons entre relevés d'époques différentes.

Sur le volet sécurité, l'évaluation de GLM-5.3 sur CyberGym, publiée à la mi-août, mérite une lecture attentive : elle documente les capacités offensives d'un modèle à poids ouverts, donc librement déployable. Nous y consacrons une analyse dédiée.

Note de méthodologie. Cette édition est la dernière publiée avant la refonte de notre protocole. À partir de l'édition #9 de septembre 2026, nous avons abandonné notre score composite maison — devenu inapplicable, trois de ses quatre benchmarks n'étant plus publiés par les éditeurs — au profit de six mesures tierces affichées côte à côte. Le détail est exposé dans l'édition de septembre et sur notre page de classement.

Questions fréquentes

Quel était le meilleur modèle en août 2026 ?

Sur la préférence humaine, Claude Fable 5 menait l'Arena à 1525 points d'Elo, suivi de près par Claude Opus 5 à 1522. Sur l'Intelligence Index v4.2, Grok 4.6 arrivait en tête à 60,9. Les deux mesures ne disent pas la même chose : l'une évalue ce que les utilisateurs préfèrent, l'autre la justesse sur des épreuves fermées.

Un modèle à poids ouverts peut-il remplacer une API propriétaire ?

En août 2026, c'est devenu défendable sur une partie des usages. Kimi K3 a pris la tête du classement Frontend Code de LMArena, et DeepSeek V4 Pro atteint 87,9 sur Terminal-Bench 2.1 pour moins d'un dollar par million de jetons en sortie. Les réserves restent les mêmes : licences à vérifier, jeux d'entraînement non publiés, et origine juridictionnelle à intégrer dans votre analyse de risque si les données sont sensibles.

Pourquoi les scores d'août diffèrent-ils autant de ceux de septembre ?

Parce que l'instrument a changé. Artificial Analysis a refondu son indice le 7 septembre : Grok 4.6 passe de 60,9 à 44, Kimi K3 de 60 à 44, DeepSeek V4 Pro de 53 à 36. Aucun de ces modèles n'a régressé. C'est la raison pour laquelle nous datons et versionnons systématiquement chaque relevé.

Comment choisir entre un modèle à 0,87 $ et un modèle à 50 $ en sortie ?

Par le coût d'une erreur. Sur une tâche où une réponse imparfaite se corrige sans conséquence — classification, extraction, reformulation — le modèle bon marché gagne largement. Sur un agent qui modifie du code en production ou produit un document engageant, le coût d'une erreur dépasse de très loin l'écart de facture. Commencez par qualifier ce coût, le choix du modèle en découle.