GPQA Diamond est le sous-ensemble le plus difficile du benchmark Graduate-Level Google-Proof Q&A, conçu par Google DeepMind en 2023 pour évaluer le raisonnement des LLMs sur 448 questions de niveau doctorat en chimie, physique quantique et biologie. En 2026, les meilleurs modèles IA (Claude 3.7, GPT-4o, Gemini 1.5 Ultra) dépassent le score humain expert de 69,7 % — ce qui soulève des questions fondamentales sur la valeur de ce benchmark pour choisir un LLM en contexte cybersécurité.

Le GPQA Diamond benchmark académique est aujourd'hui l'une des mesures de référence les plus citées lorsqu'il s'agit d'évaluer les capacités de raisonnement des grands modèles de langage (LLMs) sur des tâches réellement difficiles. Conçu par David Rein et ses collègues de Google DeepMind et publié fin 2023, GPQA — pour Graduate-Level Google-Proof Question and Answer — se distingue radicalement des benchmarks traditionnels comme MMLU : ses questions ont été rédigées par des experts doctorants et post-doctorants, validées par d'autres experts, et conçues de façon à rendre une recherche Google pratiquement inutile pour les résoudre. Pour un RSSI, un architecte sécurité ou un consultant qui doit choisir le bon LLM pour des tâches d'analyse technique complexes — audit de code, raisonnement sur des CVE complexes, interprétation de logs de sécurité avancés — comprendre ce que GPQA Diamond mesure vraiment, et ce qu'il ne mesure pas, est devenu une compétence stratégique. Cet article décortique le benchmark, compare les scores 2026 des principaux modèles, et vous donne des critères concrets pour exploiter GPQA dans votre processus de sélection LLM.

⚡ À retenir — GPQA Diamond

GPQA Diamond regroupe 448 questions de niveau doctorat, sélectionnées parmi les plus difficiles de l'ensemble GPQA (198 questions dans le sous-ensemble Extended). Les experts humains sans accès à leurs outils habituels scorent environ 69,7 %. En 2026, les meilleurs LLMs dépassent ce seuil — mais cela signifie que le benchmark approche de la saturation sur les top modèles. Pour évaluer un LLM en cybersécurité, GPQA Diamond doit être combiné avec des benchmarks spécialisés (CyberSecEval, NYU CTF, HackTheBox-LLM) : il mesure le raisonnement général avancé, pas la connaissance sécurité spécifique.

Qu'est-ce que le GPQA Diamond benchmark ?

GPQA — Graduate-Level Google-Proof Question and Answer — est un benchmark publié en novembre 2023 par David Rein, Betty Li Hou, Asa Cooper Stickland, Jackson Petty, Richard Yuanzhe Pang, Julien Dirani, Julian Michael et Samuel R. Bowman, avec des chercheurs de Google DeepMind, de l'Université de New York et d'autres institutions. L'article original est disponible sur arXiv (2311.12022).

Le benchmark se compose de questions à choix multiples (4 options) dans trois domaines scientifiques de haut niveau : la biologie moléculaire et cellulaire, la chimie organique et inorganique avancée, et la physique quantique et relativiste. Chaque question a été créée par un expert ayant un niveau minimum de master ou de doctorat dans le domaine concerné. La validation croisée est assurée par d'autres experts : une question n'est retenue que si l'expert rédacteur la résout correctement, mais si d'autres experts dans des domaines connexes peinent à la résoudre sans ressources documentaires. Cette double exigence garantit que les questions sont à la fois correctes et genuinement difficiles.

Le terme Google-Proof est au cœur du design : les questions sont construites de manière à ce qu'une simple recherche web ou une lecture d'article Wikipédia ne permette pas de déduire la bonne réponse. Elles nécessitent un raisonnement en plusieurs étapes intégrant des connaissances implicites que seul un expert du domaine maîtrise intuitivement. La baseline aléatoire (25 %, un quart des réponses pour 4 options) représente donc le plancher absolu, et le score humain expert constitue le repère naturel.

GPQA Main, Diamond et Extended : les trois sous-ensembles

GPQA se décline en trois ensembles de difficulté croissante, ce qui crée parfois de la confusion dans les tableaux de classement publiés par les laboratoires IA :

  • GPQA Main : 448 questions, le corpus complet. C'est l'ensemble de référence. Les scores humains experts s'établissent autour de 69,7 % sur cet ensemble dans les conditions originales (sans outils).
  • GPQA Diamond : 198 questions extraites de GPQA Main, retenues parce qu'elles ont le taux d'erreur le plus élevé parmi les experts non-spécialistes. Ce sont les questions les plus difficiles du benchmark, celles qui exigent un raisonnement le plus approfondi et les moins susceptibles d'être résolues par mémorisation. C'est sur ce sous-ensemble que la plupart des laboratoires reportent leurs scores depuis 2024.
  • GPQA Extended : un ensemble élargi incluant des questions supplémentaires qui n'ont pas passé tous les filtres de qualité de GPQA Main, utile pour l'entraînement ou l'exploration, mais moins utilisé comme benchmark officiel.

Depuis 2024, GPQA Diamond est devenu le standard de facto pour comparer les LLMs avancés, précisément parce qu'il résiste mieux à la saturation : un modèle qui atteindrait 90 % sur GPQA Main serait considéré comme ayant "résolu" le benchmark, ce qui rendrait les comparaisons entre les meilleurs modèles impossibles. Diamond, avec ses 198 questions les plus ardues, maintient une discrimination plus fine entre les top modèles.

Disciplines couvertes et design des questions

La répartition disciplinaire de GPQA Diamond reflète une volonté délibérée de cibler des domaines où le raisonnement formel est irremplaçable :

  • Biologie (environ 28 %) : mécanismes moléculaires de maladies rares, interactions protéine-ligand, voies de signalisation cellulaire, génomique fonctionnelle. Ces questions exigent une compréhension intégrée de la biochimie et de la biologie cellulaire, pas seulement la mémorisation de faits.
  • Chimie (environ 42 %) : mécanismes de réactions organiques multi-étapes, stéréochimie avancée, chimie de coordination, thermodynamique de réactions. C'est le domaine le plus représenté, en partie parce que la chimie avancée se prête bien aux questions "Google-Proof" : la plupart des raisonnements ne sont pas cherchables directement.
  • Physique (environ 30 %) : mécanique quantique, relativité générale et restreinte, physique des particules, optique quantique. Les questions de physique sont souvent celles qui discriminent le mieux les modèles, car elles combinent calcul formel, intuition physique et interprétation conceptuelle.

Le format à 4 options est intentionnel : il évite les problèmes de notation des réponses libres, mais maintient une difficulté réelle car les distracteurs (mauvaises réponses) sont conçus pour être plausibles. Un expert distrait peut se faire piéger par une option séduisante mais incorrecte — c'est précisément ce que le benchmark mesure : non pas la récitation de connaissances, mais leur application précise sous pression de raisonnement.

Scores 2026 : les LLMs dépassent le seuil humain expert

En juillet 2026, le tableau des performances sur GPQA Diamond a considérablement évolué par rapport aux premiers résultats de 2023-2024. Les meilleurs modèles actuels dépassent désormais le score humain expert de référence :

Modèle Score GPQA Diamond Statut
Claude 3.7 Sonnet (extended thinking)~78 %Au-dessus expert
GPT-4o (2025)~77 %Au-dessus expert
Gemini 1.5 Ultra~72 %Au-dessus expert
Llama 3.1 405B~51 %En dessous expert
Mistral Large 2~49 %En dessous expert
Human expert (sans outils)69,7 %Référence
Baseline aléatoire (25 %)25 %Plancher

Ces scores doivent être interprétés avec prudence. D'une part, les conditions de test varient entre laboratoires : certains utilisent des techniques de chain-of-thought, d'extended thinking ou de majority voting qui améliorent significativement les performances. D'autre part, la contamination des données d'entraînement est un risque documenté : si des questions de GPQA ont été vues pendant l'entraînement, les scores sur ces questions ne reflètent plus un raisonnement pur mais une forme de mémorisation. Des travaux récents de Hugging Face Open LLM Leaderboard tentent de contrôler ce biais par rotation des questions et introduction de variantes.

Pourquoi "Google-Proof" : la méthodologie anti-recherche

Le concept Google-Proof mérite une explication détaillée car il est au cœur de ce qui distingue GPQA des benchmarks traditionnels. La plupart des questions de MMLU, par exemple, peuvent être résolues en cherchant la bonne réponse sur Wikipédia ou dans un manuel en ligne. Ce n'est pas une critique de MMLU — c'est juste que ces questions testent la mémorisation des connaissances, pas le raisonnement.

GPQA Diamond adopte une approche différente à plusieurs niveaux :

  1. Questions multi-étapes : la réponse résulte d'un enchaînement de déductions, chacune s'appuyant sur la précédente. Même si chaque étape individuelle est trouvable sur internet, la combinaison correcte ne l'est pas.
  2. Connaissances implicites : les questions exploitent des heuristiques professionnelles que les experts développent au fil des années de pratique et qui ne sont généralement pas documentées explicitement dans la littérature.
  3. Distracteurs sophistiqués : les mauvaises réponses sont des erreurs plausibles que ferait un étudiant bien informé mais pas encore expert — ce qui force le modèle à discriminer finement, pas juste à identifier la bonne réponse.
  4. Validation croisée rigoureuse : une question n'est incluse que si des experts d'un domaine adjacent échouent à la résoudre correctement dans plus de 50 % des cas sans accès à leurs ressources habituelles.

Pour un RSSI qui évalue des LLMs, cette propriété est particulièrement pertinente : elle garantit que le score GPQA Diamond est plus robuste que des benchmarks faciles à "tricher" par fine-tuning ciblé ou contamination de données.

Comparaison avec d'autres benchmarks IA : MMLU, HumanEval, HELM, CyberSecEval

GPQA Diamond s'inscrit dans un écosystème de benchmarks qu'il est important de comprendre pour ne pas lui faire dire ce qu'il ne dit pas :

  • MMLU (Massive Multitask Language Understanding) : 57 domaines, 14 000 questions, niveau lycée à universitaire. Utile pour évaluer la couverture générale des connaissances, mais saturé par les top modèles (>90 %). GPQA Diamond est complémentaire pour discriminer les meilleurs modèles.
  • HumanEval / MBPP : benchmarks de codage, évaluation de la capacité à écrire du code Python correct. Indispensables pour des use-cases cybersécurité impliquant de l'analyse de code ou de la génération de scripts, mais orthogonaux au raisonnement scientifique mesuré par GPQA.
  • HELM (Holistic Evaluation of Language Models) : framework Stanford qui agrège de nombreux benchmarks et métriques (exactitude, robustesse, calibration, équité). GPQA Diamond y est intégré comme l'un des scénarios de difficulté maximale.
  • CyberSecEval (Meta) : benchmark spécifiquement conçu pour évaluer les LLMs sur des tâches de cybersécurité — analyse de malware, génération de code sécurisé, résistance aux attaques prompt injection. C'est ce benchmark qui est le plus directement pertinent pour un RSSI, mais il est moins connu que GPQA Diamond. Notre comparatif LLMs France intègre les deux dimensions.
  • NYU CTF Bench : évalue la capacité des LLMs à résoudre des challenges Capture The Flag. Très spécialisé, mais directement opérationnel pour les équipes de sécurité offensive et les analystes threat intelligence.

Pour un choix éclairé en contexte cybersécurité, la combinaison GPQA Diamond (raisonnement général avancé) + CyberSecEval (compétences cyber spécifiques) + HumanEval (capacités de codage) offre une triangulation solide. Aucun de ces benchmarks pris isolément n'est suffisant.

Applications pour les RSSI : GPQA Diamond comme critère de sélection LLM

Les RSSI et architectes sécurité qui intègrent des LLMs dans leurs workflows se posent une question pratique : quel modèle choisir pour quelle tâche ? GPQA Diamond apporte une réponse partielle mais précieuse.

Cas d'usage où GPQA Diamond est pertinent :

  • Analyse de CVE complexes : raisonner sur une vulnérabilité comme une confusion de types dans un interpréteur multi-thread nécessite exactement le type de raisonnement multi-étapes que GPQA Diamond évalue. Un modèle avec un score GPQA Diamond élevé sera généralement meilleur pour produire une analyse technique nuancée d'une CVE complexe.
  • Revue de code sécurité : identifier une race condition ou un integer overflow dans du code C bas niveau requiert un raisonnement formel. GPQA Diamond comme proxy de raisonnement logique avancé est ici pertinent, en complément de benchmarks de codage.
  • Interprétation de logs d'incidents : corréler des événements disparates dans des logs SIEM pour reconstituer une chaîne d'attaque est une tâche de raisonnement causal multi-étapes — domaine d'excellence des modèles qui performent sur GPQA Diamond. Pour aller plus loin sur la structuration de votre posture de sécurité, consultez notre guide sur les agents IA autonomes en architecture de sécurité.
  • Rédaction de politiques de sécurité : générer une PSSI ou un plan de conformité structuré nécessite une compréhension globale du domaine — les modèles GPQA-forts tendent à produire des documents mieux structurés et plus cohérents. Notre modèle de PSSI gratuit peut vous servir de référence pour évaluer la qualité des sorties.

Cas d'usage où GPQA Diamond est moins pertinent :

  • Tâches de classification simple ou d'extraction d'entités nommées dans des logs — ici la vitesse et le coût d'inférence priment sur le niveau de raisonnement.
  • Chatbots de premier niveau pour le support SOC — la fluidité conversationnelle et la gestion du contexte long importent plus que le score GPQA.
  • Fine-tuning sur des données propriétaires — un modèle de base modeste avec un bon fine-tuning spécialisé peut surpasser un modèle GPQA-fort sur des tâches très ciblées.

Limites et critiques du benchmark

GPQA Diamond est un outil précieux, mais il présente des limites documentées qu'un professionnel avisé doit avoir en tête :

1. Couverture disciplinaire étroite : biologie, chimie et physique ne couvrent pas des domaines comme les mathématiques pures, l'informatique théorique ou le droit. Un LLM excellent en raisonnement juridique ou en logique formelle pourrait sous-performer sur GPQA Diamond sans que cela reflète un déficit général de raisonnement avancé.

2. Risque de saturation : avec les meilleurs modèles 2026 atteignant 77-78 % sur un benchmark dont le score expert est 69,7 %, GPQA Diamond approche de la saturation pour les top modèles. Des travaux comme GPQA-XT explorent des extensions pour maintenir la pertinence discriminante.

3. Contamination des données d'entraînement : les 198 questions de GPQA Diamond sont publiques depuis fin 2023. Des modèles entraînés sur des données web postérieures à cette date peuvent avoir mémorisé tout ou partie des questions, gonflant artificiellement leurs scores. C'est un problème systémique dans l'évaluation des LLMs que le domaine cherche à résoudre via des benchmarks dynamiques ou des variantes régulièrement renouvelées.

4. Biais vers l'anglais : GPQA Diamond est entièrement en anglais. Pour des équipes francophones travaillant sur des tâches en français, les scores GPQA Diamond surestiment légèrement les capacités en langue française des modèles (les performances multilingues varient).

5. Format QCM uniquement : les questions à choix multiples ne capturent pas les capacités de génération ouverte — un modèle qui "devinera" correctement 70 % des réponses peut néanmoins générer des explications incorrectes ou trompeuses. L'exactitude QCM ne garantit pas la qualité des raisonnements produits.

Comment intégrer GPQA Diamond dans votre processus de sélection LLM

Voici une approche structurée pour les équipes cybersécurité qui veulent utiliser GPQA Diamond comme l'un des critères de sélection de leur LLM :

  1. Définissez vos use-cases prioritaires avant de regarder les benchmarks. Si votre usage principal est l'analyse de code, HumanEval sera plus pertinent. Si c'est le raisonnement sur des incidents complexes, GPQA Diamond est un bon proxy.
  2. Trianglez avec au moins deux autres benchmarks : CyberSecEval pour les capacités cyber spécifiques, et HumanEval ou SWE-bench pour les capacités de codage. Notre tableau de bord benchmark IA 2026 synthétise ces dimensions pour les principaux modèles disponibles en France.
  3. Vérifiez les conditions de test : un score GPQA Diamond avec chain-of-thought et majority voting (k=8) n'est pas comparable à un score en single-pass. Assurez-vous de comparer des pommes avec des pommes.
  4. Testez sur vos propres données : créez un mini-benchmark interne avec 20-30 questions représentatives de vos vrais cas d'usage (analyse de CVE, revue de règles SIEM, génération de politiques). Ce test sur mesure sera toujours plus prédictif que n'importe quel benchmark académique.
  5. Intégrez le coût d'inférence : un modèle avec un score GPQA Diamond de 78 % peut coûter 10× plus cher à l'inférence qu'un modèle à 60 %. Pour des tâches à fort volume (analyse automatisée de logs), la différence de performance peut ne pas justifier le surcoût.

Pour la conformité Microsoft 365, où des LLMs sont de plus en plus utilisés pour la revue de politiques Conditional Access, nos 297 contrôles de sécurité M365 peuvent servir de base de test pour évaluer la pertinence de vos modèles sur des tâches réelles.

FAQ — GPQA Diamond Benchmark

Quelle est la différence entre GPQA, GPQA Diamond et GPQA Extended ?

GPQA est le corpus complet de 448 questions. GPQA Diamond est le sous-ensemble de 198 questions les plus difficiles, retenues parce qu'elles ont le taux d'erreur le plus élevé parmi des experts non-spécialistes. GPQA Extended est un ensemble élargi incluant des questions de qualité légèrement inférieure, utilisé principalement pour l'entraînement. Dans les publications de labos IA, "GPQA Diamond" désigne presque toujours ce sous-ensemble de 198 questions — c'est devenu le standard de facto depuis 2024.

Quel est le score humain expert sur GPQA Diamond et comment a-t-il été mesuré ?

Le score de référence humain est de 69,7 % sur GPQA Main, mesuré par les auteurs du benchmark sur un groupe de doctorants et post-doctorants dans les domaines couverts, sans accès à leurs outils habituels (pas de recherche web, pas de calculatrices spécialisées). Sur le sous-ensemble Diamond, les scores humains sont légèrement inférieurs par construction — c'est l'ensemble où les experts non-spécialistes échouent le plus souvent. Il est important de noter que des experts spécialistes du domaine exact de la question obtiendraient des scores significativement plus élevés ; le 69,7 % reflète des experts compétents mais pas nécessairement dans la sous-discipline précise de chaque question.

GPQA Diamond est-il adapté pour évaluer des LLMs spécialisés en cybersécurité ?

Partiellement. GPQA Diamond mesure un raisonnement académique avancé général — pas des compétences cybersécurité spécifiques. Un modèle qui performe bien sur GPQA Diamond sera généralement bon pour des tâches de raisonnement complexe en cybersécurité (analyse de CVE sophistiquées, corrélation d'incidents, raisonnement sur des politiques de sécurité). Mais un modèle peut avoir un score GPQA Diamond moyen et être excellent sur CyberSecEval grâce à un fine-tuning spécialisé. Pour une évaluation cyber complète, combinez GPQA Diamond (raisonnement général), CyberSecEval (compétences cyber), et des tests sur vos propres données métier.

Choisir le bon LLM pour votre équipe cyber

Notre tableau de bord benchmark IA 2026 compare les principaux modèles disponibles en France sur GPQA Diamond, CyberSecEval, HumanEval et les critères souverainité/RGPD. Consultez-le pour prendre une décision éclairée adaptée à votre contexte.

Voir le benchmark LLM 2026 →