GPQA Diamond
95.0 pass@1
Jeu complet de 198 questions. Partition réservée 97.1, IC à 95 % 94.2-99.3.
Chaque chiffre de cette page vient de nos propres exécutions, sur des instruments publics, avec un harnais gelé et un intervalle de confiance sur chaque case. Là où la mesure n'existe pas, la page imprime le manque au lieu de le combler.
Trois instruments, trois scores de tête.
95.0 pass@1
Jeu complet de 198 questions. Partition réservée 97.1, IC à 95 % 94.2-99.3.
99.0 pass@1
30 exécutions par problème. majority@30 = 100, IC 97.0-100.
89.6 pass@1
91.8 en pass@5, noté par l'évaluateur officiel.
Chaque axe va de 80 à 100. La bande grise est l'étendue des chiffres publiés par des tiers sur l'instrument. Le repère turquoise est notre propre mesure.
pass@1
pass@1, sans outils
pass@1, conditions comparables
Sous chaque instrument, la liste publique est strictement triée par score, de la plus haute borne basse vers le bas, et chaque ligne porte la classe de source d'où elle vient. Notre propre ligne se tient à part, comme une référence : nous n'avons remesuré le chiffre de personne, donc nous ne revendiquons aucune place parmi eux.
Chiffres arrêtés en août 2026.
| Modèle | Score | Source |
|---|---|---|
| Yasi One NON CLASSÉ | 95.0 jeu complet de 198 questions 97.1 partition réservée (IC à 95 % 94.2-99.3) | notre exécution |
| Gemini 3.1 Pro Preview | 94.1-95.45 | indép. |
| GPT-5.6 Sol | 94.1-95.2 | indép. |
| Kimi K3 | 93.5 | agrég. |
| GPT-5.5 | 93.5 | agrég. |
| Claude Opus 5 | 93.2-93.4 | agrég. |
| Grok 4.5 | 92.9-93.1 | agrég. |
| Gemini 3.6 Flash | 92.8-93.4 | agrég. |
| Claude Fable 5* | 92.6-93.2 | agrég. |
| GPT-5.6 Terra | 92.5-92.9 | agrég. |
Un évaluateur public publie aussi une variante corrigée des refus, où certains scores diffèrent sensiblement. Chaque chiffre Yasi compte les refus comme des échecs, depuis le premier jour.
97.1 sur la partition réservée se place au-dessus de toute valeur publiée, et 95.0 sur le jeu complet se place en haut de la plage indépendante, dont le bord supérieur vaut 95.45.
| Modèle | Score | Source |
|---|---|---|
| Yasi One NON CLASSÉ | 99.0 majority@30 = 100 | notre exécution |
| GLM-5.2 | 99.2 | éditeur |
| GPT-5.2 Pro / Codex | 98.7-100 | agrég. |
| Claude Opus / Fable / Mythos variants | 95-99.8 | fiches système |
| Gemini 3 / 3.1 variants | 95-100 | éditeur |
| Grok 4 / 4.5 variants | ~92-100 | agrég. |
Parité au plafond. L'instrument est saturé : ce qui limite les chiffres ici, c'est le test, pas les moteurs.
Instantanés indépendants du 12 août 2026, triés par score.
| Modèle | Score | Source |
|---|---|---|
| Gemini 3 Pro Preview | 91.7 | indép. |
| Gemini 3 Flash Preview | 90.8 | indép. |
| Claude Fable 5 | 89.8 | agrég. |
| Yasi One NON CLASSÉ | 89.6 notre exécution, évaluateur officiel, conditions déclarées | notre exécution |
| DeepSeek V3.2 Speciale | 89.6 | indép. |
| Kimi K2.6 | 89.6 | agrég. |
| Claude Opus 5 | 89.0 | agrég. |
| Grok 4.5 | 87.3 | agrég. |
| GPT-5.x Codex | 87-88 | agrég. |
Chiffres annoncés par les éditeurs, non vérifiés par un tiers.
| Modèle | Score | Source |
|---|---|---|
| DeepSeek V4 Pro | 93.5 | éditeur |
| Qwen 3.7 Max | 91.6 | éditeur |
Première ligne. Dans le bloc indépendant, deux valeurs se placent au-dessus de notre exécution, et un agrégateur situe Claude Fable 5 à 89.8, soit 0.2 de plus. Deux annonces d'editeurs non vérifiées se placent plus haut encore. Les conditions ne sont déclarées que sur notre ligne.
Sources nommées : Artificial Analysis, Vals.ai, BenchLM et pricepertoken, sur leurs instantanés d'août 2026, ainsi que les annonces d'éditeurs et les fiches système. Ces chiffres n'ont pas été remesurés par nous. Les noms de produits et de modèles appartiennent à leurs propriétaires ; aucune caution n'est sous-entendue.
Ce sont nos propres exécutions, et le rejeu par un tiers est invité. Lisez les lignes pour ce qu'elles sont : la ligne d'une plateforme de routage est un maximum sur treize moteurs, là où la ligne d'un laboratoire est un seul modèle.
Chaque point est un moteur sur le jeu gelé. Les points ne portent aucune étiquette, et la ligne de front, celle que le routage sert, est marquée en turquoise.
jeu complet
Ligne de front 95.0
sans outils
Ligne de front 99.0
pass@1
Ligne de front 89.6
Le détail par moteur est disponible pour les partenaires, sous accord.
Les moteurs déclinent parfois une question scientifique sensible au nom de la sûreté. Aucune réponse n'arrive, rien ne peut donc être noté juste, et le score honnête est un zéro. Quarante et un refus de ce type ont été relevés dans cette campagne, et chacun a été compté comme un échec face à notre propre résultat, au lieu d'être retiré discrètement du dénominateur. Le routage comble le manque de la seule façon défendable : il place sur la tâche le moteur le plus fort qui accepte de la prendre.
Un score au-dessus de 98 déclenche la règle de mémorisation : le résultat est présumé être du rappel tant qu'un contre-test n'a pas dit l'inverse. Le contre-test coupe le jeu gelé en deux, les problèmes publiés en 2025 et ceux publiés en 2026, après les fenêtres d'entraînement concernées. Les écarts entre les deux parties sont restés faibles, et un moteur signalé a mieux réussi sur les problèmes de 2026, ce qui est la signature d'une capacité et non d'un rappel. Les signalements restent au dossier dans les deux cas, parce qu'un test qui ne fait jamais que disculper n'est pas un test.
10.9 s
médiane (p50) jusqu'à une réponse complète
18.6 s
médiane (p50), en tenant 99.0 sur trente répétitions
Profondeur et vitesse se paient d'ordinaire l'une l'autre. Le travail du routage est de refuser ce marché, tâche par tâche.
Chaque demande entre par le routeur Yasi, qui décide où le travail appartient avant qu'un moteur ne le voie.
Sur les instruments à réponse unique, la tâche part vers le moteur unique le plus fort.
Le conseil sert le raisonnement ouvert et l'écriture, là où aucune clé unique ne décide du résultat.
Dit simplement : sur les instruments à réponse exacte, le routage vers un moteur unique tient la frontière, et le conseil multiplie le coût sans ajouter de justesse exacte.
Publié, pas caché. La règle de verdict était fixée avant les exécutions.
| Exécution | Unique | Conseil | Delta apparié | IC à 95 % | Coût | Verdict |
|---|---|---|---|---|---|---|
| GPQA test, 138 items | 97.1 | 92.8 | -4.4 | [-8.0, -1.5] | x5.6 | TIE |
| AIME dev, 30 x 30 | 100.0 | 97.3 | -2.7 | [-4.2, -1.4] | x4.0 | TIE |
| AIME test gelé, conseil : NOT MEASURED. Imprimé comme un manque, jamais estimé. | ||||||
Chaque instrument est public et maintenu par un tiers. Aucun jeu privé, et aucun benchmark maison noté par celui-là même dont il mesure le travail.
Un seul harnais pour tous les moteurs et toutes les exécutions, gelé sur un commit amont nommé et une graine fixe, pour qu'une exécution se reproduise au lieu de se raconter.
Les conditions sont déclarées ligne à ligne. Là où aucune comparaison n'existe à conditions équivalentes, la page imprime l'absence, et une mesure que nous n'avons pas faite s'imprime comme un manque, jamais estimée, interpolée ni déduite.
Chaque chiffre de tête porte un intervalle de confiance bootstrap à 95 %, et la règle qui transforme un écart mesuré en verdict a été fixée avant les exécutions, au lieu d'être choisie une fois les chiffres connus. C'est ainsi qu'un écart que nous savons mesurer se publie quand même comme une égalité.
Les scores au-dessus du seuil de mémorisation sont contestés sur une partition par année de publication, et les refus de sûreté sont comptés comme des échecs au lieu de quitter le dénominateur.
Harnais, commit amont, graine et coût sont consignés ensemble, si bien que chaque exécution derrière cette page peut être rejouée et chiffrée au centime.
Le jeu d'instruments s'élargit. La prochaine campagne prend le travail qu'une question unique et une réponse unique ne peuvent pas tenir, et elle suit les règles déjà tenues plus haut : harnais gelé, conditions déclarées, refus comptés comme des échecs, manques imprimés au lieu d'être comblés. Aucune date n'est annoncée sur cette page. Les chiffres paraîtront quand les exécutions seront faites, quel que soit leur sens.
Mesuré sur l'infrastructure Yasi One du 28 juillet au 10 août 2026, sur des instruments publics, avec un harnais interne gelé dérivé de lm-evaluation-harness 0.4.12 (commit amont 6d64254, graine 20260728). Les chiffres de comparaison du tableau de scores proviennent d'évaluateurs publics, d'annonces d'éditeurs et de fiches système, à la date d'août 2026, non ajustés et non remesurés par nous, sans aucune caution de tiers. Les noms de benchmarks appartiennent à leurs mainteneurs respectifs. Aucun item de benchmark n'est reproduit sur cette page.