GPQA Diamond
95.0 pass@1
Insieme completo di 198 domande. Partizione riservata 97.1, IC al 95 % 94.2-99.3.
Ogni cifra di questa pagina viene dalle nostre esecuzioni, su strumenti pubblici, con un harness congelato e un intervallo di confidenza su ogni cella. Dove la misura non esiste, la pagina stampa la lacuna invece di colmarla.
Tre strumenti, tre punteggi di testa.
95.0 pass@1
Insieme completo di 198 domande. Partizione riservata 97.1, IC al 95 % 94.2-99.3.
99.0 pass@1
30 esecuzioni per problema. majority@30 = 100, IC 97.0-100.
89.6 pass@1
91.8 a pass@5, valutato dal valutatore ufficiale.
Ogni asse va da 80 a 100. La banda grigia è l'ampiezza delle cifre pubblicate da terzi su quello strumento. Il segno turchese è la nostra misura.
pass@1
pass@1, senza strumenti
pass@1, condizioni equivalenti
Sotto ogni strumento la lista pubblica è ordinata rigorosamente per cifra, dal limite inferiore più alto in giù, e ogni riga porta la classe della fonte da cui viene. La nostra riga sta a parte, come riferimento: non abbiamo rimisurato la cifra di nessuno, quindi non rivendichiamo alcuna posizione fra loro.
Cifre alla data di agosto 2026.
| Modello | Cifra | Fonte |
|---|---|---|
| Yasi One NON IN CLASSIFICA | 95.0 insieme completo di 198 domande 97.1 partizione riservata (IC al 95 % 94.2-99.3) | nostra esecuzione |
| Gemini 3.1 Pro Preview | 94.1-95.45 | indip. |
| GPT-5.6 Sol | 94.1-95.2 | indip. |
| Kimi K3 | 93.5 | aggreg. |
| GPT-5.5 | 93.5 | aggreg. |
| Claude Opus 5 | 93.2-93.4 | aggreg. |
| Grok 4.5 | 92.9-93.1 | aggreg. |
| Gemini 3.6 Flash | 92.8-93.4 | aggreg. |
| Claude Fable 5* | 92.6-93.2 | aggreg. |
| GPT-5.6 Terra | 92.5-92.9 | aggreg. |
Un valutatore pubblico pubblica anche una variante corretta per i rifiuti, in cui alcune cifre differiscono in modo sensibile. Ogni cifra Yasi conta i rifiuti come fallimenti, fin dal primo giorno.
97.1 sulla partizione riservata sta sopra ogni valore pubblicato, e 95.0 sull'insieme completo sta in cima alla fascia indipendente, il cui bordo superiore vale 95.45.
| Modello | Cifra | Fonte |
|---|---|---|
| Yasi One NON IN CLASSIFICA | 99.0 majority@30 = 100 | nostra esecuzione |
| GLM-5.2 | 99.2 | fornitore |
| GPT-5.2 Pro / Codex | 98.7-100 | aggreg. |
| Claude Opus / Fable / Mythos variants | 95-99.8 | schede di sistema |
| Gemini 3 / 3.1 variants | 95-100 | fornitore |
| Grok 4 / 4.5 variants | ~92-100 | aggreg. |
Parità al soffitto. Lo strumento è saturo, quindi ciò che limita le cifre qui è la prova, non i motori.
Istantanee indipendenti del 12 agosto 2026, ordinate per cifra.
| Modello | Cifra | Fonte |
|---|---|---|
| Gemini 3 Pro Preview | 91.7 | indip. |
| Gemini 3 Flash Preview | 90.8 | indip. |
| Claude Fable 5 | 89.8 | aggreg. |
| Yasi One NON IN CLASSIFICA | 89.6 nostra esecuzione, valutatore ufficiale, condizioni dichiarate | nostra esecuzione |
| DeepSeek V3.2 Speciale | 89.6 | indip. |
| Kimi K2.6 | 89.6 | aggreg. |
| Claude Opus 5 | 89.0 | aggreg. |
| Grok 4.5 | 87.3 | aggreg. |
| GPT-5.x Codex | 87-88 | aggreg. |
Cifre dichiarate dal fornitore, non verificate da terzi.
| Modello | Cifra | Fonte |
|---|---|---|
| DeepSeek V4 Pro | 93.5 | fornitore |
| Qwen 3.7 Max | 91.6 | fornitore |
Prima fascia. Nel blocco indipendente due valori stanno sopra la nostra esecuzione, e un aggregatore colloca Claude Fable 5 a 89.8, cioè 0.2 sopra. Due dichiarazioni di fornitore non verificate stanno più in alto ancora. Le condizioni sono dichiarate solo sulla nostra riga.
Fonti nominate: Artificial Analysis, Vals.ai, BenchLM e pricepertoken, sulle loro istantanee di agosto 2026, insieme alle dichiarazioni dei fornitori e alle schede di sistema. Queste cifre non sono state rimisurate da noi. I nomi di prodotti e modelli appartengono ai rispettivi proprietari; nessun avallo è sottinteso.
Sono le nostre esecuzioni, e il rigioco da parte di terzi è invitato. Leggete le righe per quello che sono: la riga di una piattaforma di instradamento è un massimo su tredici motori, mentre la riga di un laboratorio è un solo modello.
Ogni punto è un motore sull'insieme congelato. I punti non portano etichette, e la linea di fronte, la cifra che l'instradamento serve, è segnata in turchese.
insieme completo
Linea di fronte 95.0
senza strumenti
Linea di fronte 99.0
pass@1
Linea di fronte 89.6
Il dettaglio per motore è disponibile ai partner, previo accordo.
I motori a volte declinano una domanda scientifica sensibile per ragioni di sicurezza. Nessuna risposta arriva, quindi nulla può essere dato per corretto, e il punteggio onesto è uno zero. In questa campagna sono stati registrati quarantuno rifiuti di questo tipo, e ognuno è stato contato come fallimento contro il nostro stesso risultato, invece di uscire in silenzio dal denominatore. L'instradamento colma il vuoto nell'unico modo difendibile: mette sul compito il motore più forte che accetta di prenderlo.
Un punteggio sopra 98 fa scattare la regola di memorizzazione: il risultato si presume ricordo finché una controprova non dice il contrario. La controprova taglia in due l'insieme congelato, i problemi pubblicati nel 2025 e quelli pubblicati nel 2026, successivi alle finestre di addestramento in questione. Gli scarti fra le due parti sono rimasti piccoli, e un motore segnalato ha fatto meglio sui problemi del 2026, che è la firma di una capacità e non di un ricordo. Le segnalazioni restano agli atti in entrambi i casi, perché una prova che si limita a scagionare non è una prova.
10.9 s
mediana (p50) fino a una risposta completa
18.6 s
mediana (p50), tenendo 99.0 su trenta ripetizioni
Profondità e velocità di solito si pagano a vicenda. Il compito dell'instradamento è rifiutare quello scambio, compito per compito.
Ogni richiesta entra dal router Yasi, che decide dove appartiene il lavoro prima che un motore lo veda.
Sugli strumenti con una sola risposta corretta, il compito va al motore singolo più forte.
Il consiglio serve il ragionamento aperto e la scrittura, dove nessuna chiave unica decide l'esito.
Detto senza giri di parole: sugli strumenti a risposta esatta l'instradamento a un motore singolo tiene la frontiera, e il consiglio moltiplica il costo senza aggiungere accuratezza esatta.
Pubblicato, non nascosto. La regola del verdetto era fissata prima delle esecuzioni.
| Esecuzione | Singolo | Consiglio | Delta appaiato | IC al 95 % | Costo | Verdetto |
|---|---|---|---|---|---|---|
| GPQA test, 138 item | 97.1 | 92.8 | -4.4 | [-8.0, -1.5] | x5.6 | TIE |
| AIME dev, 30 x 30 | 100.0 | 97.3 | -2.7 | [-4.2, -1.4] | x4.0 | TIE |
| AIME test congelato, consiglio: NOT MEASURED. Stampato come lacuna, mai stimato. | ||||||
Ogni strumento è pubblico e mantenuto da terzi. Nessun insieme privato, e nessun benchmark interno valutato da chi ne è misurato.
Un solo harness per tutti i motori e tutte le esecuzioni, congelato su un commit a monte con nome e un seme fisso, perché un'esecuzione si riproduca invece di raccontarsi.
Le condizioni sono dichiarate riga per riga. Dove non esiste confronto a condizioni equivalenti la pagina stampa l'assenza, e una misura che non abbiamo eseguito si stampa come un vuoto, mai stimata, interpolata o dedotta.
Ogni cifra di testa porta un intervallo di confidenza bootstrap al 95 %, e la regola che trasforma uno scarto misurato in un verdetto è stata fissata prima delle esecuzioni, invece di essere scelta a numeri noti. È così che uno scarto che sappiamo misurare viene pubblicato lo stesso come parità.
I punteggi sopra la soglia di memorizzazione sono contestati su una partizione per anno di pubblicazione, e i rifiuti di sicurezza contano come fallimenti invece di lasciare il denominatore.
Harness, commit a monte, seme e costo sono registrati insieme, così ogni esecuzione dietro questa pagina può essere ripetuta e quantificata al centesimo.
Il set di strumenti si allarga. La prossima campagna affronta il lavoro che una singola domanda e una singola risposta non reggono, e segue le regole già tenute qui sopra: harness congelato, condizioni dichiarate, rifiuti contati come fallimenti, assenze stampate invece che colmate. Nessuna data è annunciata in questa pagina. Le cifre saranno pubblicate quando le esecuzioni saranno fatte, comunque vadano.
Misurato sull'infrastruttura Yasi One dal 28 luglio al 10 agosto 2026, su strumenti pubblici, con un harness interno congelato derivato da lm-evaluation-harness 0.4.12 (commit a monte 6d64254, seme 20260728). Le cifre di confronto del tabellone provengono da valutatori pubblici, da dichiarazioni dei fornitori e da schede di sistema alla data di agosto 2026, non rettificate e non rimisurate da noi, senza alcun avallo di terzi. I nomi dei benchmark appartengono ai rispettivi manutentori. Nessun item di benchmark è riprodotto in questa pagina.