Misura

Misurato, non proclamato.

Ogni cifra di questa pagina viene dalle nostre esecuzioni, su strumenti pubblici, con un harness congelato e un intervallo di confidenza su ogni cella. Dove la misura non esiste, la pagina stampa la lacuna invece di colmarla.

Tre strumenti, tre punteggi di testa.

GPQA Diamond

95.0 pass@1

Insieme completo di 198 domande. Partizione riservata 97.1, IC al 95 % 94.2-99.3.

AIME

99.0 pass@1

30 esecuzioni per problema. majority@30 = 100, IC 97.0-100.

LiveCodeBench

89.6 pass@1

91.8 a pass@5, valutato dal valutatore ufficiale.

La misura dietro questa pagina

  • oltre 39.000 misurazioni valutate
  • 13 motori
  • IC bootstrap al 95 % su ogni cella
  • 41 rifiuti di sicurezza contati come fallimenti
  • contaminazione contro testata
Intervallo

Dove sta la frontiera e dove cade la nostra cifra.

Ogni asse va da 80 a 100. La banda grigia è l'ampiezza delle cifre pubblicate da terzi su quello strumento. Il segno turchese è la nostra misura.

GPQA Diamond

pass@1

  • Ampiezza delle cifre pubblicate da terzi 92.5-95.45
  • Yasi One 95.0
  • Partizione riservata 97.1

AIME

pass@1, senza strumenti

  • Cifre pubblicate da terzi, senza strumenti 92-100
  • Yasi One 99.0
  • IC al 95 % 97.0-100

LiveCodeBench

pass@1, condizioni equivalenti

  • Yasi One 89.6
  • Nessuna pubblicazione comparabile a condizioni equivalenti.
Tabellone

La nostra riga è un riferimento, non una posizione.

Sotto ogni strumento la lista pubblica è ordinata rigorosamente per cifra, dal limite inferiore più alto in giù, e ogni riga porta la classe della fonte da cui viene. La nostra riga sta a parte, come riferimento: non abbiamo rimisurato la cifra di nessuno, quindi non rivendichiamo alcuna posizione fra loro.

Cifre alla data di agosto 2026.

GPQA Diamond pass@1

Modello Cifra Fonte
Yasi One NON IN CLASSIFICA 95.0 insieme completo di 198 domande 97.1 partizione riservata (IC al 95 % 94.2-99.3) nostra esecuzione
Gemini 3.1 Pro Preview 94.1-95.45 indip.
GPT-5.6 Sol 94.1-95.2 indip.
Kimi K3 93.5 aggreg.
GPT-5.5 93.5 aggreg.
Claude Opus 5 93.2-93.4 aggreg.
Grok 4.5 92.9-93.1 aggreg.
Gemini 3.6 Flash 92.8-93.4 aggreg.
Claude Fable 5 92.6-93.2 aggreg.
GPT-5.6 Terra 92.5-92.9 aggreg.

Un valutatore pubblico pubblica anche una variante corretta per i rifiuti, in cui alcune cifre differiscono in modo sensibile. Ogni cifra Yasi conta i rifiuti come fallimenti, fin dal primo giorno.

97.1 sulla partizione riservata sta sopra ogni valore pubblicato, e 95.0 sull'insieme completo sta in cima alla fascia indipendente, il cui bordo superiore vale 95.45.

AIME pass@1, senza strumenti, strumento saturo

Modello Cifra Fonte
Yasi One NON IN CLASSIFICA 99.0 majority@30 = 100 nostra esecuzione
GLM-5.2 99.2 fornitore
GPT-5.2 Pro / Codex 98.7-100 aggreg.
Claude Opus / Fable / Mythos variants 95-99.8 schede di sistema
Gemini 3 / 3.1 variants 95-100 fornitore
Grok 4 / 4.5 variants ~92-100 aggreg.

Parità al soffitto. Lo strumento è saturo, quindi ciò che limita le cifre qui è la prova, non i motori.

LiveCodeBench pass@1

Istantanee indipendenti del 12 agosto 2026, ordinate per cifra.

Modello Cifra Fonte
Gemini 3 Pro Preview 91.7 indip.
Gemini 3 Flash Preview 90.8 indip.
Claude Fable 5 89.8 aggreg.
Yasi One NON IN CLASSIFICA 89.6 nostra esecuzione, valutatore ufficiale, condizioni dichiarate nostra esecuzione
DeepSeek V3.2 Speciale 89.6 indip.
Kimi K2.6 89.6 aggreg.
Claude Opus 5 89.0 aggreg.
Grok 4.5 87.3 aggreg.
GPT-5.x Codex 87-88 aggreg.

Cifre dichiarate dal fornitore, non verificate da terzi.

Modello Cifra Fonte
DeepSeek V4 Pro 93.5 fornitore
Qwen 3.7 Max 91.6 fornitore

Prima fascia. Nel blocco indipendente due valori stanno sopra la nostra esecuzione, e un aggregatore colloca Claude Fable 5 a 89.8, cioè 0.2 sopra. Due dichiarazioni di fornitore non verificate stanno più in alto ancora. Le condizioni sono dichiarate solo sulla nostra riga.

Fonti nominate: Artificial Analysis, Vals.ai, BenchLM e pricepertoken, sulle loro istantanee di agosto 2026, insieme alle dichiarazioni dei fornitori e alle schede di sistema. Queste cifre non sono state rimisurate da noi. I nomi di prodotti e modelli appartengono ai rispettivi proprietari; nessun avallo è sottinteso.

Come leggere queste righe.

Sono le nostre esecuzioni, e il rigioco da parte di terzi è invitato. Leggete le righe per quello che sono: la riga di una piattaforma di instradamento è un massimo su tredici motori, mentre la riga di un laboratorio è un solo modello.

Profondità della piattaforma

Tredici motori, una sola risposta instradata.

Ogni punto è un motore sull'insieme congelato. I punti non portano etichette, e la linea di fronte, la cifra che l'instradamento serve, è segnata in turchese.

GPQA Diamond

insieme completo

Linea di fronte 95.0

AIME

senza strumenti

Linea di fronte 99.0

LiveCodeBench

pass@1

Linea di fronte 89.6

Il dettaglio per motore è disponibile ai partner, previo accordo.

Registro dei rifiuti

Quarantuno rifiuti, contati tutti come fallimenti.

I motori a volte declinano una domanda scientifica sensibile per ragioni di sicurezza. Nessuna risposta arriva, quindi nulla può essere dato per corretto, e il punteggio onesto è uno zero. In questa campagna sono stati registrati quarantuno rifiuti di questo tipo, e ognuno è stato contato come fallimento contro il nostro stesso risultato, invece di uscire in silenzio dal denominatore. L'instradamento colma il vuoto nell'unico modo difendibile: mette sul compito il motore più forte che accetta di prenderlo.

Contaminazione

Ogni punteggio sopra 98 è stato contestato.

Un punteggio sopra 98 fa scattare la regola di memorizzazione: il risultato si presume ricordo finché una controprova non dice il contrario. La controprova taglia in due l'insieme congelato, i problemi pubblicati nel 2025 e quelli pubblicati nel 2026, successivi alle finestre di addestramento in questione. Gli scarti fra le due parti sono rimasti piccoli, e un motore segnalato ha fatto meglio sui problemi del 2026, che è la firma di una capacità e non di un ricordo. Le segnalazioni restano agli atti in entrambi i casi, perché una prova che si limita a scagionare non è una prova.

Velocità di risposta

La profondità senza l'attesa consueta.

Scienze

10.9 s

mediana (p50) fino a una risposta completa

Matematica

18.6 s

mediana (p50), tenendo 99.0 su trenta ripetizioni

Profondità e velocità di solito si pagano a vicenda. Il compito dell'instradamento è rifiutare quello scambio, compito per compito.

Instradamento

Il compito va al router. La risposta va dove misura meglio.

  1. Il router prende il compito

    Ogni richiesta entra dal router Yasi, che decide dove appartiene il lavoro prima che un motore lo veda.

  2. Le risposte esatte vanno a un solo motore

    Sugli strumenti con una sola risposta corretta, il compito va al motore singolo più forte.

  3. Il consiglio Majlis prende le domande aperte

    Il consiglio serve il ragionamento aperto e la scrittura, dove nessuna chiave unica decide l'esito.

Detto senza giri di parole: sugli strumenti a risposta esatta l'instradamento a un motore singolo tiene la frontiera, e il consiglio moltiplica il costo senza aggiungere accuratezza esatta.

Il consiglio, misurato contro un motore singolo.

Pubblicato, non nascosto. La regola del verdetto era fissata prima delle esecuzioni.

Esecuzione Singolo Consiglio Delta appaiato IC al 95 % Costo Verdetto
GPQA test, 138 item 97.1 92.8 -4.4 [-8.0, -1.5] x5.6 TIE
AIME dev, 30 x 30 100.0 97.3 -2.7 [-4.2, -1.4] x4.0 TIE
AIME test congelato, consiglio: NOT MEASURED. Stampato come lacuna, mai stimato.
  • TIE per regola fissata in anticipo.
Metodo

Sei regole, fissate prima della prima esecuzione.

  1. Strumenti pubblici

    Ogni strumento è pubblico e mantenuto da terzi. Nessun insieme privato, e nessun benchmark interno valutato da chi ne è misurato.

  2. Harness congelato

    Un solo harness per tutti i motori e tutte le esecuzioni, congelato su un commit a monte con nome e un seme fisso, perché un'esecuzione si riproduca invece di raccontarsi.

  3. Condizioni dichiarate

    Le condizioni sono dichiarate riga per riga. Dove non esiste confronto a condizioni equivalenti la pagina stampa l'assenza, e una misura che non abbiamo eseguito si stampa come un vuoto, mai stimata, interpolata o dedotta.

  4. Statistica, non impressioni

    Ogni cifra di testa porta un intervallo di confidenza bootstrap al 95 %, e la regola che trasforma uno scarto misurato in un verdetto è stata fissata prima delle esecuzioni, invece di essere scelta a numeri noti. È così che uno scarto che sappiamo misurare viene pubblicato lo stesso come parità.

  5. Integrità del set di dati

    I punteggi sopra la soglia di memorizzazione sono contestati su una partizione per anno di pubblicazione, e i rifiuti di sicurezza contano come fallimenti invece di lasciare il denominatore.

  6. Ripetibile

    Harness, commit a monte, seme e costo sono registrati insieme, così ogni esecuzione dietro questa pagina può essere ripetuta e quantificata al centesimo.

Prossima campagna

Fase 2 delle misure.

Il set di strumenti si allarga. La prossima campagna affronta il lavoro che una singola domanda e una singola risposta non reggono, e segue le regole già tenute qui sopra: harness congelato, condizioni dichiarate, rifiuti contati come fallimenti, assenze stampate invece che colmate. Nessuna data è annunciata in questa pagina. Le cifre saranno pubblicate quando le esecuzioni saranno fatte, comunque vadano.

  • Ingegneria del software a lungo orizzonte
  • Terminale e uso del computer
  • Recupero su contesto lungo
  • Uno strumento di fattualità
Glossario

Le parole di questa pagina, definite.

pass@1
Un tentativo per problema, valutato giusto o sbagliato. Nessuna ripetizione, nessun migliore fra più prove.
majority@30
Trenta tentativi indipendenti per problema. Viene valutata la risposta che torna più spesso.
pass@5
Cinque tentativi per problema. Il problema conta come risolto se uno qualsiasi è corretto.
IC al 95 %
Un intervallo di confidenza bootstrap al 95%: la fascia in cui la cifra cadrebbe diciannove volte su venti se la stessa esecuzione fosse ripetuta.
p50
La mediana. Metà delle risposte arriva prima di così, metà dopo.
NOT MEASURED
Non lo abbiamo eseguito. Il vuoto si stampa come vuoto, mai stimato, interpolato o dedotto.

Misurato sull'infrastruttura Yasi One dal 28 luglio al 10 agosto 2026, su strumenti pubblici, con un harness interno congelato derivato da lm-evaluation-harness 0.4.12 (commit a monte 6d64254, seme 20260728). Le cifre di confronto del tabellone provengono da valutatori pubblici, da dichiarazioni dei fornitori e da schede di sistema alla data di agosto 2026, non rettificate e non rimisurate da noi, senza alcun avallo di terzi. I nomi dei benchmark appartengono ai rispettivi manutentori. Nessun item di benchmark è riprodotto in questa pagina.

Il metodo dietro queste cifre è lo stesso che regge ogni risposta.

Yasi One arriva presto

Stiamo preparando il lancio con la massima cura. Tornate a trovarci molto presto.