GPQA Diamond
95.0 pass@1
Conjunto completo de 198 questões. Partição reservada 97.1, IC de 95 % 94.2-99.3.
Cada número desta página vem das nossas próprias execuções, em instrumentos públicos, com um harness congelado e um intervalo de confiança em cada célula. Onde a medição não existe, a página imprime a lacuna em vez de preenchê-la.
Três instrumentos, três pontuações de destaque.
95.0 pass@1
Conjunto completo de 198 questões. Partição reservada 97.1, IC de 95 % 94.2-99.3.
99.0 pass@1
30 execuções por problema. majority@30 = 100, IC 97.0-100.
89.6 pass@1
91.8 em pass@5, pontuado pelo avaliador oficial.
Cada eixo vai de 80 a 100. A faixa cinza é a amplitude dos números publicados por terceiros sobre aquele instrumento. A marca turquesa é a nossa própria medição.
pass@1
pass@1, sem ferramentas
pass@1, condições equivalentes
Sob cada instrumento a lista pública vai estritamente ordenada por número, do limite inferior mais alto para baixo, e cada linha carrega a classe da fonte de onde veio. Nossa própria linha fica à parte, como referência: não medimos de novo o número de ninguém, então não reivindicamos colocação alguma entre elas.
Números na data de agosto de 2026.
| Modelo | Número | Fonte |
|---|---|---|
| Yasi One SEM COLOCAÇÃO | 95.0 conjunto completo de 198 questões 97.1 partição reservada (IC de 95 % 94.2-99.3) | nossa execução |
| Gemini 3.1 Pro Preview | 94.1-95.45 | indep. |
| GPT-5.6 Sol | 94.1-95.2 | indep. |
| Kimi K3 | 93.5 | agreg. |
| GPT-5.5 | 93.5 | agreg. |
| Claude Opus 5 | 93.2-93.4 | agreg. |
| Grok 4.5 | 92.9-93.1 | agreg. |
| Gemini 3.6 Flash | 92.8-93.4 | agreg. |
| Claude Fable 5* | 92.6-93.2 | agreg. |
| GPT-5.6 Terra | 92.5-92.9 | agreg. |
Um avaliador público publica também uma variante corrigida por recusas, na qual alguns números diferem de forma sensível. Todo número da Yasi conta as recusas como falhas, desde o primeiro dia.
97.1 na partição reservada fica acima de todo valor publicado, e 95.0 no conjunto completo fica no topo da faixa independente, cuja borda superior é 95.45.
| Modelo | Número | Fonte |
|---|---|---|
| Yasi One SEM COLOCAÇÃO | 99.0 majority@30 = 100 | nossa execução |
| GLM-5.2 | 99.2 | fornecedor |
| GPT-5.2 Pro / Codex | 98.7-100 | agreg. |
| Claude Opus / Fable / Mythos variants | 95-99.8 | fichas de sistema |
| Gemini 3 / 3.1 variants | 95-100 | fornecedor |
| Grok 4 / 4.5 variants | ~92-100 | agreg. |
Empate no teto. O instrumento está saturado, então o que limita os números aqui é o teste, não os motores.
Instantâneos independentes de 12 de agosto de 2026, ordenados por número.
| Modelo | Número | Fonte |
|---|---|---|
| Gemini 3 Pro Preview | 91.7 | indep. |
| Gemini 3 Flash Preview | 90.8 | indep. |
| Claude Fable 5 | 89.8 | agreg. |
| Yasi One SEM COLOCAÇÃO | 89.6 nossa execução, avaliador oficial, condições declaradas | nossa execução |
| DeepSeek V3.2 Speciale | 89.6 | indep. |
| Kimi K2.6 | 89.6 | agreg. |
| Claude Opus 5 | 89.0 | agreg. |
| Grok 4.5 | 87.3 | agreg. |
| GPT-5.x Codex | 87-88 | agreg. |
Números anunciados pelo fornecedor, não verificados por terceiros.
| Modelo | Número | Fonte |
|---|---|---|
| DeepSeek V4 Pro | 93.5 | fornecedor |
| Qwen 3.7 Max | 91.6 | fornecedor |
Primeira faixa. No bloco independente dois valores ficam acima da nossa execução, e um agregador coloca Claude Fable 5 em 89.8, ou seja 0.2 acima. Dois anúncios de fornecedor sem verificação ficam mais alto ainda. As condições só são declaradas na nossa linha.
Fontes nomeadas: Artificial Analysis, Vals.ai, BenchLM e pricepertoken, sobre seus instantâneos de agosto de 2026, junto com anúncios de fornecedores e fichas de sistema. Estes números não foram medidos de novo por nós. Os nomes de produtos e modelos pertencem aos seus proprietários; nenhum endosso está implícito.
São as nossas próprias execuções, e a repetição por terceiros é convidada. Leia as linhas pelo que elas são: a linha de uma plataforma de roteamento é um máximo sobre treze motores, enquanto a linha de um laboratório é um único modelo.
Cada ponto é um motor sobre o conjunto congelado. Os pontos não levam rótulo, e a linha de frente, o número que o roteamento entrega, está marcada em turquesa.
conjunto completo
Linha de frente 95.0
sem ferramentas
Linha de frente 99.0
pass@1
Linha de frente 89.6
O detalhe por motor fica disponível para parceiros, mediante acordo.
Os motores às vezes recusam uma pergunta científica sensível por razões de segurança. Nenhuma resposta chega, então nada pode ser dado como correto, e a nota honesta é um zero. Nesta campanha foram registradas quarenta e uma recusas desse tipo, e cada uma foi contada como falha diante do nosso próprio resultado, em vez de sair em silêncio do denominador. O roteamento cobre a lacuna do único jeito defensável: coloca na tarefa o motor mais forte que aceita assumi-la.
Um número acima de 98 dispara a regra de memorização: o resultado é presumido como lembrança até que um contra-teste diga o contrário. O contra-teste corta o conjunto congelado em dois, os problemas publicados em 2025 e os publicados em 2026, posteriores às janelas de treinamento em questão. As diferenças entre as duas partes ficaram pequenas, e um motor sinalizado foi melhor nos problemas de 2026, o que é a assinatura de uma capacidade e não de uma lembrança. As sinalizações ficam nos autos de todo modo, porque um teste que só inocenta não é um teste.
10.9 s
mediana (p50) até uma resposta completa
18.6 s
mediana (p50), sustentando 99.0 ao longo de trinta repetições
Profundidade e velocidade costumam ser pagas uma pela outra. O trabalho do roteamento é recusar essa troca, tarefa por tarefa.
Cada pedido entra pelo roteador Yasi, que decide onde o trabalho pertence antes de qualquer motor vê-lo.
Em instrumentos com uma única resposta correta, a tarefa vai ao motor individual mais forte.
O conselho serve o raciocínio aberto e a escrita, onde nenhuma chave única decide o resultado.
Dito sem rodeios: em instrumentos de resposta exata, o roteamento para um único motor sustenta a fronteira, e o conselho multiplica o custo sem acrescentar exatidão.
Publicado, não escondido. A regra do veredito ficou fixada antes das execuções.
| Execução | Único | Conselho | Delta pareado | IC de 95 % | Custo | Veredito |
|---|---|---|---|---|---|---|
| GPQA teste, 138 itens | 97.1 | 92.8 | -4.4 | [-8.0, -1.5] | x5.6 | TIE |
| AIME dev, 30 x 30 | 100.0 | 97.3 | -2.7 | [-4.2, -1.4] | x4.0 | TIE |
| AIME teste congelado, conselho: NOT MEASURED. Impresso como lacuna, nunca estimado. | ||||||
Todo instrumento é público e mantido por terceiros. Nenhum conjunto privado, e nenhum benchmark da casa avaliado por quem ele mesmo mede.
Um único harness para todos os motores e todas as execuções, congelado em um commit de origem nomeado e uma semente fixa, para que uma execução se reproduza em vez de se contar.
As condições são declaradas linha a linha. Onde não existe comparação em condições equivalentes a página imprime a ausência, e uma medição que não fizemos é impressa como lacuna, nunca estimada, interpolada ou deduzida.
Todo número de destaque carrega um intervalo de confiança bootstrap de 95 %, e a regra que transforma uma diferença medida em veredito foi fixada antes das execuções, em vez de escolhida com os números já na mesa. É assim que uma diferença que sabemos medir é publicada mesmo assim como empate.
Números acima do limiar de memorização são contestados sobre uma partição por ano de publicação, e recusas de segurança contam como falhas em vez de deixar o denominador.
Harness, commit de origem, semente e custo ficam registrados juntos, de modo que toda execução por trás desta página pode ser repetida e custeada ao centavo.
O conjunto de instrumentos se amplia. A próxima campanha assume o trabalho que uma única pergunta e uma única resposta não sustentam, e segue as regras já sustentadas acima: harness congelado, condições declaradas, recusas contadas como falhas, ausências impressas em vez de preenchidas. Nenhuma data é anunciada nesta página. Os números serão publicados quando as execuções estiverem feitas, seja qual for o resultado.
Medido na infraestrutura Yasi One de 28 de julho a 10 de agosto de 2026, em instrumentos públicos, com um harness interno congelado derivado de lm-evaluation-harness 0.4.12 (commit de origem 6d64254, semente 20260728). Os números de comparação do placar vêm de avaliadores públicos, de anúncios de fornecedores e de fichas de sistema na data de agosto de 2026, sem ajuste e sem que os tenhamos medido de novo, sem qualquer endosso de terceiros. Os nomes dos benchmarks pertencem aos seus respectivos mantenedores. Nenhum item de benchmark é reproduzido nesta página.