Medição

Medido, não proclamado.

Cada número desta página vem das nossas próprias execuções, em instrumentos públicos, com um harness congelado e um intervalo de confiança em cada célula. Onde a medição não existe, a página imprime a lacuna em vez de preenchê-la.

Três instrumentos, três pontuações de destaque.

GPQA Diamond

95.0 pass@1

Conjunto completo de 198 questões. Partição reservada 97.1, IC de 95 % 94.2-99.3.

AIME

99.0 pass@1

30 execuções por problema. majority@30 = 100, IC 97.0-100.

LiveCodeBench

89.6 pass@1

91.8 em pass@5, pontuado pelo avaliador oficial.

A medição por trás desta página

  • mais de 39.000 medições pontuadas
  • 13 motores
  • IC bootstrap de 95 % em cada célula
  • 41 recusas de segurança contadas como falhas
  • contaminação contra testada
Faixa

Onde está a fronteira e onde cai o nosso número.

Cada eixo vai de 80 a 100. A faixa cinza é a amplitude dos números publicados por terceiros sobre aquele instrumento. A marca turquesa é a nossa própria medição.

GPQA Diamond

pass@1

  • Amplitude dos números publicados por terceiros 92.5-95.45
  • Yasi One 95.0
  • Partição reservada 97.1

AIME

pass@1, sem ferramentas

  • Números publicados por terceiros, sem ferramentas 92-100
  • Yasi One 99.0
  • IC de 95 % 97.0-100

LiveCodeBench

pass@1, condições equivalentes

  • Yasi One 89.6
  • Não há publicação comparável em condições equivalentes.
Placar

Nossa linha é uma referência, não uma colocação.

Sob cada instrumento a lista pública vai estritamente ordenada por número, do limite inferior mais alto para baixo, e cada linha carrega a classe da fonte de onde veio. Nossa própria linha fica à parte, como referência: não medimos de novo o número de ninguém, então não reivindicamos colocação alguma entre elas.

Números na data de agosto de 2026.

GPQA Diamond pass@1

Modelo Número Fonte
Yasi One SEM COLOCAÇÃO 95.0 conjunto completo de 198 questões 97.1 partição reservada (IC de 95 % 94.2-99.3) nossa execução
Gemini 3.1 Pro Preview 94.1-95.45 indep.
GPT-5.6 Sol 94.1-95.2 indep.
Kimi K3 93.5 agreg.
GPT-5.5 93.5 agreg.
Claude Opus 5 93.2-93.4 agreg.
Grok 4.5 92.9-93.1 agreg.
Gemini 3.6 Flash 92.8-93.4 agreg.
Claude Fable 5 92.6-93.2 agreg.
GPT-5.6 Terra 92.5-92.9 agreg.

Um avaliador público publica também uma variante corrigida por recusas, na qual alguns números diferem de forma sensível. Todo número da Yasi conta as recusas como falhas, desde o primeiro dia.

97.1 na partição reservada fica acima de todo valor publicado, e 95.0 no conjunto completo fica no topo da faixa independente, cuja borda superior é 95.45.

AIME pass@1, sem ferramentas, instrumento saturado

Modelo Número Fonte
Yasi One SEM COLOCAÇÃO 99.0 majority@30 = 100 nossa execução
GLM-5.2 99.2 fornecedor
GPT-5.2 Pro / Codex 98.7-100 agreg.
Claude Opus / Fable / Mythos variants 95-99.8 fichas de sistema
Gemini 3 / 3.1 variants 95-100 fornecedor
Grok 4 / 4.5 variants ~92-100 agreg.

Empate no teto. O instrumento está saturado, então o que limita os números aqui é o teste, não os motores.

LiveCodeBench pass@1

Instantâneos independentes de 12 de agosto de 2026, ordenados por número.

Modelo Número Fonte
Gemini 3 Pro Preview 91.7 indep.
Gemini 3 Flash Preview 90.8 indep.
Claude Fable 5 89.8 agreg.
Yasi One SEM COLOCAÇÃO 89.6 nossa execução, avaliador oficial, condições declaradas nossa execução
DeepSeek V3.2 Speciale 89.6 indep.
Kimi K2.6 89.6 agreg.
Claude Opus 5 89.0 agreg.
Grok 4.5 87.3 agreg.
GPT-5.x Codex 87-88 agreg.

Números anunciados pelo fornecedor, não verificados por terceiros.

Modelo Número Fonte
DeepSeek V4 Pro 93.5 fornecedor
Qwen 3.7 Max 91.6 fornecedor

Primeira faixa. No bloco independente dois valores ficam acima da nossa execução, e um agregador coloca Claude Fable 5 em 89.8, ou seja 0.2 acima. Dois anúncios de fornecedor sem verificação ficam mais alto ainda. As condições só são declaradas na nossa linha.

Fontes nomeadas: Artificial Analysis, Vals.ai, BenchLM e pricepertoken, sobre seus instantâneos de agosto de 2026, junto com anúncios de fornecedores e fichas de sistema. Estes números não foram medidos de novo por nós. Os nomes de produtos e modelos pertencem aos seus proprietários; nenhum endosso está implícito.

Como ler estas linhas.

São as nossas próprias execuções, e a repetição por terceiros é convidada. Leia as linhas pelo que elas são: a linha de uma plataforma de roteamento é um máximo sobre treze motores, enquanto a linha de um laboratório é um único modelo.

Profundidade da plataforma

Treze motores, uma única resposta roteada.

Cada ponto é um motor sobre o conjunto congelado. Os pontos não levam rótulo, e a linha de frente, o número que o roteamento entrega, está marcada em turquesa.

GPQA Diamond

conjunto completo

Linha de frente 95.0

AIME

sem ferramentas

Linha de frente 99.0

LiveCodeBench

pass@1

Linha de frente 89.6

O detalhe por motor fica disponível para parceiros, mediante acordo.

Registro de recusas

Quarenta e uma recusas, todas contadas como falhas.

Os motores às vezes recusam uma pergunta científica sensível por razões de segurança. Nenhuma resposta chega, então nada pode ser dado como correto, e a nota honesta é um zero. Nesta campanha foram registradas quarenta e uma recusas desse tipo, e cada uma foi contada como falha diante do nosso próprio resultado, em vez de sair em silêncio do denominador. O roteamento cobre a lacuna do único jeito defensável: coloca na tarefa o motor mais forte que aceita assumi-la.

Contaminação

Todo número acima de 98 foi contestado.

Um número acima de 98 dispara a regra de memorização: o resultado é presumido como lembrança até que um contra-teste diga o contrário. O contra-teste corta o conjunto congelado em dois, os problemas publicados em 2025 e os publicados em 2026, posteriores às janelas de treinamento em questão. As diferenças entre as duas partes ficaram pequenas, e um motor sinalizado foi melhor nos problemas de 2026, o que é a assinatura de uma capacidade e não de uma lembrança. As sinalizações ficam nos autos de todo modo, porque um teste que só inocenta não é um teste.

Velocidade de resposta

Profundidade sem a espera de sempre.

Ciências

10.9 s

mediana (p50) até uma resposta completa

Matemática

18.6 s

mediana (p50), sustentando 99.0 ao longo de trinta repetições

Profundidade e velocidade costumam ser pagas uma pela outra. O trabalho do roteamento é recusar essa troca, tarefa por tarefa.

Roteamento

A tarefa vai ao roteador. A resposta vai onde mede melhor.

  1. O roteador recebe a tarefa

    Cada pedido entra pelo roteador Yasi, que decide onde o trabalho pertence antes de qualquer motor vê-lo.

  2. Respostas exatas vão a um único motor

    Em instrumentos com uma única resposta correta, a tarefa vai ao motor individual mais forte.

  3. O conselho Majlis assume as perguntas abertas

    O conselho serve o raciocínio aberto e a escrita, onde nenhuma chave única decide o resultado.

Dito sem rodeios: em instrumentos de resposta exata, o roteamento para um único motor sustenta a fronteira, e o conselho multiplica o custo sem acrescentar exatidão.

O conselho, medido contra um único motor.

Publicado, não escondido. A regra do veredito ficou fixada antes das execuções.

Execução Único Conselho Delta pareado IC de 95 % Custo Veredito
GPQA teste, 138 itens 97.1 92.8 -4.4 [-8.0, -1.5] x5.6 TIE
AIME dev, 30 x 30 100.0 97.3 -2.7 [-4.2, -1.4] x4.0 TIE
AIME teste congelado, conselho: NOT MEASURED. Impresso como lacuna, nunca estimado.
  • TIE por regra fixada de antemão.
Método

Seis regras, fixadas antes da primeira execução.

  1. Instrumentos públicos

    Todo instrumento é público e mantido por terceiros. Nenhum conjunto privado, e nenhum benchmark da casa avaliado por quem ele mesmo mede.

  2. Harness congelado

    Um único harness para todos os motores e todas as execuções, congelado em um commit de origem nomeado e uma semente fixa, para que uma execução se reproduza em vez de se contar.

  3. Condições declaradas

    As condições são declaradas linha a linha. Onde não existe comparação em condições equivalentes a página imprime a ausência, e uma medição que não fizemos é impressa como lacuna, nunca estimada, interpolada ou deduzida.

  4. Estatística, não impressões

    Todo número de destaque carrega um intervalo de confiança bootstrap de 95 %, e a regra que transforma uma diferença medida em veredito foi fixada antes das execuções, em vez de escolhida com os números já na mesa. É assim que uma diferença que sabemos medir é publicada mesmo assim como empate.

  5. Integridade do conjunto de dados

    Números acima do limiar de memorização são contestados sobre uma partição por ano de publicação, e recusas de segurança contam como falhas em vez de deixar o denominador.

  6. Replicável

    Harness, commit de origem, semente e custo ficam registrados juntos, de modo que toda execução por trás desta página pode ser repetida e custeada ao centavo.

Próxima campanha

Fase 2 das medições.

O conjunto de instrumentos se amplia. A próxima campanha assume o trabalho que uma única pergunta e uma única resposta não sustentam, e segue as regras já sustentadas acima: harness congelado, condições declaradas, recusas contadas como falhas, ausências impressas em vez de preenchidas. Nenhuma data é anunciada nesta página. Os números serão publicados quando as execuções estiverem feitas, seja qual for o resultado.

  • Engenharia de software de horizonte longo
  • Terminal e uso do computador
  • Recuperação em contexto longo
  • Um instrumento de factualidade
Glossário

As palavras desta página, definidas.

pass@1
Uma tentativa por problema, avaliada certa ou errada. Sem repetição, sem melhor de várias.
majority@30
Trinta tentativas independentes por problema. Avalia-se a resposta que volta com mais frequência.
pass@5
Cinco tentativas por problema. O problema conta como resolvido se qualquer uma estiver correta.
IC de 95 %
Um intervalo de confiança bootstrap de 95%: a faixa em que o número cairia dezenove vezes em vinte se a mesma execução fosse repetida.
p50
A mediana. Metade das respostas chega antes disso, metade depois.
NOT MEASURED
Não executamos. A lacuna é impressa como lacuna, nunca estimada, interpolada ou deduzida.

Medido na infraestrutura Yasi One de 28 de julho a 10 de agosto de 2026, em instrumentos públicos, com um harness interno congelado derivado de lm-evaluation-harness 0.4.12 (commit de origem 6d64254, semente 20260728). Os números de comparação do placar vêm de avaliadores públicos, de anúncios de fornecedores e de fichas de sistema na data de agosto de 2026, sem ajuste e sem que os tenhamos medido de novo, sem qualquer endosso de terceiros. Os nomes dos benchmarks pertencem aos seus respectivos mantenedores. Nenhum item de benchmark é reproduzido nesta página.

O método por trás destes números é o mesmo que sustenta cada resposta.

A Yasi One chega em breve

Estamos preparando o lançamento com o maior cuidado. Volte muito em breve.