Medición

Medido, no proclamado.

Cada cifra de esta página procede de nuestras propias ejecuciones, en instrumentos públicos, con un arnés congelado y un intervalo de confianza en cada celda. Donde no existe medición, la página imprime el hueco en lugar de rellenarlo.

Tres instrumentos, tres puntuaciones de cabecera.

GPQA Diamond

95.0 pass@1

Conjunto completo de 198 preguntas. Partición reservada 97.1, IC del 95 % 94.2-99.3.

AIME

99.0 pass@1

30 ejecuciones por problema. majority@30 = 100, IC 97.0-100.

LiveCodeBench

89.6 pass@1

91.8 en pass@5, puntuado por el evaluador oficial.

La medición detrás de esta página

  • más de 39.000 mediciones puntuadas
  • 13 motores
  • IC bootstrap del 95 % en cada celda
  • 41 rechazos de seguridad contados como fallos
  • contaminación contrastada
Rango

Dónde está la frontera y dónde cae nuestra cifra.

Cada eje va de 80 a 100. La banda gris es el rango de las cifras publicadas por terceros sobre ese instrumento. La marca turquesa es nuestra propia medición.

GPQA Diamond

pass@1

  • Rango de las cifras publicadas por terceros 92.5-95.45
  • Yasi One 95.0
  • Partición reservada 97.1

AIME

pass@1, sin herramientas

  • Cifras publicadas por terceros, sin herramientas 92-100
  • Yasi One 99.0
  • IC del 95 % 97.0-100

LiveCodeBench

pass@1, condiciones equiparables

  • Yasi One 89.6
  • No existe publicación equiparable en condiciones equivalentes.
Marcador

Nuestra línea es una referencia, no un puesto.

Bajo cada instrumento la lista pública va estrictamente ordenada por cifra, de la cota inferior más alta hacia abajo, y cada línea lleva la clase de fuente de la que viene. Nuestra propia línea queda aparte, como referencia: no hemos vuelto a medir la cifra de nadie, así que no reclamamos puesto alguno entre ellas.

Cifras con fecha de agosto de 2026.

GPQA Diamond pass@1

Modelo Cifra Fuente
Yasi One SIN CLASIFICAR 95.0 conjunto completo de 198 preguntas 97.1 partición reservada (IC del 95 % 94.2-99.3) nuestra ejecución
Gemini 3.1 Pro Preview 94.1-95.45 indep.
GPT-5.6 Sol 94.1-95.2 indep.
Kimi K3 93.5 agreg.
GPT-5.5 93.5 agreg.
Claude Opus 5 93.2-93.4 agreg.
Grok 4.5 92.9-93.1 agreg.
Gemini 3.6 Flash 92.8-93.4 agreg.
Claude Fable 5 92.6-93.2 agreg.
GPT-5.6 Terra 92.5-92.9 agreg.

Un evaluador público publica además una variante corregida por negativas, en la que algunas cifras difieren de forma apreciable. Toda cifra de Yasi cuenta las negativas como fallos, desde el primer día.

97.1 en la partición reservada queda por encima de toda cifra publicada, y 95.0 en el conjunto completo queda en lo alto del rango independiente, cuyo borde superior es 95.45.

AIME pass@1, sin herramientas, instrumento saturado

Modelo Cifra Fuente
Yasi One SIN CLASIFICAR 99.0 majority@30 = 100 nuestra ejecución
GLM-5.2 99.2 proveedor
GPT-5.2 Pro / Codex 98.7-100 agreg.
Claude Opus / Fable / Mythos variants 95-99.8 fichas de sistema
Gemini 3 / 3.1 variants 95-100 proveedor
Grok 4 / 4.5 variants ~92-100 agreg.

Empate en el techo. El instrumento está saturado, así que lo que limita las cifras aquí es la prueba y no los motores.

LiveCodeBench pass@1

Instantáneas independientes del 12 de agosto de 2026, ordenadas por cifra.

Modelo Cifra Fuente
Gemini 3 Pro Preview 91.7 indep.
Gemini 3 Flash Preview 90.8 indep.
Claude Fable 5 89.8 agreg.
Yasi One SIN CLASIFICAR 89.6 nuestra ejecución, evaluador oficial, condiciones declaradas nuestra ejecución
DeepSeek V3.2 Speciale 89.6 indep.
Kimi K2.6 89.6 agreg.
Claude Opus 5 89.0 agreg.
Grok 4.5 87.3 agreg.
GPT-5.x Codex 87-88 agreg.

Cifras anunciadas por el proveedor, no verificadas por un tercero.

Modelo Cifra Fuente
DeepSeek V4 Pro 93.5 proveedor
Qwen 3.7 Max 91.6 proveedor

Primera línea. En el bloque independiente dos cifras quedan por encima de nuestra ejecución, y un agregador sitúa a Claude Fable 5 en 89.8, es decir 0.2 por encima. Dos anuncios de proveedor sin verificar quedan aún más arriba. Las condiciones solo se declaran en nuestra línea.

Fuentes nombradas: Artificial Analysis, Vals.ai, BenchLM y pricepertoken, sobre sus instantáneas de agosto de 2026, junto con anuncios de proveedores y fichas de sistema. Estas cifras no han sido vueltas a medir por nosotros. Los nombres de productos y modelos pertenecen a sus propietarios; no se da a entender aval alguno.

Cómo leer estas líneas.

Son nuestras propias ejecuciones, y se invita a que un tercero las repita. Lea las líneas por lo que son: la línea de una plataforma de enrutado es un máximo sobre trece motores, mientras que la línea de un laboratorio es un solo modelo.

Profundidad de la plataforma

Trece motores, una sola respuesta enrutada.

Cada punto es un motor sobre el conjunto congelado. Los puntos no llevan etiqueta, y la línea de frente, la cifra que sirve el enrutado, va marcada en turquesa.

GPQA Diamond

conjunto completo

Línea de frente 95.0

AIME

sin herramientas

Línea de frente 99.0

LiveCodeBench

pass@1

Línea de frente 89.6

El detalle por motor está disponible para socios, bajo acuerdo.

Registro de negativas

Cuarenta y una negativas, todas contadas como fallos.

A veces los motores rechazan una pregunta científica sensible por motivos de seguridad. No llega respuesta, así que nada puede darse por correcto, y la nota honesta es un cero. En esta campaña se registraron cuarenta y una negativas de ese tipo, y cada una se contó como fallo frente a nuestro propio resultado, en lugar de salir en silencio del denominador. El enrutado cubre el hueco de la única forma defendible: pone en la tarea al motor más fuerte que acepta hacerla.

Contaminación

Toda cifra por encima de 98 fue impugnada.

Una cifra por encima de 98 activa la regla de memorización: el resultado se presume recuerdo mientras una contraprueba no diga lo contrario. La contraprueba parte el conjunto congelado en dos, los problemas publicados en 2025 y los publicados en 2026, posteriores a las ventanas de entrenamiento en cuestión. Las diferencias entre ambas partes se mantuvieron pequeñas, y un motor señalado obtuvo mejor cifra en los problemas de 2026, que es la firma de una capacidad y no de un recuerdo. Las señales quedan en el expediente en cualquier caso, porque una prueba que solo exculpa no es una prueba.

Velocidad de respuesta

Profundidad sin la espera de costumbre.

Ciencias

10.9 s

mediana (p50) hasta una respuesta completa

Matemáticas

18.6 s

mediana (p50), sosteniendo 99.0 a lo largo de treinta repeticiones

Profundidad y velocidad suelen pagarse la una con la otra. El trabajo del enrutado es rechazar ese trato, tarea por tarea.

Enrutado

La tarea va al enrutador. La respuesta va adonde mejor mide.

  1. El enrutador recibe la tarea

    Cada petición entra por el enrutador de Yasi, que decide dónde corresponde el trabajo antes de que lo vea ningún motor.

  2. Las respuestas exactas van a un solo motor

    En instrumentos con una única respuesta correcta, la tarea va al motor individual más fuerte.

  3. El consejo Majlis toma las preguntas abiertas

    El consejo sirve al razonamiento abierto y a la escritura, donde ninguna clave única decide el resultado.

Dicho sin rodeos: en instrumentos de respuesta exacta, el enrutado a un solo motor sostiene la frontera, y el consejo multiplica el coste sin añadir exactitud.

El consejo, medido frente a un solo motor.

Publicado, no escondido. La regla del veredicto quedó fijada antes de las ejecuciones.

Ejecución Individual Consejo Delta emparejado IC del 95 % Coste Veredicto
GPQA test, 138 ítems 97.1 92.8 -4.4 [-8.0, -1.5] x5.6 TIE
AIME dev, 30 x 30 100.0 97.3 -2.7 [-4.2, -1.4] x4.0 TIE
AIME test congelado, consejo: NOT MEASURED. Impreso como hueco, nunca estimado.
  • TIE por regla fijada de antemano.
Método

Seis reglas, fijadas antes de la primera ejecución.

  1. Instrumentos públicos

    Cada instrumento es público y lo mantiene un tercero. Ningún conjunto privado, y ningún benchmark propio calificado por aquel mismo cuyo trabajo mide.

  2. Arnés congelado

    Un solo arnés para todos los motores y todas las ejecuciones, congelado en un commit original con nombre y una semilla fija, para que una ejecución se reproduzca en lugar de contarse.

  3. Condiciones declaradas

    Las condiciones se declaran línea por línea. Donde no existe comparación en condiciones equiparables, la página imprime la ausencia, y una medición que no hicimos se imprime como un hueco, nunca estimada, interpolada ni deducida.

  4. Estadística, no impresiones

    Cada cifra principal lleva un intervalo de confianza bootstrap del 95 %, y la regla que convierte una diferencia medida en un veredicto se fijó antes de las ejecuciones, en vez de elegirse con las cifras ya sobre la mesa. Así es como una diferencia que sabemos medir se publica igualmente como empate.

  5. Integridad del conjunto de datos

    Las cifras por encima del umbral de memorización se impugnan sobre una partición por año de publicación, y las negativas de seguridad cuentan como fallos en vez de abandonar el denominador.

  6. Reproducible

    Arnés, commit original, semilla y coste quedan registrados juntos, de modo que toda ejecución detrás de esta página puede repetirse y costearse al céntimo.

Próxima campaña

Fase 2 de las mediciones.

El conjunto de instrumentos se amplía. La próxima campaña aborda el trabajo que una sola pregunta y una sola respuesta no sostienen, y sigue las reglas ya sostenidas arriba: arnés congelado, condiciones declaradas, rechazos contados como fallos, ausencias impresas en lugar de rellenadas. En esta página no se anuncia ninguna fecha. Las cifras se publicarán cuando las ejecuciones estén hechas, salgan como salgan.

  • Ingeniería de software de horizonte largo
  • Terminal y uso del ordenador
  • Recuperación en contexto largo
  • Un instrumento de factualidad
Glosario

Las palabras de esta página, definidas.

pass@1
Un intento por problema, calificado correcto o incorrecto. Sin reintento, sin mejor de varios.
majority@30
Treinta intentos independientes por problema. Se califica la respuesta que vuelve con más frecuencia.
pass@5
Cinco intentos por problema. El problema cuenta como resuelto si alguno de ellos es correcto.
IC del 95 %
Un intervalo de confianza bootstrap del 95%: el rango en el que caería la cifra diecinueve de cada veinte veces si se repitiera la misma ejecución.
p50
La mediana. La mitad de las respuestas llega antes que eso, la otra mitad después.
NOT MEASURED
No lo ejecutamos. El hueco se imprime como hueco, nunca estimado, interpolado ni deducido.

Medido en la infraestructura de Yasi One del 28 de julio al 10 de agosto de 2026, en instrumentos públicos, con un arnés interno congelado derivado de lm-evaluation-harness 0.4.12 (commit original 6d64254, semilla 20260728). Las cifras de comparación del marcador proceden de evaluadores públicos, de anuncios de proveedores y de fichas de sistema con fecha de agosto de 2026, sin ajustar y sin que las hayamos vuelto a medir, sin aval alguno de terceros. Los nombres de los benchmarks pertenecen a sus respectivos mantenedores. Ningún ítem de benchmark se reproduce en esta página.

El método detrás de estas cifras es el mismo que sostiene cada respuesta.

Yasi One llega pronto

Estamos preparando el lanzamiento con el mayor cuidado. Vuelva muy pronto.