GPQA Diamond
95.0 pass@1
Conjunto completo de 198 preguntas. Partición reservada 97.1, IC del 95 % 94.2-99.3.
Cada cifra de esta página procede de nuestras propias ejecuciones, en instrumentos públicos, con un arnés congelado y un intervalo de confianza en cada celda. Donde no existe medición, la página imprime el hueco en lugar de rellenarlo.
Tres instrumentos, tres puntuaciones de cabecera.
95.0 pass@1
Conjunto completo de 198 preguntas. Partición reservada 97.1, IC del 95 % 94.2-99.3.
99.0 pass@1
30 ejecuciones por problema. majority@30 = 100, IC 97.0-100.
89.6 pass@1
91.8 en pass@5, puntuado por el evaluador oficial.
Cada eje va de 80 a 100. La banda gris es el rango de las cifras publicadas por terceros sobre ese instrumento. La marca turquesa es nuestra propia medición.
pass@1
pass@1, sin herramientas
pass@1, condiciones equiparables
Bajo cada instrumento la lista pública va estrictamente ordenada por cifra, de la cota inferior más alta hacia abajo, y cada línea lleva la clase de fuente de la que viene. Nuestra propia línea queda aparte, como referencia: no hemos vuelto a medir la cifra de nadie, así que no reclamamos puesto alguno entre ellas.
Cifras con fecha de agosto de 2026.
| Modelo | Cifra | Fuente |
|---|---|---|
| Yasi One SIN CLASIFICAR | 95.0 conjunto completo de 198 preguntas 97.1 partición reservada (IC del 95 % 94.2-99.3) | nuestra ejecución |
| Gemini 3.1 Pro Preview | 94.1-95.45 | indep. |
| GPT-5.6 Sol | 94.1-95.2 | indep. |
| Kimi K3 | 93.5 | agreg. |
| GPT-5.5 | 93.5 | agreg. |
| Claude Opus 5 | 93.2-93.4 | agreg. |
| Grok 4.5 | 92.9-93.1 | agreg. |
| Gemini 3.6 Flash | 92.8-93.4 | agreg. |
| Claude Fable 5* | 92.6-93.2 | agreg. |
| GPT-5.6 Terra | 92.5-92.9 | agreg. |
Un evaluador público publica además una variante corregida por negativas, en la que algunas cifras difieren de forma apreciable. Toda cifra de Yasi cuenta las negativas como fallos, desde el primer día.
97.1 en la partición reservada queda por encima de toda cifra publicada, y 95.0 en el conjunto completo queda en lo alto del rango independiente, cuyo borde superior es 95.45.
| Modelo | Cifra | Fuente |
|---|---|---|
| Yasi One SIN CLASIFICAR | 99.0 majority@30 = 100 | nuestra ejecución |
| GLM-5.2 | 99.2 | proveedor |
| GPT-5.2 Pro / Codex | 98.7-100 | agreg. |
| Claude Opus / Fable / Mythos variants | 95-99.8 | fichas de sistema |
| Gemini 3 / 3.1 variants | 95-100 | proveedor |
| Grok 4 / 4.5 variants | ~92-100 | agreg. |
Empate en el techo. El instrumento está saturado, así que lo que limita las cifras aquí es la prueba y no los motores.
Instantáneas independientes del 12 de agosto de 2026, ordenadas por cifra.
| Modelo | Cifra | Fuente |
|---|---|---|
| Gemini 3 Pro Preview | 91.7 | indep. |
| Gemini 3 Flash Preview | 90.8 | indep. |
| Claude Fable 5 | 89.8 | agreg. |
| Yasi One SIN CLASIFICAR | 89.6 nuestra ejecución, evaluador oficial, condiciones declaradas | nuestra ejecución |
| DeepSeek V3.2 Speciale | 89.6 | indep. |
| Kimi K2.6 | 89.6 | agreg. |
| Claude Opus 5 | 89.0 | agreg. |
| Grok 4.5 | 87.3 | agreg. |
| GPT-5.x Codex | 87-88 | agreg. |
Cifras anunciadas por el proveedor, no verificadas por un tercero.
| Modelo | Cifra | Fuente |
|---|---|---|
| DeepSeek V4 Pro | 93.5 | proveedor |
| Qwen 3.7 Max | 91.6 | proveedor |
Primera línea. En el bloque independiente dos cifras quedan por encima de nuestra ejecución, y un agregador sitúa a Claude Fable 5 en 89.8, es decir 0.2 por encima. Dos anuncios de proveedor sin verificar quedan aún más arriba. Las condiciones solo se declaran en nuestra línea.
Fuentes nombradas: Artificial Analysis, Vals.ai, BenchLM y pricepertoken, sobre sus instantáneas de agosto de 2026, junto con anuncios de proveedores y fichas de sistema. Estas cifras no han sido vueltas a medir por nosotros. Los nombres de productos y modelos pertenecen a sus propietarios; no se da a entender aval alguno.
Son nuestras propias ejecuciones, y se invita a que un tercero las repita. Lea las líneas por lo que son: la línea de una plataforma de enrutado es un máximo sobre trece motores, mientras que la línea de un laboratorio es un solo modelo.
Cada punto es un motor sobre el conjunto congelado. Los puntos no llevan etiqueta, y la línea de frente, la cifra que sirve el enrutado, va marcada en turquesa.
conjunto completo
Línea de frente 95.0
sin herramientas
Línea de frente 99.0
pass@1
Línea de frente 89.6
El detalle por motor está disponible para socios, bajo acuerdo.
A veces los motores rechazan una pregunta científica sensible por motivos de seguridad. No llega respuesta, así que nada puede darse por correcto, y la nota honesta es un cero. En esta campaña se registraron cuarenta y una negativas de ese tipo, y cada una se contó como fallo frente a nuestro propio resultado, en lugar de salir en silencio del denominador. El enrutado cubre el hueco de la única forma defendible: pone en la tarea al motor más fuerte que acepta hacerla.
Una cifra por encima de 98 activa la regla de memorización: el resultado se presume recuerdo mientras una contraprueba no diga lo contrario. La contraprueba parte el conjunto congelado en dos, los problemas publicados en 2025 y los publicados en 2026, posteriores a las ventanas de entrenamiento en cuestión. Las diferencias entre ambas partes se mantuvieron pequeñas, y un motor señalado obtuvo mejor cifra en los problemas de 2026, que es la firma de una capacidad y no de un recuerdo. Las señales quedan en el expediente en cualquier caso, porque una prueba que solo exculpa no es una prueba.
10.9 s
mediana (p50) hasta una respuesta completa
18.6 s
mediana (p50), sosteniendo 99.0 a lo largo de treinta repeticiones
Profundidad y velocidad suelen pagarse la una con la otra. El trabajo del enrutado es rechazar ese trato, tarea por tarea.
Cada petición entra por el enrutador de Yasi, que decide dónde corresponde el trabajo antes de que lo vea ningún motor.
En instrumentos con una única respuesta correcta, la tarea va al motor individual más fuerte.
El consejo sirve al razonamiento abierto y a la escritura, donde ninguna clave única decide el resultado.
Dicho sin rodeos: en instrumentos de respuesta exacta, el enrutado a un solo motor sostiene la frontera, y el consejo multiplica el coste sin añadir exactitud.
Publicado, no escondido. La regla del veredicto quedó fijada antes de las ejecuciones.
| Ejecución | Individual | Consejo | Delta emparejado | IC del 95 % | Coste | Veredicto |
|---|---|---|---|---|---|---|
| GPQA test, 138 ítems | 97.1 | 92.8 | -4.4 | [-8.0, -1.5] | x5.6 | TIE |
| AIME dev, 30 x 30 | 100.0 | 97.3 | -2.7 | [-4.2, -1.4] | x4.0 | TIE |
| AIME test congelado, consejo: NOT MEASURED. Impreso como hueco, nunca estimado. | ||||||
Cada instrumento es público y lo mantiene un tercero. Ningún conjunto privado, y ningún benchmark propio calificado por aquel mismo cuyo trabajo mide.
Un solo arnés para todos los motores y todas las ejecuciones, congelado en un commit original con nombre y una semilla fija, para que una ejecución se reproduzca en lugar de contarse.
Las condiciones se declaran línea por línea. Donde no existe comparación en condiciones equiparables, la página imprime la ausencia, y una medición que no hicimos se imprime como un hueco, nunca estimada, interpolada ni deducida.
Cada cifra principal lleva un intervalo de confianza bootstrap del 95 %, y la regla que convierte una diferencia medida en un veredicto se fijó antes de las ejecuciones, en vez de elegirse con las cifras ya sobre la mesa. Así es como una diferencia que sabemos medir se publica igualmente como empate.
Las cifras por encima del umbral de memorización se impugnan sobre una partición por año de publicación, y las negativas de seguridad cuentan como fallos en vez de abandonar el denominador.
Arnés, commit original, semilla y coste quedan registrados juntos, de modo que toda ejecución detrás de esta página puede repetirse y costearse al céntimo.
El conjunto de instrumentos se amplía. La próxima campaña aborda el trabajo que una sola pregunta y una sola respuesta no sostienen, y sigue las reglas ya sostenidas arriba: arnés congelado, condiciones declaradas, rechazos contados como fallos, ausencias impresas en lugar de rellenadas. En esta página no se anuncia ninguna fecha. Las cifras se publicarán cuando las ejecuciones estén hechas, salgan como salgan.
Medido en la infraestructura de Yasi One del 28 de julio al 10 de agosto de 2026, en instrumentos públicos, con un arnés interno congelado derivado de lm-evaluation-harness 0.4.12 (commit original 6d64254, semilla 20260728). Las cifras de comparación del marcador proceden de evaluadores públicos, de anuncios de proveedores y de fichas de sistema con fecha de agosto de 2026, sin ajustar y sin que las hayamos vuelto a medir, sin aval alguno de terceros. Los nombres de los benchmarks pertenecen a sus respectivos mantenedores. Ningún ítem de benchmark se reproduce en esta página.