GPQA Diamond
95.0 pass@1
Vollständiger Satz aus 198 Fragen. Zurückgehaltene Teilmenge 97.1, 95 % KI 94.2-99.3.
Jede Zahl auf dieser Seite stammt aus unseren eigenen Läufen, an öffentlichen Instrumenten, mit eingefrorenem Harness und einem Konfidenzintervall auf jeder Zelle. Wo eine Messung fehlt, druckt die Seite die Lücke, statt sie zu füllen.
Drei Instrumente, drei Spitzenwerte.
95.0 pass@1
Vollständiger Satz aus 198 Fragen. Zurückgehaltene Teilmenge 97.1, 95 % KI 94.2-99.3.
99.0 pass@1
30 Läufe je Aufgabe. majority@30 = 100, KI 97.0-100.
89.6 pass@1
91.8 bei pass@5, gewertet vom offiziellen Evaluator.
Jede Achse läuft von 80 bis 100. Das graue Band ist die Spannweite der von Dritten veröffentlichten Werte zu diesem Instrument. Die türkise Marke ist unsere eigene Messung.
pass@1
pass@1, ohne Werkzeuge
pass@1, vergleichbare Bedingungen
Unter jedem Instrument ist die öffentliche Liste streng nach Wert sortiert, von der höchsten unteren Schranke abwärts, und jede Zeile trägt die Klasse ihrer Quelle. Unsere eigene Zeile steht daneben, als Referenz: wir haben niemandes Zahl nachgemessen, also beanspruchen wir auch keinen Platz unter ihnen.
Zahlenstand August 2026.
| Modell | Wert | Quelle |
|---|---|---|
| Yasi One NICHT PLATZIERT | 95.0 vollständiger Satz aus 198 Fragen 97.1 zurückgehaltene Teilmenge (95 % KI 94.2-99.3) | unser Lauf |
| Gemini 3.1 Pro Preview | 94.1-95.45 | unabh. |
| GPT-5.6 Sol | 94.1-95.2 | unabh. |
| Kimi K3 | 93.5 | Aggreg. |
| GPT-5.5 | 93.5 | Aggreg. |
| Claude Opus 5 | 93.2-93.4 | Aggreg. |
| Grok 4.5 | 92.9-93.1 | Aggreg. |
| Gemini 3.6 Flash | 92.8-93.4 | Aggreg. |
| Claude Fable 5* | 92.6-93.2 | Aggreg. |
| GPT-5.6 Terra | 92.5-92.9 | Aggreg. |
Ein öffentlicher Bewerter veröffentlicht zusätzlich eine um Verweigerungen bereinigte Variante, in der einzelne Werte deutlich abweichen. Jede Yasi Zahl zählt Verweigerungen als Fehlschlag, vom ersten Tag an.
97.1 auf der zurückgehaltenen Teilmenge liegt über jedem veröffentlichten Wert, und 95.0 auf dem vollständigen Satz liegt im oberen Bereich der unabhängigen Spanne, deren obere Kante 95.45 beträgt.
| Modell | Wert | Quelle |
|---|---|---|
| Yasi One NICHT PLATZIERT | 99.0 majority@30 = 100 | unser Lauf |
| GLM-5.2 | 99.2 | Anbieter |
| GPT-5.2 Pro / Codex | 98.7-100 | Aggreg. |
| Claude Opus / Fable / Mythos variants | 95-99.8 | Systemkarten |
| Gemini 3 / 3.1 variants | 95-100 | Anbieter |
| Grok 4 / 4.5 variants | ~92-100 | Aggreg. |
Gleichstand an der Decke. Das Instrument ist gesättigt, es begrenzt hier also der Test die Zahlen und nicht die Engines.
Unabhängige Momentaufnahmen vom 12. August 2026, nach Wert sortiert.
| Modell | Wert | Quelle |
|---|---|---|
| Gemini 3 Pro Preview | 91.7 | unabh. |
| Gemini 3 Flash Preview | 90.8 | unabh. |
| Claude Fable 5 | 89.8 | Aggreg. |
| Yasi One NICHT PLATZIERT | 89.6 unser Lauf, offizieller Bewerter, erklärte Bedingungen | unser Lauf |
| DeepSeek V3.2 Speciale | 89.6 | unabh. |
| Kimi K2.6 | 89.6 | Aggreg. |
| Claude Opus 5 | 89.0 | Aggreg. |
| Grok 4.5 | 87.3 | Aggreg. |
| GPT-5.x Codex | 87-88 | Aggreg. |
Vom Anbieter berichtete Angaben, nicht von Dritten geprüft.
| Modell | Wert | Quelle |
|---|---|---|
| DeepSeek V4 Pro | 93.5 | Anbieter |
| Qwen 3.7 Max | 91.6 | Anbieter |
Spitzenfeld. Im unabhängigen Block liegen zwei Werte über unserem Lauf, und ein Aggregator setzt Claude Fable 5 auf 89.8, also 0.2 darüber. Zwei ungeprüfte Anbieterangaben liegen noch höher. Bedingungen sind nur auf unserer Zeile erklärt.
Genannte Quellen: Artificial Analysis, Vals.ai, BenchLM und pricepertoken, auf ihren Momentaufnahmen von August 2026, dazu Anbieterangaben und Systemkarten. Diese Zahlen wurden von uns nicht nachgemessen. Produkt und Modellnamen gehören ihren Eigentümern; eine Billigung ist damit nicht verbunden.
Dies sind unsere eigenen Läufe, und ein Nachspielen durch Dritte ist ausdrücklich eingeladen. Lesen Sie die Zeilen als das, was sie sind: die Zeile einer Routing Plattform ist ein Maximum über dreizehn Engines, während die Zeile eines Labors ein einzelnes Modell ist.
Jeder Punkt ist eine Engine auf dem eingefrorenen Satz. Die Punkte tragen keine Beschriftung, und die vorderste Linie, also die Zahl, die das Routing ausliefert, ist türkis markiert.
vollständiger Satz
Vorderste Linie 95.0
ohne Werkzeuge
Vorderste Linie 99.0
pass@1
Vorderste Linie 89.6
Das Detail je Engine steht Partnern unter Vereinbarung zur Verfügung.
Engines lehnen eine heikle naturwissenschaftliche Frage bisweilen aus Sicherheitsgründen ab. Es kommt keine Antwort, also kann nichts als richtig gewertet werden, und die ehrliche Note ist eine Null. Einundvierzig solcher Verweigerungen wurden in dieser Kampagne erfasst, und jede einzelne wurde als Fehlschlag gegen unser eigenes Ergebnis gewertet, statt still aus dem Nenner zu verschwinden. Das Routing schließt die Lücke auf die einzige vertretbare Weise: Es setzt die stärkste Engine, die die Aufgabe annimmt, auf diese Aufgabe.
Ein Wert über 98 löst die Memorierungsregel aus: Das Ergebnis gilt als Erinnerung, bis eine Gegenprüfung etwas anderes sagt. Die Gegenprüfung teilt den eingefrorenen Satz in zwei Teile, in Aufgaben aus dem Jahr 2025 und in Aufgaben aus dem Jahr 2026, also nach den betreffenden Trainingsfenstern. Die Abstände zwischen beiden Teilen blieben klein, und eine markierte Engine schnitt auf den Aufgaben von 2026 besser ab, was die Signatur von Können ist und nicht von Erinnerung. Die Markierungen bleiben in beiden Fällen aktenkundig, denn eine Prüfung, die ihren Gegenstand immer nur entlastet, ist keine Prüfung.
10.9 s
Median (p50) bis zur vollständigen Antwort
18.6 s
Median (p50), bei gehaltenen 99.0 über dreißig Wiederholungen
Tiefe und Geschwindigkeit werden üblicherweise gegeneinander eingetauscht. Die Aufgabe des Routings ist, diesen Tausch abzulehnen, Aufgabe für Aufgabe.
Jede Anfrage läuft über den Yasi Router, der entscheidet, wohin die Arbeit gehört, bevor eine Engine sie sieht.
Bei Instrumenten mit genau einer richtigen Antwort geht die Aufgabe an die stärkste einzelne Engine.
Der Rat dient offenem Denken und dem Schreiben, wo kein einzelner Schlüssel das Ergebnis entscheidet.
Klar gesagt: bei Instrumenten mit exakter Antwort hält das Routing auf eine einzelne Engine die Spitze, und der Rat vervielfacht die Kosten, ohne exakte Genauigkeit hinzuzufügen.
Veröffentlicht, nicht verborgen. Die Urteilsregel stand vor den Läufen fest.
| Lauf | Einzeln | Rat | Gepaartes Delta | 95 % KI | Kosten | Urteil |
|---|---|---|---|---|---|---|
| GPQA Test, 138 Aufgaben | 97.1 | 92.8 | -4.4 | [-8.0, -1.5] | x5.6 | TIE |
| AIME Dev, 30 x 30 | 100.0 | 97.3 | -2.7 | [-4.2, -1.4] | x4.0 | TIE |
| AIME eingefrorener Test, Rat: NOT MEASURED. Als Lücke gedruckt, niemals geschätzt. | ||||||
Jedes Instrument ist öffentlich und wird von Dritten gepflegt. Kein privater Satz, und kein hauseigener Benchmark, der von dem benotet wird, dessen Arbeit er misst.
Ein Harness für jede Engine und jeden Lauf, eingefroren auf einem benannten Upstream Commit mit festem Seed, damit ein Lauf sich wiederholen lässt statt nur erzählt zu werden.
Bedingungen werden zeilenweise erklärt. Wo es unter passenden Bedingungen keinen Vergleich gibt, druckt die Seite das Fehlen, und eine Messung, die wir nicht durchgeführt haben, wird als Lücke gedruckt, niemals geschätzt, interpoliert oder abgeleitet.
Jede Kennzahl trägt ein 95 % Bootstrap Konfidenzintervall, und die Regel, die aus einem gemessenen Unterschied ein Urteil macht, wurde vor den Läufen festgelegt und nicht ausgesucht, als die Zahlen schon vorlagen. So wird ein Unterschied, den wir messen können, dennoch als Gleichstand veröffentlicht.
Werte über der Memorierungsschwelle werden auf einer Aufteilung nach Erscheinungsjahr angefochten, und Sicherheitsverweigerungen zählen als Fehlschlag, statt den Nenner zu verlassen.
Harness, Upstream Commit, Seed und Kosten werden zusammen festgehalten, sodass jeder Lauf hinter dieser Seite nachgespielt und auf den Cent beziffert werden kann.
Der Instrumentensatz wird breiter. Die nächste Kampagne nimmt die Arbeit auf, die eine einzelne Frage und eine einzelne Antwort nicht tragen, und sie folgt den oben bereits gehaltenen Regeln: eingefrorenes Harness, deklarierte Bedingungen, Verweigerungen als Fehlschläge gezählt, Lücken gedruckt statt gefüllt. Auf dieser Seite wird kein Datum angekündigt. Die Zahlen werden veröffentlicht, wenn die Läufe getan sind, wie sie auch ausfallen.
Gemessen auf der Yasi One Infrastruktur vom 28. Juli bis 10. August 2026, an öffentlichen Instrumenten, mit einem eingefrorenen internen Harness abgeleitet von lm-evaluation-harness 0.4.12 (Upstream Commit 6d64254, Seed 20260728). Die Vergleichszahlen der Wertetafel stammen von öffentlichen Bewertern, aus Anbieterangaben und Systemkarten mit Stand August 2026, unangepasst und von uns nicht nachgemessen, ohne jede Billigung durch Dritte. Benchmark Namen gehören ihren jeweiligen Betreuern. Kein Benchmark Element wird auf dieser Seite wiedergegeben.