Messung

Gemessen, nicht behauptet.

Jede Zahl auf dieser Seite stammt aus unseren eigenen Läufen, an öffentlichen Instrumenten, mit eingefrorenem Harness und einem Konfidenzintervall auf jeder Zelle. Wo eine Messung fehlt, druckt die Seite die Lücke, statt sie zu füllen.

Drei Instrumente, drei Spitzenwerte.

GPQA Diamond

95.0 pass@1

Vollständiger Satz aus 198 Fragen. Zurückgehaltene Teilmenge 97.1, 95 % KI 94.2-99.3.

AIME

99.0 pass@1

30 Läufe je Aufgabe. majority@30 = 100, KI 97.0-100.

LiveCodeBench

89.6 pass@1

91.8 bei pass@5, gewertet vom offiziellen Evaluator.

Die Messung hinter dieser Seite

  • über 39.000 gewertete Messungen
  • 13 Engines
  • 95 % Bootstrap KI auf jeder Zelle
  • 41 Sicherheitsverweigerungen als Fehlschlag gewertet
  • Kontamination gegengeprüft
Spannweite

Wo die Front steht, und wo unsere Zahl landet.

Jede Achse läuft von 80 bis 100. Das graue Band ist die Spannweite der von Dritten veröffentlichten Werte zu diesem Instrument. Die türkise Marke ist unsere eigene Messung.

GPQA Diamond

pass@1

  • Spannweite der von Dritten veröffentlichten Werte 92.5-95.45
  • Yasi One 95.0
  • Zurückgehaltene Teilmenge 97.1

AIME

pass@1, ohne Werkzeuge

  • Von Dritten veröffentlichte Werte, ohne Werkzeuge 92-100
  • Yasi One 99.0
  • 95 % KI 97.0-100

LiveCodeBench

pass@1, vergleichbare Bedingungen

  • Yasi One 89.6
  • Keine vergleichbare Veröffentlichung unter passenden Bedingungen.
Punktetafel

Unsere Zeile ist eine Referenz, kein Rang.

Unter jedem Instrument ist die öffentliche Liste streng nach Wert sortiert, von der höchsten unteren Schranke abwärts, und jede Zeile trägt die Klasse ihrer Quelle. Unsere eigene Zeile steht daneben, als Referenz: wir haben niemandes Zahl nachgemessen, also beanspruchen wir auch keinen Platz unter ihnen.

Zahlenstand August 2026.

GPQA Diamond pass@1

Modell Wert Quelle
Yasi One NICHT PLATZIERT 95.0 vollständiger Satz aus 198 Fragen 97.1 zurückgehaltene Teilmenge (95 % KI 94.2-99.3) unser Lauf
Gemini 3.1 Pro Preview 94.1-95.45 unabh.
GPT-5.6 Sol 94.1-95.2 unabh.
Kimi K3 93.5 Aggreg.
GPT-5.5 93.5 Aggreg.
Claude Opus 5 93.2-93.4 Aggreg.
Grok 4.5 92.9-93.1 Aggreg.
Gemini 3.6 Flash 92.8-93.4 Aggreg.
Claude Fable 5 92.6-93.2 Aggreg.
GPT-5.6 Terra 92.5-92.9 Aggreg.

Ein öffentlicher Bewerter veröffentlicht zusätzlich eine um Verweigerungen bereinigte Variante, in der einzelne Werte deutlich abweichen. Jede Yasi Zahl zählt Verweigerungen als Fehlschlag, vom ersten Tag an.

97.1 auf der zurückgehaltenen Teilmenge liegt über jedem veröffentlichten Wert, und 95.0 auf dem vollständigen Satz liegt im oberen Bereich der unabhängigen Spanne, deren obere Kante 95.45 beträgt.

AIME pass@1, ohne Werkzeuge, gesättigtes Instrument

Modell Wert Quelle
Yasi One NICHT PLATZIERT 99.0 majority@30 = 100 unser Lauf
GLM-5.2 99.2 Anbieter
GPT-5.2 Pro / Codex 98.7-100 Aggreg.
Claude Opus / Fable / Mythos variants 95-99.8 Systemkarten
Gemini 3 / 3.1 variants 95-100 Anbieter
Grok 4 / 4.5 variants ~92-100 Aggreg.

Gleichstand an der Decke. Das Instrument ist gesättigt, es begrenzt hier also der Test die Zahlen und nicht die Engines.

LiveCodeBench pass@1

Unabhängige Momentaufnahmen vom 12. August 2026, nach Wert sortiert.

Modell Wert Quelle
Gemini 3 Pro Preview 91.7 unabh.
Gemini 3 Flash Preview 90.8 unabh.
Claude Fable 5 89.8 Aggreg.
Yasi One NICHT PLATZIERT 89.6 unser Lauf, offizieller Bewerter, erklärte Bedingungen unser Lauf
DeepSeek V3.2 Speciale 89.6 unabh.
Kimi K2.6 89.6 Aggreg.
Claude Opus 5 89.0 Aggreg.
Grok 4.5 87.3 Aggreg.
GPT-5.x Codex 87-88 Aggreg.

Vom Anbieter berichtete Angaben, nicht von Dritten geprüft.

Modell Wert Quelle
DeepSeek V4 Pro 93.5 Anbieter
Qwen 3.7 Max 91.6 Anbieter

Spitzenfeld. Im unabhängigen Block liegen zwei Werte über unserem Lauf, und ein Aggregator setzt Claude Fable 5 auf 89.8, also 0.2 darüber. Zwei ungeprüfte Anbieterangaben liegen noch höher. Bedingungen sind nur auf unserer Zeile erklärt.

Genannte Quellen: Artificial Analysis, Vals.ai, BenchLM und pricepertoken, auf ihren Momentaufnahmen von August 2026, dazu Anbieterangaben und Systemkarten. Diese Zahlen wurden von uns nicht nachgemessen. Produkt und Modellnamen gehören ihren Eigentümern; eine Billigung ist damit nicht verbunden.

Wie diese Zeilen zu lesen sind.

Dies sind unsere eigenen Läufe, und ein Nachspielen durch Dritte ist ausdrücklich eingeladen. Lesen Sie die Zeilen als das, was sie sind: die Zeile einer Routing Plattform ist ein Maximum über dreizehn Engines, während die Zeile eines Labors ein einzelnes Modell ist.

Tiefe der Plattform

Dreizehn Engines, eine geroutete Antwort.

Jeder Punkt ist eine Engine auf dem eingefrorenen Satz. Die Punkte tragen keine Beschriftung, und die vorderste Linie, also die Zahl, die das Routing ausliefert, ist türkis markiert.

GPQA Diamond

vollständiger Satz

Vorderste Linie 95.0

AIME

ohne Werkzeuge

Vorderste Linie 99.0

LiveCodeBench

pass@1

Vorderste Linie 89.6

Das Detail je Engine steht Partnern unter Vereinbarung zur Verfügung.

Verweigerungsbuch

Einundvierzig Verweigerungen, jede als Fehlschlag gewertet.

Engines lehnen eine heikle naturwissenschaftliche Frage bisweilen aus Sicherheitsgründen ab. Es kommt keine Antwort, also kann nichts als richtig gewertet werden, und die ehrliche Note ist eine Null. Einundvierzig solcher Verweigerungen wurden in dieser Kampagne erfasst, und jede einzelne wurde als Fehlschlag gegen unser eigenes Ergebnis gewertet, statt still aus dem Nenner zu verschwinden. Das Routing schließt die Lücke auf die einzige vertretbare Weise: Es setzt die stärkste Engine, die die Aufgabe annimmt, auf diese Aufgabe.

Kontamination

Jeder Wert über 98 wurde angefochten.

Ein Wert über 98 löst die Memorierungsregel aus: Das Ergebnis gilt als Erinnerung, bis eine Gegenprüfung etwas anderes sagt. Die Gegenprüfung teilt den eingefrorenen Satz in zwei Teile, in Aufgaben aus dem Jahr 2025 und in Aufgaben aus dem Jahr 2026, also nach den betreffenden Trainingsfenstern. Die Abstände zwischen beiden Teilen blieben klein, und eine markierte Engine schnitt auf den Aufgaben von 2026 besser ab, was die Signatur von Können ist und nicht von Erinnerung. Die Markierungen bleiben in beiden Fällen aktenkundig, denn eine Prüfung, die ihren Gegenstand immer nur entlastet, ist keine Prüfung.

Antwortgeschwindigkeit

Tiefe ohne das übliche Warten.

Naturwissenschaft

10.9 s

Median (p50) bis zur vollständigen Antwort

Mathematik

18.6 s

Median (p50), bei gehaltenen 99.0 über dreißig Wiederholungen

Tiefe und Geschwindigkeit werden üblicherweise gegeneinander eingetauscht. Die Aufgabe des Routings ist, diesen Tausch abzulehnen, Aufgabe für Aufgabe.

Routing

Die Aufgabe geht an den Router. Die Antwort geht dorthin, wo sie am besten misst.

  1. Der Router nimmt die Aufgabe

    Jede Anfrage läuft über den Yasi Router, der entscheidet, wohin die Arbeit gehört, bevor eine Engine sie sieht.

  2. Exakte Antworten gehen an eine Engine

    Bei Instrumenten mit genau einer richtigen Antwort geht die Aufgabe an die stärkste einzelne Engine.

  3. Der Majlis Rat nimmt die offenen Fragen

    Der Rat dient offenem Denken und dem Schreiben, wo kein einzelner Schlüssel das Ergebnis entscheidet.

Klar gesagt: bei Instrumenten mit exakter Antwort hält das Routing auf eine einzelne Engine die Spitze, und der Rat vervielfacht die Kosten, ohne exakte Genauigkeit hinzuzufügen.

Der Rat, gemessen gegen eine einzelne Engine.

Veröffentlicht, nicht verborgen. Die Urteilsregel stand vor den Läufen fest.

Lauf Einzeln Rat Gepaartes Delta 95 % KI Kosten Urteil
GPQA Test, 138 Aufgaben 97.1 92.8 -4.4 [-8.0, -1.5] x5.6 TIE
AIME Dev, 30 x 30 100.0 97.3 -2.7 [-4.2, -1.4] x4.0 TIE
AIME eingefrorener Test, Rat: NOT MEASURED. Als Lücke gedruckt, niemals geschätzt.
  • TIE nach vorab fixierter Regel.
Methode

Sechs Regeln, festgelegt vor dem ersten Lauf.

  1. Öffentliche Instrumente

    Jedes Instrument ist öffentlich und wird von Dritten gepflegt. Kein privater Satz, und kein hauseigener Benchmark, der von dem benotet wird, dessen Arbeit er misst.

  2. Eingefrorenes Harness

    Ein Harness für jede Engine und jeden Lauf, eingefroren auf einem benannten Upstream Commit mit festem Seed, damit ein Lauf sich wiederholen lässt statt nur erzählt zu werden.

  3. Erklärte Bedingungen

    Bedingungen werden zeilenweise erklärt. Wo es unter passenden Bedingungen keinen Vergleich gibt, druckt die Seite das Fehlen, und eine Messung, die wir nicht durchgeführt haben, wird als Lücke gedruckt, niemals geschätzt, interpoliert oder abgeleitet.

  4. Statistik statt Bauchgefühl

    Jede Kennzahl trägt ein 95 % Bootstrap Konfidenzintervall, und die Regel, die aus einem gemessenen Unterschied ein Urteil macht, wurde vor den Läufen festgelegt und nicht ausgesucht, als die Zahlen schon vorlagen. So wird ein Unterschied, den wir messen können, dennoch als Gleichstand veröffentlicht.

  5. Integrität des Datensatzes

    Werte über der Memorierungsschwelle werden auf einer Aufteilung nach Erscheinungsjahr angefochten, und Sicherheitsverweigerungen zählen als Fehlschlag, statt den Nenner zu verlassen.

  6. Nachspielbar

    Harness, Upstream Commit, Seed und Kosten werden zusammen festgehalten, sodass jeder Lauf hinter dieser Seite nachgespielt und auf den Cent beziffert werden kann.

Nächste Kampagne

Phase 2 der Messungen.

Der Instrumentensatz wird breiter. Die nächste Kampagne nimmt die Arbeit auf, die eine einzelne Frage und eine einzelne Antwort nicht tragen, und sie folgt den oben bereits gehaltenen Regeln: eingefrorenes Harness, deklarierte Bedingungen, Verweigerungen als Fehlschläge gezählt, Lücken gedruckt statt gefüllt. Auf dieser Seite wird kein Datum angekündigt. Die Zahlen werden veröffentlicht, wenn die Läufe getan sind, wie sie auch ausfallen.

  • Softwareentwicklung über lange Horizonte
  • Terminal und Computernutzung
  • Abruf über lange Kontexte
  • Ein Instrument für Faktentreue
Glossar

Die Wörter dieser Seite, definiert.

pass@1
Ein Versuch je Aufgabe, richtig oder falsch gewertet. Kein zweiter Anlauf, keine Bestenauswahl.
majority@30
Dreißig unabhängige Versuche je Aufgabe. Gewertet wird die Antwort, die am häufigsten zurückkommt.
pass@5
Fünf Versuche je Aufgabe. Die Aufgabe gilt als gelöst, wenn einer der Versuche richtig ist.
95 % KI
Ein 95 % Bootstrap Konfidenzintervall: der Bereich, in dem die Zahl bei Wiederholung desselben Laufs in neunzehn von zwanzig Fällen läge.
p50
Der Median. Die Hälfte der Antworten kommt schneller an, die andere Hälfte langsamer.
NOT MEASURED
Wir haben es nicht durchgeführt. Die Lücke wird als Lücke gedruckt, niemals geschätzt, interpoliert oder abgeleitet.

Gemessen auf der Yasi One Infrastruktur vom 28. Juli bis 10. August 2026, an öffentlichen Instrumenten, mit einem eingefrorenen internen Harness abgeleitet von lm-evaluation-harness 0.4.12 (Upstream Commit 6d64254, Seed 20260728). Die Vergleichszahlen der Wertetafel stammen von öffentlichen Bewertern, aus Anbieterangaben und Systemkarten mit Stand August 2026, unangepasst und von uns nicht nachgemessen, ohne jede Billigung durch Dritte. Benchmark Namen gehören ihren jeweiligen Betreuern. Kein Benchmark Element wird auf dieser Seite wiedergegeben.

Die Methode hinter diesen Zahlen trägt auch jede einzelne Antwort.

Yasi One kommt bald

Wir bereiten den Start mit größter Sorgfalt vor. Schauen Sie bald wieder vorbei.