GPQA Diamond
95.0 pass@1
المجموعة الكاملة من 198 سؤالاً. القسم المحجوز 97.1، وفاصل ثقة 95% من 94.2 إلى 99.3.
كل رقم في هذه الصفحة يأتي من تشغيلاتنا نحن، على أدوات عامة، بأداة قياس مجمَّدة وفاصل ثقة على كل خانة. وحيث لا يوجد قياس، تطبع الصفحة النقص بدل أن تملأه.
ثلاث أدوات، وثلاث درجات رئيسية.
95.0 pass@1
المجموعة الكاملة من 198 سؤالاً. القسم المحجوز 97.1، وفاصل ثقة 95% من 94.2 إلى 99.3.
99.0 pass@1
30 تشغيلاً لكل مسألة. majority@30 = 100، والفاصل من 97.0 إلى 100.
89.6 pass@1
91.8 عند pass@5، بتقييم المُقيِّم الرسمي.
يمتد كل محور من 80 إلى 100. والشريط الرمادي هو مدى الأرقام المنشورة من أطراف ثالثة على تلك الأداة. أما العلامة الفيروزية فهي قياسنا نحن.
pass@1
pass@1، دون أدوات
pass@1، بشروط مطابقة
تحت كل أداة تأتي القائمة العامة مرتبة ترتيباً صارماً بحسب الرقم، من أعلى حد أدنى نزولاً، ويحمل كل سطر صنف المصدر الذي جاء منه. أما سطرنا نحن فيقف على حدة، بوصفه مرجعاً: لم نُعد قياس رقم أحد، فلا ندّعي لأنفسنا موضعاً بينهم.
أرقام بتاريخ أغسطس 2026.
| النموذج | الرقم | المصدر |
|---|---|---|
| Yasi One خارج الترتيب | 95.0 المجموعة الكاملة من 198 سؤالاً 97.1 القسم المحجوز (فاصل 95% 94.2-99.3) | تشغيلنا |
| Gemini 3.1 Pro Preview | 94.1-95.45 | مستقل |
| GPT-5.6 Sol | 94.1-95.2 | مستقل |
| Kimi K3 | 93.5 | مُجمِّع |
| GPT-5.5 | 93.5 | مُجمِّع |
| Claude Opus 5 | 93.2-93.4 | مُجمِّع |
| Grok 4.5 | 92.9-93.1 | مُجمِّع |
| Gemini 3.6 Flash | 92.8-93.4 | مُجمِّع |
| Claude Fable 5* | 92.6-93.2 | مُجمِّع |
| GPT-5.6 Terra | 92.5-92.9 | مُجمِّع |
ينشر أحد المُقيِّمين العامين أيضاً نسخة مصححة لحالات الرفض، تختلف فيها بعض الأرقام اختلافاً ملموساً. وكل رقم من أرقام Yasi يحسب الرفض إخفاقاً، منذ اليوم الأول.
97.1 على القسم المحجوز يقف فوق كل قيمة منشورة، و95.0 على المجموعة الكاملة يقف في أعلى المدى المستقل، الذي حده الأعلى 95.45.
| النموذج | الرقم | المصدر |
|---|---|---|
| Yasi One خارج الترتيب | 99.0 majority@30 = 100 | تشغيلنا |
| GLM-5.2 | 99.2 | المزوّد |
| GPT-5.2 Pro / Codex | 98.7-100 | مُجمِّع |
| Claude Opus / Fable / Mythos variants | 95-99.8 | بطاقات النظام |
| Gemini 3 / 3.1 variants | 95-100 | المزوّد |
| Grok 4 / 4.5 variants | ~92-100 | مُجمِّع |
تعادل عند السقف. الأداة مشبعة، فالذي يحد الأرقام هنا هو الاختبار لا المحركات.
لقطات مستقلة بتاريخ 12 أغسطس 2026، مرتبة بحسب الرقم.
| النموذج | الرقم | المصدر |
|---|---|---|
| Gemini 3 Pro Preview | 91.7 | مستقل |
| Gemini 3 Flash Preview | 90.8 | مستقل |
| Claude Fable 5 | 89.8 | مُجمِّع |
| Yasi One خارج الترتيب | 89.6 تشغيلنا، بالمُقيِّم الرسمي، وبشروط معلنة | تشغيلنا |
| DeepSeek V3.2 Speciale | 89.6 | مستقل |
| Kimi K2.6 | 89.6 | مُجمِّع |
| Claude Opus 5 | 89.0 | مُجمِّع |
| Grok 4.5 | 87.3 | مُجمِّع |
| GPT-5.x Codex | 87-88 | مُجمِّع |
أرقام يعلنها المزوّد، ولم يتحقق منها طرف ثالث.
| النموذج | الرقم | المصدر |
|---|---|---|
| DeepSeek V4 Pro | 93.5 | المزوّد |
| Qwen 3.7 Max | 91.6 | المزوّد |
الصف الأول. في الكتلة المستقلة تقف قيمتان فوق تشغيلنا، ويضع أحد المُجمِّعين Claude Fable 5 عند 89.8، أي 0.2 فوقنا. وتقف مطالبتان من مزوّدين دون تحقق أعلى من ذلك. والشروط معلنة على سطرنا وحده.
مصادر مسماة: Artificial Analysis وVals.ai وBenchLM وpricepertoken، على لقطاتها لأغسطس 2026، ومعها إعلانات المزوّدين وبطاقات النظام. ولم نُعد نحن قياس هذه الأرقام. وأسماء المنتجات والنماذج ملك لأصحابها، ولا تُفهم منها أي تزكية.
هذه تشغيلاتنا نحن، وإعادة التشغيل من طرف ثالث مدعوة. اقرأ السطور على حقيقتها: سطر منصة توجيه هو حد أقصى على ثلاثة عشر محركاً، بينما سطر المختبر نموذج واحد.
كل نقطة محرك واحد على المجموعة المجمَّدة. والنقاط بلا أسماء، وخط المقدمة، أي الرقم الذي يقدمه التوجيه، مُعلَّم بالفيروزي.
المجموعة الكاملة
خط المقدمة 95.0
دون أدوات
خط المقدمة 99.0
pass@1
خط المقدمة 89.6
التفصيل لكل محرك متاح للشركاء بموجب اتفاق.
ترفض المحركات أحياناً سؤالاً علمياً حساساً لدواعي السلامة. فلا تصل إجابة، ولا يمكن عندها احتساب شيء صحيحاً، والدرجة الأمينة هي صفر. وقد سُجل في هذه الحملة واحد وأربعون رفضاً من هذا النوع، وحُسب كل واحد منها إخفاقاً في مواجهة نتيجتنا نحن، بدل أن يُسحب بهدوء من المقام. ويسد التوجيه هذا النقص بالطريقة الوحيدة القابلة للدفاع: يضع على المهمة أقوى محرك يقبل تنفيذها.
تستدعي أي درجة فوق 98 قاعدة الحفظ: تُفترض النتيجة استرجاعاً حتى يقول اختبار مضاد غير ذلك. ويقسم الاختبار المضاد المجموعة المجمَّدة قسمين، مسائل نُشرت في 2025 ومسائل نُشرت في 2026، أي بعد نوافذ التدريب المعنية. وبقيت الفوارق بين القسمين صغيرة، وسجل أحد المحركات المُعلَّمة نتيجة أعلى على مسائل 2026، وتلك بصمة قدرة لا بصمة استرجاع. وتبقى العلامات في السجل في الحالتين، لأن اختباراً لا يفعل سوى التبرئة ليس اختباراً.
10.9 s
الوسيط (p50) حتى إجابة كاملة
18.6 s
الوسيط (p50)، مع الثبات على 99.0 عبر ثلاثين تكراراً
العمق والسرعة يُدفع أحدهما ثمناً للآخر عادة. ومهمة التوجيه أن يرفض هذه المقايضة، مهمة بعد مهمة.
كل طلب يدخل عبر موجِّه Yasi، الذي يقرر أين ينتمي العمل قبل أن يراه أي محرك.
على الأدوات ذات الإجابة الصحيحة الواحدة، تذهب المهمة إلى أقوى محرك منفرد.
يخدم المجلس التفكير المفتوح والكتابة، حيث لا يحسم مفتاح واحد النتيجة.
بصراحة: على أدوات الإجابة الدقيقة، يحافظ التوجيه إلى محرك واحد على المقدمة، بينما يضاعف المجلس الكلفة دون أن يضيف دقة في الإجابة.
منشور لا مخفي. وقاعدة الحكم كانت مثبتة قبل التشغيل.
| التشغيل | منفرد | المجلس | الفارق المزدوج | فاصل 95% | الكلفة | الحكم |
|---|---|---|---|---|---|---|
| GPQA اختبار، 138 عنصراً | 97.1 | 92.8 | -4.4 | [-8.0, -1.5] | x5.6 | TIE |
| AIME تطوير، 30 x 30 | 100.0 | 97.3 | -2.7 | [-4.2, -1.4] | x4.0 | TIE |
| AIME الاختبار المجمَّد، المجلس: NOT MEASURED. مطبوع كنقص، وغير مقدَّر أبداً. | ||||||
كل أداة عامة ويتولاها طرف ثالث. لا مجموعة خاصة، ولا مقياس داخلي يصححه من يقيس عمله.
أداة قياس واحدة لكل المحركات وكل التشغيلات، مجمَّدة على التزام أصلي مُسمى وبذرة ثابتة، كي يُعاد التشغيل بدل أن يُروى.
الشروط معلنة سطراً بسطر. وحيث لا وجود لمقارنة بشروط مطابقة تطبع الصفحة الغياب، والقياس الذي لم ننفذه يُطبع نقصاً، ولا يُقدَّر ولا يُستكمل ولا يُستنتج أبداً.
يحمل كل رقم رئيسي فاصل ثقة bootstrap عند 95%، والقاعدة التي تحوّل فارقاً مقيساً إلى حكم ثُبتت قبل التشغيلات، لا اختيرت بعد ظهور الأرقام. وهكذا يُنشر فارق نعرف قياسه تعادلاً رغم ذلك.
الدرجات فوق عتبة الحفظ تخضع للطعن على قسمة بحسب سنة النشر، وحالات الرفض الأمني تُحسب إخفاقاً بدل أن تغادر المقام.
أداة القياس والالتزام الأصلي والبذرة والتكلفة تُسجَّل معاً، فيمكن إعادة كل تشغيل خلف هذه الصفحة وتقدير كلفته حتى القرش.
تتّسع مجموعة الأدوات. تتناول الحملة القادمة العمل الذي لا يسعه سؤال واحد وجواب واحد، وتجري وفق القواعد المحفوظة أعلاه: أداة قياس مجمَّدة، وشروط معلنة، ورفض يُحسب إخفاقاً، وغياب يُطبع بدل أن يُملأ. ولا يُعلن أي تاريخ في هذه الصفحة. ستُنشر الأرقام حين تكتمل الإجراءات، مهما جاءت.
قيس على بنية Yasi One من 28 يوليو إلى 10 أغسطس 2026، على أدوات عامة، بأداة قياس داخلية مجمَّدة مشتقة من lm-evaluation-harness 0.4.12 (الالتزام الأصلي 6d64254، البذرة 20260728). أرقام المقارنة في لوحة النتائج مصدرها مُقيِّمون عامون وإعلانات مزوّدين وبطاقات نظام بتاريخ أغسطس 2026، دون تعديل ودون أن نُعيد قياسها، ودون أي تزكية من طرف ثالث. أسماء المقاييس ملك للقائمين عليها. ولا يُعاد إنتاج أي عنصر اختبار في هذه الصفحة.