القياس

مقيس، لا مُدَّعى.

كل رقم في هذه الصفحة يأتي من تشغيلاتنا نحن، على أدوات عامة، بأداة قياس مجمَّدة وفاصل ثقة على كل خانة. وحيث لا يوجد قياس، تطبع الصفحة النقص بدل أن تملأه.

ثلاث أدوات، وثلاث درجات رئيسية.

GPQA Diamond

95.0 pass@1

المجموعة الكاملة من 198 سؤالاً. القسم المحجوز 97.1، وفاصل ثقة 95% من 94.2 إلى 99.3.

AIME

99.0 pass@1

30 تشغيلاً لكل مسألة. majority@30 = 100، والفاصل من 97.0 إلى 100.

LiveCodeBench

89.6 pass@1

91.8 عند pass@5، بتقييم المُقيِّم الرسمي.

حجم القياس خلف هذه الصفحة

  • أكثر من 39,000 قياس مُقيَّم
  • 13 محركاً
  • فواصل ثقة bootstrap 95% على كل خانة
  • 41 رفضاً أمنياً حُسب إخفاقاً
  • التلوث خضع لاختبار مضاد
المدى

أين تقف المقدمة، وأين يقع رقمنا.

يمتد كل محور من 80 إلى 100. والشريط الرمادي هو مدى الأرقام المنشورة من أطراف ثالثة على تلك الأداة. أما العلامة الفيروزية فهي قياسنا نحن.

GPQA Diamond

pass@1

  • مدى الأرقام المنشورة من أطراف ثالثة 92.5-95.45
  • Yasi One 95.0
  • القسم المحجوز 97.1

AIME

pass@1، دون أدوات

  • أرقام منشورة من أطراف ثالثة، دون أدوات 92-100
  • Yasi One 99.0
  • فاصل 95% 97.0-100

LiveCodeBench

pass@1، بشروط مطابقة

  • Yasi One 89.6
  • لا توجد أي مادة منشورة قابلة للمقارنة بشروط مطابقة.
لوحة الدرجات

سطرنا مرجع، لا ترتيب.

تحت كل أداة تأتي القائمة العامة مرتبة ترتيباً صارماً بحسب الرقم، من أعلى حد أدنى نزولاً، ويحمل كل سطر صنف المصدر الذي جاء منه. أما سطرنا نحن فيقف على حدة، بوصفه مرجعاً: لم نُعد قياس رقم أحد، فلا ندّعي لأنفسنا موضعاً بينهم.

أرقام بتاريخ أغسطس 2026.

GPQA Diamond pass@1

النموذج الرقم المصدر
Yasi One خارج الترتيب 95.0 المجموعة الكاملة من 198 سؤالاً 97.1 القسم المحجوز (فاصل 95% 94.2-99.3) تشغيلنا
Gemini 3.1 Pro Preview 94.1-95.45 مستقل
GPT-5.6 Sol 94.1-95.2 مستقل
Kimi K3 93.5 مُجمِّع
GPT-5.5 93.5 مُجمِّع
Claude Opus 5 93.2-93.4 مُجمِّع
Grok 4.5 92.9-93.1 مُجمِّع
Gemini 3.6 Flash 92.8-93.4 مُجمِّع
Claude Fable 5 92.6-93.2 مُجمِّع
GPT-5.6 Terra 92.5-92.9 مُجمِّع

ينشر أحد المُقيِّمين العامين أيضاً نسخة مصححة لحالات الرفض، تختلف فيها بعض الأرقام اختلافاً ملموساً. وكل رقم من أرقام Yasi يحسب الرفض إخفاقاً، منذ اليوم الأول.

97.1 على القسم المحجوز يقف فوق كل قيمة منشورة، و95.0 على المجموعة الكاملة يقف في أعلى المدى المستقل، الذي حده الأعلى 95.45.

AIME pass@1، دون أدوات، أداة مشبعة

النموذج الرقم المصدر
Yasi One خارج الترتيب 99.0 majority@30 = 100 تشغيلنا
GLM-5.2 99.2 المزوّد
GPT-5.2 Pro / Codex 98.7-100 مُجمِّع
Claude Opus / Fable / Mythos variants 95-99.8 بطاقات النظام
Gemini 3 / 3.1 variants 95-100 المزوّد
Grok 4 / 4.5 variants ~92-100 مُجمِّع

تعادل عند السقف. الأداة مشبعة، فالذي يحد الأرقام هنا هو الاختبار لا المحركات.

LiveCodeBench pass@1

لقطات مستقلة بتاريخ 12 أغسطس 2026، مرتبة بحسب الرقم.

النموذج الرقم المصدر
Gemini 3 Pro Preview 91.7 مستقل
Gemini 3 Flash Preview 90.8 مستقل
Claude Fable 5 89.8 مُجمِّع
Yasi One خارج الترتيب 89.6 تشغيلنا، بالمُقيِّم الرسمي، وبشروط معلنة تشغيلنا
DeepSeek V3.2 Speciale 89.6 مستقل
Kimi K2.6 89.6 مُجمِّع
Claude Opus 5 89.0 مُجمِّع
Grok 4.5 87.3 مُجمِّع
GPT-5.x Codex 87-88 مُجمِّع

أرقام يعلنها المزوّد، ولم يتحقق منها طرف ثالث.

النموذج الرقم المصدر
DeepSeek V4 Pro 93.5 المزوّد
Qwen 3.7 Max 91.6 المزوّد

الصف الأول. في الكتلة المستقلة تقف قيمتان فوق تشغيلنا، ويضع أحد المُجمِّعين Claude Fable 5 عند 89.8، أي 0.2 فوقنا. وتقف مطالبتان من مزوّدين دون تحقق أعلى من ذلك. والشروط معلنة على سطرنا وحده.

مصادر مسماة: Artificial Analysis وVals.ai وBenchLM وpricepertoken، على لقطاتها لأغسطس 2026، ومعها إعلانات المزوّدين وبطاقات النظام. ولم نُعد نحن قياس هذه الأرقام. وأسماء المنتجات والنماذج ملك لأصحابها، ولا تُفهم منها أي تزكية.

كيف تُقرأ هذه السطور.

هذه تشغيلاتنا نحن، وإعادة التشغيل من طرف ثالث مدعوة. اقرأ السطور على حقيقتها: سطر منصة توجيه هو حد أقصى على ثلاثة عشر محركاً، بينما سطر المختبر نموذج واحد.

عمق المنصة

ثلاثة عشر محركاً، وإجابة واحدة موجَّهة.

كل نقطة محرك واحد على المجموعة المجمَّدة. والنقاط بلا أسماء، وخط المقدمة، أي الرقم الذي يقدمه التوجيه، مُعلَّم بالفيروزي.

GPQA Diamond

المجموعة الكاملة

خط المقدمة 95.0

AIME

دون أدوات

خط المقدمة 99.0

LiveCodeBench

pass@1

خط المقدمة 89.6

التفصيل لكل محرك متاح للشركاء بموجب اتفاق.

سجل الرفض

واحد وأربعون رفضاً، حُسبت جميعها إخفاقاً.

ترفض المحركات أحياناً سؤالاً علمياً حساساً لدواعي السلامة. فلا تصل إجابة، ولا يمكن عندها احتساب شيء صحيحاً، والدرجة الأمينة هي صفر. وقد سُجل في هذه الحملة واحد وأربعون رفضاً من هذا النوع، وحُسب كل واحد منها إخفاقاً في مواجهة نتيجتنا نحن، بدل أن يُسحب بهدوء من المقام. ويسد التوجيه هذا النقص بالطريقة الوحيدة القابلة للدفاع: يضع على المهمة أقوى محرك يقبل تنفيذها.

التلوث

كل درجة فوق 98 خضعت للطعن.

تستدعي أي درجة فوق 98 قاعدة الحفظ: تُفترض النتيجة استرجاعاً حتى يقول اختبار مضاد غير ذلك. ويقسم الاختبار المضاد المجموعة المجمَّدة قسمين، مسائل نُشرت في 2025 ومسائل نُشرت في 2026، أي بعد نوافذ التدريب المعنية. وبقيت الفوارق بين القسمين صغيرة، وسجل أحد المحركات المُعلَّمة نتيجة أعلى على مسائل 2026، وتلك بصمة قدرة لا بصمة استرجاع. وتبقى العلامات في السجل في الحالتين، لأن اختباراً لا يفعل سوى التبرئة ليس اختباراً.

سرعة الإجابة

عمق بلا الانتظار المعتاد.

العلوم

10.9 s

الوسيط (p50) حتى إجابة كاملة

الرياضيات

18.6 s

الوسيط (p50)، مع الثبات على 99.0 عبر ثلاثين تكراراً

العمق والسرعة يُدفع أحدهما ثمناً للآخر عادة. ومهمة التوجيه أن يرفض هذه المقايضة، مهمة بعد مهمة.

التوجيه

المهمة تذهب إلى الموجِّه. والإجابة تذهب حيث تقيس أفضل.

  1. الموجِّه يتسلم المهمة

    كل طلب يدخل عبر موجِّه Yasi، الذي يقرر أين ينتمي العمل قبل أن يراه أي محرك.

  2. الإجابات الدقيقة تذهب إلى محرك واحد

    على الأدوات ذات الإجابة الصحيحة الواحدة، تذهب المهمة إلى أقوى محرك منفرد.

  3. مجلس الشورى يتولى الأسئلة المفتوحة

    يخدم المجلس التفكير المفتوح والكتابة، حيث لا يحسم مفتاح واحد النتيجة.

بصراحة: على أدوات الإجابة الدقيقة، يحافظ التوجيه إلى محرك واحد على المقدمة، بينما يضاعف المجلس الكلفة دون أن يضيف دقة في الإجابة.

المجلس، مقيساً أمام محرك واحد.

منشور لا مخفي. وقاعدة الحكم كانت مثبتة قبل التشغيل.

التشغيل منفرد المجلس الفارق المزدوج فاصل 95% الكلفة الحكم
GPQA اختبار، 138 عنصراً 97.1 92.8 -4.4 [-8.0, -1.5] x5.6 TIE
AIME تطوير، 30 x 30 100.0 97.3 -2.7 [-4.2, -1.4] x4.0 TIE
AIME الاختبار المجمَّد، المجلس: NOT MEASURED. مطبوع كنقص، وغير مقدَّر أبداً.
  • TIE بقاعدة مثبتة مسبقاً.
المنهج

ست قواعد، ثُبتت قبل أول تشغيل.

  1. أدوات عامة

    كل أداة عامة ويتولاها طرف ثالث. لا مجموعة خاصة، ولا مقياس داخلي يصححه من يقيس عمله.

  2. أداة قياس مجمَّدة

    أداة قياس واحدة لكل المحركات وكل التشغيلات، مجمَّدة على التزام أصلي مُسمى وبذرة ثابتة، كي يُعاد التشغيل بدل أن يُروى.

  3. شروط معلنة

    الشروط معلنة سطراً بسطر. وحيث لا وجود لمقارنة بشروط مطابقة تطبع الصفحة الغياب، والقياس الذي لم ننفذه يُطبع نقصاً، ولا يُقدَّر ولا يُستكمل ولا يُستنتج أبداً.

  4. إحصاء لا انطباعات

    يحمل كل رقم رئيسي فاصل ثقة bootstrap عند 95%، والقاعدة التي تحوّل فارقاً مقيساً إلى حكم ثُبتت قبل التشغيلات، لا اختيرت بعد ظهور الأرقام. وهكذا يُنشر فارق نعرف قياسه تعادلاً رغم ذلك.

  5. سلامة مجموعة البيانات

    الدرجات فوق عتبة الحفظ تخضع للطعن على قسمة بحسب سنة النشر، وحالات الرفض الأمني تُحسب إخفاقاً بدل أن تغادر المقام.

  6. قابل للإعادة

    أداة القياس والالتزام الأصلي والبذرة والتكلفة تُسجَّل معاً، فيمكن إعادة كل تشغيل خلف هذه الصفحة وتقدير كلفته حتى القرش.

الحملة القادمة

المرحلة 2 من القياسات.

تتّسع مجموعة الأدوات. تتناول الحملة القادمة العمل الذي لا يسعه سؤال واحد وجواب واحد، وتجري وفق القواعد المحفوظة أعلاه: أداة قياس مجمَّدة، وشروط معلنة، ورفض يُحسب إخفاقاً، وغياب يُطبع بدل أن يُملأ. ولا يُعلن أي تاريخ في هذه الصفحة. ستُنشر الأرقام حين تكتمل الإجراءات، مهما جاءت.

  • هندسة برمجيات على مدى طويل
  • الطرفية واستخدام الحاسوب
  • الاسترجاع في سياق طويل
  • أداة لقياس مطابقة الوقائع
المسرد

كلمات هذه الصفحة، معرَّفة.

pass@1
محاولة واحدة لكل مسألة، تُصحح صواباً أو خطأً. لا إعادة، ولا اختيار أفضل من عدة محاولات.
majority@30
ثلاثون محاولة مستقلة لكل مسألة. وتُصحح الإجابة التي تتكرر أكثر من غيرها.
pass@5
خمس محاولات لكل مسألة. وتُحسب المسألة محلولة إذا صحت أي واحدة منها.
فاصل 95%
فاصل ثقة bootstrap عند 95%: المدى الذي يقع فيه الرقم تسع عشرة مرة من كل عشرين لو أُعيد التشغيل نفسه.
p50
الوسيط. نصف الإجابات يصل أسرع من ذلك، والنصف الآخر أبطأ.
NOT MEASURED
لم ننفذه. النقص يُطبع نقصاً، ولا يُقدَّر ولا يُستكمل ولا يُستنتج أبداً.

قيس على بنية Yasi One من 28 يوليو إلى 10 أغسطس 2026، على أدوات عامة، بأداة قياس داخلية مجمَّدة مشتقة من lm-evaluation-harness 0.4.12 (الالتزام الأصلي 6d64254، البذرة 20260728). أرقام المقارنة في لوحة النتائج مصدرها مُقيِّمون عامون وإعلانات مزوّدين وبطاقات نظام بتاريخ أغسطس 2026، دون تعديل ودون أن نُعيد قياسها، ودون أي تزكية من طرف ثالث. أسماء المقاييس ملك للقائمين عليها. ولا يُعاد إنتاج أي عنصر اختبار في هذه الصفحة.

المنهج خلف هذه الأرقام هو نفسه المنهج خلف كل إجابة.

Yasi One تصل قريبًا

نستعد للإطلاق بعناية فائقة. عودوا إلينا قريبًا جدًا.