كيف تُحسب النتائج
تجمع مَحَكّ النتائج من مصدرين: تصويت المجتمع ومعايير التقييم. إليك كيف يعمل كل منهما.
تصويت المجتمع
يصوّت المجتمع على كل مخرَج بصوت إيجابي أو سلبي. لا تُحتسب الأصوات المتطابقة من المستخدم نفسه على نفس المخرَج — صوت واحد لكل مستخدم لكل مخرَج.
معايير التقييم (Rubric)
لكل مطالبة معايير تقييم محددة. يقيّم المجتمع كل مخرَج وفق هذه المعايير بنظام نجاح/فشل. تُجمع نتائج المعايير لحساب نسبة الالتزام بكل معيار.
درجة ويلسون (Wilson Score)
لا تعتمد مَحَكّ على المتوسط الحسابي البسيط — فهو يُحابي المخرجات القليلة الأصوات. بدلًا من ذلك، نستخدم حد ويلسون السفلي بنسبة ثقة 95%:
- مخرَج له 9 أصوات إيجابية من 10 يحصل على درجة أقل من مخرَج له 90 من 100، رغم أن النسبة نفسها.
- هذا يضمن أن المخرَج الذي حصل على أصوات أكثر يحصل على ثقة أعلى.
- المخرجات ذات الأصوات القليلة تُصنّف كـ «مبدئية» حتى تصل إلى عتبة الثقة.
نظام Elo للساحة
تعرض المصفوفة تصنيف النموذج المسجّل في الساحة على مستوى المنصة. وتظهر عبارة «غير متاح» حتى يخوض النموذج جولة مسجّلة. لا يحوّل اختيار مجال محدد هذا التصنيف العام إلى تصنيف خاص بالمجال.
في الساحة، تُقارن النماذج في جولات ثنائية مزدوجة التعمية. بعد كل جولة:
- يُحدَّث تصنيف Elo للنموذجين بناءً على النتيجة.
- معامل K = 32 للنماذج الجديدة (أقل من 30 جولة) لتسريع التكيف.
- معامل K = 16 للنماذج المتأقلمة (30 جولة أو أكثر) لاستقرار التصنيف.
- الاحتمال المتوقع يُحسب بمعادلة برادلي-تيري:
1 / (1 + 10^((ratingB - ratingA) / 400)). - الفائز يكتسب نقاطًا والخاسر يفقدها نفس المقدار — صفر مجموعي.
تصنيف جودة العينة
تُلخّص درجة النموذج نتائج المهام المؤهلة ضمن النطاق المختار. وهي متوسط حدود ويلسون السفلى لهذه النتائج على مقياس من صفر إلى مئة. تتأهل نتيجة المهمة حين تضم مخرجًا منشورًا وخمسة أصوات على الأقل. لا تدخل المهام الخالية أو الأقل تصويتًا في هذا المتوسط. وحين لا تتأهل أي نتيجة، تكون الدرجة غير متاحة؛ أما الصفر الناتج عن تقييم فعلي فيبقى درجة صحيحة.
يبقى ملخص النموذج مبدئيًا حتى تكون له نتيجة معايرة في كل مهمة ضمن النطاق المختار. لذلك تمنع التغطية الناقصة وصف الملخص بأنه معاير. تُطبّق قواعد فض التعادل على النماذج ذات الدرجات، ثم تُعرض النماذج التي لم تتوافر لها درجة.
يُحسب كل مقيّم مرة واحدة ضمن نتائج المهمة للنموذج نفسه. فإذا قيّم شخصان ثلاثة مخرجات، كان المجموع ستة أصوات من مقيّمين اثنين. لا يثبت هذا العدد وحده استقلال التقييمات إحصائيًا، ولا يغيّر عتبات التصويت الحالية المبينة أدناه.
سياسة الأهلية (eligibility-1)
تُقرَّر أهلية نتيجة المهمة بسياسة واحدة إصدارية قابلة للتفسير — الدالة نفسها تخدم النتائج الحية والمخزّنة وملخصات النماذج والتصديرات وتسميات التقدّم. كل قرار يحمل أسبابًا مقروءة آليًا، وتُعرض التغطية الناقصة كناقصة، لا كدرجة ضعيفة.
تصبح النتيجة مبدئية (قابلة للترتيب) بخمسة أصوات على الأقل من مصوّتين مستقلّين على الأقل (معرّفات مستخدمين مميزة). وتصبح معايَرة بثلاثين صوتًا على الأقل من ثلاثة مصوّتين مستقلّين على الأقل ومساهمَين اثنين على الأقل. ثلاثون صوتًا من شخص واحد لا تصبح أبدًا دليلًا مستقلًا، والمخرجات غير المنشورة لا تُحتسب أبدًا.
تحمل كل نتيجة حقلَي eligible وeligibility_reasons — رموزًا مثل
independent_raters_below_provisional_minimum أو
votes_below_calibrated_threshold — مع إصدار السياسة وتعريف المجتمع، بحيث
يمكن إعادة تشغيل أي لقطة والتحقق منها في ظل السياسة نفسها التي أنتجتها.
عدم اليقين ومجموعات التداخل (uncertainty-1)
تحمل ملخصات النماذج كتلة صريحة لقوة الدليل: التقدير وفاصل الثقة 95٪ وعدد الخلايا المؤهلة ومجموع الأصوات، أو «غير متاح» صراحةً حين تقل الخلايا المؤهلة عن اثنتين. يُنشر الفاصل عبر متوسط فواصل ويلسون للخلايا، شاملاً الاختلاف بين المهام — بصيغة مغلقة وحتمية، فلا يُنفَّذ أي إعادة معاينة في الطلبات العامة.
النماذج التي تتداخل فواصل ثقتها تُشكّل مكونات متصلة تُدرج في indistinguishable_groups. هذا وصف
للفصل فقط: تداخل الفواصل المتصل لا يثبت تكافؤ النماذج في القدرات، ونقاط النهاية المتماسة تُعد تداخلاً،
والفواصل المنفصلة ليست اختبار معنوية إحصائية رسمية. ويعرض رأس المصفوفة الفاصل نصًا (مع ملاحظة لقارئ
الشاشة بأن فواصل الثقة المتداخلة ليست اختبار معنوية ولا تعني تكافؤ النماذج)، فلا يعتمد بيان قوة الدليل على اللون وحده.
مرجع المنهجية: Chatbot Arena (ICML 2024) لمنهجية إعادة المعاينة العنقودية —
اتجاه مستقبلي، لا المُقدِّر الحالي.
تُصنّف كل نتيجة حسب حجم العينة:
- 0–4 أصوات (بانتظار التقييم): تُعرض في المصفوفة مع مؤشر التقدم لدعوة المساهمين لمعايرتها.
- مبدئي: 5–29 صوتًا — يُحسب الحد الأدنى لويلسون بثقة 95٪.
- مُعاير: 30 صوتًا فأكثر — نتيجة مستقرة مكتملة المعايرة.