تخطَّ إلى المحتوى
مَحَكّ

الأسئلة الشائعة

ما هي مَحَكّ؟

مَحَكّ منصّة مجتمعية مفتوحة تقيس كفاءة نماذج الذكاء الاصطناعي في العربية عبر مهام عملية من الحياة اليومية: عقود، مراسلات، كتابة إبداعية، وخدمة عملاء.

هل بياناتي عامة؟

نعم. مَحَكّ مشروع مفتوح المصدر. المطالبات والمخرجات والتقييمات كلها عامة ويمكن لأي شخص الاطلاع عليها. لا توجد بيانات خاصة تُجمع من المستخدمين. يستخدم الموقع تحليلات Cloudflare بدون ملفات تعريف ارتباط (cookieless) لقياس الزيارات فقط.

كيف أساهم؟

انسخ مطالبة من صفحة المهام، شغّلها في أي نموذج ذكاء اصطناعي، ثم ارفع الناتج من صفحة المساهمة مع تفاصيل التشغيل. راجع دليل المساهمة للتفاصيل الكاملة.

لماذا المقارنة العمياء؟

المقارنة العمياء تزيل التحيز لاسم النموذج أو شهرته. في الساحة، تُعرض مخرجات نموذجين دون كشف هويتهما، ويصوّت المقوّم للأفضل بناءً على جودة الناتج وحدها. هذا يضمن عدالة التقييم.

كيف أثق بالنتائج؟

المنهجية مفتوحة بالكامل. نستخدم حد ويلسون السفلي بدلًا من المتوسط البسيط لتجنب تضخيم المخرجات القليلة الأصوات. نظام Elo يستخدم معاملات K مختلفة للنماذج الجديدة والمتأقلمة. كل صيغة الحساب متاحة في الكود المصدري على GitHub.

ما هي معايير التقييم؟

كل مطالبة مرفقة بمعايير محددة تنقسم إلى إيجابية (ما يجب أن يتوفر) وسلبية (ما يجب ألا يتوفر). لكل معيار وزن يحدد أهميته. راجع تعريف المجالات ومعايير التقييم للتفاصيل.

هل يمكنني تقييم مخرجات الآخرين؟

نعم. يمكن لأي عضو في المجتمع التصويت على المخرجات وتقييمها وفق المعايير. كل صوت يساهم في دقة النتائج.

ما الفرق بين «مبدئي» و«معاير»؟

الخلايا التي تحصل على أقل من 5 أصوات تُصنّف «غير كافية» لحساب ترتيب موثوق. بين 5 و29 صوتًا تُصنّف «مبدئية». عند وصولها إلى 30 صوتًا أو أكثر تُصنّف «معايرة». هذا التدرج يضمن دقة الترتيب الإحصائي ويمنع تضخيم العينات الصغيرة.

كيف أبلغ عن مشكلة؟

افتح issue على مستودع GitHub الخاص بالمشروع. نرحب بالتبليغات عن الأخطاء والاقتراحات.