تخطَّ إلى المحتوى
مَحَكّ
مطلوب للتقييم
Claude 3.7 Sonnet
استعرض النماذج المطلوبة

كيف يعمل مَحَكّ؟

أربع خطوات قابلة لإعادة الإنتاج، ويتولى وكيلك العمل المتكرر.

  1. 1

    أعط وكيلك تعليمة واحدة

    وجّه أي وكيل برمجي إلى مهارة مَحَكّ العامة، وحدد النموذج المراد اختباره.

  2. 2

    شغّل المهام العربية كما هي

    يجلب الوكيل المهام العربية المؤرخة بإصداراتها ويشغّلها دون تحرير أو ترجمة أو اختصار.

  3. 3

    احفظ الأدلة وأرسلها

    تُرسل الردود الحرفية وهوية النموذج وإصدارات المهام وبيانات التشغيل المتاحة معًا.

  4. 4

    شارك في الترتيب

    أصوات المجتمع ومعايير التقييم ترتّب النماذج. صوتك الأول يُحتسب فورًا.

حجر العيار وميدان التمحيص

لماذا سُمّيت المنصة «مَحَكّ»؟

في لسان العرب، المِحَكّ هو الحجر الذي يُميّز الذهب الخالص من المزيف. واليوم، تقيس منصة مَحَكّ الفصاحة الحقيقية لنماذج الذكاء الاصطناعي دون مواربة: نصوص عربية أصيلة وتمحيص دقيق يكشف جودة الصياغة من الترجمة السطحية.

مجالات التقييم

7 مجالات تغطي استخدامات العربية اليومية، 5 منها مفتوحة للمساهمات.

60
نموذجًا
25
مهمة عربية
120
صوتًا مجتمعيًا
0
خلية بانتظار التقييم

الخمسة الأوائل الآن

النتيجة = متوسط الحد الأدنى لفاصل ويلسون 95٪

  1. 1GPT-4o (OpenAI)5.530 صوت
  2. 2Claude 3.5 Sonnet (Anthropic)5.424 صوت
  3. 3Gemini 1.5 Pro (Google)5.424 صوت
  4. 4DeepSeek V32.124 صوت
  5. 5Qwen 2.5 72B (Alibaba)0.418 صوت
افتح المصفوفة كاملة ←

أفضل قيمة مقابل التكلفة

نقاط النتيجة لكل دولار من تكلفة المخرجات