تشغيل التقييم الكامل عبر وكيل ذكاء اصطناعي
انسخ المربع أدناه والصقه في أي وكيل برمجة (Codex وOpenCode وDroid وAgy
وCMD). يقيس الوكيل النموذج قيد الاختبار على جميع مطالبات مَحَكّ ويعيد
ملاحظات منظمة. وإن فضّلت ملفًا نصيًا جاهزًا للنسخ أو الجلب، فالنص الكامل
في /benchmark-prompt.md.
أنت تقيّم نموذج ذكاء اصطناعي لمنصة مَحَكّ (https://mahak.waqf.dev)، وهي
منصة مجتمعية تقيس الفصاحة العربية: العقود والمراسلات والكتابة الإبداعية
وخدمة العملاء والالتزام بالتعليمات.
الإعدادات (املأها قبل البدء):
MAHAK=https://mahak.waqf.dev
PAT=<رمز شخصي من /ar/token — مطلوب للنشر الفوري، انظر أدناه>
MODEL_SLUG=<اسم النموذج قيد الاختبار بصيغة kebab-case مثل muse-spark>
HANDLE=@<اسمك المستعار، من 3 إلى 24 حرفًا، مثل معرّفك على X>
AUTH="Authorization: Bearer $PAT"
مجلد المخرجات:
responses/<HANDLE بدون @>/<MODEL_SLUG>/ ملف واحد لكل مطالبة، باسم p_XX مع الامتداد المطابق للصيغة المطلوبة (.json للمطالبات التي تطلب JSON، و.txt للمطالبات التي تطلب YAML أو CSV أو نصًا حرًا). مثال: responses/jadmadi/muse-spark/p_01.json
الخطوة ٠ — اجلب المطالبات. جرّب الواجهة البرمجية أولًا؛ وانتقل إلى ملف البذور المحلي عند تعذّر الوصول. لا تبحث في الويب عن محتوى المطالبات.
جرّب الواجهة:
curl -sS --max-time 20 $MAHAK/api/prompts
القائمة داخل JSON في data.prompts (والعدد في data.count)، وكل عنصر
فيها يحمل المعرف والslug والمجال والنص العربي. أكّد لي العدد.
الاحتياطي (ملف البذور المحلي):
عند تعذّر الوصول، أبلغني بالخطأ الفعلي مرة واحدة (الأمر + رسالة
الخطأ)، ثم اقرأ المطالبات من ملف البذور في المستودع:
src/db/seeds/prompts.json
وهو مصفوفة JSON من ٢٥ مطالبة، كل واحدة تحتوي على id وslug و
title_ar وtitle_en وbody_ar وdomain_id. استخدمها كما هي. لا تخترع
معرفات أو نصوصًا أو مخرجات.
انحصار الشبكة يعني التبديل إلى وضع آخر، لا الفشل. وكل ما في هذا التوجيه يبقى كما هو.
الخطوة 1 — التشغيل. لكل مطالبة بترتيب المعرف (من p_01 إلى p_25): خذ
نصها العربي body_ar وشغّله حرفيًا في النموذج قيد الاختبار (هذا
النموذج ما لم أسمِّ غيره). لا تحرر المطالبة ولا تترجمها ولا تختصرها
ولا تشرحها. اجمع كل الردود أولًا — الحفظ والإرسال يأتيان تاليًا.
إذا طلبت المطالبة مخرج JSON: احفظ الرد بصيغة p_XX.json. إذا طلبت YAML أو CSV أو نصًا حرًا: احفظ بصيغة p_XX.txt. محتوى الملف هو مخرج النموذج الخام بايتًا ببايت، بلا أسوار markdown ولا مقدمات ولا تعليقات.
الخطوة 2 — احفظ محليًا. اكتب كل رد في ملفه تحت
responses/<HANDLE without @>/<MODEL_SLUG>/. أنشئ المجلد إن لم يكن
موجودًا. كل ملف هو مخرج النموذج الخام فقط.
الخطوة 3 — الإرسال (اخياري، مكالمة واحدة). إذا توفر رمز PAT، أرسل
جميع الردود في دفعة واحدة:
POST $MAHAK/api/outputs/batch مع ترويسة $AUTH:
{ "items": [
{ "prompt_id": "<المعرف>", "model_slug": "<MODEL_SLUG>",
"output_text": "<الرد حرفيًا بايتًا ببايت>",
"handle": "<HANDLE>", "provenance": "self_reported",
"telemetry": { "engine": "api" },
"idempotency_key": "<UUID v4 جديد لكل عنصر>" },
... عنصر لكل مطالبة (25 كحد أقصى للمكالمة)
] }
توقع 207 مع نتائج لكل عنصر. 201 = منشور. 409 = مكرر، تابع.
429 = التزم بـ Retry-After.
إذا لم يتوفر رمز PAT، تخطَّ هذه الخطوة. الملفات المحلية تحت
responses/<HANDLE without @>/<MODEL_SLUG>/ هي المُسلَّم النهائي.
الخطوة 4 — الملاحظات. لخص لي:
(أ) اقتراحات kind=domain التي اكتشفتها أثناء العمل (title_ar وbody_ar
يبرر سبب استحقاقها التقييم)، و
(ب) مقترحات kind=prompt للمجالات الجديدة أو القليلة (domain_slug
والعنوان العربي والنص العربي الكامل بشروط على غرار المجموعة
الحالية)، و
(ج) احتكاك المشروع: كل ما أربكك أو تعطّل أو تباطأ، مع النقطة ورمز الحالة.
القواعد: الصق output_text حرفيًا ولا تحسّنه. ملف واحد لكل رد. لا
تصوّت لمشاركاتك أبدًا. لا ترسل نصوص المطالبات كمخرجات أبدًا. لا تكتب
رمز PAT أو ترويسة Authorization أو أي سر آخر في الملفات المحفوظة.
نصائح للبشر
- يغطي التشغيل 25 مطالبة، فتوقع عدة دقائق مع فواصل الإيقاع.
- راجع جدول التقرير، ثم الصق الأقسام (ب)-(د) كمقترحات مطالبات من صفحة المساهمة أو افتح issue على GitHub.
- تفضّل MCP؟ تنطبق الحلقة نفسها عبر
POST /mcp(list_promptsثمget_promptثمsubmit_output) مع PAT في ترويسة Bearer.