اللوحة التي صحّحت نفسها علنًا: قصة تقييم النماذج العربية

وقت القراءة: 8 دقيقة
18
إيهاب صالح | techkahwa.net أُطلقت اللوحة: 14 أيار 2024 | تاريخ النشر: 4 حزيران 2024

الأرقام أولًا

المقياس النتيجة ما الذي يقيسه المصدر
تاريخ إطلاق اللوحة 14 أيار 2024 Hugging Face مع معهد الابتكار التكنولوجي مدوّنة الإطلاق
معيار AlGhafa الأصلي نحو اثنتي عشرة مجموعة بيانات، أغلبها عربية أصلية الأساس العربي Almazrouei وآخرون، ArabicNLP 2023
التوسعة اللاحقة إحدى عشرة مجموعة إضافية مترجَمة ما دخل بعد ذلك مدوّنة الإطلاق
معايير ACVA وAceGPT 58 مجموعة الثقافة والقيم مدوّنة الإطلاق
معايير مضافة MMLU وEXAMS مترجَمتان المعرفة مدوّنة الإطلاق
قبول المراجعين البشر للأسئلة المترجمة آليًا في AlGhafa 58٪ فقط جودة الترجمة الآلية، بشهادة بُناة المعيار ورقة AlGhafa
اعتراف النسخة الثانية، أولًا “كثير من المهام كانت ترجمات مباشرة من الإنجليزية، ما أدخل تباينات لغوية وسياقية” نقد ذاتي معلن مدوّنة OALL v2، 10 شباط 2025
الاعتراف الثاني “جزء كبير من المجموعات والمهام نشأ في سياقات غير ناطقة بالعربية” نقد ذاتي معلن المصدر نفسه
الاعتراف الثالث “بعض المعايير فقدت فاعليتها مع الوقت لأن النماذج قاربت الدرجة الكاملة” تشبّع المعيار المصدر نفسه
الخطأ البرمجي المعلن التحقق من الإجابة استعمل نص الخيارات بدل أرقامها، وأضرّ بالنماذج الصغيرة أكثر خلل في التصحيح أثّر على الترتيب المنشور المصدر نفسه

الصف الأخير هو أندر شيء في هذا المجال: جهة قياس تعلن أن حسابها كان فيه خطأ.


ما تغيّر بين النسختين

تركيبة لوحة التقييم العربي
عربي أصلي
مترجَم آليًا
عربي أصلي
مترجَم بشريًا
مترجَم آليًا
أُزيل
النسخة الأولى، أيار 2024
النسخة الثانية، شباط 2025

ملاحظة صريحة: هذا الرسم يوضّح اتجاه التغيير كما وصفه القائمون على اللوحة، لا نسبًا مئوية منشورة. القائمون وصفوا الحجم بكلمات مثل “كثير” و”جزء كبير” ولم ينشروا نسبة دقيقة، وأنا لن أخترع واحدة.


بطاقة اللوحة

البند التفصيل
الاسم Open Arabic LLM Leaderboard
الجهتان Hugging Face، ومعهد الابتكار التكنولوجي
تاريخ النسخة الأولى 14 أيار 2024
تاريخ النسخة الثانية 10 شباط 2025
ما أُزيل في الثانية المهام المشبعة والمترجمة آليًا
ما أُضيف MMLU عربية أصلية بأربعين مهمة، وMMLU مترجمة بشريًا بسبع وخمسين مهمة، وMedinaQA، وAraTrust، وALRAGE للاسترجاع

قراءة ARAB-LENS: لماذا أحترم هذه اللوحة أكثر بعد أخطائها

سأقول رأيًا قد يبدو غريبًا: النسخة الثانية من هذه اللوحة أهم من النسخة الأولى، وأهم ما فيها هو اعترافها.

لنفكك ما حدث.

في أيار 2024 أُطلقت أول لوحة ترتيب عربية جادة. وهذا بحد ذاته إنجاز: قبلها، من أراد أن يعرف أي نموذج أفضل بالعربية كان يعتمد على انطباعات. اللوحة أعطت المنطقة مرجعًا مشتركًا.

ثم بعد تسعة أشهر، نشر القائمون عليها تقييمًا لعملهم، واعترفوا بثلاثة أشياء.

الأول: كثير من المهام كانت ترجمات مباشرة. وهذا ما ظللتُ أكرره في كل مقالة من هذه السلسلة، والآن يقوله أصحاب المعيار عن معيارهم. ليس اتهامًا من الخارج، بل تشخيصًا من الداخل.

الثاني: جزء كبير من المحتوى نشأ في سياقات غير عربية، و”غالبًا ما فشل في عكس حالات الاستعمال الحقيقية أو تلبية الاحتياجات العملية للمجتمعات الناطقة بالعربية”. اقرأ الجملة مرة ثانية. هذه لوحة تقول عن نفسها إنها كانت تقيس شيئًا آخر.

الثالث، وأكثرها إثارة: خطأ برمجي في التصحيح. آلية التحقق من الإجابة في مهام AlGhafa كانت تستعمل نص الخيارات نفسه بدل مؤشراتها الرقمية. ونتيجة هذا الخطأ، بحسب وصفهم، أنه أضرّ بالنماذج الصغيرة أكثر من غيرها.

ما معنى هذا عمليًا؟ معناه أن ترتيبًا منشورًا لتسعة أشهر، بنت عليه فرق قرارات وبنت عليه شركات خطط، كان متأثرًا بخلل في الكود. ونموذج صغير ربما بدا أضعف مما هو.

ولماذا أحترم هذا بدل أن أهاجمه؟

لأن البديل أسوأ بكثير. البديل أن يُكتشف الخطأ من الخارج، أو ألّا يُكتشف أبدًا، أو أن يُصحَّح بصمت في تحديث لا يقرؤه أحد. ما حدث هنا أن فريقًا نشر نقد نفسه بالتفصيل، وأعاد بناء الأداة.

وأنا أكتب هذه السلسلة كلها على قاعدة واحدة: الرقم بلا طريقة ليس رقمًا. وهذه اللوحة، بنسختها الثانية، فعلت بالضبط ما أدعو إليه: نشرت طريقتها، ونقدتها، وأصلحتها.

لكن لي ملاحظتان نقديتان تبقيان.

الأولى: تسعة أشهر مدة طويلة. وخلالها اتُّخذت قرارات حقيقية بناءً على أرقام معطوبة. ولا توجد آلية لإبلاغ من بنى على الأرقام القديمة.

والثانية، وهي الأعم: مشكلة التشبّع. حين تقارب النماذج الدرجة الكاملة على معيار، يتوقف المعيار عن التمييز بينها. وهذا يعني أن كل معيار عربي له عمر افتراضي، وأن بناء المعايير ليس مشروعًا يُنجز مرة، بل التزامًا مستمرًا. والمنطقة ما زالت تتعامل مع المعايير كمشاريع لا كبنية تحتية.


من دفتر الاختبار: كيف تقرأ أي لوحة ترتيب عربية

سبعة أسئلة أطرحها على أي لوحة قبل أن أصدّق رقمًا منها.

السؤال لماذا يهم علامة الإنذار
ما نسبة المهام المترجمة آليًا؟ الترجمة تقيس شيئًا آخر إن لم يكن الجواب منشورًا
متى شُغّل التقييم؟ النماذج تتغير بالأسماء نفسها إدخالات بلا تاريخ
أي مقياس، acc أم acc_norm؟ الفرق قد يتجاوز عشرين نقطة عمود واحد بلا تسمية
هل النموذج رسمي أم نسخة مجتمعية؟ نسخة معدّلة ليست النموذج اسم صاحب غير معروف
هل المعيار مشبع؟ إن كان الجميع فوق 90، لا يميّز تقارب النتائج في القمة
هل تغطي اللهجات؟ أغلب اللوحات فصحى فقط لا ذكر للهجات
هل نُشر الخطأ المعياري؟ فرق نقطتين قد يكون ضجيجًا أرقام بلا هوامش

بند إضافي: اختبار الحساسية.

إن كان عندك وصول إلى نموذجين متقاربين في الترتيب، بفارق نقطة أو نقطتين، شغّل عليهما امتحانك الخاص المكوّن من خمسين سؤالًا. في تجربتي، الفارق الذي تراه على اللوحة لا يتنبأ بالفارق الذي تراه على بياناتك. ومرات كثيرة ينقلب الترتيب تمامًا.

وهذا ليس عيبًا في اللوحة، إنه طبيعة القياس: اللوحة تقيس متوسطًا عامًا، وأنت تحتاج أداءً على حالتك الخاصة.

بند أخير: ما الذي لا تقيسه أي لوحة عربية حتى اليوم؟

البعد هل يُقاس؟
الفصحى، اختيار من متعدد نعم، جيدًا
المعرفة العامة نعم
اللهجات مكتوبة جزئيًا، وبضعف
اللهجات منطوقة لا، لوحات منفصلة
البراغماتية والسياق لا
الرفض الصحيح بالعربية لا
الثبات عبر الجلسات لا
جودة التوليد الطويل نادرًا

نصف هذا الجدول فارغ من ناحية التغطية. وهذا ليس نقدًا للقائمين، بل وصف لحالة المجال. ومن يبني منتجًا عربيًا اليوم، يقيس نصف ما يحتاج.

بند إضافي ثانٍ: كيف تبني معيارك الصغير المضاد.

المعايير العامة تشبع وتتقادم. معيارك الخاص لا. هذه طريقة بناء “معيار مضاد” في يوم واحد:

الخطوة التفصيل
1 اجمع عشرين سؤالًا أخطأ فيها نموذجك الحالي
2 صنّفها: نحو، لهجة، معرفة، براغماتية، رفض
3 اكتب الجواب المرجعي لكل واحد بنفسك
4 شغّلها على كل نموذج جديد
5 أضف سؤالًا جديدًا كل شهر من شكاوى العملاء

لماذا الأسئلة التي أخطأ فيها تحديدًا؟ لأن المعيار المفيد هو الذي يميّز، والأسئلة التي ينجح فيها الجميع لا تميّز شيئًا. وهذا بالضبط درس التشبّع الذي اعترفت به اللوحة.


تسلسل زمني لتقييم العربية

التاريخ الحدث الأثر
2020 إلى 2022 ARLUE وARGEN أول معايير عربية أصيلة
كانون الأول 2023 AlGhafa معيار اختيار من متعدد، أغلبه أصيل
شباط 2024 ArabicMMLU أول امتحان مدرسي عربي واسع
أيار 2024 لوحة OALL النسخة الأولى أول مرجع مشترك
شباط 2025 لوحة OALL النسخة الثانية نقد ذاتي وإزالة المترجَم

خمس محطات في خمس سنوات. وهذا أسرع مما يظن كثيرون، وأبطأ مما نحتاج.

والملاحظة التي أختم بها: أربع من هذه المحطات الخمس بنتها فرق عربية أو بتمويل عربي. المعايير هي المجال الوحيد في هذه السلسلة كلها الذي تقوده المنطقة فعلًا. وأنا أرى أن هذا هو المكان الصحيح للاستثمار: من يملك المعيار، يحدّد اتجاه التحسين.


الحكم العملي

استعمل اللوحات للفرز الأولي، لا للقرار النهائي. اللوحة تختصر لك قائمة من ثلاثين نموذجًا إلى خمسة. أما اختيار الواحد من الخمسة فيحتاج امتحانك أنت.

واحفظ تاريخ الرقم مع الرقم. “سجّل كذا على النسخة الأولى من اللوحة في أيار 2024” جملة صحيحة اليوم. وبلا تاريخ تصير الجملة خاطئة بعد تحديث واحد.

والأهم: حين ترى جهة تنشر نقد نفسها، ثِق بها أكثر لا أقل. ومن لا ينشر أخطاءه أبدًا، إما أنه لا يخطئ، وهذا مستحيل، أو أنه لا يبحث عنها.


المقالة القادمة

بعد يومين من هذه اللوحة، أطلقت Cohere For AI نموذج Aya 23، وهو نموذج مفتوح بثلاث وعشرين لغة. والعربية أول لغة في قائمته. المقالة القادمة عن تجربة اختارت العمق على الاتساع، وعن معنى أن تكون لغتك من الثلاث والعشرين لا من المئة وواحدة.


المصادر

  • Hugging Face وTII، Introducing the Open Arabic LLM Leaderboard، 14 أيار 2024: huggingface.co/blog/leaderboard-arabic
  • Hugging Face، The Open Arabic LLM Leaderboard 2، 10 شباط 2025: huggingface.co/blog/leaderboard-arabic-v2
  • Almazrouei وآخرون، AlGhafa Evaluation Benchmark for Arabic Language Models، ArabicNLP 2023، الصفحات 244 إلى 275: aclanthology.org/2023.arabicnlp-1.21