أربعة عشر ألف سؤال من مدارسنا: الامتحان الذي فضح الأرقام المترجمة

وقت القراءة: 8 دقيقة
18
إيهاب صالح | techkahwa.net صدرت الورقة: 20 شباط 2024 | تاريخ النشر: 5 آذار 2024

الأرقام أولًا

المقياس النتيجة ما الذي يقيسه المصدر
عدد الأسئلة 14,575 سؤال اختيار من متعدد حجم الامتحان ورقة ArabicMMLU، Findings of ACL 2024
عدد المهام 40 مهمة اتساع المجالات الورقة نفسها
عدد الدول المصدر 8 دول عربية التنوّع الجغرافي الورقة نفسها
الدول المغرب ومصر والأردن وفلسطين ولبنان والإمارات والكويت والسعودية من أين جاءت الأسئلة الورقة نفسها
نسبة الترجمة الآلية صفر ما يميّزه عن كل ما سبقه الورقة نفسها
عدد النماذج المقيَّمة 35 نموذجًا حجم المسح الورقة نفسها
GPT-4 72.5٪ الأعلى بين الجميع الورقة نفسها
GPT-3.5 57.7٪ الفارق بين الجيلين: 14.8 نقطة الورقة نفسها
Jais-chat 30B 62.3٪ أفضل نموذج مفتوح الورقة نفسها
Jais-chat 13B 54.8٪ النسخة الأصغر الورقة نفسها
LLaMA2-13B 36.1٪ نموذج عالمي بلا عربية معلنة الورقة نفسها
Falcon 40B 34.8٪ نموذج عربي المنشأ الورقة نفسها
التخمين العشوائي 29.0٪ خط القاع الورقة نفسها
توزيع المراحل الدراسية ابتدائي 22.2٪، إعدادي 12.2٪، ثانوي 34٪، جامعي 6.1٪، والباقي غير مصنّف بنية الامتحان الورقة نفسها

الرقم الذي أريدك أن تحمله معك: 72.5٪ لـ GPT-4 هنا، مقابل 80٪ على MMLU المترجَمة. الامتحان العربي الأصلي أصعب بسبع نقاط ونصف على النموذج نفسه.


خريطة النتائج، من القاع إلى القمة

ArabicMMLU، متوسط الدقة
التخمين العشوائي
29.0٪
Jais-13B الأساسي
32.2٪
Falcon 40B
34.8٪
LLaMA2-13B
36.1٪
Jais-chat 13B
54.8٪
GPT-3.5
57.7٪
Jais-chat 30B
62.3٪
GPT-4
72.5٪

لاحظ الصفوف الثلاثة الأولى بعد التخمين. ثلاثة نماذج شهيرة جدًا تقف على بعد ثلاث إلى سبع نقاط من رمي النرد.


بطاقة المعيار

البند التفصيل
الاسم ArabicMMLU
الفريق Koto وLi وShatnawi وDoughman وSadallah وAlraeesi وAlmubarak وAlyafeai وSengupta وShehata وHabash وNakov وBaldwin
تاريخ الورقة شباط 2024
مكان النشر Findings of ACL 2024، الصفحات 5622 إلى 5640
اللغة الفصحى
المصدر امتحانات مدرسية حقيقية
المنهجية بناء بالتعاون مع متحدثين أصليين في المنطقة
ما لا يغطّيه اللهجات، الكلام المنطوق، البراغماتية، التوليد الحر

قراءة ARAB-LENS: ثلاثة أشياء كشفها هذا الامتحان

الأول: الترجمة كانت تجمّل الصورة.

هذا أهم استنتاج. النموذج نفسه، GPT-4، يسجّل 80٪ على امتحان مترجَم آليًا و72.5٪ على امتحان كُتب بالعربية أصلًا. الفرق سبع نقاط ونصف، والورقة نفسها تشير إلى الرقم المترجَم وتقارن به.

سبع نقاط ونصف ليست تفصيلًا. في ترتيب النماذج، سبع نقاط قد تعني ثلاثة مراكز. ولو كانت كل القرارات العربية في 2023 اتُّخذت على أساس الأرقام المترجمة، فقد اتُّخذت على صورة أجمل من الواقع.

الثاني: الفجوة بين النماذج العربية والعالمية أضيق مما يُظن، لكن في اتجاه محدد.

انظر: Jais-chat 30B سجّل 62.3٪، وGPT-3.5 سجّل 57.7٪. نموذج عربي مفتوح تفوّق على GPT-3.5 في امتحان عربي أصلي. هذا خبر كبير ولم يأخذ حقه إعلاميًا.

لكن انظر أيضًا: GPT-4 سجّل 72.5٪، أي عشر نقاط فوق أفضل نموذج عربي. والفجوة هنا ليست فجوة عربية، إنها فجوة قدرة عامة. GPT-4 أذكى، والذكاء ينتقل إلى العربية.

وهذا يعطينا القاعدة التي تكررت في هذه السلسلة: التخصص العربي يهزم الحجم المتوسط، ولا يهزم الحجم الكبير.

الثالث، وهو نقدي على الامتحان نفسه: ArabicMMLU إنجاز كبير، وأنا أستعمله وأثق به. لكن يجب أن نعرف حدوده.

هو امتحان اختيار من متعدد، بالفصحى، من مناهج مدرسية. وهذا يعني ثلاثة أشياء لا يقيسها: لا يقيس اللهجات، ولا يقيس التوليد الحر، ولا يقيس البراغماتية. نموذج يسجّل 72.5٪ هنا قد يكون عاجزًا تمامًا عن كتابة رسالة شامية طبيعية، أو عن فهم أن “خلينا نشوف” تعني لا.

ولاحظ تفصيلًا في الجدول: نسب المراحل الدراسية تجمع 74.5٪ فقط، والربع الباقي غير مصنّف. هذه ملاحظة صغيرة لكنها تذكّرك أن كل معيار، مهما كان جيدًا، فيه مناطق غير محدّدة. ومن يقتبس رقمًا من معيار دون أن يقرأ حدوده، يقتبس نصف الحقيقة.


من دفتر الاختبار: بناء امتحانك العربي الخاص

ArabicMMLU يقيس المعرفة المدرسية. منتجك لا يبيع معرفة مدرسية. هذه طريقتي في بناء امتحان يقيس ما يهمك فعلًا.

الخطوة الأولى: خمس فئات، عشرة أسئلة لكل فئة.

الفئة مثال من قطاع التجارة الإلكترونية
معرفة المنتج “شو الفرق بين الضمان والاستبدال عندكم؟”
فهم اللهجة “المقاس طلع صغير، بدي أبدله. كيف؟”
البراغماتية “طلبيتي تأخرت أسبوع ومحدا رد عليي.”
الحساسية الثقافية “بدي هدية لعروس، شو بتنصحوني؟”
الرفض الصحيح “بدي رقم موبايل المدير الشخصي.”

الفئة الأخيرة هي التي ينساها الجميع. النموذج الجيد يرفض بأدب وبالعربية الصحيحة، لا يرفض بالإنجليزية ولا يوافق.

الخطوة الثانية: اكتب أسئلتك بثلاث لهجات.

السؤال نفسه بالشامي والمصري والخليجي. وهذا يضاعف حجم امتحانك ثلاث مرات ويعطيك أهم معلومة عندك: أي لهجة يخدمها منتجك فعلًا؟

الشامي المصري الخليجي
“بدي أرجّع الطلبية” “عايز أرجّع الأوردر” “أبي أرجع الطلب”
“شو رقم الشحنة؟” “إيه رقم الشحنة؟” “وش رقم الشحنة؟”
“ما وصلني شي لهلق” “مجاليش حاجة لحد دلوقتي” “ما وصلني شي لين الحين”

الخطوة الثالثة: صحّح بمقياس ثلاثي لا بصح وخطأ.

الدرجة المعنى
2 صحيح وبلهجة السائل
1 صحيح لكن بالفصحى أو بلهجة أخرى
0 خاطئ أو بالإنجليزية أو رفض في غير محله

الفرق بين 2 و1 هو الفرق الذي يحدّد رضا العميل، ولا يقيسه أي معيار عالمي.

الخطوة الرابعة: احتفظ به ولا تغيّره.

خمسون سؤالًا ثابتة تشغّلها مع كل نموذج جديد ومع كل ترقية. بعد سنة يصير عندك منحنى حقيقي لمنتجك أنت. وهذا في رأيي أنفع بمئة مرة من متابعة لوحات الترتيب العالمية.

البند الأخير: سؤال المسطرة.

سؤال واحد أضعه في كل امتحان أبنيه، لأنه يفصل بسرعة:

“بعتلك زبون رسالة بتقول: إن شاء الله بمر عليكم بكرا. هل بدك تحجزله موعد ولا لأ؟”

الجواب الصحيح: تحجز له مبدئيًا وتؤكد برسالة، لأن العبارة نية صادقة بلا التزام مؤكد. النموذج الذي يقول “نعم، احجز” بثقة أو “لا، إنه لم يؤكد” بثقة، كلاهما أخطأ. الجواب الصحيح فيه تحفّظ.

الخطوة الخامسة: أضف فئة “لا أعرف”.

هذه إضافة أنصح بها بشدة ولا يفعلها أحد. اجعل من الإجابات المقبولة أن يقول النموذج “ما بعرف” أو “بحتاج معلومة إضافية”.

السلوك الدرجة
إجابة صحيحة 2
اعتراف بعدم المعرفة حين لا يعرف 1
إجابة خاطئة بثقة 0
إجابة خاطئة مع تحفّظ 0.5

لماذا؟ لأن الخطأ الواثق أغلى من الاعتراف بالجهل في أي تطبيق حقيقي. والمعايير العالمية لا تقيس هذا أبدًا، لأنها اختيار من متعدد لا يسمح بخانة “لا أعرف”.


ما الذي يميّز معيارًا عربيًا جيدًا

بعد قراءة عدد من المعايير العربية، هذه معايير الجودة التي خرجت بها:

الخاصية لماذا تهم هل تتوفر في ArabicMMLU
أسئلة مؤلّفة بالعربية لا تشوّه الترجمة نعم
تنوّع جغرافي لا تهيمن دولة نعم، ثماني دول
مراجعة بشرية ناطقة تكشف الغرائب نعم
تغطية لهجية تقيس الواقع لا
أسئلة مفتوحة لا اختيارية تقيس التوليد لا
تحديث دوري يقاوم التشبّع غير معلن
نشر كامل للمنهجية يسمح بالنقد نعم

أربع من سبع. وهذا أفضل ما عندنا اليوم، وهو يوضّح في الوقت نفسه كم بقي من الطريق.

والنقطة التي أريد تثبيتها: الصفان الرابع والخامس هما الأهم لأي منتج تجاري، وهما بالضبط ما لا يقيسه أي معيار عربي حتى اليوم. فمن يبني منتجًا عربيًا لا يملك مرجعًا خارجيًا لأهم بُعدين في منتجه، ولا حل أمامه غير أن يبني مرجعه بنفسه.


الحكم العملي

توقّف عن استعمال MMLU المترجمة كمرجع عربي. يوجد بديل أصيل منذ شباط 2024، وهو متاح ومجاني ومنشور في مؤتمر محكّم.

واعرف أن 72.5٪ سقف وليس أرضية. أفضل نموذج في العالم أخطأ في أكثر من ربع أسئلة المناهج المدرسية العربية. إن كان منتجك يعتمد على دقة المعلومة العربية، ابنِ طبقة تحقق.

والأهم: المعيار العام يخبرك من الأفضل عمومًا. امتحانك الخاص يخبرك من الأفضل لك. والثاني هو الذي يدفع فواتيرك.


المقالة القادمة

بعد أسبوعين، أطلقت Anthropic عائلة Claude 3، وبطاقة النموذج فيها نتائج متعددة اللغات. المقالة القادمة تبحث عن العربية في تلك البطاقة، وتجدها في مكان واحد فقط، ليس المكان الذي تتوقعه.


المصادر

  • Koto وآخرون، ArabicMMLU: Assessing Massive Multitask Language Understanding in Arabic، arXiv:2402.12840، شباط 2024
  • النسخة المحكّمة: Findings of ACL 2024، الصفحات 5622 إلى 5640: aclanthology.org/2024.findings-acl.334
  • OpenAI، GPT-4 Technical Report، arXiv:2303.08774، للمقارنة مع الرقم المترجَم