4.74 في الفصحى و2.73 في الشامية: الرقم الذي يلخّص أزمة التقييم العربي

وقت القراءة: 9 دقيقة
18
إيهاب صالح | techkahwa.net صدر النموذج: آب 2025 | تاريخ النشر: 14 أيلول 2025

الأرقام أولًا

تقييم مستقل لنموذج ALLaM 34B عبر واجهة HUMAIN Chat، بثلاثة نماذج حَكَم مستقلة (GPT-5 و Gemini 2.5 Pro و Claude Sonnet 4)، على 23 مطلبًا كُرّر كل منها خمس مرات، بمجموع 115 ردًا:

الفئةالدرجة من 5المصدر
التبديل اللغوي والتوليد4.92arXiv 2508.17378، آب 2025
المعرفة4.77المصدر نفسه
الفصحى4.74المصدر نفسه
الاستدلال4.64المصدر نفسه
السلامة4.54المصدر نفسه
التعامل مع اللهجات4.21المصدر نفسه

والآن الجدول الذي يجب أن يقرأه كل من يكتب عن الذكاء الاصطناعي العربي:

اللهجةالدرجة من 5المصدر
النجديةنحو 3.8arXiv 2508.17378
الحجازيةنحو 3.8المصدر نفسه
المصريةنحو 3.8المصدر نفسه
المغربية3.3المصدر نفسه
الشامية2.73المصدر نفسه
الفجوة داخل النموذج الواحد
الفصحى
4.74
النجدية
3.80
المغربية
3.30
الشامية
2.73
نموذجان داخل نموذج واحد: واحد ممتاز بالفصحى،
وآخر راسب بالشامية

فرق نقطتين كاملتين بين الفصحى والشامية، في النموذج نفسه، في الجلسة نفسها، بالحكَم نفسه. هذا الرقم هو أوضح دليل منشور على الفرضية التي بنيت عليها ARAB-LENS كله: العربية ليست لغة واحدة تُقاس بدرجة واحدة.


لماذا ترسب الشامية تحديدًا

الملاحظة الأهم في ذلك التقييم ليست الدرجة، بل نمط الفشل الذي وصفه الباحثون: النموذج يعود إلى رسمية الفصحى عند مواجهة مطلب لهجي، خصوصًا في اللهجات الأقل تمثيلًا في بياناته، وأحيانًا يكسر الشخصية تمامًا فيردّ بما يشبه نتيجة بحث بالإنجليزية.

هذا بالضبط ما أسميه تسرّب الفصحى (MSA leakage)، وهو نمط الفشل الذي خصصت له مقياسًا مستقلًا في محور ARAB-DIALECT. والسبب بنيوي لا عشوائي:

نموذج بُني بتمويل وبيانات سعودية
        ↓
تمثيل ممتاز للنجدية والحجازية والفصحى الرسمية
        ↓
تمثيل أضعف للشامية والمغربية
        ↓
حين يعجز عن اللهجة، يلجأ إلى ما يتقنه: الفصحى

ولا يوجد في هذا عيب أخلاقي. أي نموذج يعكس بياناته، والبيانات تعكس من موّلها وأين جُمعت. لكن النتيجة العملية يجب أن تُقال بوضوح: نموذج وطني ممتاز داخل سياقه قد يكون ضعيفًا خارج حدوده اللهجية، ومن يبني منتجًا لدمشق أو عمّان أو بيروت لا يستطيع أن يستورد الرقم كما هو.


بطاقة النموذج

البندالتفصيل
الاسمALLaM 34B
الجهةHUMAIN والهيئة السعودية للبيانات والذكاء الاصطناعي
الإصدارآب 2025، ومعه تطبيق HUMAIN Chat
السلفALLaM 13B، أيار 2024 عبر IBM watsonx، ثم Azure في أيلول 2024
بُنينموذج أساس مدرَّب من الصفر، بمشاركة أربعين باحثًا بدرجة دكتوراه وبيانات سعودية خاصة
ما يُنسب إليهصدارة على ArabicMMLU بين النماذج العربية
المحور المختبَرالمعرفة مقابل اللهجة

المفارقة: ArabicMMLU ليس اختبار عربية

يُنسب إلى ALLaM تصدّر مقياس ArabicMMLU، وهو مقياس محترم وأصيل، ومبني على أسئلة امتحانات مدرسية عربية حقيقية لا على ترجمة من الإنجليزية، وهذا في ذاته إنجاز يستحق الذكر.

لكن دعنا نكون دقيقين في ما يقيسه: ArabicMMLU يقيس المعرفة المصوغة بالعربية، لا القدرة على العربية. سؤال في الأحياء مكتوب بالعربية يقيس الأحياء. سؤال في التاريخ الإسلامي مكتوب بالعربية يقيس التاريخ. اللغة هنا وعاء لا موضوع.

ولهذا تجتمع في النموذج نفسه صدارة في المعرفة العربية ودرجة 2.73 في الشامية بلا أي تناقض. القياسان يقيسان شيئين مختلفين تمامًا:

المقياسيقيس فعلًالا يقيس
ArabicMMLUمعرفة مدرسية وأكاديمية مصوغة بالعربيةإنتاج لغة طبيعية
MadinahQAمعرفة بقواعد العربيةتطبيق القواعد في نص مولَّد
AraTrustالسلامةالملاءمة الاجتماعية
التقييم عبر الواجهة (arXiv 2508.17378)أمانة اللهجة والطلاقة والالتزامحجم المعرفة

وأنا أعتبر هذه المقارنة أهم ما في المقالة: لا يوجد مقياس سيئ في هذه القائمة، بل استعمال سيئ للمقاييس. حين يقول أحدهم “هذا النموذج الأفضل بالعربية” استنادًا إلى ArabicMMLU وحده، فهو ينقل رقمًا صحيحًا إلى سؤال لم يُسأل.


منهجية التقييم عبر الواجهة: لماذا أحبها ولماذا أحذر منها

التقييم الذي بنيت عليه هذه المقالة تم عبر واجهة المستخدم لا عبر واجهة برمجية. أي أن الباحثين اختبروا ما يختبره المستخدم فعلًا: النموذج مع طبقة الحماية ومع تعليمات النظام ومع كل ما تضيفه الشركة فوقه.

وهذه ميزة كبيرة، لأن ما يصل المستخدم ليس النموذج الخام. وهي أيضًا حدّ يجب ذكره: النتيجة تخصّ المنتج لا النموذج، وقد تتغير بتغيير تعليمات النظام وحدها.

وفيها ملاحظة ثالثة تخصّني كمقيّم: استُعملت نماذج حَكَمًا على نماذج. هذا مفيد للتوسع، وخطر إن تُرك وحده، لأن النموذج الحاكم قد يكافئ العربية الجميلة لا العربية الصحيحة اجتماعيًا، وهو بالضبط فخ “الطليق والخاطئ”. ولهذا أضع في ARAB-LENS قاعدة ثابتة: الحكم النهائي على أمانة اللهجة لمتحدث أصلي، والنموذج الحاكم طبقة مساعدة لا مصدر حقيقة. ويسجَّل للباحثين هنا أنهم أضافوا تحققًا بشريًا فوق الحكم الآلي.


الاختبار: هل نموذجك يعرف حدوده اللهجية؟

البند 1، مطلب لهجي صريح. اطلب الرد بالشامية، ثم طبّق اختبار الحذف: احذف كل كلمة لهجية صريحة، واقرأ ما تبقّى. إن كان فصحى سليمة تمامًا فقد وقع التسرّب.

البند 2، كسر الشخصية. أطل الحوار خمسة أدوار باللهجة، وراقب في أي دور يعود إلى الفصحى. عندي أن دور العودة مقياس بحد ذاته، وأسميه طول النفس اللهجي.

البند 3، المقارنة الداخلية. اطلب الرد نفسه بالنجدية ثم بالشامية، وقارن الطبيعية. الفرق الذي ستراه هو الفرق بين 3.8 و2.73، لكن بعينك أنت لا بعين نموذج حَكَم.

البند 4، الاعتراف بالحد. اسأله مباشرة: ما اللهجات التي تتقنها وما اللهجات التي تضعف فيها؟ النموذج الذي يجيب بصدق أنفع من نموذج يدّعي إتقان اثنتين وعشرين لهجة.


الحكم العملي

  1. اختر نموذجك حسب لهجة مستخدمك، لا حسب لوحة الصدارة. نموذج متقدم في النجدية قد يكون أضعف خيار لمنتج شامي، والعكس صحيح.
  2. لا تستعمل ArabicMMLU دليلًا على جودة الكتابة العربية. استعمله دليلًا على المعرفة، وهذا ما يقيسه.
  3. قِس طول النفس اللهجي. عدد الأدوار قبل أن يعود النموذج إلى الفصحى مؤشر عملي ممتاز وسهل الحساب.
  4. لا تجعل نموذجًا حَكَمًا وحيدًا على لهجتك. ضع متحدثًا أصليًا في الحلقة، ولو على عشر عينات فقط.

في المقالة القادمة

أعود إلى النماذج العامة، وتحديدًا إلى Claude Opus 4.6، صاحب واحدة من أعلى الدرجات العربية المنشورة على Global-MMLU-Lite، مع محور لم يقسه أحد تقريبًا: الحوار متعدد الأدوار، وما يحدث للعربية بعد الدور الخامس.


هل المشكلة في هذا النموذج وحده؟ لا

قد يُقرأ رقم 2.73 على أنه ضعف في نموذج بعينه. والأمانة البحثية تقتضي وضعه في سياقه الأوسع، وهذا السياق موجود في دراسة AL-QASIDA التي قاست تسعة نماذج عبر ثماني لهجات، من بينها السورية والفلسطينية.

نتائجها:

القياسالنتيجة
ADI2 في الوضع أحادي اللغةأقل من 50٪ في جميع النماذج تقريبًا
GPT-4o في الوضع عبر اللغويلم يتجاوز 13٪ على نصف اللهجات
ارتباط ALDi بـ ADI20.99
التقييم البشريردود طليقة وكافية، وغالبًا ليست باللهجة المطلوبة

الارتباط 0.99 هو المفتاح: حين يفشل النموذج في إنتاج اللهجة، فإنه ينتج الفصحى تحديدًا، لا لهجة أخرى ولا لغة هجينة. أي أن ما رصده تقييم ALLaM في نموذج واحد هو سلوك عام في الفئة كلها.

وهذا يغيّر الاستنتاج: الفارق بين 4.74 و2.73 ليس عيبًا في نموذج سعودي، بل هو المسافة بين ما تتقنه هذه النماذج جميعًا وما لا تتقنه. النموذج السعودي تفوّق في النجدية لأن بياناته نجدية، وأي نموذج آخر سيتفوق في اللهجة التي تغلب على بياناته، ويسقط إلى الفصحى خارجها.

كيف تختار نموذجك حسب السوق لا حسب الصدارة

سوقكما يجب أن تسأل عنه أولًا
السعودية والخليجتمثيل النجدية والحجازية في البيانات، وهو ما تتفوق فيه النماذج المحلية
بلاد الشاماختبر بنفسك، فهي الأضعف في كل القياسات المتاحة
مصرالأفضل تمثيلًا بين اللهجات في معظم المقاييس
المغرب العربيالأصعب، ومعه التبديل اللغوي مع الفرنسية
جمهور عابر للبلداننموذج قوي بالفصحى مع طبقة لهجية مضبوطة بأمثلة، لا نموذج يدّعي كل اللهجات

قياس طول النفس اللهجي عمليًا

الدورماذا تسجّل
1هل بدأ باللهجة أصلًا؟
2هل بقيت البنية لهجية أم صارت المفردات فقط؟
3أول ظهور لصيغة فصيحة (سوف، لم، الذي)
4هل عاد بعد تذكيرك أم استمر بالفصحى؟
5الحالة النهائية

الرقم الذي تخرج به هو رقم الدور الذي وقع فيه التسرّب. في تجربتي، تذكير واحد باللهجة يعيد النموذج دورين أو ثلاثة فقط، ثم يعود إلى الفصحى مجددًا. ولهذا فإن الحل ليس في التذكير بل في الأمثلة داخل تعليمات النظام.


من دفتر الاختبار: جدول المقابلات الذي أستعمله

حين أقيس قدرة نموذج على لهجة بعينها، لا أسأله “اكتب بالنجدية”. أعطيه جملة واحدة وأطلب صياغتها في خمس لهجات، ثم أقارن بجدول المقابلات الذي أحتفظ به:

المعنىنجديةشاميةمصريةمغربيةخليجية إماراتية
ماذاوششوإيهأشنوشو أو وش
الآنالحينهلقدلوقتيداباالحين
أريدأبغىبديعايزبغيتأبا أو أبي
جيدزينمنيحكويسمزيانزين
كيف حالككيفك أو شلونككيفكإزيكلاباسشحالك
ليس عنديما عنديما عنديمش عنديما عنديشما عندي

النموذج الذي يعطيني خمس جمل بمفردات مختلفة وتركيب واحد لم يترجم لهجة. اللهجات لا تختلف في القاموس فقط: النفي المصري والمغربي يحيط الفعل بـ”ما” و”ش”، والشامي يكتفي بـ”ما” قبله، والخليجي يستعمل “ما” و”مو” في مواضع مختلفة.

اختبار ريفي حضري داخل اللهجة الواحدة

هذا ما لا تقيسه أي لوحة، وهو أكثر ما يهم منتجًا حقيقيًا:

“گلتلّه يا خيّ لا تتأخر، گال لي إن شاء الله.”

هذه أردنية شمالية ريفية بوضوح: القاف گاف، و”يا خيّ” نداء شائع في الشمال، والإدغام سريع. النموذج المدرَّب على عمّان الحضرية يعتبرها “خارج الشامية”، والمدرَّب على بيانات خليجية يرسلها إلى نجد.

والجواب الصحيح: شامية أردنية بملمح بدوي شمالي. وهذا هو البند الذي أقيس به إن كان النموذج يعرف أن اللهجة طيف لا صندوق.

لماذا يهمّ هذا في اختيار النموذج

النتيجة المنشورة تقول 3.8 للنجدية و2.73 للشامية في نموذج واحد. وهذا لا يعني أن النموذج ضعيف، بل يعني أن بياناته نجدية. ولو قاس أحدهم نموذجًا مدرَّبًا على بيانات شامية لانقلب الترتيب.

ولهذا فإن السؤال الصحيح عند اختيار نموذج ليس “أيهما أفضل بالعربية” بل “أي لهجة تغلب على بياناته، وهل هي لهجة مستخدمي”. وهذا سؤال تستطيع الإجابة عنه في عشر دقائق بجدول المقابلات فوق، ولا تجيب عنه أي لوحة في العالم.

المصادر

  • تقييم ALLaM 34B عبر واجهة HUMAIN Chat: arxiv.org/abs/2508.17378
  • إعلان HUMAIN عن إطلاق ALLaM 34B: middleeastainews.com
  • لوحة OALL النسخة الثانية ومقاييسها: huggingface.co/blog/leaderboard-arabic-v2
  • HELM Arabic، Stanford CRFM: crfm.stanford.edu/2025/12/18/helm-arabic.html
  • AL-QASIDA، قياس أمانة اللهجة: arxiv.org/abs/2412.04193