الأرقام أولًا
تقييم مستقل لنموذج ALLaM 34B عبر واجهة HUMAIN Chat، بثلاثة نماذج حَكَم مستقلة (GPT-5 و Gemini 2.5 Pro و Claude Sonnet 4)، على 23 مطلبًا كُرّر كل منها خمس مرات، بمجموع 115 ردًا:
| الفئة | الدرجة من 5 | المصدر |
|---|---|---|
| التبديل اللغوي والتوليد | 4.92 | arXiv 2508.17378، آب 2025 |
| المعرفة | 4.77 | المصدر نفسه |
| الفصحى | 4.74 | المصدر نفسه |
| الاستدلال | 4.64 | المصدر نفسه |
| السلامة | 4.54 | المصدر نفسه |
| التعامل مع اللهجات | 4.21 | المصدر نفسه |
والآن الجدول الذي يجب أن يقرأه كل من يكتب عن الذكاء الاصطناعي العربي:
| اللهجة | الدرجة من 5 | المصدر |
|---|---|---|
| النجدية | نحو 3.8 | arXiv 2508.17378 |
| الحجازية | نحو 3.8 | المصدر نفسه |
| المصرية | نحو 3.8 | المصدر نفسه |
| المغربية | 3.3 | المصدر نفسه |
| الشامية | 2.73 | المصدر نفسه |
فرق نقطتين كاملتين بين الفصحى والشامية، في النموذج نفسه، في الجلسة نفسها، بالحكَم نفسه. هذا الرقم هو أوضح دليل منشور على الفرضية التي بنيت عليها ARAB-LENS كله: العربية ليست لغة واحدة تُقاس بدرجة واحدة.
لماذا ترسب الشامية تحديدًا
الملاحظة الأهم في ذلك التقييم ليست الدرجة، بل نمط الفشل الذي وصفه الباحثون: النموذج يعود إلى رسمية الفصحى عند مواجهة مطلب لهجي، خصوصًا في اللهجات الأقل تمثيلًا في بياناته، وأحيانًا يكسر الشخصية تمامًا فيردّ بما يشبه نتيجة بحث بالإنجليزية.
هذا بالضبط ما أسميه تسرّب الفصحى (MSA leakage)، وهو نمط الفشل الذي خصصت له مقياسًا مستقلًا في محور ARAB-DIALECT. والسبب بنيوي لا عشوائي:
نموذج بُني بتمويل وبيانات سعودية
↓
تمثيل ممتاز للنجدية والحجازية والفصحى الرسمية
↓
تمثيل أضعف للشامية والمغربية
↓
حين يعجز عن اللهجة، يلجأ إلى ما يتقنه: الفصحى
ولا يوجد في هذا عيب أخلاقي. أي نموذج يعكس بياناته، والبيانات تعكس من موّلها وأين جُمعت. لكن النتيجة العملية يجب أن تُقال بوضوح: نموذج وطني ممتاز داخل سياقه قد يكون ضعيفًا خارج حدوده اللهجية، ومن يبني منتجًا لدمشق أو عمّان أو بيروت لا يستطيع أن يستورد الرقم كما هو.
بطاقة النموذج
| البند | التفصيل |
|---|---|
| الاسم | ALLaM 34B |
| الجهة | HUMAIN والهيئة السعودية للبيانات والذكاء الاصطناعي |
| الإصدار | آب 2025، ومعه تطبيق HUMAIN Chat |
| السلف | ALLaM 13B، أيار 2024 عبر IBM watsonx، ثم Azure في أيلول 2024 |
| بُني | نموذج أساس مدرَّب من الصفر، بمشاركة أربعين باحثًا بدرجة دكتوراه وبيانات سعودية خاصة |
| ما يُنسب إليه | صدارة على ArabicMMLU بين النماذج العربية |
| المحور المختبَر | المعرفة مقابل اللهجة |
المفارقة: ArabicMMLU ليس اختبار عربية
يُنسب إلى ALLaM تصدّر مقياس ArabicMMLU، وهو مقياس محترم وأصيل، ومبني على أسئلة امتحانات مدرسية عربية حقيقية لا على ترجمة من الإنجليزية، وهذا في ذاته إنجاز يستحق الذكر.
لكن دعنا نكون دقيقين في ما يقيسه: ArabicMMLU يقيس المعرفة المصوغة بالعربية، لا القدرة على العربية. سؤال في الأحياء مكتوب بالعربية يقيس الأحياء. سؤال في التاريخ الإسلامي مكتوب بالعربية يقيس التاريخ. اللغة هنا وعاء لا موضوع.
ولهذا تجتمع في النموذج نفسه صدارة في المعرفة العربية ودرجة 2.73 في الشامية بلا أي تناقض. القياسان يقيسان شيئين مختلفين تمامًا:
| المقياس | يقيس فعلًا | لا يقيس |
|---|---|---|
| ArabicMMLU | معرفة مدرسية وأكاديمية مصوغة بالعربية | إنتاج لغة طبيعية |
| MadinahQA | معرفة بقواعد العربية | تطبيق القواعد في نص مولَّد |
| AraTrust | السلامة | الملاءمة الاجتماعية |
| التقييم عبر الواجهة (arXiv 2508.17378) | أمانة اللهجة والطلاقة والالتزام | حجم المعرفة |
وأنا أعتبر هذه المقارنة أهم ما في المقالة: لا يوجد مقياس سيئ في هذه القائمة، بل استعمال سيئ للمقاييس. حين يقول أحدهم “هذا النموذج الأفضل بالعربية” استنادًا إلى ArabicMMLU وحده، فهو ينقل رقمًا صحيحًا إلى سؤال لم يُسأل.
منهجية التقييم عبر الواجهة: لماذا أحبها ولماذا أحذر منها
التقييم الذي بنيت عليه هذه المقالة تم عبر واجهة المستخدم لا عبر واجهة برمجية. أي أن الباحثين اختبروا ما يختبره المستخدم فعلًا: النموذج مع طبقة الحماية ومع تعليمات النظام ومع كل ما تضيفه الشركة فوقه.
وهذه ميزة كبيرة، لأن ما يصل المستخدم ليس النموذج الخام. وهي أيضًا حدّ يجب ذكره: النتيجة تخصّ المنتج لا النموذج، وقد تتغير بتغيير تعليمات النظام وحدها.
وفيها ملاحظة ثالثة تخصّني كمقيّم: استُعملت نماذج حَكَمًا على نماذج. هذا مفيد للتوسع، وخطر إن تُرك وحده، لأن النموذج الحاكم قد يكافئ العربية الجميلة لا العربية الصحيحة اجتماعيًا، وهو بالضبط فخ “الطليق والخاطئ”. ولهذا أضع في ARAB-LENS قاعدة ثابتة: الحكم النهائي على أمانة اللهجة لمتحدث أصلي، والنموذج الحاكم طبقة مساعدة لا مصدر حقيقة. ويسجَّل للباحثين هنا أنهم أضافوا تحققًا بشريًا فوق الحكم الآلي.
الاختبار: هل نموذجك يعرف حدوده اللهجية؟
البند 1، مطلب لهجي صريح. اطلب الرد بالشامية، ثم طبّق اختبار الحذف: احذف كل كلمة لهجية صريحة، واقرأ ما تبقّى. إن كان فصحى سليمة تمامًا فقد وقع التسرّب.
البند 2، كسر الشخصية. أطل الحوار خمسة أدوار باللهجة، وراقب في أي دور يعود إلى الفصحى. عندي أن دور العودة مقياس بحد ذاته، وأسميه طول النفس اللهجي.
البند 3، المقارنة الداخلية. اطلب الرد نفسه بالنجدية ثم بالشامية، وقارن الطبيعية. الفرق الذي ستراه هو الفرق بين 3.8 و2.73، لكن بعينك أنت لا بعين نموذج حَكَم.
البند 4، الاعتراف بالحد. اسأله مباشرة: ما اللهجات التي تتقنها وما اللهجات التي تضعف فيها؟ النموذج الذي يجيب بصدق أنفع من نموذج يدّعي إتقان اثنتين وعشرين لهجة.
الحكم العملي
- اختر نموذجك حسب لهجة مستخدمك، لا حسب لوحة الصدارة. نموذج متقدم في النجدية قد يكون أضعف خيار لمنتج شامي، والعكس صحيح.
- لا تستعمل ArabicMMLU دليلًا على جودة الكتابة العربية. استعمله دليلًا على المعرفة، وهذا ما يقيسه.
- قِس طول النفس اللهجي. عدد الأدوار قبل أن يعود النموذج إلى الفصحى مؤشر عملي ممتاز وسهل الحساب.
- لا تجعل نموذجًا حَكَمًا وحيدًا على لهجتك. ضع متحدثًا أصليًا في الحلقة، ولو على عشر عينات فقط.
في المقالة القادمة
أعود إلى النماذج العامة، وتحديدًا إلى Claude Opus 4.6، صاحب واحدة من أعلى الدرجات العربية المنشورة على Global-MMLU-Lite، مع محور لم يقسه أحد تقريبًا: الحوار متعدد الأدوار، وما يحدث للعربية بعد الدور الخامس.
هل المشكلة في هذا النموذج وحده؟ لا
قد يُقرأ رقم 2.73 على أنه ضعف في نموذج بعينه. والأمانة البحثية تقتضي وضعه في سياقه الأوسع، وهذا السياق موجود في دراسة AL-QASIDA التي قاست تسعة نماذج عبر ثماني لهجات، من بينها السورية والفلسطينية.
نتائجها:
| القياس | النتيجة |
|---|---|
| ADI2 في الوضع أحادي اللغة | أقل من 50٪ في جميع النماذج تقريبًا |
| GPT-4o في الوضع عبر اللغوي | لم يتجاوز 13٪ على نصف اللهجات |
| ارتباط ALDi بـ ADI2 | 0.99 |
| التقييم البشري | ردود طليقة وكافية، وغالبًا ليست باللهجة المطلوبة |
الارتباط 0.99 هو المفتاح: حين يفشل النموذج في إنتاج اللهجة، فإنه ينتج الفصحى تحديدًا، لا لهجة أخرى ولا لغة هجينة. أي أن ما رصده تقييم ALLaM في نموذج واحد هو سلوك عام في الفئة كلها.
وهذا يغيّر الاستنتاج: الفارق بين 4.74 و2.73 ليس عيبًا في نموذج سعودي، بل هو المسافة بين ما تتقنه هذه النماذج جميعًا وما لا تتقنه. النموذج السعودي تفوّق في النجدية لأن بياناته نجدية، وأي نموذج آخر سيتفوق في اللهجة التي تغلب على بياناته، ويسقط إلى الفصحى خارجها.
كيف تختار نموذجك حسب السوق لا حسب الصدارة
| سوقك | ما يجب أن تسأل عنه أولًا |
|---|---|
| السعودية والخليج | تمثيل النجدية والحجازية في البيانات، وهو ما تتفوق فيه النماذج المحلية |
| بلاد الشام | اختبر بنفسك، فهي الأضعف في كل القياسات المتاحة |
| مصر | الأفضل تمثيلًا بين اللهجات في معظم المقاييس |
| المغرب العربي | الأصعب، ومعه التبديل اللغوي مع الفرنسية |
| جمهور عابر للبلدان | نموذج قوي بالفصحى مع طبقة لهجية مضبوطة بأمثلة، لا نموذج يدّعي كل اللهجات |
قياس طول النفس اللهجي عمليًا
| الدور | ماذا تسجّل |
|---|---|
| 1 | هل بدأ باللهجة أصلًا؟ |
| 2 | هل بقيت البنية لهجية أم صارت المفردات فقط؟ |
| 3 | أول ظهور لصيغة فصيحة (سوف، لم، الذي) |
| 4 | هل عاد بعد تذكيرك أم استمر بالفصحى؟ |
| 5 | الحالة النهائية |
الرقم الذي تخرج به هو رقم الدور الذي وقع فيه التسرّب. في تجربتي، تذكير واحد باللهجة يعيد النموذج دورين أو ثلاثة فقط، ثم يعود إلى الفصحى مجددًا. ولهذا فإن الحل ليس في التذكير بل في الأمثلة داخل تعليمات النظام.
من دفتر الاختبار: جدول المقابلات الذي أستعمله
حين أقيس قدرة نموذج على لهجة بعينها، لا أسأله “اكتب بالنجدية”. أعطيه جملة واحدة وأطلب صياغتها في خمس لهجات، ثم أقارن بجدول المقابلات الذي أحتفظ به:
| المعنى | نجدية | شامية | مصرية | مغربية | خليجية إماراتية |
|---|---|---|---|---|---|
| ماذا | وش | شو | إيه | أشنو | شو أو وش |
| الآن | الحين | هلق | دلوقتي | دابا | الحين |
| أريد | أبغى | بدي | عايز | بغيت | أبا أو أبي |
| جيد | زين | منيح | كويس | مزيان | زين |
| كيف حالك | كيفك أو شلونك | كيفك | إزيك | لاباس | شحالك |
| ليس عندي | ما عندي | ما عندي | مش عندي | ما عنديش | ما عندي |
النموذج الذي يعطيني خمس جمل بمفردات مختلفة وتركيب واحد لم يترجم لهجة. اللهجات لا تختلف في القاموس فقط: النفي المصري والمغربي يحيط الفعل بـ”ما” و”ش”، والشامي يكتفي بـ”ما” قبله، والخليجي يستعمل “ما” و”مو” في مواضع مختلفة.
اختبار ريفي حضري داخل اللهجة الواحدة
هذا ما لا تقيسه أي لوحة، وهو أكثر ما يهم منتجًا حقيقيًا:
“گلتلّه يا خيّ لا تتأخر، گال لي إن شاء الله.”
هذه أردنية شمالية ريفية بوضوح: القاف گاف، و”يا خيّ” نداء شائع في الشمال، والإدغام سريع. النموذج المدرَّب على عمّان الحضرية يعتبرها “خارج الشامية”، والمدرَّب على بيانات خليجية يرسلها إلى نجد.
والجواب الصحيح: شامية أردنية بملمح بدوي شمالي. وهذا هو البند الذي أقيس به إن كان النموذج يعرف أن اللهجة طيف لا صندوق.
لماذا يهمّ هذا في اختيار النموذج
النتيجة المنشورة تقول 3.8 للنجدية و2.73 للشامية في نموذج واحد. وهذا لا يعني أن النموذج ضعيف، بل يعني أن بياناته نجدية. ولو قاس أحدهم نموذجًا مدرَّبًا على بيانات شامية لانقلب الترتيب.
ولهذا فإن السؤال الصحيح عند اختيار نموذج ليس “أيهما أفضل بالعربية” بل “أي لهجة تغلب على بياناته، وهل هي لهجة مستخدمي”. وهذا سؤال تستطيع الإجابة عنه في عشر دقائق بجدول المقابلات فوق، ولا تجيب عنه أي لوحة في العالم.
المصادر
- تقييم ALLaM 34B عبر واجهة HUMAIN Chat: arxiv.org/abs/2508.17378
- إعلان HUMAIN عن إطلاق ALLaM 34B: middleeastainews.com
- لوحة OALL النسخة الثانية ومقاييسها: huggingface.co/blog/leaderboard-arabic-v2
- HELM Arabic، Stanford CRFM: crfm.stanford.edu/2025/12/18/helm-arabic.html
- AL-QASIDA، قياس أمانة اللهجة: arxiv.org/abs/2412.04193