الأرقام أولًا
| المقياس | النتيجة | ما الذي يقيسه | المصدر |
|---|---|---|---|
| HELM Arabic | Llama 4 Maverick ضمن أفضل عشرة نماذج مفتوحة الأوزان | سبعة مقاييس عربية أصيلة | Stanford CRFM و Arabic.AI، كانون الأول 2025 |
| لوحة OALL، نماذج المحادثة | Llama3.3-70B-Instruct في الصدارة | مقاييس عربية أصيلة | OALL v2 |
| Llama 4 Maverick | 17 مليار معامل نشط من 400 مليار، بنافذة مليون رمز | الحجم ونافذة السياق | ويكيبيديا نقلًا عن Meta |
| Llama 4 Scout | 17 مليار نشط من 109 مليارات، بنافذة عشرة ملايين رمز | الحجم ونافذة السياق | المصدر نفسه |
| اللغات المدعومة رسميًا | 12 لغة | اتساع التغطية | المصدر نفسه |
| الرخصة | متاحة المصدر بشروط استخدام، لا مفتوحة بالمعنى الكامل | حدود الاستعمال وإعادة النشر | المصدر نفسه |
| مقياس منشور لتسرّب الفصحى | لا يوجد | بقاء البنية الفصيحة داخل نص لهجي | مسح المصادر العامة |
اثنتا عشرة لغة. العربية منها. وهذا في ذاته قرار يستحق الانتباه: حين يختار مختبر عالمي اثنتي عشرة لغة فقط ويضع العربية بينها، فهو يقرّ بحجمها. والسؤال الذي أطرحه: العربية التي اختاروها، أي عربية هي؟
أوضح نمط فشل في العربية، وأقله قياسًا
اطلب من نموذج قوي أن يكتب لك ردًّا بالسورية، وسيستجيب. وهنا تحديدًا تبدأ المشكلة، لأن استجابته تنقسم إلى طبقتين: طبقة معجمية ينفّذ فيها طلبك، وطبقة بنيوية يخالفه فيها.
هذا ما أسميه تسرّب الفصحى. والنموذج هنا ليس عاصيًا للتعليمات، بل مطيع لها حرفيًا: طُلبت منه كلمات سورية فأعطى كلمات سورية. المشكلة أن اللهجة ليست معجمًا، بل نظام لغوي كامل.
ولماذا لا يرصده أحد؟ لأن رصده يحتاج متحدثًا أصليًا يقرأ النص ويقول “هذه ليست سورية”، ولا يمكن أتمتة هذا الحكم بمقياس اختيار من متعدد. فالنتيجة أن أكثر أنماط الفشل شيوعًا في المنتجات العربية هو أقل الأنماط ظهورًا في لوحات القياس.
وهناك دليل رقمي واحد على الأقل: التقييم المستقل لنموذج ALLaM 34B وصف النمط صراحة، وهو العودة إلى رسمية الفصحى عند المطالب اللهجية، وسجّل 4.74 للفصحى مقابل 2.73 للشامية في النموذج نفسه.
بطاقة النموذج
| البند | التفصيل |
|---|---|
| الاسم | Llama 4، بنسختي Scout و Maverick |
| الجهة | Meta |
| تاريخ الإصدار | 5 نيسان 2025 |
| المعمارية | خليط خبراء، مع مدخلات نص وصورة |
| نافذة السياق | عشرة ملايين رمز في Scout، ومليون في Maverick |
| المحور المختبَر | ARAB-DIALECT: تسرّب الفصحى |
نافذة العشرة ملايين رمز رقم مذهل، ويصلح لتحليل أرشيف كامل من المحادثات العربية دفعة واحدة. وهذه في رأيي أهم فرصة عملية يقدّمها هذا النموذج للفرق العربية: ليس أن يكتب لك لهجة جيدة، بل أن يقرأ لك عشرة آلاف رسالة من مستخدميك ويصنّفها.
اختبار الحذف: عشر ثوانٍ تكشف التسرّب
هذا أبسط اختبار في ARAB-LENS كله وأكثرها فائدة، ولا يحتاج أداة ولا حسابًا:
- اطلب ردًّا بلهجتك.
- احذف من الرد كل كلمة لهجية صريحة: شو، هلق، ليش، عم، بدي، مو، هيك، لهون.
- اقرأ ما تبقّى.
إن كان ما تبقّى فصحى سليمة تمامًا، فالنموذج لم يكتب لهجة، بل كتب فصحى وزيّنها.
والمعيار المقابل: خذ فقرة كتبها سوري حقيقي، واحذف منها الكلمات نفسها. لن يتبقّى نص فصيح، بل نص مكسور، لأن اللهجة داخلة في بنيته لا مرشوشة فوقه.
خمسة بنود إضافية
البند 1، الزمن المستقبل. اطلب جملة عن الغد. “رح” أو “حـ” مقابل “سوف” أو “سـ”. هذا أسرع كاشف بنيوي في الشامية والمصرية.
البند 2، النفي. اطلب نفي جملة. “ما بعرف” مقابل “لا أعرف”. النفي من آخر ما تتعلمه النماذج لأنه بنيوي لا معجمي.
البند 3، ضمير المخاطب والإضافة. “كتابك” و”عندك” و”إلك”. النموذج المتسرّب يميل إلى “الخاص بك” حتى داخل اللهجة، وهي صيغة لا يقولها أحد في الكلام.
البند 4، الإيقاع. اطلب ثلاث جمل قصيرة متتالية كما تُقال في رسالة صوتية. النموذج المتسرّب يكتب جملة واحدة طويلة مركّبة، لأن هذا إيقاع الكتابة.
البند 5، الثبات عبر الأدوار. خمسة أدوار باللهجة، وسجّل رقم الدور الذي عاد فيه إلى الفصحى. هذا هو طول النفس اللهجي.
لماذا يحدث التسرّب تقنيًا
ثلاثة أسباب متراكبة، وكلها تقود إلى النتيجة نفسها:
- البيانات. العربية المكتوبة على الإنترنت فصحى في أغلبها: صحافة وكتب ومواقع رسمية. اللهجة موجودة في وسائط التواصل، وهي أقل نظافة وأصعب جمعًا وأكثر عرضة للاستبعاد أثناء التنظيف.
- ضبط الاستجابة. النماذج تُضبط لتكون “مهذبة ورسمية”، والمعايرة غالبًا إنجليزية. وفي العربية يترجم “الرسمي” تلقائيًا إلى فصحى، فيصير الأدب والفصحى شيئًا واحدًا في سلوك النموذج.
- التقطيع. الكلمة العربية اللهجية تُقسَّم إلى رموز أكثر من نظيرتها الفصيحة، لأن الفصحى أكثر تكرارًا في بيانات التدريب. والنموذج يميل بنيويًا إلى المسار الأقل كلفة.
والنتيجة العملية أن الطلب وحده لا يكفي. أفضل ما وجدته في الاستعمال الفعلي هو وضع ثلاثة أمثلة حقيقية من كتابة متحدث أصلي داخل تعليمات النظام، لا وصف اللهجة بالكلام.
الحكم العملي
- طبّق اختبار الحذف على كل مخرَج لهجي قبل الإطلاق. عشر ثوانٍ، وبلا أدوات.
- علّم بالأمثلة لا بالوصف. ثلاثة نصوص أصلية داخل الطلب تساوي عشر جمل من التعليمات.
- افصل “الرسمي” عن “الفصيح” في تعليماتك. يمكن أن يكون الرد مهذبًا جدًا وباللهجة في الوقت نفسه، وهذا ما يفعله موظف خدمة عملاء جيد في عمّان كل يوم.
- استعمل نافذة السياق الضخمة في التحليل لا في التوليد. هنا يتفوق هذا النموذج فعلًا.
في المقالة القادمة
DeepSeek R1 والسؤال الذي لم أجد له جوابًا منشورًا: حين يعرض النموذج سلسلة تفكيره، بأي لغة يفكر قبل أن يكتب لك بالعربية؟ وهل يتغير جوابه إن أجبرته على التفكير بالعربية؟
الدليل الرقمي على أن التسرّب اتجاه واحد
وصفت أعلاه تسرّب الفصحى بوصفه نمط فشل، وقلت إن أحدًا لا يقيسه. والدقة تقتضي تصحيح هذه الجملة: لا تقيسه اللوحات، لكن البحث الأكاديمي قاسه، وبنتيجة حاسمة.
دراسة AL-QASIDA قاست تسعة نماذج عبر ثماني لهجات، ووجدت ارتباطًا قدره 0.99 بين فشل النموذج في إنتاج اللهجة وبين إنتاجه للفصحى.
هذا الرقم يستحق أن يُفهم جيدًا. الارتباط شبه التام يعني أن الفشل ليس عشوائيًا:
وسقطت أغلب درجات ADI2 تحت 50٪ في الوضع أحادي اللغة، ولم يتجاوز GPT-4o 13٪ على نصف اللهجات في الوضع عبر اللغوي. والتقييم البشري في الدراسة وصف المخرجات بأنها طليقة وكافية المعنى وغالبًا ليست باللهجة المطلوبة.
أي أن ما أسميه تسرّب الفصحى ليس انطباعًا، بل ظاهرة موصوفة ومقيسة وذات اتجاه معروف.
نص تعليمات النظام الذي أستعمله
بدل الوصف، هذا النص نفسه، جاهزًا للنسخ والتعديل على لهجتك:
اكتب بالشامية الدمشقية المحكية كما يكتب شخص على واتساب.
ممنوع تمامًا: سوف، سـ، لم، لن، الذي، التي، الخاص بك، يمكنك أن.
استعمل: رح، ما، يلي، تبعك، فيك.
جمل قصيرة متتابعة، لا جملة واحدة طويلة.
أبقِ أي مصطلح تقني كما كتبه المستخدم بالإنجليزية.
الأدب لا يعني الفصحى: كن مهذبًا بالمحكية.
أمثلة على النبرة المطلوبة:
“أهلين، أكيد بقدر ساعدك. بس خبرني شو صار بالضبط؟”
“تمام، رح بعتلك الملف خلال ساعة. إذا في شي ناقص احكيلي.”
“والله ما انتبهت لهالنقطة، معك حق. رح عدّلها هلق.”
العنصر الحاسم هو سطر الممنوعات. منع أربع صيغ بالاسم أقوى من عشر جمل تصف اللهجة، لأن النموذج يعامل المنع قيدًا والوصف اقتراحًا. والعنصر الثاني هو الأمثلة الثلاثة: النموذج يقلّد نبرة يراها أفضل بكثير مما ينفّذ وصفًا يقرؤه.
كيف تقيس أثر كل عنصر
شغّل الحوار نفسه أربع مرات، وغيّر إعداد الطلب في كل مرة، وسجّل رقمًا واحدًا فقط: الدور الذي وقع فيه أول تسرّب بنيوي، أي أول ظهور لـ”سوف” أو “لم” أو تركيب فصيح كامل.
الترتيب الذي أتوقعه من تجربتي، ومن المفيد أن تتحقق منه بنفسك لأنه يختلف بين النماذج:
| الإعداد | ما ألاحظه عادة |
|---|---|
| طلب بسيط: “ردّ بالسورية” | التسرّب مبكر، غالبًا من الدور الثاني أو الثالث |
| طلب مع وصف اللهجة بالكلام | تحسّن طفيف، والوصف وحده لا يصمد |
| طلب مع ثلاثة أمثلة مكتوبة | تحسّن ملموس، لأن التقليد أقوى من الوصف |
| أمثلة زائد قائمة ممنوعات صريحة | الأفضل بوضوح، والتسرّب يتأخر إلى أدوار متقدمة |
النقطة العملية: أنت تملك تحسين هذا الرقم بنفسك دون انتظار إصدار جديد. وهذه من المرات القليلة في تقييم النماذج التي يكون فيها القرار بيدك لا بيد المختبر.
من دفتر الاختبار: اختبار الحذف مطبَّقًا على نصين
اختبار الحذف هو أسرع ما عندي، وهذه تجربته كاملة على نصين.
النص الأول، مخرَج نموذج طُلب منه الرد بالشامية:
“أهلاً فيك، شو بقدر ساعدك؟ هلق سوف أقوم بمراجعة طلبك، ولم أتمكن من ذلك سابقًا لأن النظام الخاص بنا كان متوقفًا.”
احذف الكلمات اللهجية الصريحة: أهلاً فيك، شو، هلق. ماذا بقي؟
“بقدر ساعدك؟ سوف أقوم بمراجعة طلبك، ولم أتمكن من ذلك سابقًا لأن النظام الخاص بنا كان متوقفًا.”
فصحى سليمة تقريبًا. النتيجة: تسرّب كامل.
النص الثاني، مكتوب بيد متحدث أصلي:
“أهلين، كيف بقدر ساعدك؟ هلق بشوف طلبك، ما قدرت شوفو قبل لأن النظام تبعنا كان واقع.”
احذف الكلمات نفسها: أهلين، هلق. ماذا بقي؟
“كيف بقدر ساعدك؟ بشوف طلبك، ما قدرت شوفو قبل لأن النظام تبعنا كان واقع.”
نص مكسور فصيحًا، لأن اللهجة داخلة في بنيته: “بشوف” لا “سأرى”، و”ما قدرت” لا “لم أتمكن”، و”تبعنا” لا “الخاص بنا”، و”واقع” لا “متوقف”. النتيجة: لهجة أصيلة.
هذا الاختبار يأخذ عشر ثوانٍ ولا يحتاج أداة، وهو أدق من أي مقياس معجمي رأيته.
المؤشرات الخمسة التي أعدّها في كل نص لهجي
| المؤشر | اللهجي | الفصيح المتسرّب |
|---|---|---|
| المستقبل | رح، حـ | سوف، سـ |
| النفي | ما | لم، لا، لن |
| الموصول | يلي | الذي، التي |
| الملكية | تبعي، إلي | الخاص بي، لدي |
| الفعل المضارع | بشوف، بروح | أرى، أذهب |
خمسة مؤشرات، وعدّ سريع. إن وجدت ثلاثة منها بالصيغة الفصيحة داخل نص يُفترض أنه لهجي، فالنموذج لم يكتب لهجة.
لماذا الأمثلة أقوى من الوصف
جرّبت الاثنين مرارًا، والفرق واضح: النموذج يقلّد ما يراه أفضل مما ينفّذ ما يقرؤه. وصف اللهجة بجملة “اكتب بالشامية المحكية” يعطي نتيجة أضعف بكثير من ثلاثة أمثلة قصيرة مكتوبة بيد متحدث أصلي داخل تعليمات النظام.
والسبب بنيوي: الوصف يُعالَج بوصفه تعليمة قابلة للتفسير، والمثال يُعالَج بوصفه نمطًا يُحتذى. ولهذا أضع الأمثلة دائمًا قبل القواعد، لا بعدها.
المصادر
- HELM Arabic، Stanford CRFM مع Arabic.AI: crfm.stanford.edu/2025/12/18/helm-arabic.html
- لوحة OALL النسخة الثانية: huggingface.co/blog/leaderboard-arabic-v2
- تفاصيل Llama 4 وإصداراته: en.wikipedia.org/wiki/Llama_(language_model)
- تقييم ALLaM 34B ونمط العودة إلى الفصحى: arxiv.org/abs/2508.17378
- AL-QASIDA، ارتباط الفشل اللهجي بالعودة إلى الفصحى: arxiv.org/abs/2412.04193