تسرّب الفصحى: كيف ينفّذ Llama 4 طلبك اللهجي ويخالفه في الوقت نفسه

وقت القراءة: 10 دقيقة
18
إيهاب صالح | techkahwa.net صدر النموذج: 5 نيسان 2025 | تاريخ النشر: 19 نيسان 2025

الأرقام أولًا

المقياسالنتيجةما الذي يقيسهالمصدر
HELM ArabicLlama 4 Maverick ضمن أفضل عشرة نماذج مفتوحة الأوزانسبعة مقاييس عربية أصيلةStanford CRFM و Arabic.AI، كانون الأول 2025
لوحة OALL، نماذج المحادثةLlama3.3-70B-Instruct في الصدارةمقاييس عربية أصيلةOALL v2
Llama 4 Maverick17 مليار معامل نشط من 400 مليار، بنافذة مليون رمزالحجم ونافذة السياقويكيبيديا نقلًا عن Meta
Llama 4 Scout17 مليار نشط من 109 مليارات، بنافذة عشرة ملايين رمزالحجم ونافذة السياقالمصدر نفسه
اللغات المدعومة رسميًا12 لغةاتساع التغطيةالمصدر نفسه
الرخصةمتاحة المصدر بشروط استخدام، لا مفتوحة بالمعنى الكاملحدود الاستعمال وإعادة النشرالمصدر نفسه
مقياس منشور لتسرّب الفصحىلا يوجدبقاء البنية الفصيحة داخل نص لهجيمسح المصادر العامة

اثنتا عشرة لغة. العربية منها. وهذا في ذاته قرار يستحق الانتباه: حين يختار مختبر عالمي اثنتي عشرة لغة فقط ويضع العربية بينها، فهو يقرّ بحجمها. والسؤال الذي أطرحه: العربية التي اختاروها، أي عربية هي؟


أوضح نمط فشل في العربية، وأقله قياسًا

اطلب من نموذج قوي أن يكتب لك ردًّا بالسورية، وسيستجيب. وهنا تحديدًا تبدأ المشكلة، لأن استجابته تنقسم إلى طبقتين: طبقة معجمية ينفّذ فيها طلبك، وطبقة بنيوية يخالفه فيها.

ما طلبتَه:
رد بالسورية
ما تحصل عليه:
المفردات
✔
شو، هلق، بدي، مشان
الصرف
✘
سوف أرسل بدل رح بعتلك
التركيب
✘
لم أستطع بدل ما قدرت
الاصطلاح
✘
ترجمة حرفية عن الإنجليزية
السجل
✘
نبرة بيان إداري
الإيقاع
✘
إيقاع كتابة لا إيقاع كلام

هذا ما أسميه تسرّب الفصحى. والنموذج هنا ليس عاصيًا للتعليمات، بل مطيع لها حرفيًا: طُلبت منه كلمات سورية فأعطى كلمات سورية. المشكلة أن اللهجة ليست معجمًا، بل نظام لغوي كامل.

ولماذا لا يرصده أحد؟ لأن رصده يحتاج متحدثًا أصليًا يقرأ النص ويقول “هذه ليست سورية”، ولا يمكن أتمتة هذا الحكم بمقياس اختيار من متعدد. فالنتيجة أن أكثر أنماط الفشل شيوعًا في المنتجات العربية هو أقل الأنماط ظهورًا في لوحات القياس.

وهناك دليل رقمي واحد على الأقل: التقييم المستقل لنموذج ALLaM 34B وصف النمط صراحة، وهو العودة إلى رسمية الفصحى عند المطالب اللهجية، وسجّل 4.74 للفصحى مقابل 2.73 للشامية في النموذج نفسه.


بطاقة النموذج

البندالتفصيل
الاسمLlama 4، بنسختي Scout و Maverick
الجهةMeta
تاريخ الإصدار5 نيسان 2025
المعماريةخليط خبراء، مع مدخلات نص وصورة
نافذة السياقعشرة ملايين رمز في Scout، ومليون في Maverick
المحور المختبَرARAB-DIALECT: تسرّب الفصحى

نافذة العشرة ملايين رمز رقم مذهل، ويصلح لتحليل أرشيف كامل من المحادثات العربية دفعة واحدة. وهذه في رأيي أهم فرصة عملية يقدّمها هذا النموذج للفرق العربية: ليس أن يكتب لك لهجة جيدة، بل أن يقرأ لك عشرة آلاف رسالة من مستخدميك ويصنّفها.


اختبار الحذف: عشر ثوانٍ تكشف التسرّب

هذا أبسط اختبار في ARAB-LENS كله وأكثرها فائدة، ولا يحتاج أداة ولا حسابًا:

  1. اطلب ردًّا بلهجتك.
  2. احذف من الرد كل كلمة لهجية صريحة: شو، هلق، ليش، عم، بدي، مو، هيك، لهون.
  3. اقرأ ما تبقّى.

إن كان ما تبقّى فصحى سليمة تمامًا، فالنموذج لم يكتب لهجة، بل كتب فصحى وزيّنها.

والمعيار المقابل: خذ فقرة كتبها سوري حقيقي، واحذف منها الكلمات نفسها. لن يتبقّى نص فصيح، بل نص مكسور، لأن اللهجة داخلة في بنيته لا مرشوشة فوقه.

مؤشر التسرّب
النص بعد الحذف فصحى سليمة
← تسرّب كامل
النص بعد الحذف مكسور جزئيًا
← تسرّب جزئي
النص بعد الحذف غير مفهوم
← لهجة أصيلة

خمسة بنود إضافية

البند 1، الزمن المستقبل. اطلب جملة عن الغد. “رح” أو “حـ” مقابل “سوف” أو “سـ”. هذا أسرع كاشف بنيوي في الشامية والمصرية.

البند 2، النفي. اطلب نفي جملة. “ما بعرف” مقابل “لا أعرف”. النفي من آخر ما تتعلمه النماذج لأنه بنيوي لا معجمي.

البند 3، ضمير المخاطب والإضافة. “كتابك” و”عندك” و”إلك”. النموذج المتسرّب يميل إلى “الخاص بك” حتى داخل اللهجة، وهي صيغة لا يقولها أحد في الكلام.

البند 4، الإيقاع. اطلب ثلاث جمل قصيرة متتالية كما تُقال في رسالة صوتية. النموذج المتسرّب يكتب جملة واحدة طويلة مركّبة، لأن هذا إيقاع الكتابة.

البند 5، الثبات عبر الأدوار. خمسة أدوار باللهجة، وسجّل رقم الدور الذي عاد فيه إلى الفصحى. هذا هو طول النفس اللهجي.


لماذا يحدث التسرّب تقنيًا

ثلاثة أسباب متراكبة، وكلها تقود إلى النتيجة نفسها:

  1. البيانات. العربية المكتوبة على الإنترنت فصحى في أغلبها: صحافة وكتب ومواقع رسمية. اللهجة موجودة في وسائط التواصل، وهي أقل نظافة وأصعب جمعًا وأكثر عرضة للاستبعاد أثناء التنظيف.
  2. ضبط الاستجابة. النماذج تُضبط لتكون “مهذبة ورسمية”، والمعايرة غالبًا إنجليزية. وفي العربية يترجم “الرسمي” تلقائيًا إلى فصحى، فيصير الأدب والفصحى شيئًا واحدًا في سلوك النموذج.
  3. التقطيع. الكلمة العربية اللهجية تُقسَّم إلى رموز أكثر من نظيرتها الفصيحة، لأن الفصحى أكثر تكرارًا في بيانات التدريب. والنموذج يميل بنيويًا إلى المسار الأقل كلفة.

والنتيجة العملية أن الطلب وحده لا يكفي. أفضل ما وجدته في الاستعمال الفعلي هو وضع ثلاثة أمثلة حقيقية من كتابة متحدث أصلي داخل تعليمات النظام، لا وصف اللهجة بالكلام.


الحكم العملي

  1. طبّق اختبار الحذف على كل مخرَج لهجي قبل الإطلاق. عشر ثوانٍ، وبلا أدوات.
  2. علّم بالأمثلة لا بالوصف. ثلاثة نصوص أصلية داخل الطلب تساوي عشر جمل من التعليمات.
  3. افصل “الرسمي” عن “الفصيح” في تعليماتك. يمكن أن يكون الرد مهذبًا جدًا وباللهجة في الوقت نفسه، وهذا ما يفعله موظف خدمة عملاء جيد في عمّان كل يوم.
  4. استعمل نافذة السياق الضخمة في التحليل لا في التوليد. هنا يتفوق هذا النموذج فعلًا.

في المقالة القادمة

DeepSeek R1 والسؤال الذي لم أجد له جوابًا منشورًا: حين يعرض النموذج سلسلة تفكيره، بأي لغة يفكر قبل أن يكتب لك بالعربية؟ وهل يتغير جوابه إن أجبرته على التفكير بالعربية؟


الدليل الرقمي على أن التسرّب اتجاه واحد

وصفت أعلاه تسرّب الفصحى بوصفه نمط فشل، وقلت إن أحدًا لا يقيسه. والدقة تقتضي تصحيح هذه الجملة: لا تقيسه اللوحات، لكن البحث الأكاديمي قاسه، وبنتيجة حاسمة.

دراسة AL-QASIDA قاست تسعة نماذج عبر ثماني لهجات، ووجدت ارتباطًا قدره 0.99 بين فشل النموذج في إنتاج اللهجة وبين إنتاجه للفصحى.

هذا الرقم يستحق أن يُفهم جيدًا. الارتباط شبه التام يعني أن الفشل ليس عشوائيًا:

النموذج يفشل في السورية
→
لا ينتج مصرية
لا ينتج لغة هجينة
لا ينتج نصًا مكسورًا
ينتج فصحى، دائمًا

وسقطت أغلب درجات ADI2 تحت 50٪ في الوضع أحادي اللغة، ولم يتجاوز GPT-4o 13٪ على نصف اللهجات في الوضع عبر اللغوي. والتقييم البشري في الدراسة وصف المخرجات بأنها طليقة وكافية المعنى وغالبًا ليست باللهجة المطلوبة.

أي أن ما أسميه تسرّب الفصحى ليس انطباعًا، بل ظاهرة موصوفة ومقيسة وذات اتجاه معروف.

نص تعليمات النظام الذي أستعمله

بدل الوصف، هذا النص نفسه، جاهزًا للنسخ والتعديل على لهجتك:

اكتب بالشامية الدمشقية المحكية كما يكتب شخص على واتساب.
ممنوع تمامًا: سوف، سـ، لم، لن، الذي، التي، الخاص بك، يمكنك أن.
استعمل: رح، ما، يلي، تبعك، فيك.
جمل قصيرة متتابعة، لا جملة واحدة طويلة.
أبقِ أي مصطلح تقني كما كتبه المستخدم بالإنجليزية.
الأدب لا يعني الفصحى: كن مهذبًا بالمحكية.
أمثلة على النبرة المطلوبة:
“أهلين، أكيد بقدر ساعدك. بس خبرني شو صار بالضبط؟”
“تمام، رح بعتلك الملف خلال ساعة. إذا في شي ناقص احكيلي.”
“والله ما انتبهت لهالنقطة، معك حق. رح عدّلها هلق.”

العنصر الحاسم هو سطر الممنوعات. منع أربع صيغ بالاسم أقوى من عشر جمل تصف اللهجة، لأن النموذج يعامل المنع قيدًا والوصف اقتراحًا. والعنصر الثاني هو الأمثلة الثلاثة: النموذج يقلّد نبرة يراها أفضل بكثير مما ينفّذ وصفًا يقرؤه.

كيف تقيس أثر كل عنصر

شغّل الحوار نفسه أربع مرات، وغيّر إعداد الطلب في كل مرة، وسجّل رقمًا واحدًا فقط: الدور الذي وقع فيه أول تسرّب بنيوي، أي أول ظهور لـ”سوف” أو “لم” أو تركيب فصيح كامل.

الترتيب الذي أتوقعه من تجربتي، ومن المفيد أن تتحقق منه بنفسك لأنه يختلف بين النماذج:

الإعدادما ألاحظه عادة
طلب بسيط: “ردّ بالسورية”التسرّب مبكر، غالبًا من الدور الثاني أو الثالث
طلب مع وصف اللهجة بالكلامتحسّن طفيف، والوصف وحده لا يصمد
طلب مع ثلاثة أمثلة مكتوبةتحسّن ملموس، لأن التقليد أقوى من الوصف
أمثلة زائد قائمة ممنوعات صريحةالأفضل بوضوح، والتسرّب يتأخر إلى أدوار متقدمة

النقطة العملية: أنت تملك تحسين هذا الرقم بنفسك دون انتظار إصدار جديد. وهذه من المرات القليلة في تقييم النماذج التي يكون فيها القرار بيدك لا بيد المختبر.


من دفتر الاختبار: اختبار الحذف مطبَّقًا على نصين

اختبار الحذف هو أسرع ما عندي، وهذه تجربته كاملة على نصين.

النص الأول، مخرَج نموذج طُلب منه الرد بالشامية:

“أهلاً فيك، شو بقدر ساعدك؟ هلق سوف أقوم بمراجعة طلبك، ولم أتمكن من ذلك سابقًا لأن النظام الخاص بنا كان متوقفًا.”

احذف الكلمات اللهجية الصريحة: أهلاً فيك، شو، هلق. ماذا بقي؟

“بقدر ساعدك؟ سوف أقوم بمراجعة طلبك، ولم أتمكن من ذلك سابقًا لأن النظام الخاص بنا كان متوقفًا.”

فصحى سليمة تقريبًا. النتيجة: تسرّب كامل.

النص الثاني، مكتوب بيد متحدث أصلي:

“أهلين، كيف بقدر ساعدك؟ هلق بشوف طلبك، ما قدرت شوفو قبل لأن النظام تبعنا كان واقع.”

احذف الكلمات نفسها: أهلين، هلق. ماذا بقي؟

“كيف بقدر ساعدك؟ بشوف طلبك، ما قدرت شوفو قبل لأن النظام تبعنا كان واقع.”

نص مكسور فصيحًا، لأن اللهجة داخلة في بنيته: “بشوف” لا “سأرى”، و”ما قدرت” لا “لم أتمكن”، و”تبعنا” لا “الخاص بنا”، و”واقع” لا “متوقف”. النتيجة: لهجة أصيلة.

هذا الاختبار يأخذ عشر ثوانٍ ولا يحتاج أداة، وهو أدق من أي مقياس معجمي رأيته.

المؤشرات الخمسة التي أعدّها في كل نص لهجي

المؤشراللهجيالفصيح المتسرّب
المستقبلرح، حـسوف، سـ
النفيمالم، لا، لن
الموصوليليالذي، التي
الملكيةتبعي، إليالخاص بي، لدي
الفعل المضارعبشوف، بروحأرى، أذهب

خمسة مؤشرات، وعدّ سريع. إن وجدت ثلاثة منها بالصيغة الفصيحة داخل نص يُفترض أنه لهجي، فالنموذج لم يكتب لهجة.

لماذا الأمثلة أقوى من الوصف

جرّبت الاثنين مرارًا، والفرق واضح: النموذج يقلّد ما يراه أفضل مما ينفّذ ما يقرؤه. وصف اللهجة بجملة “اكتب بالشامية المحكية” يعطي نتيجة أضعف بكثير من ثلاثة أمثلة قصيرة مكتوبة بيد متحدث أصلي داخل تعليمات النظام.

والسبب بنيوي: الوصف يُعالَج بوصفه تعليمة قابلة للتفسير، والمثال يُعالَج بوصفه نمطًا يُحتذى. ولهذا أضع الأمثلة دائمًا قبل القواعد، لا بعدها.

المصادر

  • HELM Arabic، Stanford CRFM مع Arabic.AI: crfm.stanford.edu/2025/12/18/helm-arabic.html
  • لوحة OALL النسخة الثانية: huggingface.co/blog/leaderboard-arabic-v2
  • تفاصيل Llama 4 وإصداراته: en.wikipedia.org/wiki/Llama_(language_model)
  • تقييم ALLaM 34B ونمط العودة إلى الفصحى: arxiv.org/abs/2508.17378
  • AL-QASIDA، ارتباط الفشل اللهجي بالعودة إلى الفصحى: arxiv.org/abs/2412.04193