الأرقام أولًا
| المقياس | النتيجة | ما الذي يقيسه | المصدر |
|---|---|---|---|
| حصة العربية في بيانات تدريب Llama 2 | غير مدرجة، أي أقل من 0.005٪ | كم عربية دخلت النموذج أصلًا | ورقة Llama 2، الجدول 10، تموز 2023 |
| حصة الإنجليزية | 89.70٪ | حجم الهيمنة | الجدول نفسه |
| حصة “لغة غير معروفة” | 8.38٪ | الكتلة التي لا تفصيلات لها | الجدول نفسه |
| أعلى لغة غير إنجليزية، الألمانية | 0.17٪ | السقف الحقيقي لأي لغة أخرى | الجدول نفسه |
| عتبة الإدراج في الجدول | 0.005٪ | لماذا اختفت العربية | الجدول نفسه |
| LLaMA2-7B على MMLU العربية | 29.47٪ | مقابل 29.0٪ للتخمين العشوائي | ورقة AceGPT، NAACL 2024 |
| LLaMA2-7B على EXAMs العربية | 23.48٪ | أقل من التخمين | الورقة نفسها |
| LLaMA2-13B على ArabicMMLU | 36.1٪ | مقابل 72.5٪ لـ GPT-4 | Koto وآخرون، ArabicMMLU |
| Llama 2-Chat 7B على araSwag | 24.44 | أضعف رقم في جدول المقارنة كله | ورقة ALLaM، تموز 2024 |
الرقم السادس هو الذي يجب أن يوقفك: 29.47 مقابل 29.0 للتخمين العشوائي. نصف نقطة فوق الصدفة. هذا ليس أداء ضعيفًا، هذا غياب أداء.
جدول اللغات، كما نشرته ميتا
انتبه للسطر الأخير. لا يوجد عمود لأن لا يوجد رقم. العربية، لغة نحو نصف مليار إنسان، لم تصل إلى عتبة خمسة أجزاء من مئة ألف.
بطاقة النموذج
| البند | التفصيل |
|---|---|
| النموذج | Llama 2، بأحجام 7 و13 و70 مليار معامل |
| الجهة | ميتا |
| تاريخ الإصدار | 18 تموز 2023 |
| الورقة | arXiv:2307.09288 |
| الترخيص | مفتوح للاستعمال التجاري بشروط |
| العربية في اللغات المذكورة | لا ذكر |
| تحذير ميتا نفسها | “مجموعة تدريب أغلبها إنجليزي تعني أن النموذج قد لا يكون مناسبًا للاستعمال في لغات أخرى” |
السطر الأخير مهم جدًا وسأعود إليه. ميتا حذّرت. الورقة تقول الجملة حرفيًا. ومع ذلك بنى نصف العالم العربي منتجاته على هذا النموذج لأنه كان مجانيًا.
قراءة ARAB-LENS: الصفر الذي لم يعتذر أحد عنه
سأقول شيئًا قد يبدو قاسيًا: Llama 2 لم يفشل في العربية، Llama 2 لم يحاول العربية. والفرق بين الاثنين هو الفرق بين طالب رسب في الامتحان وطالب لم يدخل القاعة.
انظر إلى الجدول مرة أخرى. لم تختفِ العربية وحدها. اختفت الهندية والبنغالية والتركية والفارسية والعبرية والإندونيسية والسواحلية. الجدول يضم ستًا وعشرين لغة تقريبًا، كلها أوروبية أو شرق آسيوية، والباقي صفر. هذا ليس قرارًا ضد العربية، هذا قرار لصالح الإنجليزية وحدها، والعربية من بين الضحايا.
والآن الشيء الذي أريدك أن تفهمه جيدًا، لأنه يفسّر عشر سنوات من الإحباط العربي مع هذه النماذج:
كتلة الـ 8.38٪ “غير معروفة” هي المكان الوحيد الذي قد تكون العربية اختبأت فيه. ميتا لا تفصّلها. أنا لا أستطيع أن أدّعي أن العربية داخلها، ولا أستطيع أن أنفي. لكن ما أستطيع قوله إنه حتى لو كانت كل العربية الموجودة داخل هذه الكتلة، فهي دخلت بلا تصنيف، بلا تنظيف، بلا وزن. نص عربي عشوائي سقط في العجينة.
وهذا يفسّر سلوكًا رأيته يتكرر مع كل نموذج مبني على Llama 2: النموذج يعرف شكل الحرف العربي، ويعرف بضع مئات من الكلمات الشائعة، ويستطيع أن يبني جملة تبدو عربية. ثم تسأله سؤالًا يحتاج معرفة فيسقط إلى مستوى التخمين. الشكل موجود، المحتوى غائب. وهذا بالضبط ما يقوله رقم 29.47 مقابل 29.0.
الملاحظة الأخيرة، وهي الأهم للمنطقة: عشرات الشركات والجامعات العربية أخذت Llama 2 وبنت عليه، لأن الترخيص مفتوح والتكلفة صفر. وهذه ليست غلطة، هذا كان الخيار الواقعي الوحيد. لكن النتيجة أن طبقة كاملة من المنتجات العربية بُنيت فوق أساس عربيته أقل من 0.005٪. ثم نتساءل لماذا لا تفهم منتجاتنا لهجاتنا.
رأيي بصراحة: المشكلة ليست أن ميتا لم تدرّب على العربية، المشكلة أننا بنينا كما لو أنها فعلت.
من دفتر الاختبار: كيف تكشف نموذجًا عربيته سطحية
هذه أربعة بنود تفصل بين “يكتب عربي” و”يعرف عربي”. شغّلها بالترتيب.
البند الأول: جمع غير العاقل.
القاعدة العربية: جمع غير العاقل يعامَل معاملة المفرد المؤنث. النموذج السطحي يخطئ فيها دائمًا لأنه تعلّمها من الإنجليزية.
| الصواب | الخطأ الشائع | لماذا |
|---|---|---|
| الكتب جديدة | الكتب جدد | الكتب غير عاقل |
| السيارات واقفة | السيارات واقفين | السيارات غير عاقل |
| المشاكل كثيرة | المشاكل كثار | مشاكل غير عاقل |
| الموظفون جدد | الموظفون جديدة | الموظفون عاقل، فالعكس صحيح هنا |
اطلب من النموذج أن يكتب فقرة من مئتي كلمة فيها خمسة جموع غير عاقل على الأقل، ثم عدّ الأخطاء.
البند الثاني: تمييز العدد المعكوس.
في العربية، العدد من ثلاثة إلى عشرة يخالف المعدود في التذكير والتأنيث. هذه قاعدة لا توجد في أي لغة أوروبية، فالنموذج السطحي لا يملكها أصلًا.
| الصواب | الخطأ | القاعدة |
|---|---|---|
| ثلاثة كتب | ثلاث كتب | كتاب مذكر، فالعدد مؤنث |
| ثلاث سيارات | ثلاثة سيارات | سيارة مؤنثة، فالعدد مذكر |
| خمسة رجال | خمس رجال | رجل مذكر |
| خمس نساء | خمسة نساء | امرأة مؤنثة |
البند الثالث: الإضافة.
اطلب جملة فيها إضافة، ثم افحص التنوين وأل التعريف:
| الصواب | الخطأ |
|---|---|
| كتابُ الطالبِ | الكتابُ الطالبِ |
| مدير الشركة | المدير الشركة |
| بابُ بيتٍ قديمٍ | بابُ البيتٍ قديمٍ |
النموذج الذي يضع “ال” على المضاف لم يتعلم العربية، تعلّم أن يلصق “ال” بالأسماء.
البند الرابع: اختبار اللهجة الأدنى.
اكتب بالشامي البسيط جدًا واطلب ردًا بالشامي:
“مرحبا، أنا بدي أسأل عن شغلة صغيرة. إذا حدا حجز وبعدين ما إجا، بترجعوله المصاري ولا لأ؟”
سجّل ثلاثة أشياء: هل فهم السؤال؟ هل ردّ بالشامي أم انزلق إلى الفصحى؟ وهل استعمل “بدي” و”مصاري” أم حوّلهما إلى “أريد” و”المال”؟
في النماذج المبنية على أساس ضعيف، الرد يكون فصيحًا بالكامل من الجملة الأولى. وهذا ليس تهذيبًا، هذا عجز.
البند الخامس: الهمزة على كرسيها.
قاعدة الهمزة المتوسطة تعتمد على قوة الحركتين: الكسرة ثم الضمة ثم الفتحة ثم السكون. النموذج الضعيف يكتب الهمزة عشوائيًا لأنه حفظ أشكال كلمات ولم يتعلم قاعدة.
| الصواب | الخطأ الشائع | الحركة الأقوى |
|---|---|---|
| مسؤول | مسئول أو مسأول | الضمة |
| رئيس | رءيس أو رايس | الكسرة |
| سأل | سئل بمعنى آخر | الفتحة |
| يقرأ | يقرآ أو يقرا | الفتحة والسكون |
| شيء | شئ | السكون قبل الهمزة |
| دفء | دفئ | السكون |
اطلب فقرة فيها عشر همزات متوسطة ومتطرفة، ثم عدّ. النموذج الذي يخطئ في أكثر من ثلاث لم يتعلم القاعدة، حفظ قائمة.
البند السادس: اختبار المعرفة المحلية.
هذه أسئلة لا يمكن الإجابة عنها من نص إنجليزي مترجَم:
| السؤال | ما يقيسه |
|---|---|
| “شو الفرق بين الشوبك والكرك؟” | جغرافيا أردنية دقيقة |
| “ليش بيقولوا على أهل حمص هيك؟” | نكتة شعبية شامية |
| “شو يعني حدا يقول لك إنه من الـ48؟” | سياق فلسطيني |
| “إيش الفرق بين العصيدة والمديدة؟” | مطبخ خليجي وسوداني |
| “ليش الجمعة إجازة وليس الأحد؟” | بديهية ثقافية |
الأخير هو الفخ. أي نموذج مدرَّب على نص إنجليزي سيقول “عطلة نهاية الأسبوع” ويربطها بالسبت والأحد افتراضًا. النموذج الذي يعرف العربية فعلًا يعرف أن أسبوع العمل يختلف، وأنه يختلف حتى بين الدول العربية نفسها.
من بنى على هذا الأساس، وماذا حصل
هذا الجدول أهم ما في المقالة عمليًا، لأنه يشرح خريطة النماذج العربية التي ستراها في المقالات التالية:
| النموذج | بُني على | النتيجة |
|---|---|---|
| Jais | مبني من الصفر، لا على Llama | عربيته أصيلة، لكن معرفته العامة أضعف |
| AceGPT | تدريب إضافي فوق Llama 2 | تحسّن كبير في الحوار، ثبات في المعرفة |
| ALLaM | بدأ من أوزان Llama 2 ثم أكمل | قفزة كبيرة، ونصف بياناته العربية مترجمة |
| عشرات النماذج المحلية | ضبط دقيق فوق Llama 2 | تحسّن سطحي فقط |
لاحظ الصف الثاني والثالث. AceGPT وALLaM كلاهما بدأ من Llama 2. أي أن نموذجين من أهم ما أنتجته المنطقة بُنيا فوق أساس عربيته تحت 0.005٪. وهما نجحا في تحسينه كثيرًا، وهذا إنجاز حقيقي. لكن السقف الذي يصطدمان به ليس سقف جهدهما، إنه سقف الأساس.
وأنا أرى أن هذا يفسّر نمطًا محدّدًا: النماذج العربية المبنية على Llama تجيد الأسلوب ولا تجيد الذاكرة. تكتب عربية جميلة وتخطئ في حقيقة تاريخية بسيطة. لأن التدريب الإضافي يعلّم النموذج كيف يتكلم، ولا يستطيع أن يزرع فيه ما لم يقرأه أصلًا.
الحكم العملي
إن كنت تختار نموذجًا مفتوحًا لمنتج عربي، اسأل سؤالًا واحدًا قبل أي شيء: هل نشرت الجهة المصنّعة حصة العربية في بيانات التدريب؟ إن كان الجواب لا، افترض أنها قريبة من الصفر حتى يثبت العكس.
وإن كنت مضطرًا للبناء على نموذج عربيته ضعيفة، فالتدريب الإضافي على بيانات عربية يساعد، لكن لا تتوقع معجزة. أنت تضيف طبقة فوق أساس، لا تبني أساسًا.
والأهم: لا تقس نموذجك بـ “هل يكتب عربي مفهوم”. هذا أسهل اختبار في الدنيا وكل النماذج تنجح فيه. قسه بالجموع والأعداد والإضافة واللهجة. هناك يظهر الفرق.
المقالة القادمة
بعد شهر واحد من هذا الإطلاق، أعلنت الإمارات عن Jais، أول نموذج ضخم مبني للعربية عمدًا، بمئة وستة عشر مليار رمز عربي. المقالة القادمة تشرح الرقم، وتشرح أيضًا التفصيل الذي يخفيه: كيف صار الـ 55 مليارًا 116 مليارًا.
المصادر
- ميتا، Meta and Microsoft Introduce the Next Generation of Llama، 18 تموز 2023: ai.meta.com/blog/llama-2
- Touvron وآخرون، Llama 2: Open Foundation and Fine-Tuned Chat Models، arXiv:2307.09288، الملحق أ.4، الجدول 10
- Huang وآخرون، AceGPT: Localizing Large Language Models in Arabic، NAACL 2024: aclanthology.org/2024.naacl-long.450
- Koto وآخرون، ArabicMMLU، Findings of ACL 2024: aclanthology.org/2024.findings-acl.334
- Bari وآخرون، ALLaM: Large Language Models for Arabic and English، arXiv:2407.15390، تموز 2024