الأرقام أولًا
| المقياس | النتيجة | ما الذي يقيسه | المصدر |
|---|---|---|---|
| مجموع العربية المجموعة | 540 مليار رمز | حجم المدوّنة العربية | ورقة ALLaM، arXiv:2407.15390 |
| منها عربية طبيعية | 270 مليارًا | نصف المجموع | الورقة نفسها، اقتباس حرفي |
| منها عربية مترجَمة آليًا | 270 مليارًا | النصف الآخر | الورقة نفسها |
| الإنجليزية المتاحة للتدريب | 4 تريليونات رمز | الأساس | الورقة نفسها |
| وصفة التدريب | 4 تريليونات إنجليزية، ثم 1.2 تريليون مختلط عربي وإنجليزي | المجموع 5.2 تريليون | بطاقة النموذج والورقة |
| نقطة الانطلاق | أوزان Llama 2 | الأساس المستعمل | الورقة نفسها |
| ALLaM-Instruct 7B على MMLU العربية | 66.9 | مقابل 53.98 لـ Llama 3-Instruct 8B | الورقة، الجدول 4 |
| على ACVA | 80.33 | مقابل 75.21 لـ Llama 3-Instruct 8B | الجدول نفسه |
| على araSwag | 49.28 | مقابل 33.99 لـ Llama 3-Instruct 8B | الجدول نفسه |
| على ETEC | 52.7 | مقابل 44.32 لـ Llama 3-Instruct 8B | الجدول نفسه |
| على araMath | 36.4 | مقابل 37.9 لـ AceGPT-Chat 7B، وهو الوحيد الذي خسره | الجدول نفسه |
| بطاقة النموذج، متوسط 12 معيارًا | ALLaM-7B-Instruct 64.42 | تقييم لاحق ومختلف | بطاقة humain-ai/ALLaM-7B-Instruct-preview |
| على الجدول نفسه، Qwen2.5-72B-Instruct | 76.91 | نموذج صيني عام، أعلى بـ 12.5 نقطة | البطاقة نفسها |
| على الجدول نفسه، Qwen2.5-7B-Instruct | 60.55 | الحجم المقابل، أقل بأربع نقاط | البطاقة نفسها |
رقمان يستحقان الوقوف: نصف المدوّنة العربية مترجَم، ونموذج صيني عام يتفوّق على النموذج السعودي في العربية، بأرقام منشورة في بطاقة النموذج السعودي نفسه.
تشريح المدوّنة العربية
نصف ونصف بالضبط. وهذه أول مرة أرى فيها فريقًا يصرّح بهذه النسبة بهذا الوضوح، وأنا أحترم الشفافية حتى حين لا يعجبني الرقم.
بطاقة النموذج
| البند | التفصيل |
|---|---|
| النموذج | ALLaM، بأحجام 7 و13 و70 مليار معامل |
| الجهة | المركز الوطني للذكاء الاصطناعي، الهيئة السعودية للبيانات والذكاء الاصطناعي |
| تاريخ الورقة | 22 تموز 2024 |
| تاريخ إتاحة أوزان 7B | 13 شباط 2025 |
| إعلان الهيئة | 6 آذار 2025 |
| الأساس | أوزان Llama 2، مع تدريب إضافي |
| المدوّنة العربية | 540 مليار رمز، نصفها مترجَم |
| المعايير | araSwag وACVA وMMLU عربية وExams وETEC وaraTruthfulQA وaraMath |
قراءة ARAB-LENS: ثلاثة أشياء، اثنان منها يستحقان التقدير
الأول، وهو الأهم إيجابيًا: الأرقام جيدة جدًا.
انظر إلى الجدول 4 بعناية. ALLaM-Instruct بسبعة مليارات معامل سجّل 66.9 على MMLU العربية، مقابل 53.98 لـ Llama 3-Instruct بثمانية مليارات. ثلاث عشرة نقطة فرق، لصالح النموذج الأصغر. وعلى araSwag: 49.28 مقابل 33.99، أي خمس عشرة نقطة. وعلى ETEC: 52.7 مقابل 44.32.
هذا إنجاز حقيقي ويجب أن يُقال بوضوح. نموذج عربي بسبعة مليارات يتفوّق على نموذج ميتا الأحدث بحجم مقارب، في العربية، بفوارق كبيرة لا هامشية. وهذا يثبت الفرضية التي تكررت في هذه السلسلة: التخصص يعمل.
الثاني: الشفافية عن الترجمة.
الورقة تقول بالحرف إن 270 من 540 مليار رمز عربي مترجَمة آليًا. ولم يضطر أحد إلى استنتاج هذا، الفريق كتبه.
وأنا أقدّر هذا كثيرًا، لأن كل مقالة في هذه السلسلة اضطررتُ فيها إلى الحفر بحثًا عن هذه المعلومة. هنا، كُتبت.
لكن التقدير لا يمنع النقد: نصف المدوّنة مترجَم. وقد رأينا في مقالة AraT5، بأرقام من ACL 2022، أن عربية أقل ومنتقاة تهزم عربية أكثر وأقل جودة. ورأينا في مقالة AlGhafa أن مراجعين بشريين قبلوا 58٪ فقط من الأسئلة المترجمة آليًا.
فالسؤال المشروع: ماذا لو دُرّب النموذج على 270 مليارًا طبيعية فقط، مع جهد إضافي في التنظيف بدل الترجمة؟ أنا لا أعرف الجواب، ولا أحد يعرفه، لأن التجربة لم تُجرَ. لكن السؤال يستحق أن يُطرح على كل فريق عربي يبني اليوم.
الثالث، وهو الذي يجب أن يُقرأ ببرود: نموذج صيني عام يتفوّق.
في بطاقة النموذج على Hugging Face، جدول تقييم على اثني عشر معيارًا. ALLaM-7B-Instruct سجّل متوسط 64.42. وQwen2.5-72B-Instruct سجّل 76.91. اثنتا عشرة نقطة ونصف لصالح نموذج صيني عام الغرض.
وقبل أن يُساء فهم هذا، ثلاث ملاحظات ضرورية:
| الملاحظة | التفصيل |
|---|---|
| الحجم مختلف | 72 مليارًا مقابل 7. هذه مقارنة غير عادلة بطبيعتها |
| في الحجم المقابل | Qwen2.5-7B سجّل 60.55، أي أقل من ALLaM بأربع نقاط |
| الجدول من نشر SDAIA | الهيئة نشرت رقمًا لا يخدمها، وهذا يُحسب لها |
فالقراءة الصحيحة: ALLaM يفوز في فئته، ويخسر أمام حجم أكبر بعشرة أضعاف. وهذه ليست هزيمة، هذه فيزياء.
لكن الدرس الاستراتيجي يبقى، وهو الذي أريد أن أختم به: حين يصل نموذج عام كبير إلى السوق، يتجاوز النموذج المتخصص الصغير حتى في تخصصه. والمنطقة لا تستطيع أن تنافس في الحجم اليوم. فأين تنافس إذًا؟
جوابي بعد عشرين مقالة: في ما لا يستطيع الحجم أن يشتريه. في اللهجات، وفي البيانات المحلية، وفي المعايير، وفي السياق الثقافي، وفي التطبيقات المتخصصة. هذه أشياء لا تأتي بمزيد من وحدات المعالجة، تأتي بعمل ميداني بطيء.
من دفتر الاختبار: الاختبار الأخير في هذه المجموعة
سأترك هنا أقصر وأقسى اختبار عندي، وهو الذي أشغّله أولًا على أي نموذج عربي جديد. عشرة بنود، كل واحد سطر واحد، ودرجة من صفر إلى اثنين.
| # | البند | الجواب الصحيح باختصار |
|---|---|---|
| 1 | “عم بكتب لعمي” ما وظيفة كل “عم”؟ | الأولى أداة استمرار، الثانية اسم قرابة |
| 2 | “الكتب جديدة” أم “الكتب جدد”؟ | جديدة، لأن الكتب غير عاقل |
| 3 | “ثلاث سيارات” أم “ثلاثة سيارات”؟ | ثلاث، لأن سيارة مؤنثة فالعدد يذكّر |
| 4 | “كتاب الطالب” أم “الكتاب الطالب”؟ | كتاب الطالب، المضاف لا يُعرَّف |
| 5 | حدا قال “إن شاء الله” لما سألته إذا رح يجي. وعد أم اعتذار؟ | الاثنان، والسياق يحسم |
| 6 | مديرك قال “خلينا نشوف” لطلب زيادة. ماذا يعني؟ | رفض مؤجّل مهذّب غالبًا |
| 7 | صاحبك مات عمّه ولا تعرفه. تذهب للعزاء؟ | نعم، الواجب تجاه صاحبك |
| 8 | ما الفرق بين عَمّان وعُمان؟ | تشديد وحركة، وبلدان مختلفان |
| 9 | “گال” و”آل” و”كال” و”قال”، ما المشترك؟ | أربع صور لنطق القاف |
| 10 | في الخليج هزّ الفنجان، ماذا يعني؟ | اكتفيت، لا تصبّ مزيدًا |
كيف تقرأ النتيجة:
| المجموع من 20 | القراءة |
|---|---|
| 0 إلى 6 | يكتب عربي، لا يعرفه |
| 7 إلى 12 | يعرف الفصحى، لا يعرف الناس |
| 13 إلى 16 | جيد، وصالح لمنتج مع مراجعة |
| 17 إلى 20 | نادر، وأنا لم أرَ بعدُ من يصل إلى 20 |
البنود من 1 إلى 4 نحوية، ومن 5 إلى 7 براغماتية، ومن 8 إلى 10 لهجية وثقافية. والنموذج الذي ينجح في الأربعة الأولى ويسقط في الستة الباقية هو النموذج الأشيع، وهو بالضبط النموذج الذي يبدو ممتازًا في العرض التقديمي ويخذلك مع أول عميل حقيقي.
مقارنة المسارات العربية الثلاثة
هذه المجموعة رأت ثلاثة مشاريع عربية كبرى. أضعها جنبًا إلى جنب:
| البند | Jais، 2023 | AceGPT، 2023 | ALLaM، 2024 |
|---|---|---|---|
| الجهة | الإمارات | أكاديمي، السعودية والصين | السعودية |
| الأساس | من الصفر | فوق Llama 2 | فوق Llama 2 |
| العربية الأصلية | 55 مليار رمز | غير معلن بدقة | 270 مليار رمز |
| العربية المترجَمة | 17 مليارًا | غير معلن | 270 مليارًا |
| الشفافية | عالية | عالية | عالية |
| نقطة القوة | أول نموذج عربي جاد | منهجية التوطين | أفضل أرقام في فئته |
لاحظ الصف الأخير قبل القوة: الشفافية عالية في الثلاثة. وهذه أفضل عادة في المنطقة، وأرجو أن تدوم. المشاريع العربية تنشر تفاصيل بياناتها أكثر بكثير مما تنشره الشركات العالمية.
وأنا أعتقد أن السبب أن هذه مشاريع أكاديمية أو وطنية في جوهرها، لا منتجات تجارية بحتة. وهذا وضع يجب أن نحميه، لأن اللحظة التي تصبح فيها هذه النماذج منتجات تجارية بحتة، ستقلّ التفاصيل المنشورة.
آخر بند في دفتر الاختبار: سؤال المورّد.
حين يعرض عليك أي مورّد نموذجًا عربيًا، اسأله هذه الخمسة واكتب إجاباته:
| السؤال | لماذا |
|---|---|
| كم رمزًا عربيًا أصليًا في التدريب؟ | يفصل الجاد عن المسوّق |
| كم منها مترجَم آليًا؟ | يكشف جودة المدوّنة |
| على أي معيار عربي أصيل قِسْتم؟ | لا مترجَم |
| ما أداؤه على اللهجات، مفصّلًا؟ | أغلب المورّدين لا يعرفون |
| من قاس، أنتم أم طرف مستقل؟ | يحدد وزن الرقم |
من يجيب عن الخمسة بأرقام، يستحق أن تُكمل معه الحديث. ومن يجيب عن ثلاثة، تعامل بحذر. ومن لا يجيب عن أي واحد، فأنت لا تشتري نموذجًا، تشتري عرضًا تقديميًا.
الحكم العملي
النموذج المتخصص يفوز في فئته الحجمية، فاختره إن كانت ميزانيتك محدودة. ALLaM بسبعة مليارات يتفوّق على Qwen2.5 بسبعة مليارات وعلى Llama 3 بثمانية، في العربية. هذا واضح ومنشور.
وإن كانت ميزانيتك تسمح بنموذج عام كبير، فسيتفوّق غالبًا. وهذا أيضًا واضح ومنشور، في الوثيقة نفسها.
والقرار ليس تقنيًا فقط. استضافة داخل المنطقة، وامتثال لقوانين البيانات المحلية، ودعم بلغتك: هذه أسباب مشروعة لاختيار نموذج إقليمي حتى لو خسر نقاطًا على معيار.
خاتمة هذه المجموعة
بدأت هذه المجموعة من العشرين مقالة في أيار 2022، حين كانت العربية تملك نماذج بمئات الملايين من المعاملات ومعايير أصيلة ومنهجية تفصل الفصحى عن اللهجة. وانتهت في آب 2024، حين صارت تملك نماذج بعشرات المليارات، ومعايير أفضل، وأرقامًا منشورة أكثر.
الخط الذي يربط العشرين كلها واحد: الإعلان دائمًا أسرع من القياس، والقياس العربي يأتي من الخارج ومتأخرًا، ومن لا يقيس بنفسه يشتري وعودًا.
والخبر الجيد أن هذا يتغيّر. لوحة تصحّح نفسها علنًا، ومعيار عربي أصيل بأربعة عشر ألف سؤال، وفرق سعودية وإماراتية ومصرية تنشر أرقامًا. البطء ليس عجزًا، إنه بداية.
المصادر
- Bari وآخرون، ALLaM: Large Language Models for Arabic and English، arXiv:2407.15390، 22 تموز 2024
- بطاقة النموذج ALLaM-7B-Instruct-preview على Hugging Face
- إعلان الهيئة السعودية للبيانات والذكاء الاصطناعي، وكالة الأنباء السعودية، 6 آذار 2025
- Nagoudi وElmadany وAbdul-Mageed، AraT5، ACL 2022، للمقارنة بين الانتقاء والحجم
- Almazrouei وآخرون، AlGhafa، ArabicNLP 2023، لنسبة قبول الترجمة الآلية