الأرقام أولًا
| المقياس | النتيجة | ما الذي يقيسه | المصدر |
|---|---|---|---|
| اللغات المدعومة رسميًا | ثماني: الإنجليزية والألمانية والفرنسية والإيطالية والبرتغالية والهندية والإسبانية والتايلاندية | التزام ميتا المعلن | بطاقة نموذج Llama 3.1 |
| العربية ضمنها | لا | هل لغتك في القائمة | البطاقة نفسها |
| نسبة البيانات متعددة اللغات | 8٪ تقريبًا من المزيج | حصة كل اللغات غير الإنجليزية مجتمعة | ورقة Llama 3 Herd of Models |
| تركيبة المزيج الكاملة | 50٪ معرفة عامة، 25٪ رياضيات واستدلال، 17٪ شيفرة، 8٪ متعدد اللغات | أين ذهبت السعة | الورقة نفسها، اقتباس حرفي |
| مجموع رموز التدريب | نحو 15 تريليون رمز | الحجم | بطاقة النموذج |
| عدد اللغات التي صُنّفت بها الوثائق | 176 لغة | أداة تصنيف fastText | الورقة نفسها |
| MMLU متعددة اللغات للنموذج 405B | البرتغالية 84.95، الإسبانية 85.08، الإيطالية 85.04، الألمانية 84.36، الفرنسية 84.66، الهندية 80.31، التايلاندية 78.21 | سبع لغات، بلا عربية | بطاقة النموذج |
| رقم عربي منشور لـ Llama 3.1 405B | لا يوجد | لا من ميتا ولا من طرف ثالث | البطاقة، الورقة، Global MMLU، AraLingBench |
| تاريخ انقطاع المعرفة | كانون الأول 2023 | حدود ما يعرفه | بطاقة النموذج |
السطر قبل الأخير هو الخبر: أكبر نموذج مفتوح في العالم، ولا رقم عربي منشور له من أي جهة.
أين ذهبت الخمسة عشر تريليونًا
ثمانية بالمئة لكل لغات العالم غير الإنجليزية. وهذه القسمة، لا اللغة نفسها، هي ما يحدّد كم ستفهم النماذج لغتك.
بطاقة النموذج
| البند | التفصيل |
|---|---|
| النموذج | Llama 3.1، بأحجام 8 و70 و405 مليار معامل |
| الجهة | ميتا |
| تاريخ الإصدار | 23 تموز 2024 |
| الورقة | The Llama 3 Herd of Models، arXiv:2407.21783 |
| بيانات التدريب | نحو 15 تريليون رمز من بيانات متاحة علنًا |
| اللغات المدعومة | ثماني |
| موقف ميتا من بقية اللغات | “قد يستطيع Llama إخراج نص بلغات أخرى غير التي تستوفي عتبات الأداء للسلامة والفائدة” |
| الترخيص | يسمح بالضبط الدقيق للغات خارج الثماني |
قراءة ARAB-LENS: ما الذي تغيّر منذ Llama 2، وما الذي لم يتغيّر
في المقالة الثانية والعشرين كتبتُ عن Llama 2: العربية تحت عتبة جدول البيانات، أي أقل من خمسة أجزاء من مئة ألف. الآن، بعد سنة، ما الوضع؟
ما تغيّر، وهو تغيّر حقيقي:
المزيج صار فيه بند صريح للغات متعددة بنسبة ثمانية بالمئة. وفي نموذج مدرَّب على خمسة عشر تريليون رمز، ثمانية بالمئة تعني نحو تريليون ومئتي مليار رمز غير إنجليزية. هذا رقم ضخم بكل المقاييس، وأكبر بأضعاف كثيرة مما كان متاحًا في الجيل السابق.
كذلك، ميتا صارت تصنّف وثائقها إلى مئة وستة وسبعين لغة بأداة تصنيف. أي أن العربية على الأقل تُرى الآن في خط الإنتاج، لا تسقط في كتلة “غير معروفة”.
ما لم يتغيّر:
القائمة الرسمية ثماني لغات، والعربية ليست منها. وجدول MMLU متعددة اللغات في بطاقة النموذج يعرض سبع لغات، والعربية ليست فيها أيضًا.
ولاحظ التركيبة: البرتغالية والإسبانية والإيطالية والألمانية والفرنسية والهندية والتايلاندية. سبع لغات، خمس منها أوروبية. والتايلاندية موجودة والعربية لا. وأنا لا أقول هذا استنكارًا، بل توثيقًا لترتيب أولويات مرئي.
والآن الحساب الذي أريدك أن تراه.
تريليون ومئتا مليار رمز موزّعة على اللغات غير الإنجليزية. لو قُسّمت بالتساوي على مئة وستة وسبعين لغة، لنالت كل لغة نحو ستة مليارات وثمانمئة مليون رمز. وهذا أكثر بكثير من أي شيء رأيناه في Llama 2.
لكن القسمة ليست بالتساوي، وهذا جوهر المسألة. القائمة الرسمية ثماني لغات، وهي التي تستوفي “عتبات الأداء”. أي أن الحصة الأكبر ذهبت إلى السبع غير الإنجليزية في القائمة، والباقي اقتُسم على البقية. وأنا أضع هذا الحساب أمامك كفرضية توضيحية لا كرقم منشور، لأن ميتا لم تنشر التوزيع.
النقطة الأخيرة، وهي الأهم عمليًا: لا يوجد رقم عربي لهذا النموذج، من أي مصدر. بحثتُ في بطاقة النموذج، وفي الورقة، وفي ورقة Global MMLU التي قيّمت نسختي 8B و70B ولم تقيّم 405B، وفي AraLingBench التي غطّت نماذج حتى سبعين مليارًا فقط. لا شيء.
وهذا يستحق التأمل: أكبر نموذج مفتوح أُنتج حتى ذلك التاريخ، متاح للجميع بترخيص مفتوح، ولا أحد نشر كم يعرف من العربية. ليس لأن أحدًا منع القياس، بل لأن حجم النموذج يجعل تشغيله مكلفًا، والباحثون العرب يقيسون ما يستطيعون تشغيله.
وهذه في رأيي إحدى أخطر الفجوات في المجال: القياس نفسه صار امتيازًا يحتاج ميزانية حوسبة.
من دفتر الاختبار: ماذا تفعل حين لا تستطيع قياس النموذج بنفسك
هذه حالة عملية شائعة: النموذج ضخم، وأنت لا تملك ما يشغّله. هذه طريقتي.
البند الأول: قِس الأصغر واستنتج الاتجاه.
إن كان النموذج يأتي بثلاثة أحجام، قِس الصغير والمتوسط. النتيجة لا تعطيك رقم النموذج الكبير، لكنها تعطيك الاتجاه: هل العربية تتحسّن مع الحجم في هذه العائلة أم تبقى ثابتة؟
| النمط الذي تراه | ما يعنيه |
|---|---|
| تحسّن كبير من 8 إلى 70 مليارًا | العربية موجودة في البيانات، والحجم يستخرجها |
| تحسّن ضئيل | العربية شبه غائبة، والحجم لا يخلقها |
| تدهور | البيانات العربية ملوّثة أو مترجمة |
البند الثاني: اختبر عبر مزوّد استضافة.
النماذج الكبيرة متاحة عبر منصات استضافة بأسعار معقولة. خمسون سؤالًا من امتحانك الخاص تكلّف أقل من فنجان قهوة. لا تحتاج أن تشغّل النموذج لتقيسه.
البند الثالث: اختبر الضبط الدقيق كخيار.
ترخيص Llama 3.1 يسمح صراحة بالضبط الدقيق للغات خارج الثماني. وهذا يفتح مسارًا عمليًا: نموذج قاعدته قوية وعربيته ضعيفة، تضبطه أنت على بياناتك. وهذا بالضبط ما فعله كثير من الفرق العربية.
لكن انتبه إلى الحد: الضبط الدقيق يحسّن الأسلوب والصيغة والمجال، ولا يزرع معرفة جديدة بكثافة. وهذا درس رأيناه في مقالة AceGPT بالأرقام.
البند الرابع: اختبار اللغات الثماني كمقياس مرجعي.
هذه حيلة أستعملها كثيرًا. اسأل السؤال نفسه بالعربية وبالإسبانية، وهي من اللغات المدعومة. ثم قارن.
“اشرح لي بإيجاز ثلاثة فروق بين عقد الإيجار وعقد البيع.”
الفرق الذي تراه بين الجوابين هو ضريبة عدم الدعم بعينها. وهذا مقياس عملي وسريع، ولا يحتاج معيارًا ولا لوحة ترتيب. وأنا أستعمله في كل مرة أقيّم فيها نموذجًا لغتي خارج قائمته.
البند الخامس: اختبار الفرق بين الأحجام في العائلة نفسها.
هذا بند منهجي أنصح به كل من يختار من عائلة نماذج:
| المقارنة | ما تكشفه |
|---|---|
| 8B مقابل 70B بالإنجليزية | مكسب الحجم عمومًا |
| 8B مقابل 70B بالعربية | مكسب الحجم في لغتك |
| النسبة بين المكسبين | هل لغتك تستفيد من الحجم كغيرها |
إن كان مكسب الحجم بالإنجليزية عشر نقاط وبالعربية نقطتين، فالحجم لا يحلّ مشكلتك. وهذا يعني أن زيادة الميزانية لن تحسّن منتجك العربي، وأن عليك أن تنفق على البيانات لا على الحوسبة.
وهذه في رأيي أهم معلومة يستطيع فريق عربي أن يحصل عليها قبل أن يلتزم بميزانية.
البند السادس: اختبار السلامة بالعربية.
ميتا تربط اللغات المدعومة بـ”عتبات الأداء للسلامة والفائدة”. وهذا يعني ضمنًا أن العربية لم تستوفِ عتبة السلامة. اختبر ذلك:
| الطلب | ما تراقبه |
|---|---|
| سؤال طبي عام بالعربية | هل يضيف تنبيهًا مناسبًا؟ |
| سؤال قانوني محلي | هل ينبّه إلى اختلاف الأنظمة؟ |
| محتوى حساس ثقافيًا | هل يتعامل بحذر أم بعشوائية؟ |
| محاولة التفاف بالعربية | هل الحماية بالعربية كما بالإنجليزية؟ |
البند الأخير هو الأخطر عمليًا، وهو ما تقصده ميتا على الأرجح: آليات الحماية تُختبر وتُضبط بالإنجليزية، وقد تكون أضعف بلغات أخرى. ومن يبني منتجًا عامًا بالعربية يجب أن يضع طبقة حماية خاصة به، لا أن يعتمد على حماية النموذج وحدها.
ماذا يعني “عتبة الأداء” عمليًا
عبارة ميتا دقيقة وتستحق التفكيك:
| الجزء | المعنى العملي |
|---|---|
| “عتبات الأداء” | يوجد رقم داخلي لم تبلغه العربية |
| “للسلامة” | الحماية غير مضمونة بلغتك |
| “والفائدة” | الجودة غير مضمونة بلغتك |
| “قد يستطيع إخراج نص” | سيعمل، لكن بلا التزام |
الجملة كلها إخلاء مسؤولية مصاغ بعناية. وأنا أحترم صياغتها لأنها صادقة: النموذج سيكتب عربية، والشركة لا تضمنها.
والخلاصة التي أريد أن أتركها: قائمة اللغات ليست تصنيفًا لغويًا، إنها حدود الضمان. واقرأها كما تقرأ ضمان جهاز: ما داخل القائمة مغطّى، وما خارجها على مسؤوليتك.
الحكم العملي
قائمة اللغات الثماني وثيقة، فاستعملها. إن كانت لغتك خارجها، أنت خارج نطاق الالتزام، مهما كان النموذج ممتازًا.
والترخيص يسمح لك بالضبط الدقيق، فاستعمله أيضًا. وميتا كتبت ذلك صراحة. هذا أفضل ما في هذا الإصدار بالنسبة للمنطقة: أساس قوي جدًا وإذن صريح بالبناء عليه.
ولا تنتظر أن يقيس أحد لغتك. إن كان أكبر نموذج مفتوح في العالم بلا رقم عربي بعد سنتين، فالانتظار ليس خطة.
المقالة القادمة
في اليوم نفسه تقريبًا، نشرت الهيئة السعودية للبيانات والذكاء الاصطناعي ورقة نموذجها ALLaM. وفيها رقم يستحق أن يُقرأ مرتين: نصف بياناتها العربية مترجَم آليًا. وفي بطاقة النموذج نفسها، جدول يضع نموذجًا صينيًا عامًا فوق النموذج السعودي في العربية. المقالة الأخيرة في هذه المجموعة.
المصادر
- ميتا، بطاقة نموذج Llama 3.1: github.com/meta-llama/llama-models
- Grattafiori وآخرون، The Llama 3 Herd of Models، arXiv:2407.21783، تموز 2024
- ورقة Global MMLU، arXiv:2412.03304، كانون الأول 2024
- AraLingBench، arXiv:2511.14295