الأرقام أولًا
| المقياس | النتيجة | ما الذي يقيسه | المصدر |
|---|---|---|---|
| اللغات المعلنة | خمس: الإنجليزية والفرنسية والإيطالية والألمانية والإسبانية | ما تقوله الشركة عن نموذجها | إعلان Mistral، 11 كانون الأول 2023 |
| ذكر العربية في الإعلان | لا يوجد | هل ذُكرت أصلًا | الإعلان نفسه |
| ذكر العربية في ملخص الورقة | لا يوجد | الوثيقة التقنية | arXiv:2401.04088 |
| البنية | مزيج خبراء، 8 خبراء يُستدعى منهم 2 | كيف يُوزَّع الحساب | الإعلان والورقة |
| المعاملات الكلية | نحو 47 مليارًا | الحجم الاسمي | الورقة |
| المعاملات النشطة لكل رمز | نحو 13 مليارًا | الكلفة الفعلية | الورقة |
| نتيجة عربية منشورة للنموذج الرسمي | لا توجد | بحثتُ في لوحة OALL وHELM Arabic | مجموعة نتائج OALL، لوحة HELM Arabic |
| ما يوجد على لوحة OALL بدل ذلك | نسخ مجتمعية معدّلة فقط | لا تمثّل النموذج الأصلي | مجموعة نتائج OALL |
الصيغة الدقيقة التي ألتزم بها: إعلان Mistral يذكر خمس لغات، والعربية ليست بينها. لم تقل الشركة إن النموذج لا يدعم العربية، وأنا لن أقول ما لم تقله.
قائمة اللغات، كما نُشرت
بطاقة النموذج
| البند | التفصيل |
|---|---|
| النموذج | Mixtral 8x7B |
| الجهة | Mistral AI، فرنسا |
| تاريخ الإصدار | 11 كانون الأول 2023 |
| الورقة التقنية | arXiv:2401.04088، 8 كانون الثاني 2024 |
| البنية | مزيج خبراء متفرّق |
| الترخيص | Apache 2.0، مفتوح بالكامل |
| موقعه وقتها | أفضل نموذج مفتوح على أغلب اللوحات الإنجليزية |
| العربية | غير مذكورة في أي وثيقة رسمية |
قراءة ARAB-LENS: الفرق بين أن تُنسى وأن تُستبعد
هذه المقالة عن فرق دقيق لكنه مهم.
مع Llama 2 رأينا إغفالًا: جدول بيانات لم تصل العربية إلى عتبته، وتحذيرًا عامًا بأن النموذج قد لا يناسب لغات أخرى. لا قائمة، لا قرار معلن.
مع Mixtral نرى شيئًا آخر: قائمة صريحة. خمس لغات مكتوبة بأسمائها. وهذا يعني أن أحدًا جلس وقرر: هذه اللغات التي نلتزم بها، وهذه التي لا نلتزم بها. العربية خارج القائمة بقرار، لا بالصدفة.
وأنا أقول شيئًا قد يفاجئك: أفضّل هذا على الإغفال.
لماذا؟ لأن القائمة الصريحة وثيقة يمكنك أن تستند إليها. حين تذهب إلى مديرك وتقول “لا نستطيع استعمال هذا النموذج لمنتجنا العربي”، تملك سطرًا مكتوبًا من الشركة نفسها. أما الإغفال فيترك بابًا مفتوحًا لمن يريد أن يقول “لكنه يكتب عربي، جرّبته”. وهذا الباب هو الذي دخلت منه عشرات المشاريع الفاشلة التي رأيتها.
النقطة الثانية، وهي تقنية ومهمة: Mixtral نموذج مزيج خبراء. ثمانية خبراء، يُستدعى اثنان لكل رمز. والمعنى العملي أن النموذج يملك سعة كبيرة لكنه ينفق منها بانتقائية.
ولماذا يهم هذا بالعربية؟ لأن بنية مزيج الخبراء تتخصص. الخبراء يتوزعون على أنماط في البيانات أثناء التدريب. فإذا لم يكن في البيانات عربية كافية، لن يتخصص أي خبير فيها، وستُعالَج العربية بخبراء عامين مصمّمين لشيء آخر. وهذا أسوأ من نموذج كثيف صغير، لأن النموذج الكثيف على الأقل يمرّر كل شيء عبر كل معاملاته.
بعبارة أبسط: في نموذج مزيج خبراء، اللغة التي لم تُدرَّب عليها لا تنقص فقط، بل تُوجَّه إلى المكان الخطأ.
النقطة الثالثة، وهي تحذير منهجي مباشر: حين بحثتُ عن نتيجة عربية لـ Mixtral 8x7B، وجدتُ على لوحة النماذج العربية المفتوحة إدخالات بأسماء مثل dolphin-mixtral وNous-Hermes-2-Mixtral وSmaug-Mixtral. هذه ليست Mixtral. إنها نسخ عدّلها أفراد ومجتمعات. ونتيجة نسخة معدّلة لا تُنسب إلى النموذج الأصلي، تمامًا كما لا تُنسب نتيجة سيارة معدّلة إلى المصنع.
وأنا أرى هذا الخطأ يتكرر كثيرًا في التغطية العربية: يُؤخذ رقم من لوحة، ويُنسب إلى الشركة، وتُبنى عليه جملة. تحقّق دائمًا من اسم صاحب النموذج على اللوحة قبل أن تقتبس رقمه.
من دفتر الاختبار: كيف تختبر نموذجًا لا يعدك بالعربية
حين يكون النموذج خارج قائمة لغتك، المطلوب ليس درجة، بل حدود. هذه طريقتي في رسمها.
البند الأول: أين يبدأ التبديل اللغوي القسري؟
اطلب منه العربية بخمس درجات صعوبة وسجّل متى يهرب إلى الإنجليزية:
| الدرجة | الطلب | السلوك المتوقّع |
|---|---|---|
| 1 | “اكتب جملة ترحيب بالعربية” | ينجح |
| 2 | “لخّص لي هذا النص العربي” | ينجح غالبًا |
| 3 | “اشرح لي بالعربية كيف يعمل التشفير” | يبدأ خلط الإنجليزية |
| 4 | “اكتب مقالة من 500 كلمة بالعربية” | يتدهور بعد الفقرة الثانية |
| 5 | “حوّل هذا النص إلى الشامي” | يفشل أو يرفض |
سجّل الدرجة. وهذا الرقم، لا أي معيار، هو ما يخبرك أين تستطيع أن تستعمله.
البند الثاني: اختبار الأربع كلمات.
هذه أربع كلمات عربية بسيطة جدًا، وكل واحدة منها فخ مختلف:
| الكلمة | الفخ | الخطأ المتوقّع |
|---|---|---|
| “مش” | نفي مصري وشامي | يقرأها اسمًا أو يتجاهلها |
| “ليش” | استفهام لهجي | يخلطها بـ “ليس” |
| “هلق” | ظرف زمان شامي | يترجمها خطأ أو يحذفها |
| “بس” | تعني “فقط” و”لكن” معًا | يختار المعنى الخطأ |
اكتب: “مش عارف ليش هلق، بس خلينا نأجلها.” واطلب ترجمة إنجليزية. الترجمة الصحيحة: “I do not know why now, but let us postpone it.” النموذج الذي يترجم “بس” إلى “only” قلب الجملة.
البند الثالث: اختبار الثبات.
اسأل السؤال العربي نفسه خمس مرات في محادثات منفصلة. النموذج الضعيف بالعربية يعطيك خمسة أجوبة مختلفة الجودة: واحد ممتاز، واثنان متوسطان، وواحد بالإنجليزية، وواحد فيه خلط. التذبذب مؤشر على أن العربية ليست قدرة مستقرة بل صدفة إحصائية.
وهذا البند في رأيي أهم من أي درجة، لأن المنتج لا يحتمل التذبذب. نموذج يعطي 70٪ دائمًا أفضل لمنتجك من نموذج يعطي 90٪ مرة و40٪ مرة.
البند الرابع: من يتحمّل المسؤولية؟
سؤال غير تقني لكنه الأهم: إن أخطأ النموذج بالعربية في منتجك، وشكا عميل، ماذا ستقول؟ حين تكون اللغة خارج القائمة المعلنة، الجواب أنك أنت المسؤول وحدك. لا يوجد التزام من المورّد تستند إليه. اجعل هذا جزءًا من قرارك التقني، لا من مفاجآتك اللاحقة.
البند الخامس: اختبار جودة المخرج لا فهم المدخل.
فرق مهم يُهمل: كثير من النماذج تفهم العربية أفضل مما تكتبها. اختبر الاتجاهين منفصلين:
| الاتجاه | المهمة | ما يقيسه |
|---|---|---|
| فهم | “لخّص هذا النص العربي بالإنجليزية” | الفهم وحده |
| إنتاج | “اكتب هذا المعنى الإنجليزي بالعربية” | الإنتاج وحده |
| الاثنان | “لخّص هذا النص العربي بالعربية” | الاثنان معًا |
النموذج خارج قائمة لغتك ينجح غالبًا في الأول، ويتعثر في الثاني، ويفشل في الثالث. ومعرفة أي اتجاه يعمل تفتح لك استعمالات لم تكن تظنها متاحة: البحث والتصنيف والاستخراج بالعربية ممكنة حتى مع نموذج لا يكتب عربية جيدة.
البند السادس: اختبار الكلفة الحقيقية.
النموذج خارج القائمة يحتاج غالبًا توجيهًا أطول ومحاولات أكثر. احسب:
عدد الرموز في التوجيه + عدد المحاولات حتى جواب مقبول
في تجربتي، الفارق بين نموذج مدعوم وغير مدعوم ليس في الجودة فقط، بل في عدد المحاولات. ونموذج أرخص بالرمز يصير أغلى بالنتيجة إن احتاج ثلاث محاولات بدل واحدة.
ملاحظة عن بنية مزيج الخبراء واللغات
هذا قسم تقني قصير يفيد من يختار نماذج مفتوحة.
| البنية | كيف تتعامل مع لغة نادرة في بياناتها |
|---|---|
| كثيفة | كل المعاملات تعالج كل رمز، فالأداء يتدهور بانتظام |
| مزيج خبراء | التوجيه يرسل الرمز إلى خبراء لم يتخصصوا فيه، فالتدهور غير منتظم |
والنتيجة العملية: نماذج مزيج الخبراء أكثر تذبذبًا في اللغات غير المدعومة. وقد تعطيك جوابًا ممتازًا ثم جوابًا سيئًا للسؤال نفسه تقريبًا.
وهذه ملاحظة بنيوية لا عيب في نموذج بعينه. لكنها تعني أن اختبار الثبات الذي ذكرته أعلاه أهم مع هذه البنية منه مع غيرها.
الحكم العملي
اقرأ قائمة اللغات قبل أن تقرأ لوحة الترتيب. هذه أقصر نصيحة في هذه السلسلة وأكثرها توفيرًا للوقت.
وإن كنت مضطرًا لاستعمال نموذج خارج القائمة، حدّد استعماله في مهام لا تحتاج إنتاج عربية: تصنيف، استخراج، بحث دلالي. هذه مهام يؤديها النموذج بالعربية أفضل بكثير مما يكتبها.
ولا تقتبس رقمًا من لوحة ترتيب دون أن تتحقق من صاحب النموذج. النسخ المجتمعية المعدّلة ليست النموذج الرسمي، والفرق بينهما قد يكون عشرين نقطة في أي اتجاه.
المقالة القادمة
في شباط 2024، نشر فريق أكاديمي أول امتحان عربي كبير مبني من أسئلة مدارس حقيقية، من ثماني دول عربية، بلا ترجمة آلية واحدة. أربعة عشر ألفًا وخمسمئة وخمسة وسبعون سؤالًا. المقالة القادمة عن ArabicMMLU، وعن الأرقام التي كشفها حين استُبدلت الترجمة بالأصل.
المصادر
- Mistral AI، Mixtral of experts، 11 كانون الأول 2023: mistral.ai/news/mixtral-of-experts
- Jiang وآخرون، Mixtral of Experts، arXiv:2401.04088، كانون الثاني 2024
- مجموعة نتائج لوحة النماذج العربية المفتوحة: huggingface.co/datasets/OALL/results
- HELM Arabic، مركز ستانفورد لأبحاث النماذج الأساسية: crfm.stanford.edu