الأرقام أولًا
| المقياس | النتيجة | ما الذي يقيسه | المصدر |
|---|---|---|---|
| عدد اللغات | 23 | نطاق النموذج | التقرير التقني لـ Aya 23 |
| موقع العربية في القائمة | الأولى | ترتيب أبجدي إنجليزي، لكنها مذكورة صراحة | التقرير نفسه |
| اللغات | العربية والصينية والتشيكية والهولندية والإنجليزية والفرنسية والألمانية واليونانية والعبرية والهندية والإندونيسية والإيطالية واليابانية والكورية والفارسية والبولندية والبرتغالية والرومانية والروسية والإسبانية والتركية والأوكرانية والفيتنامية | من دخل ومن خرج | التقرير نفسه |
| سلفه Aya 101 | 101 لغة | نقطة المقارنة | التقرير نفسه |
| الأحجام | 8 و35 مليار معامل | حجم الإتاحة | التقرير نفسه |
| الفكرة المعلنة | “تجربة في العمق مقابل الاتساع، باستكشاف أثر تخصيص سعة أكبر للغات أقل” | جوهر الورقة، اقتباس حرفي | ملخص الورقة |
| تاريخ الإصدار | 23 أيار 2024 | مؤكد من arXiv ومن مدوّنة Cohere | arXiv:2405.15032 |
| رقم عربي منفصل تمكّنتُ من تأكيده | لا يوجد | حاولت ثلاث مرات ولم أثبته بما يكفي للنشر | ملاحظة منهجية مني |
السطر الأخير مهم، ولن أخفيه: نموذج يضع العربية أول اسم في قائمته، ولم أستطع أن أؤكد له رقمًا عربيًا منفصلًا أثق به.
العمق مقابل الاتساع
هذا رسم توضيحي للفكرة التي تطرحها الورقة، لا قياس منشور. والفكرة بسيطة وقوية: لغة واحدة من ثلاث وعشرين تأخذ أكثر مما تأخذه لغة واحدة من مئة وواحدة.
بطاقة النموذج
| البند | التفصيل |
|---|---|
| النموذج | Aya 23، بحجمي 8 و35 مليار معامل |
| الجهة | Cohere For AI وCohere |
| تاريخ الإصدار | 23 أيار 2024 |
| الورقة | arXiv:2405.15032 |
| الترخيص | أوزان مفتوحة |
| العربية | مذكورة صراحة ضمن ثلاث وعشرين لغة |
| ما نُشر عن العربية | وجودها في القائمة، وهذا مؤكد |
| ما لم أستطع تأكيده | أي رقم أداء عربي منفصل |
قراءة ARAB-LENS: لماذا تهمّك قائمة قصيرة أكثر من قائمة طويلة
هذه المقالة عن فكرة أكثر منها عن رقم، والفكرة تستحق.
سلف هذا النموذج، Aya 101، كان يغطي مئة وواحدة لغة. ويبدو هذا إنجازًا هائلًا لأول وهلة: مئة لغة! تغطية للعالم كله!
ثم يأتي الفريق نفسه بعد أقل من سنة ويقول: جرّبنا العكس. ثلاث وعشرون لغة فقط، وسعة أكبر لكل واحدة. والملخص يسمّيها بصراحة “تجربة في العمق مقابل الاتساع”.
ولماذا يهم هذا العربي تحديدًا؟
لأن العربية في القوائم الطويلة تُعامَل كلغة أقلية، وفي القوائم القصيرة تُعامَل كلغة رئيسية. الفرق ليس في الاسم بل في التخصيص: بيانات أكثر، تقييم أدق، مراجعون ناطقون، ووزن أعلى في قرارات التدريب.
وأنا أكتب من تجربة متكررة: النماذج التي تعلن مئة لغة هي غالبًا أسوأ في العربية من النماذج التي تعلن عشرين. لأن المئة لغة تعني أن كل لغة أخذت ما تبقّى، والعشرين تعني أن هناك ميزانية.
النقطة الثانية: العربية أول اسم في القائمة.
هذا ترتيب أبجدي بالإنجليزية، لا ترتيب أولوية، وأنا لا أدّعي غير ذلك. لكن الأثر النفسي والعملي موجود: من يقرأ بطاقة النموذج يرى العربية أولًا. وبعد ثلاثين مقالة من البحث عن العربية في الحواشي، هذا تغيير محسوس.
النقطة الثالثة، وهي نقدي الذي يجب أن أقوله عن نفسي قبل غيري.
حاولت أن أستخرج رقمًا عربيًا منفصلًا من هذه الورقة. رأيت جدولًا يبدو أنه يحوي عمودًا عربيًا في تقييم MMLU متعدد اللغات، لكنني لم أستطع التحقق منه بشكل يرضيني، فاستبعدته. وهذه قاعدتي في كل هذه السلسلة: رقم لم أتحقق منه مرتين لا يُنشر، مهما كان مغريًا.
والنتيجة المزعجة: حتى في نموذج يضع العربية أول اسم، لا أستطيع أن أعطيك رقمًا عربيًا موثقًا. وهذا يعيدنا إلى النمط الذي رأيناه في كل مقالة: الإعلان أسهل من القياس، والقياس العربي يأتي متأخرًا أو لا يأتي.
من دفتر الاختبار: تقييم نموذج متعدد اللغات على لغتك
حين لا يوجد رقم عربي، اختبر أنت. وهذه منهجية خاصة بالنماذج متعددة اللغات، مختلفة عمّا استعملناه سابقًا.
البند الأول: اختبار التسرّب عبر اللغات.
النماذج متعددة اللغات تخلط أحيانًا. اطلب عربية خالصة وراقب:
| ما تبحث عنه | مثال على التسرّب |
|---|---|
| كلمة فارسية أو أردية | استعمال مفردة مشتركة بمعناها غير العربي |
| تركيب تركي أو عبري | ترتيب جملة غريب |
| علامات ترقيم لاتينية | الفاصلة والنقطتان اللاتينيتان داخل نص عربي |
| أرقام هندية ولاتينية مختلطة | “عندي ٣ و5 طلبات” |
اطلب فقرة من ثلاثمئة كلمة واعدد هذه. النموذج متعدد اللغات النظيف لا يخلط. والمخلوط يخبرك أن العربية عنده تجاور لغات أخرى في المساحة نفسها بلا فصل.
البند الثاني: اختبار العبرية والفارسية.
هذا بند خاص بهذا النموذج لأن قائمته تضم العبرية والفارسية والعربية معًا، وثلاثتها تُكتب بأبجديات متقاربة أو ذات اتجاه واحد.
اكتب جملة عربية فيها كلمة قد تلتبس، ثم اطلب تصنيف لغتها:
| النص | اللغة الصحيحة | الالتباس المحتمل |
|---|---|---|
| “كتاب” | عربية | كلمة قريبة في الفارسية |
| “درس” | عربية | مستعملة في الأردية والفارسية |
| “نظر” | عربية | لها استعمال مختلف بالفارسية |
| “مدرسة” | عربية | تُستعمل في لغات عدة |
النموذج الجيد لا يتردد. النموذج الذي يسأل “هل تقصد الفارسية؟” يخلط بين الأبجدية واللغة، وهذا خطأ شائع جدًا في النماذج متعددة اللغات.
البند الثالث: اختبار الترجمة المتقاطعة.
اطلب ترجمة من العربية إلى لغة ثالثة من قائمته، ثم أعدها إلى العربية. مثلًا: عربي إلى تركي إلى عربي.
النص الأصلي: “لسا ما وصلني ردّك، وإذا ما بيجي اليوم بضطر أعتذر.”
النموذج الجيد يعيدها بمعنى قريب. النموذج الضعيف يفقد الشرط أو النفي أو الاعتذار المستقبلي، وهي ثلاثة عناصر نحوية دقيقة. وهذا الاختبار يكشف عمق فهم النموذج للعربية أكثر من أي سؤال مباشر.
البند الرابع: اختبار التوزيع العادل.
اسأل السؤال المعرفي نفسه بثلاث لغات من قائمته، واحدة منها العربية:
“من هو ابن خلدون ولماذا يُعتبر مهمًا؟”
اسأله بالعربية وبالإنجليزية وبالفرنسية. قارن طول الجواب وعمقه ودقته في الثلاثة. إن كان الجواب العربي أقصر وأسطح، فالنموذج يعرف عن العالم العربي بالإنجليزية أكثر مما يعرفه بالعربية. وهذا نمط رأيته كثيرًا، وهو من أغرب ما في هذا المجال: معرفة عن ثقافتك، محفوظة بلغة غيرك.
البند الخامس: اختبار حصة اللغة.
فكرة العمق مقابل الاتساع قابلة للاختبار عمليًا. قارن نموذجين: واحدًا يعلن عشرين لغة وآخر يعلن مئة، بحجمين متقاربين.
| المهمة | ما تقيسه |
|---|---|
| فقرة من 300 كلمة بالعربية | جودة الإنتاج |
| تحليل صرفي لخمس كلمات | عمق نحوي |
| تحويل نص إلى الشامي | لهجة |
| خمسة أسئلة معرفية عربية | معرفة |
في تجربتي، الفرق يظهر في البندين الأخيرين لا الأولين. الإنتاج السطحي يتقنه الجميع، والعمق يحتاج حصة.
البند السادس: اختبار التوازن بين لغات القائمة.
اسأل النموذج السؤال نفسه بكل لغة من لغات قائمته التي تعرفها، وقارن. إن كان أداؤه بالعربية أقرب إلى ذيل القائمة منه إلى رأسها، فوجود العربية في القائمة إداري لا هندسي.
طريقة عملية: اطلب ترجمة الجملة نفسها إلى خمس لغات من قائمته، ثم أعد الخمس إلى العربية. اللغة التي تخرج منها الترجمة العكسية أدقّ هي التي يتقنها فعلًا.
العمق مقابل الاتساع: ما تعلّمته من ثلاث حالات
| الحالة | الاختيار | النتيجة العربية |
|---|---|---|
| Jais | عربية أولًا، بلغتين | أفضل نموذج عربي مفتوح في وقته |
| AceGPT | عربية فوق أساس عالمي | تفوّق في الأسلوب، تعثّر في المعرفة |
| Aya 23 | ثلاث وعشرون لغة، العربية منها | العربية لغة رئيسية لا هامشية |
ثلاثة مسارات مختلفة، وثلاث نتائج مختلفة. ولا واحد منها خاطئ.
والخلاصة التي أصل إليها: لا يوجد مسار واحد صحيح لإدخال العربية إلى النماذج. يوجد سؤال واحد صحيح يجب أن يُطرح في بداية كل مشروع: كم حصة العربية من هذا النموذج، بالأرقام؟ ومن لا يستطيع الإجابة، لم يتخذ قرارًا بعد.
الحكم العملي
فضّل النموذج الذي يعلن عشرين لغة على الذي يعلن مئة. القائمة القصيرة وعد، والقائمة الطويلة تغطية.
واطلب دائمًا رقمًا منفصلًا للغتك. ووجود لغتك في قائمة لا يعني وجود قياس لها. وهذان شيئان مختلفان يُخلط بينهما دائمًا.
وإن لم تجد الرقم، لا تفترض الأسوأ ولا الأفضل. اختبر. نصف يوم من الاختبار يغنيك عن شهور من الجدل.
المقالة القادمة
بعد أسبوعين، أطلقت علي بابا نموذج Qwen2، وفي قائمة لغاته مجموعة اسمها صراحةً “الشرق الأوسط”، وفيها العربية والفارسية والعبرية والتركية. المقالة القادمة عن نموذج صيني وضع العربية في مجموعة إقليمية بالاسم، وعن الرقم الوحيد المنشور لأدائه العربي.
المصادر
- Cohere، C4AI Launches Aya 23، 23 أيار 2024: cohere.com/blog/aya23
- Aryabumi وآخرون، Aya 23: Open Weight Releases to Further Multilingual Progress، arXiv:2405.15032، 23 أيار 2024
- التقرير التقني لـ Aya 23: cohere.com/research/aya