أول مرة تُكتب العربية في قائمة “محسَّن لها”: Command R+

وقت القراءة: 8 دقيقة
18
إيهاب صالح | techkahwa.net صدر النموذج: 4 نيسان 2024 | تاريخ النشر: 18 نيسان 2024

الأرقام أولًا

المقياس النتيجة ما الذي يقيسه المصدر
العربية ضمن اللغات المحسَّن لها نعم، بالاسم التزام صريح من شركة غربية بطاقة النموذج، Cohere
عدد اللغات المحسَّن لها 10 الإنجليزية والفرنسية والإسبانية والإيطالية والألمانية والبرتغالية البرازيلية واليابانية والكورية والصينية المبسطة والعربية البطاقة نفسها
لغات موجودة في التدريب لكن غير محسَّن لها 13 لغة الروسية والبولندية والتركية والفيتنامية والهولندية والتشيكية والإندونيسية والأوكرانية والرومانية واليونانية والهندية والعبرية والفارسية البطاقة نفسها
نتيجة عربية نشرتها Cohere لا توجد لا رقم من الشركة نفسها البطاقة والوثائق
نتيجة عربية مستقلة، acc_norm 48.91٪ التقييم الإجمالي على لوحة النماذج العربية المفتوحة مجموعة نتائج OALL، تشغيل 19 أيار 2024
نتيجة عربية مستقلة، acc 72.93٪ المقياس نفسه بوحدة مختلفة المصدر نفسه
الخطأ المعياري، acc_norm 0.0375 اتساع هامش الثقة المصدر نفسه
الخطأ المعياري، acc 0.0114 أضيق بكثير المصدر نفسه
تاريخ التشغيل 19 أيار 2024 بعد الإصدار بستة أسابيع المصدر نفسه

انتبه إلى الصفين الخامس والسادس: 48.91٪ و72.93٪ للنموذج نفسه على التشغيل نفسه. وهذا ليس تناقضًا، إنه درس في القياس سأشرحه.


نافذة اللغات

كيف تصنّف Cohere لغاتها
محسَّن لها، 10 لغات
العربية هنا
موجودة بلا تحسين، 13 لغة
العبرية والفارسية والتركية هنا
غير مذكورة
كل ما عداها

الفرق بين الصف الأول والثاني هو الفرق بين “نتحمّل مسؤوليتها” و”قد تعمل”.


بطاقة النموذج

البند التفصيل
النموذج Command R+
الجهة Cohere
تاريخ الإصدار 4 نيسان 2024
التوجّه نماذج للمؤسسات، مع تركيز على الاسترجاع واستعمال الأدوات
العربية ضمن قائمة اللغات المحسَّن لها
تنبيه مهم نسخة آب 2024 نموذج آخر، لا تخلط بينهما

قراءة ARAB-LENS: لماذا هذه القائمة أهم من أي رقم

سأقولها بوضوح: هذه أول مرة رأيت فيها شركة غربية كبرى تكتب “العربية” داخل قائمة التزام لا داخل ملاحظة هامشية.

راجع معي ما رأيناه حتى الآن في هذه السلسلة. Llama 2: العربية تحت عتبة الجدول. Falcon 180B: غير مذكورة. Mixtral: خمس لغات وليست بينها. Claude 3: مذكورة مرة في جمع بيانات التفضيل. وهنا فجأة: العربية مكتوبة بالاسم في قائمة عشر لغات “محسَّن لأدائها”.

ولماذا أعتبر هذا أهم من درجة عالية على معيار؟ لثلاثة أسباب عملية.

الأول، أنه وعد تعاقدي وليس ملاحظة. حين تضع شركة لغة في قائمة “محسَّن لها”، فهي تربط اسمها بها. تستطيع أن تفتح تذكرة دعم وتقول “أداؤه العربي دون المستوى” وتستند إلى وثيقتهم. مع نموذج خارج القائمة، لا شيء تستند إليه.

الثاني، أنه يعني قرار موارد. لا تُضاف لغة إلى هذه القائمة بلا كلفة: بيانات تقييم، ومراجعون ناطقون، وعمل محاذاة. وجود العربية في القائمة يعني أن شخصًا في تلك الشركة دافع عنها في اجتماع تخطيط.

الثالث، والأهم للمنطقة، أنه سابقة. بعد Command R+ صار من الطبيعي أن تُسأل الشركات الأخرى: أين العربية من قائمتكم؟ وهذا السؤال لم يكن ممكنًا قبل أن يجيب عنه أحد بالإيجاب.

والآن الجانب الآخر، ولا بد منه.

Cohere نفسها لم تنشر رقمًا عربيًا واحدًا. البطاقة تذكر صراحة أن مقاييسها المنشورة لا تغطي الأداء متعدد اللغات. أي أن الالتزام معلن والقياس غائب. وهذا يعيدنا إلى النمط نفسه: الشركات تعلن، والأكاديميون والمجتمع يقيسون.

الرقم الوحيد المتاح جاء من لوحة النماذج العربية المفتوحة، في تشغيل بتاريخ 19 أيار 2024. وهنا الدرس القياسي الذي وعدتك به.


درس في القياس: لماذا 48.91 و72.93 رقمان صحيحان معًا

هذا يستحق قسمًا خاصًا لأنني رأيت كثيرين يتعثرون فيه.

في تقييم نماذج اللغة باختيار من متعدد، يوجد مقياسان شائعان:

المقياس كيف يُحسب متى يُستعمل
acc هل اختار النموذج الإجابة الصحيحة؟ حين تكون الخيارات متقاربة الطول
acc_norm الشيء نفسه بعد تطبيع احتمال كل خيار على طوله حين تختلف أطوال الخيارات

لماذا التطبيع؟ لأن النموذج يميل طبيعيًا إلى تفضيل الخيارات القصيرة، فالنص القصير احتماله أعلى حسابيًا. فإن كان الخيار الصحيح طويلًا، قد يرفضه النموذج لسبب رياضي بحت لا علاقة له بالمعرفة. التطبيع يعالج هذا.

والنتيجة أن acc_norm أقسى عادةً وأصدق، وacc أكثر تسامحًا. والفارق بين 48.91 و72.93 هنا فارق ضخم، ويخبرنا أن أطوال الخيارات في هذا المعيار غير متوازنة أصلًا.

خذ منها قاعدة: حين يعطيك أحد رقمًا من لوحة عربية، اسأله أي المقياسين. ومن لا يعرف، لا يعرف ماذا يقتبس. ولاحظ أيضًا الخطأ المعياري: 0.0375 مقابل 0.0114. المقياس الأول هامش ثقته أوسع ثلاث مرات، أي أنه أقل استقرارًا.


من دفتر الاختبار: التحقق من ادعاء “محسَّن للعربية”

حين يعدك مورّد بالعربية، عندك حق أن تتحقق. هذه أربعة بنود تفحص الوعد لا القدرة العامة.

البند الأول: هل التحسين يشمل اللهجة أم الفصحى فقط؟

اسأل السؤال نفسه بالفصحى وبثلاث لهجات وقارن جودة الرد:

الصياغة النص
فصحى “أرغب في إلغاء طلبي واسترداد المبلغ.”
شامي “بدي ألغي طلبيتي وأرجّع مصاريي.”
مصري “عايز ألغي الأوردر وأرجّع فلوسي.”
خليجي “أبي ألغي طلبي وأسترد فلوسي.”

الشركات التي “تحسّن للعربية” تحسّن غالبًا للفصحى، لأن بيانات التقييم متاحة بها. فإن كان الرد ممتازًا في الأول وضعيفًا في الثلاثة الباقية، فالوعد صحيح لكنه أضيق مما فهمت.

البند الثاني: اختبار الاتجاه والترقيم.

هذا بند تقني بسيط يفضح النماذج غير المعتنى بها:

الحالة النص الصحيح الخطأ الشائع
رقم داخل جملة عربية “عندي 3 طلبات” ينعكس ترتيب الأرقام
نص إنجليزي داخل عربي “افتح ملف report.pdf” ينقلب موضع النقطة والامتداد
قوسان حول عربي “(الطلب ملغى)” ينقلب القوس المفتوح والمغلق
فاصلة عربية “،” يستعمل “,” اللاتينية
علامة نسبة “٪” أو “%” بعد الرقم يضعها قبل الرقم

هذه أخطاء صغيرة، لكنها تظهر فورًا في واجهة المستخدم وتجعل المنتج يبدو مترجَمًا لا مصنوعًا.

البند الثالث: اختبار طول الجواب.

اطلب جوابًا من خمسين كلمة بالعربية، ثم بالإنجليزية. النماذج غير المضبوطة على العربية تنتج عربية أطول بكثير من المطلوب، لأنها تعدّ الرموز لا الكلمات، وضريبة الحرف تربكها. إن طلبت خمسين وحصلت على مئة وعشرين، فالنموذج لا يقيس طوله بالعربية.

البند الرابع: اختبار الاتساق عبر جلستين.

اسأل السؤال العربي نفسه اليوم وبعد أسبوع. النموذج المحسَّن فعلًا يعطي إجابة متقاربة الجودة. والنموذج الذي “يصادف” العربية يتذبذب. هذا البند بطيء لكنه الأصدق.

البند الخامس: اختبار الاسترجاع بالعربية.

Command R+ مصمَّم للاسترجاع، فاختبره في تخصصه:

المهمة ما تقيسه
أعطه ثلاث وثائق عربية واسأل سؤالًا يحتاج اثنتين الدمج بين مصادر
ضع معلومة متناقضة في وثيقتين كشف التناقض
اسأل عن معلومة غير موجودة في الوثائق الاعتراف بعدم الوجود
اطلب اقتباسًا حرفيًا من وثيقة أمانة النقل

البند الثالث هو الأهم وأكثره فشلًا: النموذج الذي يخترع جوابًا من معرفته بدل أن يقول “غير موجود في الوثائق” يفسد أي نظام استرجاع عربي.

البند السادس: اختبار الأداة والوظيفة.

النماذج المؤسسية تستدعي أدوات. اختبر ذلك بالعربية:

“احجزلي موعد مع الدكتور سمير يوم الخميس الجاي الساعة تلاتة العصر.”

راقب: هل استخرج الاسم والتاريخ والوقت صحيحًا؟ “الخميس الجاي” تاريخ نسبي، و”تلاتة العصر” تحتاج تحويلًا إلى 15:00. النماذج التي تجيد هذا بالإنجليزية تخطئ كثيرًا بالعربية، وخصوصًا في التواريخ النسبية واللهجية.


قائمة لغات محسَّن لها: مقارنة بين خمس شركات

جمعتُ ما نشرته الشركات حتى هذا التاريخ في جدول واحد:

الشركة والنموذج عدد اللغات المعلنة العربية
Mistral، Mixtral 8x7B 5 لا
ميتا، Llama 2 لا قائمة، تحذير عام لا
TII، Falcon 180B 4 كاملة و7 محدودة لا
Anthropic، Claude 3 لا قائمة لغات محسَّن لها لا
Cohere، Command R+ 10 نعم

واحدة من خمس. وهذا هو حجم ما تحقق حتى نيسان 2024.

ولماذا أُصرّ على تتبّع هذا بدل تتبّع الدرجات؟ لأن الدرجة تتغير مع كل إصدار، أما القائمة فتعكس قرارًا مؤسسيًا يدوم. والشركة التي وضعت لغتك في قائمتها مرة، ستضعها مرة أخرى. والشركة التي لم تفعل، تحتاج سببًا لتبدأ. وذلك السبب هو السوق، لا العدالة اللغوية.


الحكم العملي

قائمة اللغات المحسَّن لها هي أول ما أقرأه في أي بطاقة نموذج، قبل أي رقم. وهذه أهم عادة اكتسبتها من كتابة هذه السلسلة.

ولا تقتبس رقمًا من لوحة عربية دون ذكر المقياس والتاريخ. “سجّل 48.91 بمقياس acc_norm على لوحة OALL في أيار 2024” جملة يمكن الدفاع عنها. “سجّل 48.91 بالعربية” جملة ناقصة.

وانتبه لأسماء النسخ. Command R+ نيسان 2024 وCommand R+ آب 2024 نموذجان مختلفان. وهذا الخلط يقع كثيرًا ويفسد أي مقارنة زمنية.


المقالة القادمة

بعد أربعين يومًا، غيّرت OpenAI مجزّئها لأول مرة منذ ChatGPT. والنتيجة للعربية كانت رقمًا محددًا ومنشورًا: من 53 رمزًا إلى 26 للجملة نفسها. المقالة القادمة عن اليوم الذي انخفضت فيه ضريبة الحرف إلى النصف.


المصادر

  • Cohere، Introducing Command R+، 4 نيسان 2024: cohere.com/blog/command-r-plus-microsoft-azure
  • بطاقة النموذج c4ai-command-r-plus على Hugging Face
  • مجموعة نتائج لوحة النماذج العربية المفتوحة، ملف تشغيل 19 أيار 2024: huggingface.co/datasets/OALL/results
  • Hugging Face وTII، Introducing the Open Arabic LLM Leaderboard، أيار 2024: huggingface.co/blog/leaderboard-arabic