25.32 على اختبار تخمينه العشوائي 25: الرقم العربي الوحيد لـ Falcon 2

وقت القراءة: 8 دقيقة
18
إيهاب صالح | techkahwa.net صدر النموذج: 13 أيار 2024 | تاريخ النشر: 30 أيار 2024

الأرقام أولًا

المقياس النتيجة ما الذي يقيسه المصدر
Falcon 2 11B على ARC-C العربية، 25 مثالًا 25.32 اختبار اختيار من أربعة، تخمينه 25 التقرير التقني، arXiv:2407.14885، الجدول 11
على MMLU العربية، 25 مثالًا 28.04 معرفة عامة الجدول نفسه
على HellaSwag العربية، بلا أمثلة 32.42 استدلال بديهي الجدول نفسه
على TruthfulQA العربية، بلا أمثلة 49.66 مقاومة المعلومة الخاطئة الجدول نفسه
اللغات المعلنة في بطاقة النموذج 11 لغة، ليس فيها العربية الإنجليزية والألمانية والإسبانية والفرنسية والإيطالية والبرتغالية والبولندية والهولندية والرومانية والتشيكية والسويدية بطاقة tiiuae/falcon-11B
ذكر العربية في بيان المعهد لا يوجد هل ذُكرت بيان معهد الابتكار التكنولوجي
العربية في مزيج بيانات التدريب غير موجودة جدول 3 من التقرير: اللغات المذكورة كلها أوروبية التقرير نفسه
الإنجليزية في المزيج 61٪ إلى 69.1٪ الكتلة الأكبر الجدول نفسه
“متعدد اللغات” في المزيج 15٪ إلى 16.6٪ عشر لغات أوروبية الجدول نفسه
عدد الجداول التي تُذكر فيها العربية واحد من التقرير كله حجم الاهتمام التقرير نفسه

الرقم الأول هو المقالة: 25.32 على اختبار حظّه 25. ثلاثة أعشار النقطة فوق رمي حجر النرد.


الرقم العربي الوحيد، بجانب خط الصدفة

Falcon 2 11B على المعايير العربية المترجمة
ARC-C
25.32 خط الصدفة 25.00
MMLU
28.04 خط الصدفة 25.00
HellaSwag
32.42 خط الصدفة 25.00
TruthfulQA
49.66 مقياس مختلف الطبيعة

ثلاثة من أربعة تلامس خط الصدفة. والرابع، TruthfulQA، مقياس مختلف النوع ولا يُقارن مباشرة، لأن النموذج الذي يرفض الإجابة كثيرًا قد يسجّل فيه عاليًا.


بطاقة النموذج

البند التفصيل
النموذج Falcon 2 11B
الجهة معهد الابتكار التكنولوجي، أبوظبي
تاريخ الإصدار 13 أيار 2024
الحجم 11 مليار معامل
التقرير التقني arXiv:2407.14885، تموز 2024
اللغات المعلنة إحدى عشرة، كلها أوروبية بالإضافة إلى الإنجليزية
العربية غير مذكورة في البطاقة ولا في البيان ولا في مزيج التدريب
المعيار العربي الوحيد لوحة النماذج متعددة اللغات المفتوحة، وهي مترجمة آليًا

قراءة ARAB-LENS: المرة الثانية، ومن الجهة نفسها

في المقالة الخامسة والعشرين كتبتُ عن Falcon 180B وغياب العربية منه، وقلتُ إن ذلك كان قرارًا استراتيجيًا مفهومًا: أرادوا صدارة اللوحات العالمية.

الآن، بعد ثمانية أشهر، النموذج الجديد، وقائمة اللغات ما زالت بلا عربية. إحدى عشرة لغة: الإنجليزية والألمانية والإسبانية والفرنسية والإيطالية والبرتغالية والبولندية والهولندية والرومانية والتشيكية والسويدية.

السويدية موجودة. التشيكية موجودة. الرومانية موجودة. العربية لا.

وأنا أكتب هذه الجملة بلا انفعال، بل كملاحظة توثيقية: عدد المتحدثين بالسويدية نحو عشرة ملايين، وبالعربية مئات الملايين، والمعهد الذي بنى النموذج في عاصمة عربية.

ثم يأتي جدول مزيج بيانات التدريب في التقرير التقني ويؤكد الأمر: بند “متعدد اللغات” يشكّل نحو خمسة عشر بالمئة، واللغات المذكورة داخله عشر لغات أوروبية. العربية ليست بندًا في مزيج التدريب أصلًا.

فمن أين جاء الرقم إذًا؟

من جدول واحد في آخر التقرير، عنوانه تقييم على لوحة النماذج متعددة اللغات المفتوحة. وهذه اللوحة تأخذ معايير إنجليزية وتترجمها آليًا إلى لغات كثيرة، ومنها العربية. أي أن الرقم الوحيد المتاح هو نتيجة نموذج لم يُدرَّب على العربية، على امتحان مترجَم آليًا إلى العربية. طبقتان من البُعد عن اللغة الحقيقية.

ومع ذلك، الرقم مفيد جدًا، وهذا ما يجعل هذه المقالة تستحق الكتابة.

لماذا 25.32 رقم مهم؟ لأن ARC-C اختبار اختيار من أربعة خيارات. التخمين العشوائي المحض يعطيك خمسة وعشرين بالمئة في المتوسط. النموذج سجّل خمسة وعشرين وثلاثة أعشار. أي أن أداءه على الأسئلة العربية لا يمكن تمييزه إحصائيًا عن الصدفة.

وهذا ليس نقدًا للنموذج، النموذج لم يدّعِ العربية يومًا. هذا قياس نظيف لما يحدث حين لا تكون اللغة في البيانات. وأنا أعتبر هذا الرقم من أنفع الأرقام في السلسلة كلها، لأنه يعطيك خط القاع: هكذا يبدو الصفر العربي حين يُقاس.

احتفظ به كمرجع. في المرة القادمة التي يخبرك فيها أحد أن نموذجًا “يدعم العربية”، اسأل عن رقمه على معيار اختيار من متعدد. إن كان قريبًا من خط الصدفة، فأنت تنظر إلى Falcon 2 بوجه آخر.


من دفتر الاختبار: كيف تحسب خط الصدفة بنفسك

هذا قسم منهجي قصير لكنه يغيّر طريقة قراءتك للأرقام إلى الأبد.

القاعدة: خط الصدفة = 100 مقسومًا على عدد الخيارات.

نوع الاختبار عدد الخيارات خط الصدفة
ARC-C، HellaSwag 4 25.0٪
MMLU 4 25.0٪
ArabicMMLU متغيّر، والمنشور 29.0٪ 29.0٪
صح أو خطأ 2 50.0٪
اختيار من خمسة 5 20.0٪

التطبيق: خذ أي رقم تقرؤه واطرح منه خط الصدفة. هذا هو الأداء الحقيقي.

النموذج والاختبار الرقم المعلن خط الصدفة الأداء الحقيقي
Falcon 2 11B على ARC-C العربية 25.32 25.0 0.32 نقطة
Falcon 2 11B على MMLU العربية 28.04 25.0 3.04 نقاط
LLaMA2-7B على MMLU العربية 29.47 29.0 0.47 نقطة
Falcon 40B على ArabicMMLU 34.8 29.0 5.8 نقاط
Jais-chat 30B على ArabicMMLU 62.3 29.0 33.3 نقطة
GPT-4 على ArabicMMLU 72.5 29.0 43.5 نقطة

انظر إلى العمود الأخير. الفروق التي تبدو متقاربة في العمود الأول تصير هائلة في الأخير. والفرق بين Falcon 40B وJais-chat 30B ليس سبعًا وعشرين نقطة، إنه سبعة وعشرون ونصف مقابل خمس نقاط وثمانية أعشار، أي أكثر من خمسة أضعاف.

وهذه أهم عادة حسابية أنصح بها كل من يقرأ أرقام النماذج العربية: اطرح خط الصدفة دائمًا قبل أن تقارن.

بند إضافي: اختبار التماسك.

طريقة سريعة للتحقق أن نموذجًا يخمّن فعلًا: اسأله السؤال نفسه خمس مرات مع تبديل ترتيب الخيارات في كل مرة. النموذج الذي يعرف الجواب يختار المحتوى نفسه. النموذج الذي يخمّن يختار الموضع نفسه غالبًا، أو يتنقّل عشوائيًا. وهذا يكشف التخمين حتى لو صادف أن سجّل درجة معقولة.

البند الرابع: اختبار الثقة المعايَرة.

النموذج الذي يخمّن يجب أن يعرف أنه يخمّن. اطلب مع كل جواب تقدير ثقة:

“أجب عن السؤال، ثم أعطني نسبة ثقتك بالجواب من 0 إلى 100.”

ثم اجمع عشرين سؤالًا وقارن. النموذج المعايَر جيدًا: حين يقول 90٪ يصيب نحو تسع مرات من عشر. النموذج غير المعايَر يقول 90٪ ويصيب نصف المرات.

وهذا البند أهم في العربية من غيرها، لأن النماذج غير المدرَّبة عليها تحافظ على نبرة واثقة حتى وهي تخمّن. والثقة اللغوية تخدع المستخدم أكثر من الخطأ نفسه.

البند الخامس: اختبار الانهيار التدريجي.

اطلب المهمة نفسها بخمسة أطوال: جملة، فقرة، ثلاث فقرات، صفحة، صفحتان. وسجّل عند أي طول يبدأ النص بالتفكك.

الطول ما يحدث في نموذج ضعيف بالعربية
جملة سليمة
فقرة سليمة غالبًا
ثلاث فقرات تكرار في البداية
صفحة تكرار واضح وانحراف عن الموضوع
صفحتان جمل مفككة أو انتقال للإنجليزية

رقم الطول الذي ينهار عنده أهم من أي درجة معيارية، لأنه يخبرك بالضبط بما تستطيع أن تطلبه منه.


خط القاع العربي: مرجع دائم

أختم بجدول أنصحك بحفظه، وهو يجمع كل ما رأيناه من “أرقام قرب الصفر” في هذه السلسلة:

النموذج الاختبار الرقم فوق الصدفة بـ
Falcon 2 11B ARC-C عربية 25.32 0.32
LLaMA2-7B MMLU عربية 29.47 0.47
Falcon 2 11B MMLU عربية 28.04 3.04
LLaMA2-7B EXAMs عربية 23.48 تحت الصدفة
Llama 2-Chat 7B araSwag 24.44 تحت الصدفة

الصفان الأخيران يستحقان الانتباه: أداء تحت خط الصدفة. وهذا ليس جهلًا فقط، إنه انحياز منهجي: النموذج يختار بنمط ثابت خاطئ، غالبًا لأنه يفضّل خيارًا معيّنًا بموضعه أو بطوله.

ومن يرى رقمًا تحت خط الصدفة ويظنه “ضعيفًا قليلًا”، لم يفهم ما يقرأ.


الحكم العملي

اقرأ قائمة لغات النموذج، ثم اطرح خط الصدفة من أرقامه. خطوتان تكفيان لفرز تسعين بالمئة من الادعاءات.

ولا تُقيّم نموذجًا عربيًا باختبارات مترجمة آليًا. المفارقة أن الرقم الوحيد المتاح لهذا النموذج مترجَم، وأنا اضطررت لاستعماله لعدم وجود سواه، وأقول لك ذلك صراحة بدل أن أخفيه.

والملاحظة الاستراتيجية: الإمارات أنتجت Jais وFalcon في الفترة نفسها. الأول عربي والثاني عالمي. وهذا مسار مشروع، لكنه يعني أن العربية لن تصل إلى النماذج الكبرى بالصدفة. تصل بقرار، ويُدفع ثمنها في الترتيب العالمي.


المقالة القادمة

بعد يوم واحد من إطلاق Falcon 2، أُطلقت لوحة النماذج العربية المفتوحة من Hugging Face ومعهد الابتكار التكنولوجي. وبعد تسعة أشهر، اعترف القائمون عليها أنفسهم بثلاث مشكلات في نسختها الأولى، إحداها خطأ برمجي في التصحيح أثر على الترتيب المنشور. المقالة القادمة عن اللوحة التي صحّحت نفسها علنًا.


المصادر

  • معهد الابتكار التكنولوجي، إطلاق سلسلة Falcon 2، 13 أيار 2024: tii.ae
  • Hugging Face، Falcon 2 11B، أيار 2024: huggingface.co/blog/falcon2-11b
  • بطاقة النموذج tiiuae/falcon-11B على Hugging Face
  • Malartic وRoy Chowdhury وآخرون، Falcon2-11B Technical Report، arXiv:2407.14885، تموز 2024، الجدولان 3 و11