مئة وستة عشر مليار رمز عربي: كيف صارت الخمسة والخمسون مئة وستة عشر

وقت القراءة: 9 دقيقة
18
إيهاب صالح | techkahwa.net صدر النموذج: 30 آب 2023 | تاريخ النشر: 13 أيلول 2023

الأرقام أولًا

المقياس النتيجة ما الذي يقيسه المصدر
مجموع رموز التدريب 395 مليارًا حجم النموذج الإجمالي ورقة Jais، arXiv:2308.16149، آب 2023
العربية الأصلية 55 مليارًا كم عربية حقيقية دخلت الورقة، الجدول 3
العربية بعد إضافة المترجَم 72 مليارًا أي 17 مليارًا مترجمة الجدول نفسه
العربية بعد التكرار 1.6 مرة 116 مليارًا الرقم الذي يُعلن دائمًا الجدول نفسه
نسبة العربية من المجموع 29٪ بعد التكرار، لا قبله الجدول نفسه
الإنجليزية 232 مليارًا، 59٪ اللغة الأكبر داخل نموذج عربي الجدول نفسه
الشيفرة البرمجية 46 مليارًا، 12٪ الباقي الجدول نفسه
Jais 13B الأساسي، متوسط الاختبارات العربية 46.5٪ صفرية اللقطة الورقة، الجدول 9
Jais-chat 13B 48.4٪ أفضل من BLOOMz بـ 5.5 نقطة الجدول نفسه
أفضل منافس سابق، BLOOMz 7.1B 42.9٪ المرجع الجدول نفسه
Jais-chat 13B على ArabicMMLU، امتحان عربي أصلي 54.8٪ مقابل 72.5٪ لـ GPT-4 Koto وآخرون، شباط 2024
Jais-chat 30B على ArabicMMLU 62.3٪ أفضل نموذج مفتوح في ذلك الوقت المصدر نفسه

الصف الثاني والصف الرابع هما القصة: 55 مليارًا أصلية صارت 116 مليارًا معلنة. والطريق بينهما يستحق الشرح.


تشريح الرقم

من أين جاءت المئة وستة عشر مليارًا
عربية أصلية مجموعة
55 مليارًا
+ عربية مترجَمة آليًا
17 مليارًا
= المجموع الحقيقي
72 مليارًا
× تكرار 1.6 مرة
116 مليارًا معلنة

التكرار ليس غشًا، إنه أسلوب تدريب معروف ومشروع ومذكور في الورقة صراحة. لكن 116 مليارًا ليست 116 مليارًا من نص عربي مختلف، إنها 72 مليارًا قُرئت مرة ونصف تقريبًا. والفرق مهم، لأن تكرار النص لا يضيف معرفة جديدة، يضيف ترسيخًا لما هو موجود.


بطاقة النموذج

البند التفصيل
النموذج Jais، بحجمي 13 و30 مليار معامل
الجهات Inception التابعة لـ G42، وجامعة محمد بن زايد للذكاء الاصطناعي، وCerebras
تاريخ الإصدار 30 آب 2023
الورقة arXiv:2308.16149
البنية الحاسوبية Condor Galaxy 1
الترخيص مفتوح
الأول من نوعه أول نموذج ضخم مبني للعربية عن قصد
مقاييس التقييم مترجمة أو مكيّفة من الإنجليزية

قراءة ARAB-LENS: إنجاز حقيقي، ورواية منقوصة

لنكن واضحين: Jais كان الحدث الأهم في العربية الرقمية منذ عشر سنوات. قبله لم يكن هناك خيار. بعده صار هناك خيار. وأنا لا أقلّل من ذلك بكلمة.

لكن ثلاثة أشياء في الأرقام تستحق أن تُقال بصوت عالٍ.

الأول: نصف النموذج إنجليزي.

اقرأ الجدول مرة أخرى. 232 مليار رمز إنجليزي مقابل 116 مليارًا عربية. النموذج “العربي” فيه إنجليزية ضعف العربية تقريبًا. وهذا قرار هندسي صحيح، لا خطأ. الاستدلال والمعرفة العامة والرياضيات تأتي من الإنجليزية، ولا يمكن بناء نموذج قادر بخمسة وخمسين مليار رمز عربي فقط.

لكن حين تقرأ عنوانًا يقول “نموذج عربي”، تخيّل نموذجًا عربيًا. والحقيقة أنه نموذج ثنائي اللغة، أغلبيته إنجليزية، مُحسَّن للعربية. وهذه ليست الرواية التي وصلت إلى الجمهور.

الثاني: سبعة عشر مليارًا مترجَمة.

من 55 إلى 72 مليارًا، الفرق عربية مترجَمة آليًا من الإنجليزية. أي أن نحو ربع العربية الأصلية في النموذج ليست عربية كتبها عربي. وأنا أعرف لماذا فعلوها: لأن العربية عالية الجودة على الإنترنت نادرة، والترجمة تملأ الفراغ.

والثمن؟ النموذج يتعلم أنماطًا لا يقولها أحد. يتعلم “يتم استخدام” بدل “يُستعمل”، و”في حال كان” بدل “إن كان”. ثم يخرج علينا بعربية سليمة نحويًا وغريبة الإيقاع. هذا ما أسميه عربية الترجمة، وستعرفها فورًا حين تقرأها.

الثالث، والأخطر: الامتحان مترجَم أيضًا.

انظر إلى مقاييس التقييم: MMLU وHellaSwag وPIQA وBoolQ وARC وWinoGrande وTruthfulQA. كلها امتحانات إنجليزية مترجمة أو مكيّفة. وهذا يعني أن الحلقة أُغلقت: دُرّب جزئيًا على عربية مترجَمة، وقُيّم على عربية مترجَمة، وأُعلن النتيجة كإنجاز عربي.

والدليل على أن هذا يهم جاء بعد ستة أشهر. حين اختُبر Jais على ArabicMMLU، وهو امتحان بُني من أسئلة مدارس عربية حقيقية، سجّل Jais-chat 13B نتيجة 54.8٪. وهذا رقم جيد جدًا لنموذج مفتوح في ذلك الوقت، بل إن Jais-chat 30B سجّل 62.3٪ وكان أفضل نموذج مفتوح على الإطلاق في ذلك الامتحان. فالنموذج صمد أمام الامتحان العربي الحقيقي، وهذا يُحسب له.

خلاصة رأيي: Jais نجح رغم منهجية قياسه، لا بسببها. ولو كان التقييم عربيًا أصيلًا من البداية، لكان الفريق قد رأى نقاط ضعفه مبكرًا وأصلحها.


من دفتر الاختبار: كشف “عربية الترجمة” داخل مخرجات النموذج

هذه بنود أشغّلها على أي نموذج عربي لأعرف من أين تعلّم.

البند الأول: قائمة البصمات.

اطلب من النموذج مقالة من ثلاثمئة كلمة عن أي موضوع، ثم ابحث عن هذه:

البصمة البديل العربي الطبيعي لماذا تظهر
يتم + مصدر المبني للمجهول المباشر ترجمة is being
قام بـ + مصدر الفعل مباشرة ترجمة did
واحد من أهم من أهم ترجمة one of the most
في حال كان إن كان، إذا ترجمة in case
بشكل + صفة ظرف أو تمييز ترجمة -ly
على الرغم من حقيقة أن مع أن، رغم أن ترجمة despite the fact that
هذا يعتبر هذا ترجمة is considered

عدّ البصمات في كل مئة كلمة. في تجربتي مع النماذج المبنية على بيانات مترجمة، النسبة تتجاوز ستًا في كل مئة كلمة. وفي النص العربي الأصيل تنزل تحت اثنتين.

البند الثاني: اختبار المثل الشعبي.

اطلب من النموذج أن يكمل خمسة أمثال. المترجَم يفشل هنا لأن الأمثال لا تُترجم:

البداية الإكمال الصحيح
“اللي إيدو بالمي” “مش متل اللي إيدو بالنار”
“القرد بعين أمه” “غزال”
“تجري الرياح” “بما لا تشتهي السفن”
“يا داخل بين البصلة وقشرتها” “ما بينوبك إلا ريحتها”
“اللي ما بيعرف الصقر” “بيشويه”

النموذج الذي يخترع نهايات منطقية لكنها غير موجودة تعلّم بنية العربية ولم يعش فيها.

البند الثالث: اختبار التحية والوداع.

هذا بند بسيط ودقيق جدًا. اطلب: “اكتبلي رسالة قصيرة لزميلي بالشغل بدي أعتذر إني ما رح أقدر أحضر الاجتماع بكرا.”

راقب أربعة أشياء:

العنصر العلامة الجيدة العلامة السيئة
البداية “مرحبا” أو “صباح الخير” “عزيزي الزميل المحترم”
الاعتذار “بعتذر منك” “أود أن أعرب عن اعتذاري”
السبب مباشر وقصير فقرة تبرير كاملة
الختام “بعتمد عليك” أو “منشوفك” “وتفضلوا بقبول فائق الاحترام”

العمود الأيمن ليس خطأ لغويًا، إنه خطأ سياقي. رسالة واتساب لزميل ليست خطابًا رسميًا لوزارة. النموذج الذي لا يفرّق بينهما تعلّم العربية من الوثائق الرسمية والمترجمة، وهي أكثر ما يتوفر منها على الإنترنت.

البند الرابع: قياس تسرّب الفصحى في ستة أدوار.

ابدأ محادثة بالشامي واستمر ستة أدوار، وسجّل في أي دور انقلب النموذج إلى الفصحى:

الدور 1: “مرحبا، كيفك؟”
الدور 2: “بدي أسألك عن شغلة بالشغل.”
الدور 3: “مديري طلب مني تقرير وأنا ما فهمت شو بدو بالضبط.”
الدور 4: “لأ، هو ما حكالي. بس قال جهزلي شي مرتب.”
الدور 5: “طيب شو رأيك أعمل؟”
الدور 6: “تمام، بس خليها قصيرة لأنه ما عندي وقت.”

النمط الذي رأيته يتكرر: الدور الأول والثاني بالشامي، الثالث فيه كلمات فصيحة، والرابع فصيح بالكامل. سجّل رقم الدور. هذا الرقم مقياس مفيد جدًا وسريع، وسأستعمله عبر السلسلة كلها.

البند الخامس: اختبار الازدواج اللغوي الداخلي.

النموذج ثنائي اللغة قد يفكّر بلغة ويجيب بأخرى. اطلب مسألة تحتاج خطوات واطلب الخطوات بالعربية:

“عندي محل، بعت 17 قطعة بسعر 23 دينار للقطعة، ودفعت 40 دينار أجرة توصيل. شو صافي الدخل؟ اكتب الخطوات بالعربي.”

راقب: هل الخطوات عربية فعلًا أم أرقام وكلمات إنجليزية؟ وهل استعمل “دينار” أم حوّلها؟ وهل رتّب الأرقام من اليمين؟ النموذج الذي يعطيك الجواب صحيحًا بخطوات نصفها إنجليزية يفكّر بالإنجليزية ويترجم.

البند السادس: اختبار الاسم العلم.

اطلب فقرة عن شخصية عربية غير مشهورة عالميًا، مثل الشاعر المتنبي أو ابن النفيس أو غسان كنفاني. ثم اطلب الفقرة نفسها بالإنجليزية. قارن عدد الحقائق الصحيحة في كل منهما. إن كانت النسخة الإنجليزية أغنى، فالنموذج يخزّن معرفته عن ثقافتك بلغة أخرى.


ماذا نتعلّم من مقارنة Jais بما قبله

المعيار ما قبل Jais ما بعده
أفضل نموذج مفتوح بالعربية BLOOMz بـ 42.9٪ Jais-chat بـ 48.4٪
وجود خيار عربي مفتوح بحجم جاد لا نعم
شفافية بيانات التدريب العربية معدومة جدول مفصّل
قابلية البناء عليه إقليميًا صعبة مباشرة
تقييم بمعايير عربية أصيلة لا جاء لاحقًا مع ArabicMMLU

الصف الثالث هو ما أقدّره أكثر. الجدول 3 في ورقة Jais يفصّل: أصلي، مترجَم، مكرّر. هذه شفافية لم أجدها في أغلب ما قرأتُه بعدها، ومنها ما هو أحدث بسنتين.

وأنا أختم بملاحظة أراها مهمة للمنطقة: الشفافية عن الضعف أنفع من إعلان عن القوة. الفريق الذي يكتب “ربع عربيتنا مترجَمة” يعطي الباحثين بعده أرضية للبناء. والفريق الذي يكتب رقمًا واحدًا لامعًا يعطيهم عنوانًا صحفيًا فقط.


الحكم العملي

إن كنت تختار بين نموذج عربي مخصص ونموذج عالمي، القاعدة التي وصلت إليها: النموذج العربي المخصص أفضل في الأسلوب والسياق الثقافي، والنموذج العالمي الكبير أفضل في المعرفة والاستدلال. اختر حسب مهمتك، لا حسب الاسم.

وإن كنت تبني بيانات تدريب عربية، لا تملأ الفراغ بالترجمة الآلية. خمسة مليارات رمز عربي أصيل أنفع من عشرين مليارًا نصفها مترجَم. وهذا ليس رأيًا فقط، ورقة AraT5 برهنته بالأرقام سنة 2022.

وإن كنت تقرأ إعلانًا عن نموذج عربي، اسأل عن ثلاثة أرقام: كم عربية أصلية، كم مترجَمة، وكم مرة كُرّرت. الرقم المعلن وحده لا يقول لك شيئًا.


المقالة القادمة

بعد أسبوع واحد من Jais، أعلنت الإمارات أيضًا عن Falcon 180B، أكبر نموذج مفتوح في العالم وقتها، بثلاثة تريليونات ونصف رمز. المقالة القادمة تبحث عن العربية في بطاقة النموذج. ولا تجدها.


المصادر

  • Sengupta وآخرون، Jais and Jais-chat: Arabic-Centric Foundation and Instruction-Tuned Open Generative Large Language Models، arXiv:2308.16149، 30 آب 2023
  • بيان Cerebras وG42 وMBZUAI الصحفي، آب 2023: cerebras.ai
  • Koto وآخرون، ArabicMMLU، Findings of ACL 2024: aclanthology.org/2024.findings-acl.334
  • Huang وآخرون، AceGPT، NAACL 2024: aclanthology.org/2024.naacl-long.450