تفوّق على GPT-3.5 في الأسلوب وخسر أمامه في المعرفة: حالة AceGPT

وقت القراءة: 8 دقيقة
18
إيهاب صالح | techkahwa.net صدرت الورقة: 21 أيلول 2023 | تاريخ النشر: 5 تشرين الأول 2023

الأرقام أولًا

المقياس النتيجة ما الذي يقيسه المصدر
AceGPT-13B-chat على Arabic Vicuna-80 100.88٪ من أداء GPT-3.5 اتباع التعليمات بالعربية، بحكم GPT-4 ورقة AceGPT، NAACL 2024
AceGPT-13B-chat على Arabic AlpacaEval 97.95٪ من أداء GPT-3.5 المقياس نفسه، مجموعة أخرى الورقة نفسها
Jais-13B-chat على Arabic Vicuna-80 75.40٪ المنافس العربي المباشر الورقة نفسها
AceGPT-13B-base على MMLU العربية 40.45٪ المعرفة العامة الورقة نفسها
GPT-3.5 Turbo على MMLU العربية 49.07٪ الفارق: 8.6 نقاط لصالح GPT-3.5 الورقة نفسها
AceGPT-13B-base على EXAMs العربية 36.63٪ امتحانات مدرسية الورقة نفسها
GPT-3.5 Turbo على EXAMs العربية 45.63٪ الفارق: 9 نقاط الورقة نفسها
AceGPT-13B-chat على ACVA، المجموعة النظيفة 74.62٪ التوافق الثقافي والقيمي العربي الورقة نفسها
GPT-3.5 Turbo على ACVA، المجموعة النظيفة 79.03٪ نموذج أميركي يتفوق ثقافيًا الورقة نفسها
LLaMA2-7B على MMLU العربية، للمرجع 29.47٪ مستوى التخمين الورقة نفسها

اقرأ الصف الأول والصف الأخير معًا: نموذج عربي بثلاثة عشر مليار معامل تجاوز GPT-3.5 في الأسلوب، وخسر أمامه في المعرفة بثماني نقاط، وخسر أمامه في الثقافة العربية بأربع نقاط ونصف.


ثلاثة محاور، لا محور واحد

AceGPT-13B مقابل GPT-3.5، نسبة مئوية من أداء GPT-3.5
اتباع التعليمات بالعربية
100.9٪ تفوّق
المعرفة العامة بالعربية
82.4٪ خسارة
الثقافة والقيم العربية
94.4٪ خسارة

هذا الرسم هو الفكرة المركزية في السلسلة كلها: الطلاقة والمعرفة والثقافة ثلاثة أشياء مختلفة، وتُقاس بثلاثة مقاييس، ويمكن أن تنجح في واحد وتسقط في الآخرين.


بطاقة النموذج

البند التفصيل
النموذج AceGPT، بحجمي 7 و13 مليار معامل
الجهات جامعة الملك عبدالله للعلوم والتقنية، ومعهد SRIBD، وجامعة هونغ كونغ الصينية في شنتشن
تاريخ الورقة 21 أيلول 2023
مكان النشر NAACL 2024
الأساس تدريب إضافي فوق Llama 2
المنهجية تدريب إضافي بالعربية، ثم ضبط بتعليمات عربية أصلية، ثم تعلّم معزّز بمكافأة مضبوطة على الثقافة المحلية
الفكرة المركزية التوطين، لا الترجمة

قراءة ARAB-LENS: الورقة التي قالت الجملة الصحيحة

هذه الورقة تحتوي جملة أعتبرها الأهم في أدبيات العربية الحاسوبية كلها:

“الاعتماد على البيانات المترجَمة قد يؤدي إلى مشكلات توطين، ما قد يقوّض سلامة النماذج وقابليتها للتطبيق في السياقات الأصلية.”

وجملة ثانية أقوى:

“ليس مرغوبًا فحسب بل ضروري أن نوطّن النماذج اللغوية الكبيرة ونفصّلها على بيئة ثقافية بعينها.”

وهم لم يكتفوا بالقول، بنوا المنهجية عليه: تدريب إضافي بالعربية، ثم تعليمات عربية أصلية لا مترجمة، ثم مرحلة تعلّم معزّز بنموذج مكافأة مضبوط على الثقافة والقيم المحلية. هذه أول مرة أرى فيها فريقًا يضع الثقافة داخل حلقة التدريب لا خارجها.

والنتيجة؟ قفزة هائلة في الأسلوب. من 75.40٪ عند Jais إلى 100.88٪ عند AceGPT. أي أن نموذجًا مفتوحًا بثلاثة عشر مليارًا صار يكتب عربية يفضّلها الحَكَم على عربية GPT-3.5.

ثم يأتي العمود الثاني والثالث ويقولان شيئًا آخر تمامًا.

في المعرفة: 40.45 مقابل 49.07. في الامتحانات المدرسية: 36.63 مقابل 45.63. وهذا منطقي تمامًا، لأن التدريب الإضافي لا يزرع معرفة جديدة بكثافة، إنه يعيد تشكيل ما هو موجود. والأساس كان Llama 2، والعربية فيه تحت 0.005٪. لا يمكنك أن تستخرج من البئر ما لم يُصبّ فيها.

وفي الثقافة، وهنا المفاجأة الحقيقية: AceGPT سجّل 74.62 على ACVA النظيفة، وGPT-3.5 سجّل 79.03. أي أن نموذجًا بُني خصيصًا لمحاذاة القيم العربية، بمكافأة مضبوطة على الثقافة المحلية، خسر أمام نموذج أميركي عام في اختبار ثقافي عربي.

كيف؟ رأيي أن السبب اثنان. الأول أن GPT-3.5 رأى كمًا هائلًا من النص عن العالم العربي، حتى لو كان أغلبه بالإنجليزية، والمعرفة الثقافية تنتقل عبر اللغات. والثاني، وهو الأهم، أن ACVA نفسه امتحان اختيار من متعدد، والاختيار من متعدد يكافئ المعرفة لا التصرّف. النموذج الذي يعرف أن العزاء ثلاثة أيام يجيب صح، والنموذج الذي يعرف كيف يتكلم في العزاء لا يُقاس أصلًا.

وهذا في تقديري أهم ما تعلّمته من هذه الورقة: AceGPT كسب في ما يُقاس بالحكم البشري، وخسر في ما يُقاس بالاختيار من متعدد. والسؤال الذي يجب أن يطرحه كل من يقيّم نموذجًا عربيًا: أي واحد منهما يهم منتجك؟


من دفتر الاختبار: فصل الطلاقة عن المعرفة عن الثقافة

هذه أدق أداة عندي، وأستعملها كمسطرة ثلاثية. اسأل ثلاثة أسئلة عن الموضوع نفسه، كل سؤال يقيس محورًا.

الموضوع: العزاء.

المحور السؤال ما يكشفه
طلاقة “اكتبلي رسالة عزاء قصيرة بالشامي” هل اللغة طبيعية؟
معرفة “كم يوم بيضل العزا عادةً؟ وشو بيصير باليوم الثالث؟” هل يعرف الحقيقة؟
ثقافة “صاحبي مات عمّه وأنا ما بعرفه. لازم أروح؟ وإذا رحت شو بقول بالضبط أول ما بفوت؟” هل يعرف كيف يتصرّف؟

النموذج الذي ينجح في الأول ويفشل في الثالث هو أخطر أنواع النماذج، لأنه مقنع وخاطئ.

الأجوبة المرجعية للسؤال الثالث: نعم تروح، لأن العزاء واجب اجتماعي تجاه صاحبك لا تجاه المتوفى الذي لا تعرفه. وأول ما تدخل تقول “عظّم الله أجركم” أو “البقية بحياتكم”. ولا تقول “مبروك” ولا تسأل عن سبب الوفاة بالتفصيل، ولا تجلس طويلًا إن كان المكان ممتلئًا.

الموضوع الثاني: العزومة.

المحور السؤال الجواب المرجعي
طلاقة “اكتب دعوة غدا لجيراني” لغة دافئة قصيرة
معرفة “شو أكلة العزايم التقليدية بالأردن؟” المنسف
ثقافة “عزمت حدا وقال لي إن شاء الله. هل بحضّر له صحن؟” نعم، تحضّر. “إن شاء الله” هنا قبول مهذّب لا التزام مؤكد، والعُرف أن تحضّر وتترك له مخرجًا

الموضوع الثالث: العمل.

المحور السؤال الجواب المرجعي
طلاقة “اكتبلي استقالة مهذبة” لغة رسمية سليمة
معرفة “شو يعني مخالصة عند ترك الشغل؟” تسوية نهائية للحقوق
ثقافة “مديري قال لي خلينا نشوف لما طلبت زيادة. شو يعني هاد؟” غالبًا رفض مؤجّل ومهذّب، لا وعد

السؤال الأخير هو أفضل اختبار براغماتي عربي أعرفه. “خلينا نشوف” في سياق العمل العربي تعني في الغالب “لا” مغلّفة. النموذج الذي يفسّرها على أنها احتمال إيجابي يقرأ الكلمات لا الموقف.

البند الرابع: مؤشر واحد سريع.

إن لم يكن عندك وقت، اسأل سؤالًا واحدًا: “شو الفرق بين إنه حدا يقول لك تعال عنا، وبين إنه يقول لك لازم تيجي عنا؟”

الأولى مجاملة اجتماعية لا تستدعي فعلًا. الثانية دعوة حقيقية. النموذج الذي يميّز بينهما يفهم العربية كما تُعاش، لا كما تُكتب.

البند الخامس: اختبار المكافأة الثقافية.

AceGPT استعمل نموذج مكافأة مضبوطًا على الثقافة المحلية. اختبر أثر ذلك مباشرة بأسئلة فيها تصادم بين إجابة “صحيحة عالميًا” و”مناسبة محليًا”:

الموقف الإجابة العالمية الإجابة المناسبة محليًا
“زميلي طلب مني سلفة وأنا ما بدي” “ارفض بوضوح” اعتذار مغلّف يحفظ الوجه
“جاري رفع صوت الأغاني بالليل” “تحدث معه مباشرة” وساطة أو تلميح أولًا
“أهلي بدهم يعرفوا راتبي” “خصوصيتك حقك” إجابة فيها احترام للسياق العائلي
“مديري أخطأ أمام الفريق” “صحّح له علنًا” تصحيح على انفراد

لا توجد إجابة واحدة صحيحة هنا، وهذا بيت القصيد. النموذج الجيد يقدّم الخيارين ويشرح الفرق، لا يفرض نموذجًا ثقافيًا واحدًا.

البند السادس: اختبار اللهجة في التلخيص.

أعطِ النموذج نصًا بالشامي واطلب تلخيصًا بالشامي. أغلب النماذج تلخّص بالفصحى حتى لو طُلب خلاف ذلك، لأن التلخيص مهمة تعلّمتها بالفصحى. سجّل النتيجة: هذا أحد أوضح مؤشرات عمق التوطين.


المسطرة الثلاثية، مطبّقة على الجدول

خذ الأرقام في أول المقالة وأعد ترتيبها حسب المحاور الثلاثة:

المحور AceGPT-13B GPT-3.5 من يفوز
طلاقة، Vicuna-80 100.88٪ من GPT-3.5 المرجع AceGPT
طلاقة، AlpacaEval 97.95٪ المرجع متقارب
معرفة، MMLU عربية 40.45 49.07 GPT-3.5
معرفة، EXAMs 36.63 45.63 GPT-3.5
ثقافة، ACVA نظيفة 74.62 79.03 GPT-3.5

خمسة قياسات، فاز العربي في واحد وتعادل في واحد وخسر ثلاثة. لكن الواحد الذي فاز فيه هو الوحيد الذي يحكم فيه بشر، والأربعة الأخرى اختيار من متعدد.

وأنا أترك هذا السؤال مفتوحًا لك: أي المقياسين أقرب إلى تجربة مستخدمك الحقيقي، حكم إنسان على جواب مكتوب، أم اختيار من أربعة خيارات؟


الحكم العملي

إن كانت مهمتك كتابة، فنموذج مثل AceGPT في زمنه كان الخيار الصحيح رغم صغره. الأسلوب يتحسّن بالتدريب الإضافي بسرعة وبكلفة معقولة.

وإن كانت مهمتك إجابة أسئلة أو استخراج معلومات، فالحجم والمعرفة يفوزان، ولا يعوّضهما ضبط لغوي.

والقاعدة التي أخرج بها من هذه الورقة: قبل أن تختار نموذجًا، اكتب على ورقة أي المحاور الثلاثة يهمك: الطلاقة أم المعرفة أم الثقافة. أغلب المشاريع التي رأيتها تفشل لأنها اختارت نموذجًا ممتازًا في محور لا تحتاجه.


المقالة القادمة

في تشرين الثاني 2023 أصدرت OpenAI نسخة جديدة من Whisper. وبعد سنتين، قاس فريق سعودي أداءها على خمس لهجات عربية، وخرج برقمين: 27.95٪ خطأ في الفصحى، و59.92٪ في الخليجي. المقالة القادمة عن هذا الضعف بالضبط، وعن معناه لأي تطبيق صوتي عربي.


المصادر

  • Huang وآخرون، AceGPT: Localizing Large Language Models in Arabic، NAACL 2024: aclanthology.org/2024.naacl-long.450
  • النسخة الأولى على arXiv:2309.12053، 21 أيلول 2023
  • Koto وآخرون، ArabicMMLU، Findings of ACL 2024: aclanthology.org/2024.findings-acl.334