قبل أن تصل النماذج الكبيرة: ماذا كانت العربية تملك فعلًا

وقت القراءة: 9 دقيقة
18
إيهاب صالح | techkahwa.net صدر العمل: أيار 2022 (ACL 2022) | تاريخ النشر: 5 حزيران 2022

الأرقام أولًا

المقياس النتيجة ما الذي يقيسه المصدر
AraBERT، حجم بيانات التدريب 70 مليون جملة، نحو 24 غيغابايت حجم المدخل العربي لأول نموذج عربي جاد Antoun وBaly وHajj، ورشة OSACT4، أيار 2020
AraBERT على تحليل المشاعر HARD 96.2٪ مقابل 95.7٪ لـ mBERT فارق نموذج عربي مخصص عن نموذج متعدد اللغات الورقة نفسها
AraBERT على استخراج الكيانات ANERcorp 84.2 مقابل 78.4 الفارق يتسع كلما صعبت المهمة الورقة نفسها
ARBERT، بيانات الفصحى 61 غيغابايت، 6.5 مليار رمز أكبر مدخل فصيح في ذلك الجيل Abdul-Mageed وElmadany وNagoudi، ACL-IJCNLP 2021
MARBERT، بيانات اللهجات مليار تغريدة عربية، 128 غيغابايت، 15.6 مليار رمز أول محاولة جادة لتعليم النموذج اللهجات الورقة نفسها
MARBERT-v2 على لوحة ARLUE 77.40 متوسط ستة عناقيد مهام عربية الورقة نفسها
AraT5، بيانات التدريب 248 غيغابايت، 29 مليار رمز نحو 49٪ أقل من عربية mT5 البالغة 57 مليار رمز Nagoudi وElmadany وAbdul-Mageed، ACL 2022
AraT5 مقابل mT5 على ARGEN أفضل في 52 من 59 مجموعة اختبار التوليد العربي، لا التصنيف فقط الورقة نفسها
AraT5 على ARLUE 77.52 مقابل 76.53 لـ MARBERT و75.05 لـ mT5 أعلى رقم في ذلك الجيل الورقة نفسها

هذه ليست أرقام نماذج محادثة. هذه أرقام مرحلة سابقة كاملة، ومن لا يعرفها لا يفهم من أين جاءت المشكلة التي نكتب عنها اليوم.


ماذا كان يوجد، وبأي حجم

حجم بيانات التدريب العربية، بالغيغابايت
AraBERT 2020
24
ARBERT فصحى 2021
61
AraT5 فصحى 2022
70
MARBERT تغريدات 2021
128
AraT5 مجموع 2022
248

انظر إلى الفجوة بين السطر الأول والسطر الأخير: عشرة أضعاف في سنتين. هذه سرعة نمو جيدة بكل المقاييس. والمشكلة أنها حدثت في عالم موازٍ، بينما كان الإنجليزي ينتقل من مليارات إلى تريليونات الرموز.


بطاقة المرحلة

البند التفصيل
الفترة 2020 إلى 2022
الجهات الجامعة الأميركية في بيروت، جامعة بريتش كولومبيا
البنية BERT للفهم، T5 للتوليد
الحجم مئات الملايين من المعاملات، لا مليارات
نقطة القوة مصنوع للعربية من الصفر، لا مترجم ولا ملحق
نقطة الضعف لا محادثة، لا اتباع تعليمات، لا استدلال
الإرث الحقيقي المعايير والبيانات، لا النماذج

قراءة ARAB-LENS: الدرس الذي دفعنا ثمنه مرتين

في هذه المرحلة حدث شيء مهم جدًا، ثم نُسي تمامًا.

الفريق الكندي في بريتش كولومبيا لم يبنِ نموذجًا واحدًا، بنى اثنين متعمدًا: ARBERT على 61 غيغابايت فصحى نظيفة، وMARBERT على مليار تغريدة. لماذا يتكبد فريق هذا العناء مرتين؟ لأنهم أدركوا مبكرًا أن الفصحى واللهجات ليستا مستوى واحدًا من اللغة نفسها، بل مدخلان مختلفان يحتاج كل منهما تدريبًا خاصًا.

هذا الفهم كان موجودًا سنة 2021. وضاع.

وأنا بقول ضاع بمعنى حرفي. كل نموذج عربي ضخم بنته المنطقة بعد ذلك، وسترى في المقالات التالية أرقامه، عاد إلى الخلط: كتلة واحدة من النص العربي، أغلبها فصحى، وقليل من اللهجات يدخل بالصدفة. ثم يُفاجأ الجميع أن النموذج يفهم مقالة صحفية ولا يفهم رسالة واتساب.

لكن انتبه للتفصيل الذي يكشف حدود تلك المرحلة أيضًا. كيف جمع الفريق بيانات اللهجات؟ بمرشّح واحد: أي تغريدة فيها ثلاث كلمات عربية على الأقل. هذا كل شيء. لا تصنيف لهجة، لا توازن بين مناطق، لا تحقق من أن التغريدة مكتوبة بلهجة أصلًا. مليار تغريدة دخلت بهذا المرشّح، ومنها تعلّم النموذج ما ظنناه لهجة.

وهنا رأيي الذي لا أتراجع عنه: مرشّح “ثلاث كلمات عربية” ليس منهجية جمع لهجات، إنه منهجية جمع نص عربي. الفرق بين الاثنين هو كل الفرق. وما زال هذا الخطأ يتكرر في 2026 بصيغ أحدث وأغلى.

الملاحظة الثالثة، وهي الأهم عمليًا: AraT5 حقق نتيجة أفضل من mT5 ببيانات أقل بنحو 49٪. ورقة ACL 2022 تقولها صراحة: 29 مليار رمز عربي مقابل 57 مليارًا عند mT5، ونتيجة أعلى. هذا برهان مبكر ونظيف على أن عربية مختارة بعناية تهزم عربية أكثر مجموعة عشوائيًا. ثم جاء عصر النماذج الكبيرة وقرر أن الحجم وحده يكفي.


من دفتر الاختبار: كيف تعرف إن كان نموذج قديم يفهم لهجة فعلًا

هذه بنود أستعملها حتى اليوم على النماذج الحديثة، وهي أصلًا من منطق تلك المرحلة. اكتبها كما هي وشغّلها.

البند الأول: الكلمة التي تنقلب.

خذ كلمة واحدة تتغير وظيفتها بين الفصحى والشامي:

الكلمة في الفصحى في الشامي ماذا يكشف
طيب، في “طيب، شو صار؟” صفة بمعنى لذيذ أو حسن أداة انتقال بمعنى حسنًا إن فسّرها النموذج صفة فهو يقرأ بالفصحى
هيك لا وجود لها هكذا كلمة لا جذر فصيح لها
عم، في “عم بكتب” العم، أخ الأب أداة استمرار أخطر فخ في الشامي
لسا لا وجود لها ما زال، بعد مؤشر زمن كامل

الاختبار: اكتب “عم بكتب لعمي” واطلب تحليلًا صرفيًا. النموذج الذي يعامل “عم” الأولى والثانية على أنهما الكلمة نفسها لم يتعلم اللهجة، تعلّم شكل الحروف.

البند الثاني: القاف بأربع صور.

النطق المنطقة التقريبية مثال
قال، بالقاف الفصحى وبعض المناطق قال لي
آل، بالهمزة دمشق، بيروت، القاهرة آل لي
گال، بالگاف الخليج ونجد وبدو الشام گال لي
كال، بالكاف بعض فلسطين والأرياف كال لي

اكتب الأربعة في نص واحد واطلب من النموذج أن يصنّف كل جملة منطقةً. النموذج القديم كان يفشل بصمت ويجيب “عربية”. النموذج الحديث يجيب بثقة وغالبًا يخطئ، وهذا أسوأ.

البند الثالث: اختبار الحذف.

هات نصًا لهجيًا واحذف منه كل كلمة لا تُستعمل في الفصحى. إن بقي النص مفهومًا ومتماسكًا فهو فصحى بغلاف لهجي. جرّب على هذين:

النص الأول: “أنا رايح على البيت هلق وبعدين بشوفك.”
بعد الحذف: “أنا رايح على البيت وبعدين بشوفك.” النص ما زال حيًا. نسبة اللهجة الحقيقية منخفضة.

النص الثاني: “لسا عم بستنى، وإذا ما إجا بروح لحالي.”
بعد الحذف: “وإذا ما لحالي.” النص انهار. هذه لهجة حقيقية.

هذا الاختبار من تأليفي وأستعمله كمسطرة ثابتة عبر كل مقالات هذه السلسلة.

البند الرابع: التاء المربوطة عند الوقف.

هذا بند يفرز النماذج بسرعة، لأنه يحتاج معرفة بالنطق لا بالكتابة فقط. التاء المربوطة تُنطق هاءً عند الوقف وتاءً عند الوصل.

الجملة النطق الصحيح للتاء الخطأ الشائع
“شفت مدرسة.” مدرسه، هاء، لأننا وقفنا مدرست
“شفت مدرسةَ الحي.” مدرست، تاء، لأننا وصلنا مدرسه الحي
“هاي سيارة.” سياره سيارت
“هاي سيارةُ أبوي.” سيارت أبوي سياره أبوي

اطلب من النموذج أن يكتب هذه الأربع بالعربيزي، أي بحروف لاتينية. النموذج الذي يكتب madraseh في الأولى وmadraset في الثانية يفهم البنية الصوتية. النموذج الذي يكتب الشكل نفسه مرتين يقرأ الحرف ولا يسمعه.

البند الخامس: عمّان وعُمان.

كلمتان تُكتبان بالحروف نفسها تقريبًا وتختلفان في كل شيء آخر.

الكلمة النطق ما هي الجنسية
عَمّان بفتح العين وتشديد الميم عاصمة الأردن أردني
عُمان بضم العين بلا تشديد سلطنة عُمان عُماني

اكتب: “صاحبي من عمان بس ما بعرف إذا عَمّان ولا عُمان.” ثم اسأل النموذج كيف يميّز. الجواب الصحيح يذكر التشديد والحركة والجنسية. الجواب الضعيف يعتذر أو يخمّن. وأنا جرّبت هذا البند على كل جيل من النماذج، ونسبة النجاح فيه ترتفع ببطء شديد مقارنة بكل شيء آخر.


ما الذي ضاع فعلًا بين 2022 و2023

أريد أن أضع الأمر في جدول واحد، لأن هذه هي النقطة التي تربط هذه المقالة بكل ما بعدها:

الميزة جيل AraBERT وMARBERT جيل النماذج الكبيرة الأولى
الفصل بين الفصحى واللهجة موجود ومقصود مفقود
نسبة العربية في البيانات 100٪ أجزاء من المئة
جودة الانتقاء يدوية ومراجَعة زحف آلي
المعايير عربية أصلية مترجمة آليًا
القدرة على المحادثة معدومة ممتازة
القدرة على الاستدلال معدومة جيدة
المعرفة العامة محدودة جدًا واسعة

انظر إلى العمودين بعناية. الجيل القديم كان أفضل في أول أربعة صفوف، والجديد أفضل في آخر ثلاثة. ولأن آخر ثلاثة هي ما يراه المستخدم، فاز الجديد وطُويت صفحة القديم.

وهذا في رأيي الخطأ الاستراتيجي الأكبر في تاريخ معالجة العربية: لم يكن علينا أن نختار. كان يمكن أن نأخذ منهجية الانتقاء والفصل من الجيل الأول ونضعها داخل الحجم الضخم للجيل الثاني. أحد لم يفعل. والنتيجة أننا في 2026 ما زلنا نكتشف من جديد أن الفصحى واللهجة مدخلان لا مدخل واحد.


الحكم العملي

إن كنت تبني منتجًا عربيًا اليوم، ثلاثة أشياء من هذه المرحلة ما زالت تنفعك:

أولًا، معايير ARLUE وARGEN وبيانات ANERcorp وHARD ما زالت متاحة ومجانية، وهي عربية أصلية غير مترجمة. استعملها للتقييم حتى لو كان نموذجك حديثًا. كثير من المعايير الأحدث والأشهر مترجمة آليًا، وسنرى في مقالة قادمة كم كلّف ذلك.

ثانيًا، إن كانت مهمتك تصنيفًا أو استخراج كيانات أو تحليل مشاعر، فنموذج بحجم MARBERT قد يكفيك ويوفّر عليك تسعين بالمئة من التكلفة. لا تستدعِ نموذجًا بمئة مليار معامل ليقول لك إن هذه المراجعة سلبية.

ثالثًا، الدرس المنهجي: افصل الفصحى عن اللهجة في بياناتك وفي تقييمك. إن كان تقييمك رقمًا واحدًا فأنت لا تعرف أين يقف منتجك.


المقالة القادمة

في تشرين الثاني 2022 وصل ChatGPT، ودخل مئات الملايين من العرب على نموذج لغوي لأول مرة. المقالة القادمة تبدأ برقم واحد فقط، لكنه رقم يشرح لماذا كانت التجربة الأولى للعربي أغلى وأبطأ من تجربة غيره: ثلاثة أضعاف.


المصادر

  • Antoun وBaly وHajj، AraBERT: Transformer-based Model for Arabic Language Understanding، ورشة OSACT4، أيار 2020: aclanthology.org/2020.osact-1.2
  • Abdul-Mageed وElmadany وNagoudi، ARBERT & MARBERT: Deep Bidirectional Transformers for Arabic، ACL-IJCNLP 2021، آب 2021: aclanthology.org/2021.acl-long.551
  • Nagoudi وElmadany وAbdul-Mageed، AraT5: Text-to-Text Transformers for Arabic Language Generation، ACL 2022، أيار 2022: aclanthology.org/2022.acl-long.47