الأرقام أولًا
| المقياس | النتيجة | ما الذي يقيسه | المصدر |
|---|---|---|---|
| كلفة ترميز العربي مقابل الإنجليزي | 3 أضعاف | عدد الرموز اللازمة للنص نفسه بالمعنى نفسه | Petrov وLa Malfa وTorr وBibi، NeurIPS 2023 |
| كلفة الإيطالي مقابل الإنجليزي | 1.6 ضعف | للمقارنة، لغة أوروبية قريبة | الورقة نفسها |
| كلفة البلغاري مقابل الإنجليزي | 2.6 ضعف | للمقارنة، لغة سيريلية | الورقة نفسها |
| أقصى فارق بين لغتين في الدراسة | حتى 15 ضعفًا | اتساع الظلم عبر لغات العالم | الورقة نفسها |
| المجزّئ محل الدراسة | cl100k_base | المجزّئ المستعمل في ChatGPT وGPT-4 | الورقة نفسها |
| النص المرجعي | FLORES-200 | نصوص موازية مترجمة بشريًا | الورقة نفسها |
| تاريخ إطلاق ChatGPT | 30 تشرين الثاني 2022 | أول لقاء جماهيري عربي بنموذج لغوي | OpenAI، صفحة الإطلاق |
الرقم الأول هو المقالة كلها. كل شيء بعده شرح.
ماذا يعني “ثلاثة أضعاف” عمليًا
وهذا ما يحوّله الرقم إليه في يومك:
| الأثر | التفصيل |
|---|---|
| الكلفة | الفاتورة تُحسب بالرمز. نفس المعنى بالعربي يكلّفك ثلاثة أضعاف |
| السرعة | النموذج يولّد رمزًا رمزًا. جواب عربي بنفس المعنى يظهر أبطأ ثلاث مرات تقريبًا |
| نافذة السياق | نافذة بأربعة آلاف رمز تسع نحو ثلث ما تسعه بالإنجليزي |
| الذاكرة في محادثة طويلة | تاريخ المحادثة يمتلئ أسرع، فينسى النموذج أول الكلام أبكر |
| الحد الأقصى للإخراج | جواب طويل بالعربي يُقطع قبل أن يكتمل |
جرّب هذا الحساب بنفسك، وهو حساب بسيط مبني على النسبة أعلاه لا على قياس جديد: لو كان لديك سياق بثمانية آلاف رمز، فأنت بالإنجليزي تضع فيه ما يعادل ثمانية آلاف وحدة معنى تقريبًا، وبالعربي نحو ألفين وستمئة. أنت وزميلك الأميركي تدفعان الاشتراك نفسه وتحصلان على نافذتين مختلفتين.
بطاقة اللحظة
| البند | التفصيل |
|---|---|
| المنتج | ChatGPT |
| تاريخ الإطلاق | 30 تشرين الثاني 2022 |
| الأساس | من سلسلة GPT-3.5، أنهت تدريبها أوائل 2022 |
| المجزّئ | cl100k_base |
| ما نُشر عن العربية وقتها | لا شيء. لا رقم، لا معيار، لا ذكر |
| كيف عرفنا الرقم | بحث أكاديمي مستقل بعد ستة أشهر |
انتبه للسطر قبل الأخير. هذه ليست ملاحظة عابرة، هذه هي القاعدة في هذه السلسلة كلها: الأرقام العربية تأتي دائمًا من خارج الشركة المصنّعة، ومتأخرة.
قراءة ARAB-LENS: الظلم يبدأ قبل الذكاء
أكثر ما يزعجني في نقاش النماذج العربية أنه يبدأ دائمًا من السؤال الخطأ: هل النموذج ذكي بالعربي؟ والحقيقة أن الظلم يبدأ قبل الذكاء بخطوة كاملة.
المجزّئ قطعة برمجية صغيرة وغبية نسبيًا، مهمتها تقطيع النص إلى وحدات. وهو يتعلم من البيانات التي دُرّب عليها. إن كانت تلك البيانات إنجليزية في أغلبها فسيتعلّم أن “ing” و”tion” وحدات كاملة تستحق رمزًا واحدًا، ولن يتعلّم أن “ال” التعريف أو “ون” الجمع أو “ها” الضمير تستحق المعاملة نفسها. فيقطّع الكلمة العربية إلى شظايا.
والنتيجة ليست مسألة كفاءة فقط، وهنا النقطة التي يغفل عنها الناس. حين تتقطّع الكلمة إلى شظايا لا معنى لها، يصبح على النموذج أن يعيد تركيب المعنى من هذه الشظايا في كل مرة. هذا عمل إضافي يدفع ثمنه بالدقة، لا بالمال فقط. وأنا أرى أن جزءًا من ضعف النماذج في الصرف العربي يعود إلى هنا، لا إلى قلة البيانات وحدها.
أضف إلى ذلك طبيعة العربية نفسها. العربية لغة اشتقاقية تراكمية: كلمة واحدة مثل “وبمدارسهم” تحمل واوًا وباء و”ال” وجذرًا ووزنًا وجمعًا وضميرًا. سبع وحدات معنى في كلمة واحدة تُكتب بتسعة أحرف. مجزّئ مبني على الإنجليزية لا يملك طريقة لرؤية هذا البناء، فيتعامل معه كسلسلة حروف غريبة.
الملاحظة الأخيرة والأقسى: الورقة تقول إن الفارق بين بعض اللغات يصل إلى خمسة عشر ضعفًا. العربية عند ثلاثة. أي أن العربية، بكل شكواها، من المحظوظات نسبيًا في هذا الترتيب. تخيّل وضع اللغات الأخرى.
من دفتر الاختبار: قياس ضريبة الحرف على أي نموذج
لا تحتاج مختبرًا. تحتاج جملتين ومسطرة.
البند الأول: الجملة المتوازية.
اكتب المعنى نفسه بالعربي والإنجليزي، وعدّ الرموز في كل منهما بأداة المجزّئ الخاصة بالنموذج:
| العربي | الإنجليزي |
|---|---|
| الاجتماع بكرا الساعة عشرة الصبح بمكتب المدير | The meeting is tomorrow at ten in the morning in the manager’s office |
| لسا ما وصلني الملف، بتقدر تبعتلي إياه تاني؟ | I have not received the file yet, could you send it to me again? |
| بدنا نعيد ترتيب الجدول قبل نهاية الأسبوع | We need to rearrange the schedule before the end of the week |
سجّل النسبة لكل سطر. ثم كرّر مع نص بالفصحى الرسمية. سترى أن الفصحى المشكّلة أغلى من اللهجة المكتوبة بالعامية، لأن التشكيل يضيف رموزًا بلا معنى إضافي.
البند الثاني: ضريبة العربيزي.
كثير من الناس يكتبون بالحروف اللاتينية والأرقام. جرّب النص نفسه بالطريقتين:
| بالعربي | بالعربيزي | الرمز ومقابله |
|---|---|---|
| شو عم تعمل؟ | shu 3am ta3mel? | 3 مقابل العين |
| حبيبي كيفك؟ | 7abibi kifak? | 7 مقابل الحاء |
| طيب خلص | 6ayeb 5alas | 6 مقابل الطاء، 5 مقابل الخاء |
| صار عندي موعد | 9ar 3endi maw3ed | 9 مقابل الصاد |
النتيجة التي رأيتها متكررة: العربيزي غالبًا أرخص بالرموز من العربي المكتوب بحروفه. وهذه مفارقة قاسية: النظام يكافئك ماديًا على هجر حروفك.
البند الثالث: اختبار السياق المقطوع.
هات نصًا عربيًا طويلًا يملأ ثمانين بالمئة من نافذة السياق، ثم اسأل سؤالًا عن السطر الأول منه. ثم كرّر التجربة بترجمة النص نفسه إلى الإنجليزية. النموذج الذي يجيب صح بالإنجليزي ويخطئ بالعربي لم يفشل في الفهم، فشل في أن يتسع.
البند الرابع: الكلمة الواحدة التي تساوي جملة.
العربية تلصق. والمجزّئ المبني على الإنجليزية لا يعرف أين يقطع. جرّب هذه الكلمات وعدّ رموزها:
| الكلمة | ما تعنيه بالإنجليزي | عدد وحدات المعنى داخلها |
|---|---|---|
| أفنقرؤها | and shall we read it | 5: همزة استفهام، فاء، نون، فعل، ضمير |
| وبمدارسهم | and in their schools | 6: واو، باء، أل، جذر، جمع، ضمير |
| فسيكتبونها | so they will write it | 5: فاء، سين، فعل، واو الجماعة، ضمير |
| ليستخرجوها | for them to extract it | 5 |
| أستسقيكموها | I ask you all for it to drink | 6 |
كل واحدة من هذه ست كلمات إنجليزية تقريبًا في كلمة عربية واحدة. ومع ذلك، حين تعدّ الرموز، ستجد أن النسخة العربية أغلى. هذه ليست مفارقة لغوية، هذه نتيجة مباشرة لكون المجزّئ لم يرَ عربية كافية ليتعلّم أن “وب” و”هم” وحدات متكررة.
البند الخامس: قياس أثر التشكيل.
اكتب البيت نفسه ثلاث مرات: بلا تشكيل، بتشكيل جزئي، بتشكيل كامل. ثم عدّ الرموز.
بلا تشكيل: “العلم يرفع بيتا لا عماد له”
بتشكيل جزئي: “العلمُ يرفعُ بيتًا لا عمادَ له”
بتشكيل كامل: “الْعِلْمُ يَرْفَعُ بَيْتًا لَا عِمَادَ لَهُ”
النتيجة المتوقعة: النسخة الثالثة قد تكلّف ضعف الأولى أو أكثر، وهي تحمل المعنى نفسه بالضبط للقارئ العربي. فإذا كنت تبني منتجًا تعليميًا يحتاج تشكيلًا، اعرف أنك تدفع مرتين: مرة لضريبة الحرف ومرة لضريبة الحركة.
ما الذي تغيّر منذ ذلك اليوم، وما الذي لم يتغيّر
أكتب هذا الجدول لأني أريدك أن تعود إليه بعد سنتين وتقارن:
| البند | حاله في كانون الأول 2022 |
|---|---|
| كلفة الرمز العربي | ثلاثة أضعاف |
| رقم عربي منشور من الشركة | لا يوجد |
| معيار عربي أصلي معتمد | لا يوجد |
| دعم معلن للهجات | لا يوجد |
| نماذج عربية مفتوحة بحجم جاد | لا يوجد |
| عدد المتحدثين بالعربية | نحو نصف مليار |
خمسة “لا يوجد” أمام نصف مليار إنسان. وأنا لا أكتب هذا شكوى، أكتبه توثيقًا. لأن أول خطوة في إصلاح أي شيء أن تعرف من أين بدأت.
والملاحظة التي أريد أن أتركها معك: ضريبة الحرف ليست مؤامرة، إنها إهمال. لا أحد جلس وقرر أن يجعل العربية أغلى. ببساطة، لم يجلس أحد ليجعلها أرخص. المجزّئ تعلّم من البيانات المتاحة، والبيانات المتاحة كانت إنجليزية، والنتيجة خرجت كما خرجت. وهذا في رأيي أسوأ من المؤامرة، لأن المؤامرة يمكن كشفها، أما الإهمال فيحتاج أن ينتبه له أحد أولًا.
الحكم العملي
إن كنت تبني منتجًا: احسب كلفتك بالرمز لا بالكلمة، وضاعف تقديرك العربي ثلاث مرات قبل أن تسعّر. ثم اختبر نافذة السياق بنص عربي حقيقي لا بترجمة نص إنجليزي، لأن الترجمة الآلية تنتج عربية أقصر وأبسط من العربية الحقيقية.
إن كنت مستخدمًا: اعرف أن بطء الإجابة العربية ليس خللًا في اتصالك.
وإن كنت تقيّم نموذجًا: لا تقارن أطوال الإجابات بين اللغتين مباشرة. قارن كثافة المعنى.
المقالة القادمة
بعد أربعة أشهر من هذه اللحظة صدر GPT-4، ومعه أول رقم عربي رسمي نشرته شركة كبرى عن نموذجها. الرقم كان 80٪، وكان يبدو ممتازًا. المقالة القادمة تشرح لماذا هو أضعف مما يبدو، وما الذي أُخفي في طريقة قياسه.
المصادر
- OpenAI، Introducing ChatGPT، 30 تشرين الثاني 2022: openai.com/index/chatgpt
- Petrov وLa Malfa وTorr وBibi، Language Model Tokenizers Introduce Unfairness Between Languages، NeurIPS 2023: arxiv.org/abs/2305.15425
- وقائع NeurIPS 2023، المجلد 36: proceedings.neurips.cc