الأرقام أولًا
| المقياس | النتيجة | ما الذي يقيسه | المصدر |
|---|---|---|---|
| GPT-4 على MMLU بالعربية | 80٪ | معرفة عامة، لكن بامتحان مترجَم آليًا | التقرير التقني لـ GPT-4، الشكل 5، آذار 2023 |
| GPT-4 على MMLU بالإنجليزية، الشرط نفسه | 85.5٪ | المرجع الذي يقارَن به الرقم العربي | التقرير نفسه، الشكل 5 |
| طريقة إنتاج النسخة العربية | ترجمة آلية عبر Azure Translate | كيف صُنع الامتحان العربي | التقرير نفسه |
| عدد الأمثلة في السؤال | 3 أمثلة، لا 5 | شرط قياس أسهل من المعتاد | التقرير نفسه |
| GPT-4 على MMLU الإنجليزية، الشرط القياسي | 86.4٪ بخمسة أمثلة | رقم مختلف تمامًا، لا يُخلط مع ما سبق | التقرير نفسه، الجدول 2 |
| GPT-3.5 على MMLU الإنجليزية | 70.0٪ | حجم القفزة بين الجيلين | التقرير نفسه، الجدول 2 |
| عدد اللغات التي تجاوز فيها GPT-4 أفضل أداء إنجليزي سابق | 24 من 26 | حجم الإنجاز متعدد اللغات | التقرير نفسه |
| GPT-4 على ArabicMMLU، امتحان عربي أصلي | 72.5٪ | الرقم نفسه تقريبًا، لكن بأسئلة كُتبت بالعربي أصلًا | Koto وآخرون، ArabicMMLU، شباط 2024 |
السطر الأول والسطر الأخير هما المقالة. ثمانون على امتحان مترجَم، واثنان وسبعون ونصف على امتحان عربي حقيقي. سبع نقاط ونصف اختفت حين استُبدلت الترجمة بالأصل.
من أين جاءت السبع نقاط
الفارق بين العمود الثاني والثالث ليس فارق ذكاء. إنه فارق في ما يقيسه الامتحان.
بطاقة النموذج
| البند | التفصيل |
|---|---|
| النموذج | GPT-4 |
| الجهة | OpenAI |
| تاريخ الإصدار | 14 آذار 2023 |
| التقرير التقني | arXiv:2303.08774 |
| ما نُشر عن العربية | رقم واحد داخل شكل بياني، بلا جدول ولا تفصيل |
| ما لم يُنشر | أي شيء عن اللهجات، أو الصرف، أو الثقافة، أو التشكيل |
| المجزّئ | cl100k_base نفسه، أي ضريبة الحرف باقية كما هي |
قراءة ARAB-LENS: ثلاثة أشياء مخبوءة في رقم واحد
الأول، وهو الأخطر: الامتحان مترجَم آليًا.
التقرير يقولها بوضوح: النسخ اللغوية من MMLU أُنتجت بـ Azure Translate. وهذا يعني أن السؤال العربي ليس سؤالًا عربيًا، إنه سؤال أميركي يرتدي حروفًا عربية.
لماذا يهم؟ لثلاثة أسباب تراكمت عندي من قراءة عشرات هذه المعايير:
أولًا، الترجمة الآلية تبسّط. تنتج جملًا قصيرة، تركيبًا مباشرًا، ومفردات شائعة. أي أن الامتحان العربي أسهل لغويًا من نظيره الإنجليزي.
ثانيًا، الترجمة الآلية تسرّب الإجابة أحيانًا. حين يُترجم خيار صحيح وخيار خاطئ، يخرج الصحيح غالبًا بصياغة أنظف لأن النص الأصلي كان أنظف. النموذج يلتقط هذا النمط.
ثالثًا، وهو الأهم، المحتوى نفسه أميركي. أسئلة عن القانون الأميركي، عن نظام التعليم الأميركي، عن تاريخ أوروبي. نموذج يجيب عنها بالعربي لم يثبت أنه يعرف العربية، أثبت أنه يعرف الإنجليزية ويستطيع أن يكتب بالعربي.
الثاني: ثلاثة أمثلة لا خمسة.
الشرط القياسي في MMLU هو خمسة أمثلة توضيحية. الشكل 5 استعمل ثلاثة. هذا ليس غشًا، التقرير يصرّح به. لكنه يعني أن الرقم العربي لا يقارَن مباشرة بأي رقم MMLU آخر تقرأه في مكان ثانٍ. وأنا رأيت هذا الخلط يتكرر في مقالات عربية كثيرة: يؤخذ 80٪ من هنا و86.4٪ من الجدول 2 ويوضعان في جملة واحدة، وهما قياسان مختلفان بشروط مختلفة.
الثالث: الرقم داخل صورة.
القيمة العربية غير موجودة كنص في التقرير، هي بارتفاع عمود في رسم بياني. أنا لا أستطيع أن أؤكد إن كان 80.0 أو 79.8 أو 80.4. والمصدر المستقل الوحيد الذي اقتبسها، وهي ورقة ArabicMMLU، كتبها “80٪” مدوّرة. فحين تقرأ 80٪ في أي مكان، اعرف أنها مدوّرة من رسم.
وهنا حكمي: هذا ليس تقييمًا عربيًا، هذا اعتراف مهذّب بأن العربية موجودة. وهو تقدّم حقيقي مقارنة بالصمت الكامل قبله، لكنه ليس ما يبدو عليه.
الدليل جاء بعد أحد عشر شهرًا. حين بنى فريق أكاديمي امتحانًا عربيًا أصليًا من أسئلة مدارس حقيقية في ثماني دول عربية، سجّل GPT-4 نفسه 72.5٪. ثمانون تصير اثنتين وسبعين ونصف حين تكفّ الأسئلة عن كونها أميركية مترجمة.
من دفتر الاختبار: كيف تكشف أن الامتحان مترجَم
هذه بنود أشغّلها على أي معيار عربي قبل أن أصدّق رقمه.
البند الأول: بحث عن الأثر الأميركي.
افتح عيّنة من مئة سؤال وعدّ:
| ما تبحث عنه | ما يعنيه وجوده |
|---|---|
| أسماء ولايات أو مدن أميركية | الامتحان مترجَم، لا مؤلَّف |
| نظام درجات GPA أو SAT | سياق تعليمي غير عربي |
| وحدات قياس إمبراطورية، ميل وباوند | ترجمة حرفية بلا توطين |
| تواريخ بالتقويم الميلادي فقط في أسئلة دينية | لم يمر على مراجع عربي |
| “الرئيس” بلا تحديد، والمقصود الأميركي | افتراض ضمني بالسياق |
البند الثاني: اختبار الجملة المقلوبة.
الترجمة الآلية تنتج ترتيبًا إنجليزيًا بكلمات عربية. علامتها الأوضح: الجملة الاسمية حيث تتوقع فعلية.
| صياغة مترجَمة، تحس بها غريبة | صياغة عربية أصيلة |
|---|---|
| “الطالب يقوم بحل المسألة” | “يحلّ الطالب المسألة” |
| “هذا يعتبر واحدًا من أهم الأسباب” | “هذا من أهم الأسباب” |
| “في حال كان الجواب هو نعم” | “إن كان الجواب نعم” |
| “يتم استخدام هذه الطريقة” | “تُستعمل هذه الطريقة” |
عدّ كم سؤالًا في العيّنة فيه واحدة من هذه العلامات. إن تجاوزت الثلث، الامتحان مترجَم مهما قال عنوانه.
البند الثالث: سؤال لا يُترجَم.
اكتب خمسة أسئلة لا يمكن أن تنتج عن ترجمة، ثم شغّلها. هذه خمستي:
- “شو الفرق بين تقول لحدا تكرم عينك وبين تقول له من عيوني؟ ومتى ما بينفع أي واحدة فيهن؟”
- “حدا عزمك على غدا وقال لك والله ما بتطلع من هون إلا وأنت شبعان. هل هاد تهديد؟”
- “بالعزا، شو بتقول لأهل الميت أول ما تفوت؟ وشو ما بينفع تقوله أبدًا؟”
- “إذا حدا قال لك إن شاء الله لما سألته إذا رح يجي، هو وعد ولا اعتذار؟”
- “شو معنى إنه حدا يهزّ فنجان القهوة قدامك بالخليج؟ وشو الفرق لو ما هزّه؟”
الجواب الصحيح للسؤال الرابع: الاثنان معًا، والسياق ونبرة الصوت هما ما يحسمان. أي نموذج يجيب “هو وعد” بثقة وبلا تحفّظ يقرأ العربية كقاموس لا كلغة يعيش فيها ناس.
والخامس: هزّ الفنجان في الخليج يعني أنك اكتفيت ولا تريد المزيد. إن لم تهزّه فسيُملأ لك مرة أخرى. هذه معلومة لا توجد في أي امتحان مترجَم، ولا في أي كتاب نحو.
البند الرابع: جدول التكافؤ اللهجي.
سؤال واحد بخمس صياغات. النموذج الذي يفهم الخمس فهم العربية، والنموذج الذي يفهم واحدة فهم الفصحى.
| اللهجة | “ماذا تريد؟” | “أين أنت؟” | “لا أعرف” |
|---|---|---|---|
| الفصحى | ماذا تريد؟ | أين أنت؟ | لا أعرف |
| الشامية | شو بدك؟ | وينك؟ | ما بعرف |
| المصرية | عايز إيه؟ | إنت فين؟ | مش عارف |
| الخليجية | وش تبي؟ | وينك؟ | ما أدري |
| المغربية | أشنو بغيتي؟ | فين راك؟ | ما عرفتش |
شغّل الخمسة عشر خانة كلها وسجّل: كم واحدة فهمها؟ وبأي لهجة ردّ على كل منها؟ الفشل الأشيع الذي رأيته: النموذج يفهم الشامي والمصري جيدًا، يتعثر في الخليجي، ويسقط تمامًا في المغربي. وهذا ليس مصادفة، إنه انعكاس مباشر لكمية النص المتاح على الإنترنت بكل لهجة.
البند الخامس: اختبار “من أين هذا الشخص”.
اكتب ستة أسطر حوار، كل سطر بلهجة، ثم اطلب من النموذج أن ينسب كل سطر إلى منطقة مع تبرير:
1. “يا زلمة شو هالحكي؟”
2. “إيه يا عم الكلام ده؟”
3. “وش هالسالفة يا رجال؟”
4. “شنو هذا الحچي؟”
5. “آش هاد الهضرة؟”
6. “شنهي هالحكاية؟”
الأجوبة: 1 شامي، 2 مصري، 3 نجدي أو خليجي، 4 عراقي أو خليجي بالچيم، 5 مغربي، 6 سوداني أو ليبي. المؤشر الحقيقي ليس عدد الإصابات، بل التبرير. النموذج الذي يقول “زلمة كلمة شامية” فهم. النموذج الذي يقول “اللهجة تبدو عربية شرق أوسطية” يخمّن بلغة مهذّبة.
لماذا ظلّ هذا الرقم يُستعمل ثلاث سنوات
شيء يستحق التوقف عنده: رقم الثمانين بالمئة ظهر في آذار 2023، وما زلت أراه يُقتبس في عروض تقديمية عربية حتى اليوم. لماذا؟
| السبب | التفصيل |
|---|---|
| لأنه الرقم الوحيد الرسمي | أي رقم من شركة كبرى يُعامل كحقيقة |
| لأنه كبير ومريح | ثمانون تقنع مديرًا، واثنان وسبعون تثير سؤالًا |
| لأن قراءة الطريقة تحتاج وقتًا | الشكل 5 داخل تقرير من مئة صفحة |
| لأنه لا يوجد بديل مشهور | ArabicMMLU أكاديمي وغير معروف خارج المجال |
| لأن لا أحد يخسر من تكراره | لا مورّد سيصحّح رقمًا لصالحه |
وهذه في رأيي المشكلة البنيوية في النقاش العربي حول الذكاء الاصطناعي: نحن نستهلك أرقامًا ولا نقرأ طرائق. والرقم بلا طريقة أداة تسويق لا أداة قرار.
خذها قاعدة مني: حين يعطيك أحد رقمًا عن أداء نموذج بالعربية، اسأله ثلاثة أسئلة قبل أي شيء. من صنع الامتحان؟ وبأي لغة كُتبت أسئلته أصلًا؟ وكم مثالًا أُعطي للنموذج؟ إن لم يعرف الأجوبة، فهو لا يعرف ما يقول لك.
الحكم العملي
لا تشترِ نموذجًا بناءً على رقم MMLU عربي. اطلب من المورّد رقمًا على معيار عربي أصلي، وإن لم يملك واحدًا فاعرف أنك تشتري وعدًا.
وإن كنت تقيّم بنفسك، ابنِ خمسين سؤالًا من عالمك أنت: من عقودك، من رسائل عملائك، من مصطلحات سوقك. خمسون سؤالًا محلية أصدق من خمسة آلاف سؤال مترجَم.
وإن كنت تكتب عن النماذج، اذكر دائمًا كيف صُنع الامتحان. الرقم بلا طريقة ليس رقمًا، إنه انطباع.
المقالة القادمة
بعد أربعة أشهر أطلقت ميتا نموذج Llama 2 مفتوح المصدر، ونشرت جدولًا بتوزيع لغات بيانات التدريب. العربية لم تكن في الجدول. لا بنسبة صغيرة، بل غير موجودة أصلًا، لأنها تحت عتبة الإدراج. المقالة القادمة تشرح ماذا يعني أن تكون لغتك أقل من خمسة من كل مئة ألف.
المصادر
- OpenAI، GPT-4، 14 آذار 2023: openai.com/index/gpt-4
- OpenAI، GPT-4 Technical Report، arXiv:2303.08774، آذار 2023
- Koto وآخرون، ArabicMMLU: Assessing Massive Multitask Language Understanding in Arabic، Findings of ACL 2024: aclanthology.org/2024.findings-acl.334