الأرقام أولًا
| المقياس | النتيجة | ما الذي يقيسه | المصدر |
|---|---|---|---|
| HELM Arabic، أفضل نموذج مفتوح الأوزان | Qwen3 235B بمتوسط 0.786 | سبعة مقاييس عربية أصيلة | Stanford CRFM و Arabic.AI، كانون الأول 2025 |
| HELM Arabic، عدد النماذج المفتوحة ضمن العشرة الأوائل | أربعة، منها Qwen3 235B و Qwen3-Next 80B | حضور النماذج المفتوحة في الصدارة | Stanford CRFM |
| لوحة OALL، النماذج المدرَّبة مسبقًا | Qwen2.5-72B في الصدارة | مقاييس عربية أصيلة | OALL v2 |
| بيانات التدريب | 36 تريليون رمز في 119 لغة ولهجة | اتساع التغطية اللغوية | ويكيبيديا نقلًا عن Qwen |
| الأحجام المفتوحة | من 0.6 مليار إلى 235 مليار، برخصة Apache 2.0 | إمكانية التشغيل والضبط محليًا | المصدر نفسه |
| DialectalArabicMMLU، المتوسط عبر اللهجات | 47.7٪ مقابل 51.9٪ للفصحى و62.8٪ للإنجليزية | فهم لهجي | LREC 2026 |
نموذج مفتوح المصدر، برخصة Apache 2.0، مدرَّب على 119 لغة، يتصدر النماذج المفتوحة في أقوى لوحة عربية مستقلة. هذا إنجاز حقيقي ويستحق الاعتراف، خصوصًا أنه يعني أن أي فريق عربي يستطيع تحميل النموذج وتشغيله وضبطه بلا إذن ولا اشتراك.
والسؤال الذي أطرحه في هذه المقالة ليس عن الرقم، بل عن معناه: 0.786 في ماذا بالضبط؟
الفرضية المركزية في ARAB-LENS
بعد سنوات من مراجعة المخرجات العربية للنماذج، صرت أقيس محورين منفصلين لا محورًا واحدًا:
وحين تفصل بينهما تظهر أربع حالات، لا حالتان:
| صحيح | خاطئ | |
|---|---|---|
| طليق | النموذج القوي فعلًا | الأخطر على الإطلاق |
| غير طليق | يفهم ولا يحسن الكلام | ضعيف في الاثنين |
الخانة الخطرة هي اليمنى العليا: طليق وخاطئ. نص عربي مصقول، بتراكيب سليمة ومفردات غنية، يحمل معنى غير المقصود أو حكمًا اجتماعيًا معكوسًا. لا يكتشفه قارئ غير عربي، ولا يرصده مقياس اختيار من متعدد، ولا ينبّه إليه نموذج حَكَم لأنه غالبًا يكافئ اللغة الجميلة.
وهذه الخانة بالذات هي ما تنتجه النماذج المتعددة اللغات الكبيرة أكثر من غيرها، لأن طلاقتها العربية ممتازة بينما تمثيلها الثقافي ضعيف. النموذج المدرَّب على 119 لغة يعرف كيف تبدو العربية. والسؤال هو كم يعرف عما تعنيه.
بطاقة النموذج
| البند | التفصيل |
|---|---|
| الاسم | Qwen3، وأبرز نسخه 235B-A22B |
| الجهة | Alibaba Cloud |
| تاريخ الإصدار | 28 نيسان 2025 |
| الرخصة | Apache 2.0 للنسخ المفتوحة |
| بيانات التدريب | 36 تريليون رمز عبر 119 لغة ولهجة |
| ميزة | التبديل بين وضع التفكير والوضع المباشر |
| المحور المختبَر | الطلاقة مقابل الفهم |
الاختبار: كيف تكشف “الطليق والخاطئ”
البند 1، المقياس المزدوج. لكل رد، أعطِ درجتين منفصلتين من خمس: واحدة للطلاقة وواحدة للصحة المعنوية والثقافية. لا تجمعهما في رقم واحد أبدًا. ثم احسب نسبة الردود التي حصلت على طلاقة 4 أو 5 وصحة 2 أو أقل. هذه النسبة هي معدل الطليق والخاطئ، وهي عندي أهم رقم في تقييم أي نموذج عربي.
البند 2، التفسير المعكوس. أعطه موقفًا اجتماعيًا يحتمل قراءتين، مثل مضيف يلحّ على ضيفه، واطلب التفسير. قِس: هل التفسير صحيح ثقافيًا، بمعزل تمامًا عن جمال الصياغة.
البند 3، سؤال المصدر. بعد أي إجابة ثقافية، اسأل: من أين عرفت هذا؟ وما درجة ثقتك؟ النموذج الطليق والخاطئ يواصل التأليف بثقة. النموذج الصادق يفصل بين ما رآه وما استنتجه.
البند 4، اختبار الترجمة العكسية. خذ ردّه العربي واطلب منه ترجمته إلى الإنجليزية ترجمة حرفية. أحيانًا تكشف الترجمة أن الجملة العربية الجميلة كانت أصلًا جملة إنجليزية مترجَمة في رأسه.
البند 5، مقارنة اللغات. اطرح السؤال الثقافي نفسه بالعربية ثم بالإنجليزية، وقارن الجوابين. إن كان جوابه الإنجليزي أدق وأغنى، فأنت أمام نموذج يفكر بالإنجليزية ويكتب بالعربية.
هذا البند الأخير ليس تخمينًا مني. أرقام DialectalArabicMMLU تدعمه مباشرة: ترجمة السؤال اللهجي إلى الإنجليزية رفعت الأداء بمقدار 5.6 نقطة، بينما ترجمته إلى الفصحى رفعته 0.3 نقطة فقط. أي أن الطريق إلى فهم النموذج للهجتك يمرّ بالإنجليزية لا بالفصحى. وهذه أوضح صورة رقمية لما أسميه الطلاقة بلا تجذّر.
ما يستحق التقدير وما يستحق التحفظ
التقدير: أن يتصدر نموذج مفتوح الأوزان لوحة عربية مستقلة أمر مهم للمنطقة أكثر مما يبدو. النماذج المغلقة لا تُدقَّق ولا تُشغَّل محليًا ولا تُضبَط على لهجة بعينها. ووجود أربعة نماذج مفتوحة ضمن العشرة الأوائل في HELM Arabic يعني أن البنية التحتية للذكاء الاصطناعي العربي صارت متاحة لمن يريد بناءها.
التحفظ: المقاييس السبعة في HELM Arabic، على جودتها، تقيس المعرفة والقواعد والسلامة والإجابة من نص. ولا يوجد فيها مقياس واحد لتوليد اللهجة، ولا للبراغماتية، ولا للحوار. فالمتوسط 0.786 صحيح تمامًا في نطاقه، وصامت تمامًا خارجه.
الحكم العملي
- لا تسجّل درجة واحدة لأي مخرَج عربي. درجتان دائمًا: طلاقة وصحة. الفارق بينهما هو تشخيصك.
- اختبر بالعربية والإنجليزية للسؤال نفسه. الفجوة بينهما تقول لك إن كان النموذج يفهم لغتك أم يترجمها.
- النموذج المفتوح يعطيك خيارًا استراتيجيًا. إن كان لديك بيانات عربية نظيفة، فضبط نموذج مفتوح على لهجتك أرخص وأدق من انتظار نموذج عالمي يهتم بها.
- احذر النص الجميل. في مراجعاتي، كلما كانت العربية أجمل وجب التدقيق أكثر، لا أقل.
في المقالة القادمة
Llama 4 من Meta ومحور تسرّب الفصحى: كيف يمكن لنموذج أن ينفّذ طلبك اللهجي حرفيًا ويخالفه بنيويًا في الوقت نفسه، ولماذا لا يرصد هذا أي مقياس منشور.
الدليل البشري على خانة “الطليق والخاطئ”
كتبت أعلاه أن الخانة الخطرة في المصفوفة هي الطليق والخاطئ، وأنها لا تُرصد بمقياس اختيار من متعدد. والحقيقة أن أحدهم رصدها، بتقييم بشري، وبعبارة تكاد تكون تعريفًا لهذه الخانة.
دراسة AL-QASIDA التي قاست تسعة نماذج عبر ثماني لهجات وصفت مخرجات النماذج بأنها:
ردود طليقة وكافية المعنى، لكنها في الغالب ليست باللهجة المطلوبة.
هذا تقييم بشري، لا آلي. وهو يقول بوضوح إن النموذج ينجح في بُعدين ويفشل في الثالث، وإن الفشل لا يظهر في جودة اللغة بل في ملاءمتها. وأضافت الدراسة أن الفهم أفضل من الإنتاج، وهو انقلاب على النمط المعتاد في النماذج التوليدية.
وبالأرقام: سقوط أغلب درجات ADI2 تحت 50٪، و GPT-4o لم يتجاوز 13٪ على نصف اللهجات في الوضع عبر اللغوي.
التسجيل المزدوج، مطبَّقًا على ثلاثة ردود
الفكرة كلها في أن تعطي درجتين لا درجة واحدة. وهذه ثلاثة نماذج مكتوبة توضح الخانات الأربع، وكلها ردود على السؤال نفسه: “صاحب البيت ألحّ على ضيفه ثلاث مرات ليأكل رغم أن الضيف قال إنه شبعان. ماذا يجري؟”
الرد الأول: “يشير هذا التفاعل إلى تجاوز لحدود الضيف الشخصية، ومن المستحسن أن يعبّر الضيف عن رفضه بوضوح وحزم حتى يحترم المضيف اختياره.” الطلاقة 5، فالعربية سليمة ومصقولة. الصحة 1، فالتفسير مقلوب اجتماعيًا: الإلحاح هنا واجب ضيافة لا انتهاكًا، والرفض الحازم هو الإهانة. الخانة: طليق وخاطئ، وهي الأخطر.
الرد الثاني: “الإلحاح جزء من طقس الضيافة، والرفض الأول مجاملة متوقعة. الحل المعتاد أن يأخذ الضيف قليلًا ويثني على الطعام ويدعو لصاحب البيت.” الطلاقة 5 والصحة 5. الخانة: قوي فعلًا.
الرد الثالث: “المضيف يريد الضيف ياكل اكثر، هذا عادة عربية معروفة، الضيف يقول لا لكن هو جائع ربما، يجب ياخذ قليل.” الطلاقة 2، فالتركيب مكسور والمطابقة مضطربة. الصحة 4، فالفهم الاجتماعي صحيح في جوهره. الخانة: يفهم ولا يتكلم.
وهذا التمرين البسيط هو ما أطالب كل فريق عربي بإدخاله في مراجعته: درجتان لكل رد، لا درجة واحدة. لأن الجمع بينهما يخفي بالضبط ما تحتاج رؤيته.
كيف تُحسب الخانة والنسبة
مثال حسابي توضيحي: لو صنّفت عشرين ردًا فوقعت ثلاثة منها في خانة الطليق والخاطئ، فمعدلك 15٪. أي أن واحدًا من كل سبعة ردود سيبدو صحيحًا لقارئ غير منتبه وهو ليس كذلك. وهذا رقم يفهمه أي مدير منتج فورًا، بعكس أي متوسط عام.
معدل الطليق والخاطئ هو الرقم الذي أطالب كل فريق عربي بحسابه ونشره، وهو الوحيد الذي يخبرك كم مرة سيصدّق مستخدمك معلومة خاطئة لأنها كُتبت بعربية جميلة.
ما قالته لوحة QIMMA عن هذه العائلة
في نيسان 2026، تصدّر نموذج من عائلة Qwen لوحة QIMMA العربية بمتوسط 68.06، وهي لوحة بأكثر من 52 ألف عينة وأربعة عشر مقياسًا و99٪ محتوى عربي أصيل.
ومع ذلك سجّلت اللوحة نفسها ملاحظة تكمل الصورة: النماذج العربية المتخصصة تتقدم في المهام الثقافية واللغوية، بينما تتقدم النماذج المتعددة اللغات في البرمجة. أي أن التصدر العام لا يعني التصدر في كل خانة، وأن اختيارك يجب أن يتبع نوع مهمتك لا رأس اللوحة.
من دفتر الاختبار: كيف أصمّم سؤالًا يكشف الطلاقة الفارغة
السؤال الجيد في هذا المحور له صفة واحدة: إجابته الجميلة والإجابة الصحيحة ليستا الشيء نفسه. وهذه ثلاثة أنواع أستعملها:
النوع الأول، موقف يحتمل قراءتين، إحداهما غربية والأخرى عربية. مثل مضيف يلحّ، أو قريب يزور بلا موعد، أو مدير يسأل عن أمر شخصي. النموذج الذي يقرأ الموقف بعدسة الحدود الشخصية يكتب فقرة أنيقة وخاطئة، وهذا بالضبط ما أريد قياسه.
النوع الثاني، سؤال عن أصل كلمة أو تعبير. مثل: “اشرح أصل كلمة شنكليش وتاريخها”. الاشتقاق مغرٍ للاختلاق، لأنه يبدو معرفة ويصعب التحقق منه على غير المختص. المطلوب أن يفصل النموذج: هذا ما هو موثق، وهذا ترجيح، وهذا لا أعرفه.
النوع الثالث، طلب صياغة بلهجة مع معنى دقيق. مثل: “اعتذر لصديقك عن تأخرك، بالشامية، دون أن تقول كلمة آسف”. هنا تُختبر الطلاقة والصحة معًا: النموذج قد يكتب شاميّة جميلة ويستعمل صيغة اعتذار لا تُقال في هذا الموقف، أو يستعمل الصيغة الصحيحة بعربية مكسورة.
مقارنة لغتين على السؤال نفسه
هذا البند يعطي أوضح دليل على “الطلاقة بلا تجذّر”. اطرح السؤال الثقافي نفسه مرتين، بالعربية وبالإنجليزية، في جلستين منفصلتين، وقارن.
ما ألاحظه كثيرًا: الجواب الإنجليزي أغنى وأدق وأكثر تفصيلًا، والجواب العربي أجمل لغةً وأفقر مضمونًا. وهذا يتسق تمامًا مع نتيجة DialectalArabicMMLU: الترجمة إلى الإنجليزية ترفع الأداء 5.6 نقطة، والترجمة إلى الفصحى ترفعه 0.3.
والاستنتاج العملي: إن كان الفارق كبيرًا عندك، فاعلم أن منتجك العربي يعمل بنصف قدرة النموذج، وأن حلّه ليس prompt أفضل بالعربية بل تصميم يمرّر السؤال الصعب بالإنجليزية داخليًا ويعيد الجواب بالعربية، مع مراجعة بشرية على النبرة.
المصادر
- HELM Arabic، Stanford CRFM مع Arabic.AI: crfm.stanford.edu/2025/12/18/helm-arabic.html
- لوحة OALL النسخة الثانية: huggingface.co/blog/leaderboard-arabic-v2
- DialectalArabicMMLU، LREC 2026: arxiv.org/abs/2510.27543
- صفحة Qwen، تواريخ الإصدار وبيانات التدريب: en.wikipedia.org/wiki/Qwen
- AL-QASIDA، الطلاقة مقابل أمانة اللهجة: arxiv.org/abs/2412.04193
- لوحة QIMMA العربية: huggingface.co/blog/tiiuae/qimma-arabic-leaderboard