الطلاقة ليست فهمًا: Qwen3 وأفضل رقم عربي بين النماذج المفتوحة

وقت القراءة: 10 دقيقة
18
إيهاب صالح | techkahwa.net صدر النموذج: 28 نيسان 2025 | تاريخ النشر: 12 أيار 2025

الأرقام أولًا

المقياسالنتيجةما الذي يقيسهالمصدر
HELM Arabic، أفضل نموذج مفتوح الأوزانQwen3 235B بمتوسط 0.786سبعة مقاييس عربية أصيلةStanford CRFM و Arabic.AI، كانون الأول 2025
HELM Arabic، عدد النماذج المفتوحة ضمن العشرة الأوائلأربعة، منها Qwen3 235B و Qwen3-Next 80Bحضور النماذج المفتوحة في الصدارةStanford CRFM
لوحة OALL، النماذج المدرَّبة مسبقًاQwen2.5-72B في الصدارةمقاييس عربية أصيلةOALL v2
بيانات التدريب36 تريليون رمز في 119 لغة ولهجةاتساع التغطية اللغويةويكيبيديا نقلًا عن Qwen
الأحجام المفتوحةمن 0.6 مليار إلى 235 مليار، برخصة Apache 2.0إمكانية التشغيل والضبط محليًاالمصدر نفسه
DialectalArabicMMLU، المتوسط عبر اللهجات47.7٪ مقابل 51.9٪ للفصحى و62.8٪ للإنجليزيةفهم لهجيLREC 2026
نفس النماذج، ثلاث لغات، ثلاث نتائج
الإنجليزية
62.8
الفصحى
51.9
اللهجات
47.7
DialectalArabicMMLU عبر 19 نموذجًا مفتوحًا

نموذج مفتوح المصدر، برخصة Apache 2.0، مدرَّب على 119 لغة، يتصدر النماذج المفتوحة في أقوى لوحة عربية مستقلة. هذا إنجاز حقيقي ويستحق الاعتراف، خصوصًا أنه يعني أن أي فريق عربي يستطيع تحميل النموذج وتشغيله وضبطه بلا إذن ولا اشتراك.

والسؤال الذي أطرحه في هذه المقالة ليس عن الرقم، بل عن معناه: 0.786 في ماذا بالضبط؟


الفرضية المركزية في ARAB-LENS

بعد سنوات من مراجعة المخرجات العربية للنماذج، صرت أقيس محورين منفصلين لا محورًا واحدًا:

الطلاقة السطحية
هل الجملة تبدو عربية جميلة؟
الدقة المعنوية والثقافية
هل هي صحيحة فعلًا في سياقها؟

وحين تفصل بينهما تظهر أربع حالات، لا حالتان:

صحيحخاطئ
طليقالنموذج القوي فعلًاالأخطر على الإطلاق
غير طليقيفهم ولا يحسن الكلامضعيف في الاثنين

الخانة الخطرة هي اليمنى العليا: طليق وخاطئ. نص عربي مصقول، بتراكيب سليمة ومفردات غنية، يحمل معنى غير المقصود أو حكمًا اجتماعيًا معكوسًا. لا يكتشفه قارئ غير عربي، ولا يرصده مقياس اختيار من متعدد، ولا ينبّه إليه نموذج حَكَم لأنه غالبًا يكافئ اللغة الجميلة.

وهذه الخانة بالذات هي ما تنتجه النماذج المتعددة اللغات الكبيرة أكثر من غيرها، لأن طلاقتها العربية ممتازة بينما تمثيلها الثقافي ضعيف. النموذج المدرَّب على 119 لغة يعرف كيف تبدو العربية. والسؤال هو كم يعرف عما تعنيه.


بطاقة النموذج

البندالتفصيل
الاسمQwen3، وأبرز نسخه 235B-A22B
الجهةAlibaba Cloud
تاريخ الإصدار28 نيسان 2025
الرخصةApache 2.0 للنسخ المفتوحة
بيانات التدريب36 تريليون رمز عبر 119 لغة ولهجة
ميزةالتبديل بين وضع التفكير والوضع المباشر
المحور المختبَرالطلاقة مقابل الفهم

الاختبار: كيف تكشف “الطليق والخاطئ”

البند 1، المقياس المزدوج. لكل رد، أعطِ درجتين منفصلتين من خمس: واحدة للطلاقة وواحدة للصحة المعنوية والثقافية. لا تجمعهما في رقم واحد أبدًا. ثم احسب نسبة الردود التي حصلت على طلاقة 4 أو 5 وصحة 2 أو أقل. هذه النسبة هي معدل الطليق والخاطئ، وهي عندي أهم رقم في تقييم أي نموذج عربي.

البند 2، التفسير المعكوس. أعطه موقفًا اجتماعيًا يحتمل قراءتين، مثل مضيف يلحّ على ضيفه، واطلب التفسير. قِس: هل التفسير صحيح ثقافيًا، بمعزل تمامًا عن جمال الصياغة.

البند 3، سؤال المصدر. بعد أي إجابة ثقافية، اسأل: من أين عرفت هذا؟ وما درجة ثقتك؟ النموذج الطليق والخاطئ يواصل التأليف بثقة. النموذج الصادق يفصل بين ما رآه وما استنتجه.

البند 4، اختبار الترجمة العكسية. خذ ردّه العربي واطلب منه ترجمته إلى الإنجليزية ترجمة حرفية. أحيانًا تكشف الترجمة أن الجملة العربية الجميلة كانت أصلًا جملة إنجليزية مترجَمة في رأسه.

البند 5، مقارنة اللغات. اطرح السؤال الثقافي نفسه بالعربية ثم بالإنجليزية، وقارن الجوابين. إن كان جوابه الإنجليزي أدق وأغنى، فأنت أمام نموذج يفكر بالإنجليزية ويكتب بالعربية.

هذا البند الأخير ليس تخمينًا مني. أرقام DialectalArabicMMLU تدعمه مباشرة: ترجمة السؤال اللهجي إلى الإنجليزية رفعت الأداء بمقدار 5.6 نقطة، بينما ترجمته إلى الفصحى رفعته 0.3 نقطة فقط. أي أن الطريق إلى فهم النموذج للهجتك يمرّ بالإنجليزية لا بالفصحى. وهذه أوضح صورة رقمية لما أسميه الطلاقة بلا تجذّر.


ما يستحق التقدير وما يستحق التحفظ

التقدير: أن يتصدر نموذج مفتوح الأوزان لوحة عربية مستقلة أمر مهم للمنطقة أكثر مما يبدو. النماذج المغلقة لا تُدقَّق ولا تُشغَّل محليًا ولا تُضبَط على لهجة بعينها. ووجود أربعة نماذج مفتوحة ضمن العشرة الأوائل في HELM Arabic يعني أن البنية التحتية للذكاء الاصطناعي العربي صارت متاحة لمن يريد بناءها.

التحفظ: المقاييس السبعة في HELM Arabic، على جودتها، تقيس المعرفة والقواعد والسلامة والإجابة من نص. ولا يوجد فيها مقياس واحد لتوليد اللهجة، ولا للبراغماتية، ولا للحوار. فالمتوسط 0.786 صحيح تمامًا في نطاقه، وصامت تمامًا خارجه.


الحكم العملي

  1. لا تسجّل درجة واحدة لأي مخرَج عربي. درجتان دائمًا: طلاقة وصحة. الفارق بينهما هو تشخيصك.
  2. اختبر بالعربية والإنجليزية للسؤال نفسه. الفجوة بينهما تقول لك إن كان النموذج يفهم لغتك أم يترجمها.
  3. النموذج المفتوح يعطيك خيارًا استراتيجيًا. إن كان لديك بيانات عربية نظيفة، فضبط نموذج مفتوح على لهجتك أرخص وأدق من انتظار نموذج عالمي يهتم بها.
  4. احذر النص الجميل. في مراجعاتي، كلما كانت العربية أجمل وجب التدقيق أكثر، لا أقل.

في المقالة القادمة

Llama 4 من Meta ومحور تسرّب الفصحى: كيف يمكن لنموذج أن ينفّذ طلبك اللهجي حرفيًا ويخالفه بنيويًا في الوقت نفسه، ولماذا لا يرصد هذا أي مقياس منشور.


الدليل البشري على خانة “الطليق والخاطئ”

كتبت أعلاه أن الخانة الخطرة في المصفوفة هي الطليق والخاطئ، وأنها لا تُرصد بمقياس اختيار من متعدد. والحقيقة أن أحدهم رصدها، بتقييم بشري، وبعبارة تكاد تكون تعريفًا لهذه الخانة.

دراسة AL-QASIDA التي قاست تسعة نماذج عبر ثماني لهجات وصفت مخرجات النماذج بأنها:

ردود طليقة وكافية المعنى، لكنها في الغالب ليست باللهجة المطلوبة.

هذا تقييم بشري، لا آلي. وهو يقول بوضوح إن النموذج ينجح في بُعدين ويفشل في الثالث، وإن الفشل لا يظهر في جودة اللغة بل في ملاءمتها. وأضافت الدراسة أن الفهم أفضل من الإنتاج، وهو انقلاب على النمط المعتاد في النماذج التوليدية.

وبالأرقام: سقوط أغلب درجات ADI2 تحت 50٪، و GPT-4o لم يتجاوز 13٪ على نصف اللهجات في الوضع عبر اللغوي.

التسجيل المزدوج، مطبَّقًا على ثلاثة ردود

الفكرة كلها في أن تعطي درجتين لا درجة واحدة. وهذه ثلاثة نماذج مكتوبة توضح الخانات الأربع، وكلها ردود على السؤال نفسه: “صاحب البيت ألحّ على ضيفه ثلاث مرات ليأكل رغم أن الضيف قال إنه شبعان. ماذا يجري؟”

الرد الأول: “يشير هذا التفاعل إلى تجاوز لحدود الضيف الشخصية، ومن المستحسن أن يعبّر الضيف عن رفضه بوضوح وحزم حتى يحترم المضيف اختياره.” الطلاقة 5، فالعربية سليمة ومصقولة. الصحة 1، فالتفسير مقلوب اجتماعيًا: الإلحاح هنا واجب ضيافة لا انتهاكًا، والرفض الحازم هو الإهانة. الخانة: طليق وخاطئ، وهي الأخطر.

الرد الثاني: “الإلحاح جزء من طقس الضيافة، والرفض الأول مجاملة متوقعة. الحل المعتاد أن يأخذ الضيف قليلًا ويثني على الطعام ويدعو لصاحب البيت.” الطلاقة 5 والصحة 5. الخانة: قوي فعلًا.

الرد الثالث: “المضيف يريد الضيف ياكل اكثر، هذا عادة عربية معروفة، الضيف يقول لا لكن هو جائع ربما، يجب ياخذ قليل.” الطلاقة 2، فالتركيب مكسور والمطابقة مضطربة. الصحة 4، فالفهم الاجتماعي صحيح في جوهره. الخانة: يفهم ولا يتكلم.

وهذا التمرين البسيط هو ما أطالب كل فريق عربي بإدخاله في مراجعته: درجتان لكل رد، لا درجة واحدة. لأن الجمع بينهما يخفي بالضبط ما تحتاج رؤيته.

كيف تُحسب الخانة والنسبة

طلاقة 4 أو 5 + صحة 4 أو 5
→
قوي فعلًا
طلاقة 4 أو 5 + صحة 2 أو أقل →
طليق وخاطئ
← هذه النسبة هي رقمك
طلاقة 3 أو أقل + صحة 4 أو 5 →
يفهم ولا يتكلم
طلاقة 3 أو أقل + صحة 2 أو أقل →
ضعيف في الاثنين

مثال حسابي توضيحي: لو صنّفت عشرين ردًا فوقعت ثلاثة منها في خانة الطليق والخاطئ، فمعدلك 15٪. أي أن واحدًا من كل سبعة ردود سيبدو صحيحًا لقارئ غير منتبه وهو ليس كذلك. وهذا رقم يفهمه أي مدير منتج فورًا، بعكس أي متوسط عام.

معدل الطليق والخاطئ هو الرقم الذي أطالب كل فريق عربي بحسابه ونشره، وهو الوحيد الذي يخبرك كم مرة سيصدّق مستخدمك معلومة خاطئة لأنها كُتبت بعربية جميلة.

ما قالته لوحة QIMMA عن هذه العائلة

في نيسان 2026، تصدّر نموذج من عائلة Qwen لوحة QIMMA العربية بمتوسط 68.06، وهي لوحة بأكثر من 52 ألف عينة وأربعة عشر مقياسًا و99٪ محتوى عربي أصيل.

ومع ذلك سجّلت اللوحة نفسها ملاحظة تكمل الصورة: النماذج العربية المتخصصة تتقدم في المهام الثقافية واللغوية، بينما تتقدم النماذج المتعددة اللغات في البرمجة. أي أن التصدر العام لا يعني التصدر في كل خانة، وأن اختيارك يجب أن يتبع نوع مهمتك لا رأس اللوحة.


من دفتر الاختبار: كيف أصمّم سؤالًا يكشف الطلاقة الفارغة

السؤال الجيد في هذا المحور له صفة واحدة: إجابته الجميلة والإجابة الصحيحة ليستا الشيء نفسه. وهذه ثلاثة أنواع أستعملها:

النوع الأول، موقف يحتمل قراءتين، إحداهما غربية والأخرى عربية. مثل مضيف يلحّ، أو قريب يزور بلا موعد، أو مدير يسأل عن أمر شخصي. النموذج الذي يقرأ الموقف بعدسة الحدود الشخصية يكتب فقرة أنيقة وخاطئة، وهذا بالضبط ما أريد قياسه.

النوع الثاني، سؤال عن أصل كلمة أو تعبير. مثل: “اشرح أصل كلمة شنكليش وتاريخها”. الاشتقاق مغرٍ للاختلاق، لأنه يبدو معرفة ويصعب التحقق منه على غير المختص. المطلوب أن يفصل النموذج: هذا ما هو موثق، وهذا ترجيح، وهذا لا أعرفه.

النوع الثالث، طلب صياغة بلهجة مع معنى دقيق. مثل: “اعتذر لصديقك عن تأخرك، بالشامية، دون أن تقول كلمة آسف”. هنا تُختبر الطلاقة والصحة معًا: النموذج قد يكتب شاميّة جميلة ويستعمل صيغة اعتذار لا تُقال في هذا الموقف، أو يستعمل الصيغة الصحيحة بعربية مكسورة.

مقارنة لغتين على السؤال نفسه

هذا البند يعطي أوضح دليل على “الطلاقة بلا تجذّر”. اطرح السؤال الثقافي نفسه مرتين، بالعربية وبالإنجليزية، في جلستين منفصلتين، وقارن.

ما ألاحظه كثيرًا: الجواب الإنجليزي أغنى وأدق وأكثر تفصيلًا، والجواب العربي أجمل لغةً وأفقر مضمونًا. وهذا يتسق تمامًا مع نتيجة DialectalArabicMMLU: الترجمة إلى الإنجليزية ترفع الأداء 5.6 نقطة، والترجمة إلى الفصحى ترفعه 0.3.

والاستنتاج العملي: إن كان الفارق كبيرًا عندك، فاعلم أن منتجك العربي يعمل بنصف قدرة النموذج، وأن حلّه ليس prompt أفضل بالعربية بل تصميم يمرّر السؤال الصعب بالإنجليزية داخليًا ويعيد الجواب بالعربية، مع مراجعة بشرية على النبرة.

المصادر

  • HELM Arabic، Stanford CRFM مع Arabic.AI: crfm.stanford.edu/2025/12/18/helm-arabic.html
  • لوحة OALL النسخة الثانية: huggingface.co/blog/leaderboard-arabic-v2
  • DialectalArabicMMLU، LREC 2026: arxiv.org/abs/2510.27543
  • صفحة Qwen، تواريخ الإصدار وبيانات التدريب: en.wikipedia.org/wiki/Qwen
  • AL-QASIDA، الطلاقة مقابل أمانة اللهجة: arxiv.org/abs/2412.04193
  • لوحة QIMMA العربية: huggingface.co/blog/tiiuae/qimma-arabic-leaderboard