الأرقام أولًا
| النموذج | الحجم | نافذة السياق | OALL | المصدر |
|---|---|---|---|---|
| Falcon-H1-Arabic 34B | 34 مليار | 256 ألف رمز | نحو 75.36٪ | معهد الابتكار التكنولوجي، كانون الثاني 2026 |
| Falcon-H1-Arabic 7B | 7 مليارات | 256 ألف رمز | 71.47٪ | المصدر نفسه |
| Falcon-H1-Arabic 3B | 3 مليارات | 128 ألف رمز | نحو 62٪ | المصدر نفسه |
وهذه المقارنات كما أعلنتها الجهة المطوّرة:
| الحجم | يتقدم على | الفارق المعلن |
|---|---|---|
| 3 مليارات | Gemma-4B و Qwen3-4B | نحو عشر نقاط |
| 7 مليارات | Fanar-9B و ALLaM-7B | تقدّم معلن بلا رقم محدد |
| 34 مليارًا | Llama-3.3-70B و AceGPT2-32B | تقدّم معلن بلا رقم محدد |
هذا الجدول يقول شيئًا واحدًا واضحًا: في العربية، التخصص يهزم الحجم. نموذج بسبعة مليارات معامل، يعمل على جهاز واحد، يتقدم على نماذج بعشرات المليارات حين يكون السؤال عربيًا أصيلًا لا مترجمًا. وهذه أهم نتيجة بنيوية خرجت من المنطقة خلال العام الماضي.
ثم يأتي السؤال الذي كتبت المقالة من أجله: 75 بالمئة من ماذا؟
ماذا تقيس لوحة OALL فعلًا
لوحة OALL في نسختها الثانية خطوة جادة إلى الأمام، ويستحق القائمون عليها التقدير على قرار واحد شجاع: حذفوا المقاييس المترجمة آليًا. السبب الذي ذكروه صريح، وهو أن كثيرًا من المهام كانت ترجمات مباشرة عن الإنجليزية، فأدخلت اختلالات لغوية وسياقية. كما حذفوا مقاييس تشبّعت حتى صارت لا تفرّق بين النماذج.
وصارت اللوحة تضم مقاييس أصيلة: ArabicMMLU للمعرفة المدرسية، و MadinahQA للغة وقواعدها، و AraTrust للسلامة، و ALRAGE للإجابة اعتمادًا على نص، إضافة إلى AlGhafa و EXAMS و Belebele.
الآن انظر إلى القائمة بعين من يبني منتجًا عربيًا، واسأل: أين اللهجة؟
| محور ARAB-LENS | هل تقيسه OALL؟ |
|---|---|
| اللغة: نحو وصرف وإملاء | نعم، عبر MadinahQA |
| المعرفة العامة بالعربية | نعم، عبر ArabicMMLU و EXAMS |
| السلامة | نعم، عبر AraTrust |
| الإجابة من نص | نعم، عبر ALRAGE |
| فهم اللهجة | لا |
| توليد اللهجة | لا |
| البراغماتية | لا |
| الحوار متعدد الأدوار | لا |
| الصوت | لا |
خمسة محاور من تسعة خارج القياس تمامًا. ولهذا فإن جملة “هذا النموذج سجّل 75 على العربية” جملة صحيحة وناقصة في آن واحد: صحيحة لأن الرقم حقيقي ومصدره معلن، وناقصة لأن الرقم لا يعرف شيئًا عن نصف ما تحتاجه أنت.
بطاقة النموذج
| البند | التفصيل |
|---|---|
| الاسم | Falcon-H1-Arabic |
| الجهة | معهد الابتكار التكنولوجي، أبوظبي |
| تاريخ الإصدار | 5 كانون الثاني 2026 |
| الأحجام | 3 و7 و34 مليار معامل |
| المعمارية | هجينة بين Mamba و Transformer، تعملان بالتوازي داخل كل طبقة ثم تُدمج مخرجاتهما |
| السابق له | Falcon-Arabic، صدر قبله بأشهر |
| المحور المختبَر | ARAB-DIALECT: التعرف والتمييز |
المعمارية الهجينة تستحق وقفة: تشغيل آلية الانتباه وآلية الحالة المتسلسلة جنبًا إلى جنب داخل الطبقة الواحدة يعطي سياقًا طويلًا بكلفة أقل، وهذا في العربية مفيد تحديدًا، لأن العربية لغة اشتقاقية طويلة الكلمات، ونصوصها تستهلك رموزًا أكثر من الإنجليزية لنفس المعنى.
اختبار اللهجة بخمسة مستويات
بما أن اللوحة لا تقيس اللهجة، إليك ما أقيسه أنا. وهذه بنود كتبتها بالشامية والأردنية، ويمكن لأي أحد أن يعيد تشغيلها على النموذج نفسه.
المستوى 1، التعرف. “هلق ما إلي خِلِق أحكي مع حدا.” المطلوب: تحديد العائلة اللهجية مع درجة ثقة. والقاعدة التي أضعها: لا عقوبة على قول “شامية” بدل “سورية”، لأن اللهجة ليست الجنسية. العقوبة على الثقة الزائدة.
المستوى 2، المفردة. هل يعرف “خِلِق” هنا بمعنى المزاج لا بمعنى الخَلق؟ وهل يعرف “حدا” بمعنى أحد؟
المستوى 3، المعنى في السياق. ضع كلمة “عمار” في ثلاثة سياقات: اسم علم، وبناء، ودعاء (“بالعمار يا رب”). ثلاث إجابات مختلفة أو رسوب.
المستوى 4، التحويل. “ماذا تفعل الآن؟” إلى السورية ثم الأردنية ثم المصرية ثم المغربية، بشرط اختلاف بنيوي لا معجمي.
المستوى 5، السجل. المعنى نفسه لصديق، ولمدير، ولكبير في السن، وفي واتساب، وفي خدمة عملاء.
وأضيف بندًا سادسًا خاصًا بالنماذج العربية المتخصصة، لأنه الفخ الذي تقع فيه تحديدًا: فخ الثقة اللهجية. أعطه جملة أردنية شمالية ريفية فيها “گال” بدل “قال”، واسأله عن أصل المتكلم. النموذج الذي درّبوه على شامية المدن سيقول “سورية” بثقة عالية، وهذا خطأ من نوع خاص: ليس جهلًا بالعربية، بل تعميمًا لعينة تدريب على منطقة أوسع منها.
قراءة مقارنة: النموذج العربي مقابل النموذج العام
هنا تفصيل مهم يجب أن يُقرأ بدقة. في لوحة HELM Arabic التي أطلقها مركز ستانفورد للأبحاث مع Arabic.AI في كانون الأول 2025، جاءت النماذج العربية المتخصصة (AceGPT-v2 و ALLaM و JAIS و SILMA) أضعف من النماذج المتعددة اللغات، وأرجع القائمون على اللوحة ذلك إلى أن معظمها كان قد مضى على إصداره أكثر من عام وقت التقييم.
ضع هذه النتيجة بجانب أرقام Falcon-H1-Arabic، وستحصل على الصورة الحقيقية:
| القراءة الخاطئة | القراءة الصحيحة |
|---|---|
| النماذج العربية أضعف من العامة | النماذج العربية القديمة أضعف من النماذج العامة الحديثة |
| التخصص لا ينفع | التخصص ينفع بشدة، لكن عمر النموذج يغلب أثر التخصص |
| اختر الأكبر دائمًا | اختر الأحدث، ثم الأخص، ثم الأكبر |
الدرس العملي: عمر النموذج متغير أقوى مما يظن الناس. نموذج عربي متخصص عمره سنة يخسر أمام نموذج عام عمره ثلاثة أشهر، ونموذج عربي متخصص جديد يقلب المعادلة مرة أخرى.
الحكم العملي
- إن كنت تبني داخل المنطقة وتحتاج تشغيلًا محليًا، فنموذج 7B المتخصص خيار جاد. يعمل على عتاد متواضع، ورقمه العربي يتجاوز نماذج أكبر منه بكثير.
- لا تقرأ رقم اللوحة على أنه شهادة لهجة. اللوحة لا تقيس اللهجة أصلًا، والفرق بين نموذج يعرف الفصحى ونموذج يفهم مستخدمك في عمّان هو الفرق بين منتج يعمل ومنتج يُهجَر.
- اسأل عن تاريخ الإصدار قبل أن تسأل عن الحجم. ستة أشهر في هذا المجال تساوي جيلًا.
- اطلب من نظامك أن يقول “لست متأكدًا”. خصوصًا في تحديد اللهجة، حيث الخطأ الاجتماعي أغلى من الخطأ التقني.
في المقالة القادمة
أبقى في النماذج العربية وأنتقل إلى Jais 2 من Inception و MBZUAI، ومعه السؤال الذي يخلط فيه أغلب المقيّمين: هل الثقافة العربية والمعرفة الإسلامية شيء واحد؟ أرقام PalmX 2025 تقول بوضوح إنهما ليسا كذلك.
لوحة جديدة تحاول سدّ الفجوة: QIMMA
بعد نشر هذه المقالة بأشهر، أطلق معهد الابتكار التكنولوجي نفسه لوحة عربية جديدة اسمها QIMMA، وهي محاولة جادة لمعالجة بعض ما انتقدته أعلاه. وأذكرها هنا لأن نقد اللوحات يجب أن يتبعه اعتراف حين تتحسن.
| البند | ما تقدمه QIMMA |
|---|---|
| حجم العينة | أكثر من 52 ألف عينة |
| المقاييس | أربعة عشر مقياسًا في سبعة مجالات: الثقافة والعلوم والقانون والطب والسلامة والشعر والبرمجة |
| نسبة المحتوى العربي الأصيل | 99٪ |
| تنقية العينات | خط تحقق آلي متعدد النماذج، ثم مراجعة بشرية، مع حذف العينات المعطوبة قبل التقييم |
| الشفافية | نشر مخرجات الاستدلال لكل عينة |
| جديد | أول لوحة عربية تضيف تقييم توليد الشيفرة |
ونتائجها الأولى في نيسان 2026: Qwen3.5-397B-A17B بمتوسط 68.06، ثم Karnak بـ66.20، ثم Jais-2-70B-Chat بـ65.81.
والملاحظة التي خرجت بها اللوحة نفسها تدعم أطروحة هذه المقالة مباشرة: النماذج العربية المتخصصة تتقدم في المهام الثقافية واللغوية، بينما تتقدم النماذج المتعددة اللغات في البرمجة. أي أن التخصص ينفع حيث تكون اللغة هي الموضوع، لا حيث تكون اللغة وعاءً.
وكشفت اللوحة أيضًا شيئًا يخص المقاييس نفسها: نسبة استبعاد بلغت 3.1٪ في ArabicMMLU بسبب مشكلات في جودة الإجابات والتنسيق. ثلاثة بالمئة تبدو صغيرة، لكنها تقترب من حجم الفوارق بين النماذج المتقاربة في الصدارة.
وماذا بقي خارج القياس
حتى بعد QIMMA، تبقى الخانات نفسها فارغة:
والسبب في كل مرة واحد: ما يُقاس بسؤال اختيار من متعدد يدخل اللوحات، وما يحتاج حكمًا بشريًا من متحدث أصلي يبقى خارجها. ولهذا أقول إن الفجوة ليست في النماذج بل في أدوات القياس، وسدّها يحتاج بشرًا لا خوارزميات.
من دفتر الاختبار: خمسة مستويات على جملة واحدة
اللوحة لا تقيس اللهجة، وهذا ما أقيسه أنا بدلًا منها. أبدأ من جملة واحدة وأبني عليها خمسة مستويات:
“هلق ما إلي خِلِق أحكي مع حدا.”
المستوى الأول، التصنيف. الجواب المقبول: عائلة شامية، وثقة متوسطة إلى عالية، بلا تحديد دولة. الجواب المرفوض: “سورية” بثقة، لأن الجملة نفسها تُقال في بيروت وعمّان ورام الله.
المستوى الثاني، المفردة داخل السياق. “خِلِق” هنا مزاج لا خلق، و”حدا” أحد، و”ما إلي” ليس عندي رغبة. النموذج الذي يترجم “خلق” إلى creation سقط في أول مستوى.
المستوى الثالث، الكلمة في ثلاثة سياقات. خذ كلمة “عمار”: اسم علم في “عمار إجا”، وبناء في “عمار البيت خلص”، ودعاء في “بالعمار يا رب”. ثلاث إجابات مختلفة أو رسوب.
المستوى الرابع، التحويل البنيوي. حوّل الجملة إلى المصرية والمغربية. المصرية: “دلوقتي مش فاضي أكلم حد”. المغربية: “دابا ما عنديش ما نهضر مع حتى واحد”. لاحظ أن الفرق ليس في المفردات فقط: النفي تغيّر، وظرف الزمان تغيّر، وبنية الجملة كلها تغيّرت. النموذج الذي يعيد ثلاث جمل بالتركيب نفسه ومفردات مختلفة لم يحوّل لهجة، بل بدّل كلمات.
المستوى الخامس، السجل. المعنى نفسه موجَّهًا لصديق، ولمدير، ولشخص أكبر سنًا. الفرق يجب أن يظهر في الطول والمباشرة وأداة الاعتذار، لا في كلمة الافتتاح وحدها.
الفخ الذي يكشف النماذج العربية تحديدًا
هذا بند أضعه للنماذج المدرَّبة على بيانات إقليمية، لأنه يكشف حدود بياناتها:
“گال لي يا زلمة شو صاير؟ قلتلّه ولا إشي.”
الجملة تخلط “گال” البدوية أو الشمالية مع “زلمة” الشامية. المتحدث الأصلي يقرؤها فورًا بوصفها منطقة تماس: شمال الأردن، أو بادية الشام، أو أردني من أصل فلسطيني في منطقة مختلطة.
النموذج المدرَّب على شامية المدن يقول “هذه ليست شامية”، والمدرَّب على بيانات خليجية يقول “خليجية”. والجواب الصحيح أنها شامية بملمح بدوي، وأن اللهجات لا تنتهي عند الحدود السياسية.
وهذا البند وحده يقيس شيئًا لا تقيسه أي لوحة عربية اليوم: هل يعرف النموذج أن اللهجة طيف متصل لا صندوق مغلق؟
المصادر
- معهد الابتكار التكنولوجي، إعلان Falcon-H1-Arabic: falcon-lm.github.io/blog/falcon-h1-arabic
- لوحة OALL النسخة الثانية ومنهجيتها: huggingface.co/blog/leaderboard-arabic-v2
- HELM Arabic، Stanford CRFM مع Arabic.AI: crfm.stanford.edu/2025/12/18/helm-arabic.html
- DialectalArabicMMLU، LREC 2026: arxiv.org/abs/2510.27543
- لوحة QIMMA العربية: huggingface.co/blog/tiiuae/qimma-arabic-leaderboard