75 بالمئة على لوحة عربية: ماذا يقيس رقم Falcon-H1-Arabic وماذا يخفي

وقت القراءة: 9 دقيقة
18
إيهاب صالح | techkahwa.net صدر النموذج: 5 كانون الثاني 2026 | تاريخ النشر: 19 كانون الثاني 2026

الأرقام أولًا

النموذجالحجمنافذة السياقOALLالمصدر
Falcon-H1-Arabic 34B34 مليار256 ألف رمزنحو 75.36٪معهد الابتكار التكنولوجي، كانون الثاني 2026
Falcon-H1-Arabic 7B7 مليارات256 ألف رمز71.47٪المصدر نفسه
Falcon-H1-Arabic 3B3 مليارات128 ألف رمزنحو 62٪المصدر نفسه

وهذه المقارنات كما أعلنتها الجهة المطوّرة:

الحجميتقدم علىالفارق المعلن
3 ملياراتGemma-4B و Qwen3-4Bنحو عشر نقاط
7 ملياراتFanar-9B و ALLaM-7Bتقدّم معلن بلا رقم محدد
34 مليارًاLlama-3.3-70B و AceGPT2-32Bتقدّم معلن بلا رقم محدد
OALL: التخصص مقابل الحجم
Falcon-H1-Arabic 34B
75.4
Falcon-H1-Arabic 7B
71.5
Falcon-H1-Arabic 3B
62.0
نموذج بسبعة مليارات معامل يتجاوز نماذج
أكبر منه بعشرة أضعاف، حين يكون القياس عربيًا

هذا الجدول يقول شيئًا واحدًا واضحًا: في العربية، التخصص يهزم الحجم. نموذج بسبعة مليارات معامل، يعمل على جهاز واحد، يتقدم على نماذج بعشرات المليارات حين يكون السؤال عربيًا أصيلًا لا مترجمًا. وهذه أهم نتيجة بنيوية خرجت من المنطقة خلال العام الماضي.

ثم يأتي السؤال الذي كتبت المقالة من أجله: 75 بالمئة من ماذا؟


ماذا تقيس لوحة OALL فعلًا

لوحة OALL في نسختها الثانية خطوة جادة إلى الأمام، ويستحق القائمون عليها التقدير على قرار واحد شجاع: حذفوا المقاييس المترجمة آليًا. السبب الذي ذكروه صريح، وهو أن كثيرًا من المهام كانت ترجمات مباشرة عن الإنجليزية، فأدخلت اختلالات لغوية وسياقية. كما حذفوا مقاييس تشبّعت حتى صارت لا تفرّق بين النماذج.

وصارت اللوحة تضم مقاييس أصيلة: ArabicMMLU للمعرفة المدرسية، و MadinahQA للغة وقواعدها، و AraTrust للسلامة، و ALRAGE للإجابة اعتمادًا على نص، إضافة إلى AlGhafa و EXAMS و Belebele.

الآن انظر إلى القائمة بعين من يبني منتجًا عربيًا، واسأل: أين اللهجة؟

محور ARAB-LENSهل تقيسه OALL؟
اللغة: نحو وصرف وإملاءنعم، عبر MadinahQA
المعرفة العامة بالعربيةنعم، عبر ArabicMMLU و EXAMS
السلامةنعم، عبر AraTrust
الإجابة من نصنعم، عبر ALRAGE
فهم اللهجةلا
توليد اللهجةلا
البراغماتيةلا
الحوار متعدد الأدوارلا
الصوتلا

خمسة محاور من تسعة خارج القياس تمامًا. ولهذا فإن جملة “هذا النموذج سجّل 75 على العربية” جملة صحيحة وناقصة في آن واحد: صحيحة لأن الرقم حقيقي ومصدره معلن، وناقصة لأن الرقم لا يعرف شيئًا عن نصف ما تحتاجه أنت.


بطاقة النموذج

البندالتفصيل
الاسمFalcon-H1-Arabic
الجهةمعهد الابتكار التكنولوجي، أبوظبي
تاريخ الإصدار5 كانون الثاني 2026
الأحجام3 و7 و34 مليار معامل
المعماريةهجينة بين Mamba و Transformer، تعملان بالتوازي داخل كل طبقة ثم تُدمج مخرجاتهما
السابق لهFalcon-Arabic، صدر قبله بأشهر
المحور المختبَرARAB-DIALECT: التعرف والتمييز

المعمارية الهجينة تستحق وقفة: تشغيل آلية الانتباه وآلية الحالة المتسلسلة جنبًا إلى جنب داخل الطبقة الواحدة يعطي سياقًا طويلًا بكلفة أقل، وهذا في العربية مفيد تحديدًا، لأن العربية لغة اشتقاقية طويلة الكلمات، ونصوصها تستهلك رموزًا أكثر من الإنجليزية لنفس المعنى.


اختبار اللهجة بخمسة مستويات

بما أن اللوحة لا تقيس اللهجة، إليك ما أقيسه أنا. وهذه بنود كتبتها بالشامية والأردنية، ويمكن لأي أحد أن يعيد تشغيلها على النموذج نفسه.

المستوى 1، التعرف. “هلق ما إلي خِلِق أحكي مع حدا.” المطلوب: تحديد العائلة اللهجية مع درجة ثقة. والقاعدة التي أضعها: لا عقوبة على قول “شامية” بدل “سورية”، لأن اللهجة ليست الجنسية. العقوبة على الثقة الزائدة.

المستوى 2، المفردة. هل يعرف “خِلِق” هنا بمعنى المزاج لا بمعنى الخَلق؟ وهل يعرف “حدا” بمعنى أحد؟

المستوى 3، المعنى في السياق. ضع كلمة “عمار” في ثلاثة سياقات: اسم علم، وبناء، ودعاء (“بالعمار يا رب”). ثلاث إجابات مختلفة أو رسوب.

المستوى 4، التحويل. “ماذا تفعل الآن؟” إلى السورية ثم الأردنية ثم المصرية ثم المغربية، بشرط اختلاف بنيوي لا معجمي.

المستوى 5، السجل. المعنى نفسه لصديق، ولمدير، ولكبير في السن، وفي واتساب، وفي خدمة عملاء.

وأضيف بندًا سادسًا خاصًا بالنماذج العربية المتخصصة، لأنه الفخ الذي تقع فيه تحديدًا: فخ الثقة اللهجية. أعطه جملة أردنية شمالية ريفية فيها “گال” بدل “قال”، واسأله عن أصل المتكلم. النموذج الذي درّبوه على شامية المدن سيقول “سورية” بثقة عالية، وهذا خطأ من نوع خاص: ليس جهلًا بالعربية، بل تعميمًا لعينة تدريب على منطقة أوسع منها.


قراءة مقارنة: النموذج العربي مقابل النموذج العام

هنا تفصيل مهم يجب أن يُقرأ بدقة. في لوحة HELM Arabic التي أطلقها مركز ستانفورد للأبحاث مع Arabic.AI في كانون الأول 2025، جاءت النماذج العربية المتخصصة (AceGPT-v2 و ALLaM و JAIS و SILMA) أضعف من النماذج المتعددة اللغات، وأرجع القائمون على اللوحة ذلك إلى أن معظمها كان قد مضى على إصداره أكثر من عام وقت التقييم.

ضع هذه النتيجة بجانب أرقام Falcon-H1-Arabic، وستحصل على الصورة الحقيقية:

القراءة الخاطئةالقراءة الصحيحة
النماذج العربية أضعف من العامةالنماذج العربية القديمة أضعف من النماذج العامة الحديثة
التخصص لا ينفعالتخصص ينفع بشدة، لكن عمر النموذج يغلب أثر التخصص
اختر الأكبر دائمًااختر الأحدث، ثم الأخص، ثم الأكبر

الدرس العملي: عمر النموذج متغير أقوى مما يظن الناس. نموذج عربي متخصص عمره سنة يخسر أمام نموذج عام عمره ثلاثة أشهر، ونموذج عربي متخصص جديد يقلب المعادلة مرة أخرى.


الحكم العملي

  1. إن كنت تبني داخل المنطقة وتحتاج تشغيلًا محليًا، فنموذج 7B المتخصص خيار جاد. يعمل على عتاد متواضع، ورقمه العربي يتجاوز نماذج أكبر منه بكثير.
  2. لا تقرأ رقم اللوحة على أنه شهادة لهجة. اللوحة لا تقيس اللهجة أصلًا، والفرق بين نموذج يعرف الفصحى ونموذج يفهم مستخدمك في عمّان هو الفرق بين منتج يعمل ومنتج يُهجَر.
  3. اسأل عن تاريخ الإصدار قبل أن تسأل عن الحجم. ستة أشهر في هذا المجال تساوي جيلًا.
  4. اطلب من نظامك أن يقول “لست متأكدًا”. خصوصًا في تحديد اللهجة، حيث الخطأ الاجتماعي أغلى من الخطأ التقني.

في المقالة القادمة

أبقى في النماذج العربية وأنتقل إلى Jais 2 من Inception و MBZUAI، ومعه السؤال الذي يخلط فيه أغلب المقيّمين: هل الثقافة العربية والمعرفة الإسلامية شيء واحد؟ أرقام PalmX 2025 تقول بوضوح إنهما ليسا كذلك.


لوحة جديدة تحاول سدّ الفجوة: QIMMA

بعد نشر هذه المقالة بأشهر، أطلق معهد الابتكار التكنولوجي نفسه لوحة عربية جديدة اسمها QIMMA، وهي محاولة جادة لمعالجة بعض ما انتقدته أعلاه. وأذكرها هنا لأن نقد اللوحات يجب أن يتبعه اعتراف حين تتحسن.

البندما تقدمه QIMMA
حجم العينةأكثر من 52 ألف عينة
المقاييسأربعة عشر مقياسًا في سبعة مجالات: الثقافة والعلوم والقانون والطب والسلامة والشعر والبرمجة
نسبة المحتوى العربي الأصيل99٪
تنقية العيناتخط تحقق آلي متعدد النماذج، ثم مراجعة بشرية، مع حذف العينات المعطوبة قبل التقييم
الشفافيةنشر مخرجات الاستدلال لكل عينة
جديدأول لوحة عربية تضيف تقييم توليد الشيفرة

ونتائجها الأولى في نيسان 2026: Qwen3.5-397B-A17B بمتوسط 68.06، ثم Karnak بـ66.20، ثم Jais-2-70B-Chat بـ65.81.

والملاحظة التي خرجت بها اللوحة نفسها تدعم أطروحة هذه المقالة مباشرة: النماذج العربية المتخصصة تتقدم في المهام الثقافية واللغوية، بينما تتقدم النماذج المتعددة اللغات في البرمجة. أي أن التخصص ينفع حيث تكون اللغة هي الموضوع، لا حيث تكون اللغة وعاءً.

وكشفت اللوحة أيضًا شيئًا يخص المقاييس نفسها: نسبة استبعاد بلغت 3.1٪ في ArabicMMLU بسبب مشكلات في جودة الإجابات والتنسيق. ثلاثة بالمئة تبدو صغيرة، لكنها تقترب من حجم الفوارق بين النماذج المتقاربة في الصدارة.

وماذا بقي خارج القياس

حتى بعد QIMMA، تبقى الخانات نفسها فارغة:

مقيس اليوم
│
غير مقيس اليوم
معرفة عامة
│
توليد اللهجة
قواعد اللغة
│
البراغماتية والمقصد
سلامة المحتوى
│
الحوار متعدد الأدوار
ثقافة عبر أسئلة
│
التنميط اللهجي
شعر وبرمجة
│
الصوت والنبرة

والسبب في كل مرة واحد: ما يُقاس بسؤال اختيار من متعدد يدخل اللوحات، وما يحتاج حكمًا بشريًا من متحدث أصلي يبقى خارجها. ولهذا أقول إن الفجوة ليست في النماذج بل في أدوات القياس، وسدّها يحتاج بشرًا لا خوارزميات.


من دفتر الاختبار: خمسة مستويات على جملة واحدة

اللوحة لا تقيس اللهجة، وهذا ما أقيسه أنا بدلًا منها. أبدأ من جملة واحدة وأبني عليها خمسة مستويات:

“هلق ما إلي خِلِق أحكي مع حدا.”

المستوى الأول، التصنيف. الجواب المقبول: عائلة شامية، وثقة متوسطة إلى عالية، بلا تحديد دولة. الجواب المرفوض: “سورية” بثقة، لأن الجملة نفسها تُقال في بيروت وعمّان ورام الله.

المستوى الثاني، المفردة داخل السياق. “خِلِق” هنا مزاج لا خلق، و”حدا” أحد، و”ما إلي” ليس عندي رغبة. النموذج الذي يترجم “خلق” إلى creation سقط في أول مستوى.

المستوى الثالث، الكلمة في ثلاثة سياقات. خذ كلمة “عمار”: اسم علم في “عمار إجا”، وبناء في “عمار البيت خلص”، ودعاء في “بالعمار يا رب”. ثلاث إجابات مختلفة أو رسوب.

المستوى الرابع، التحويل البنيوي. حوّل الجملة إلى المصرية والمغربية. المصرية: “دلوقتي مش فاضي أكلم حد”. المغربية: “دابا ما عنديش ما نهضر مع حتى واحد”. لاحظ أن الفرق ليس في المفردات فقط: النفي تغيّر، وظرف الزمان تغيّر، وبنية الجملة كلها تغيّرت. النموذج الذي يعيد ثلاث جمل بالتركيب نفسه ومفردات مختلفة لم يحوّل لهجة، بل بدّل كلمات.

المستوى الخامس، السجل. المعنى نفسه موجَّهًا لصديق، ولمدير، ولشخص أكبر سنًا. الفرق يجب أن يظهر في الطول والمباشرة وأداة الاعتذار، لا في كلمة الافتتاح وحدها.

الفخ الذي يكشف النماذج العربية تحديدًا

هذا بند أضعه للنماذج المدرَّبة على بيانات إقليمية، لأنه يكشف حدود بياناتها:

“گال لي يا زلمة شو صاير؟ قلتلّه ولا إشي.”

الجملة تخلط “گال” البدوية أو الشمالية مع “زلمة” الشامية. المتحدث الأصلي يقرؤها فورًا بوصفها منطقة تماس: شمال الأردن، أو بادية الشام، أو أردني من أصل فلسطيني في منطقة مختلطة.

النموذج المدرَّب على شامية المدن يقول “هذه ليست شامية”، والمدرَّب على بيانات خليجية يقول “خليجية”. والجواب الصحيح أنها شامية بملمح بدوي، وأن اللهجات لا تنتهي عند الحدود السياسية.

وهذا البند وحده يقيس شيئًا لا تقيسه أي لوحة عربية اليوم: هل يعرف النموذج أن اللهجة طيف متصل لا صندوق مغلق؟

المصادر

  • معهد الابتكار التكنولوجي، إعلان Falcon-H1-Arabic: falcon-lm.github.io/blog/falcon-h1-arabic
  • لوحة OALL النسخة الثانية ومنهجيتها: huggingface.co/blog/leaderboard-arabic-v2
  • HELM Arabic، Stanford CRFM مع Arabic.AI: crfm.stanford.edu/2025/12/18/helm-arabic.html
  • DialectalArabicMMLU، LREC 2026: arxiv.org/abs/2510.27543
  • لوحة QIMMA العربية: huggingface.co/blog/tiiuae/qimma-arabic-leaderboard