الأرقام أولًا
| ما تغيّر | قبل | بعد | المصدر |
|---|---|---|---|
| لوحة OALL | نسخة أولى تعتمد جزئيًا على مقاييس مترجمة آليًا | نسخة ثانية حذفت المترجَم واعتمدت مقاييس أصيلة: ArabicMMLU و MadinahQA و AraTrust و ALRAGE | OALL v2 |
| قياس الكلام العربي | لا مهمة مشتركة متعددة اللهجات | NADI 2025، أول مهمة مشتركة لمعالجة الكلام العربي متعدد اللهجات | ArabicNLP 2025 |
| قياس الثقافة | مدمج مع المعرفة الدينية أو غائب | PalmX 2025 يفصل الثقافة العربية عن الإسلامية | ArabicNLP 2025 |
| قياس الحوار | لا يوجد مقياس عربي واسع | Shawarma Chats: 30 ألف حوار من ستة أدوار | ArabicNLP 2025 |
| قياس اللهجة | متفرق | DialectalArabicMMLU: 21,945 سؤالًا عبر خمس لهجات و32 مجالًا | LREC 2026 |
| لوحة مستقلة شاملة | لا توجد | HELM Arabic من ستانفورد مع Arabic.AI، سبعة مقاييس | Stanford CRFM، كانون الأول 2025 |
| النماذج العربية | Jais و ALLaM 13B و AceGPT | Jais 2 بـ70 مليارًا، و Fanar 2.0 بـ27 مليارًا متعدد الوسائط، و Falcon-H1-Arabic حتى 34 مليارًا، و ALLaM 34B | إعلانات الجهات، 2025 و2026 |
هذا تقدم حقيقي وسريع، ويستحق أن يُقال بوضوح: البنية التحتية لقياس العربية في 2026 أفضل بكثير مما كانت عليه في 2024. الفضل فيه لفرق عربية أكاديمية وصناعية عملت بميزانيات أصغر بكثير من ميزانيات من يقيس الإنجليزية.
والآن الوجه الآخر.
ما لم يتغيّر
| المشكلة | حالتها اليوم | الدليل |
|---|---|---|
| الفجوة بين اللهجة والفصحى والإنجليزية | قائمة | 47.7٪ و51.9٪ و62.8٪، DialectalArabicMMLU |
| الفصحى ليست جسرًا إلى اللهجة | مؤكدة برقم | الترجمة إلى الفصحى ترفع 0.3 نقطة فقط، مقابل 5.6 للإنجليزية |
| توليد اللهجة | غير مقيس في أي لوحة عامة | مسح مقاييس OALL و HELM Arabic |
| البراغماتية | غير مقيسة | المسح نفسه |
| الشامية | الأضعف في القياسات المتاحة | 46.6٪ في DialectalArabicMMLU، و2.73 من 5 في تقييم ALLaM المستقل |
| تفريغ الكلام اللهجي | أكثر من ثلث الكلمات خطأ | 35.68 WER في أفضل نظام، NADI 2025 |
| التنميط اللهجي | لا يوجد مقياس | مسح المصادر العامة |
وهذه هي الخلاصة التي أخرج بها بعد سنتين: تحسّن ما كان قابلًا للقياس، وبقي ما يصعب قياسه على حاله. وليست مصادفة أن ما يصعب قياسه هو بالضبط ما يحدد نجاح المنتج العربي عند المستخدم: اللهجة، والنبرة، والمقصد، والعادة الاجتماعية.
بطاقتا الأساس
| البند | Claude 3.5 Sonnet | Gemini 2.5 Pro |
|---|---|---|
| الجهة | Anthropic | |
| التاريخ | حزيران 2024، ونسخة محدّثة في 22 تشرين الأول 2024 | 25 آذار 2025، نسخة تجريبية |
| ما مثّلاه | جيل ما قبل الاستدلال الموسّع | بداية جيل سلاسل التفكير |
| أثرهما العربي | مستوى فصحى جيد، ولهجة ضعيفة | تحسّن ملموس، مع بقاء الفجوة اللهجية |
ونقطة تستحق الذكر عن Gemini 2.5 Pro تحديدًا: في تقييم AHELM الشامل لنماذج الصوت واللغة، سجّل هذا النموذج أعلى أداء عام بمتوسط معدل فوز 0.803 عبر عشرة أبعاد. ومع ذلك رصد التقييم نفسه تحيّزًا جندريًا ذا دلالة إحصائية في بعض مهام الكلام لديه. وهذا تلخيص دقيق لحال هذه المرحلة كلها: قفزة حقيقية في القدرة، مع مشكلات إنصاف لم تُحلّ.
كيف تقيس التقدم بنفسك: مجموعة الأساس الثابتة
أهم درس عملي خرجت به من السنتين الماضيتين هو التالي: ابنِ مجموعة اختبار ثابتة لا تتغير، واختبر بها كل نموذج جديد.
عشرة بنود تكفي:
- عبارة لهجية في سياقين متضادين (دبّر حالك).
- عبارة اجتماعية في أربعة مواقف (الله يعطيك العافية).
- تحويل جملة فصيحة إلى ثلاث لهجات بفروق بنيوية.
- سلّم السجل: الرسالة نفسها لستة مخاطبين.
- سيناريو ضيافة يقيس الاستدلال الثقافي.
- عادة مخترعة لقياس الاختلاق.
- سؤال يستحيل حسمه لقياس الاعتراف بالجهل.
- حوار ستة أدوار لقياس قراءة العلاقة.
- فقرة فيها خمسة أخطاء نحوية لقياس التدقيق.
- تسجيل صوتي بلهجتك لقياس التفريغ والفهم.
احفظ النتائج بتاريخها. بعد أربعة نماذج سيصبح لديك شيء لا يملكه أحد: سلسلة زمنية لقدرة النماذج على لهجتك أنت، لا على الفصحى، ولا على متوسط اثنتين وعشرين دولة.
ثلاث نبوءات قابلة للقياس
أكتبها هنا لأعود إليها لاحقًا، وهذه في رأيي طريقة الكتابة الوحيدة التي تستحق النشر في هذا المجال:
- توليد اللهجة سيبقى بلا مقياس عام سنة أخرى على الأقل، لأن قياسه يحتاج متحدثين أصليين لا يمكن استبدالهم بنموذج حَكَم.
- الفجوة بين الفصحى واللهجة ستضيق في النماذج العربية المتخصصة قبل النماذج العامة، لأن البيانات هي القيد، والجهات العربية أقدر على جمعها.
- أول من يبني مجموعة ذهبية شامية مكتوبة بيد متحدثين أصليين ومغلقة عن التدريب سيملك مرجعًا يعود إليه الجميع. لأن الندرة هنا ليست في النماذج بل في البيانات الموثوقة.
في المقالة الأخيرة من السلسلة
الصوت، وهو أضعف حلقة في العربية اليوم: أرقام NADI 2025 كاملة، ومقارنة بين مسار التفريغ ثم الفهم ومسار النموذج الصوتي المتكامل، وما الذي يجب أن يقيسه أي فريق يبني منتجًا صوتيًا عربيًا قبل أن يطلقه.
ما أضيف إلى الخريطة بعد كتابة هذه المقالة
هذه مقالة عن التغير، فمن الإنصاف أن أضيف ما تغيّر بعدها. طبقتان مهمتان دخلتا الخريطة:
الطبقة الأولى، قياس أمانة اللهجة. دراسة AL-QASIDA قاست تسعة نماذج عبر ثماني لهجات في أربعة أبعاد: الأمانة والفهم والجودة والازدواج اللغوي. وخرجت بأرقام صارت مرجعًا: سقوط أغلب درجات ADI2 تحت 50٪، وارتباط 0.99 بين فشل اللهجة وإنتاج الفصحى، وتقييم بشري يصف المخرجات بأنها طليقة وكافية وغالبًا ليست باللهجة المطلوبة.
الطبقة الثانية، تنقية المقاييس نفسها. لوحة QIMMA في نيسان 2026، بأكثر من 52 ألف عينة وأربعة عشر مقياسًا وسبعة مجالات، أضافت ما لم يكن موجودًا: خط تحقق من جودة العينات قبل التقييم. ونتيجتها الكاشفة أن ArabicMMLU سُجّلت فيه نسبة استبعاد 3.1٪.
التنبؤات، وكيف تُقاس
كتبت ثلاث تنبؤات أعلاه. وهذه معايير الحكم عليها، حتى لا تكون كلامًا عامًا:
| التنبؤ | يتحقق إذا | يسقط إذا |
|---|---|---|
| توليد اللهجة بلا مقياس عام سنة أخرى | لم تُضف أي لوحة كبرى مقياس توليد لهجي بحكم بشري | أضافت لوحة عامة مقياسًا بحكم متحدثين أصليين |
| الفجوة تضيق في النماذج العربية أولًا | نموذج عربي جديد يتجاوز 60٪ في ADI2 قبل أي نموذج عام | نموذج عالمي يسبقه |
| الغلبة لمن يبني مجموعة ذهبية شامية | ظهور مجموعة شامية مرجعية يستشهد بها الباحثون | بقاء الشامية بلا مجموعة مرجعية |
وأعتبر كتابة التنبؤ بمعيار قابل للقياس جزءًا من المهنية: من ينشر رأيًا عن المستقبل ولا يقول متى يكون مخطئًا، لا ينشر رأيًا بل انطباعًا.
ماذا أراقب في الاثني عشر شهرًا القادمة
- هل تدخل الشامية مقاييس الحوار؟ Shawarma Chats غطّى الفصحى والمصرية والمغاربية فقط.
- هل يظهر مقياس للتنميط اللهجي؟ لا يوجد اليوم واحد.
- هل تُنشر سلاسل استدلال عربية كمجموعة بيانات؟ الفجوة الأوضح حاليًا.
- هل تبقى المقاييس نظيفة؟ بعد كشف QIMMA، صار سؤال جودة العينة سؤالًا مشروعًا لكل لوحة.
مجموعة الأساس: البنود العشرة التي أعيدها على كل نموذج جديد
أهم قرار اتخذته في السنتين الماضيتين هو أن أثبّت مجموعة اختبار لا تتغير. هذه هي بنودها كاملة، وهي ما أشغّله على كل إصدار جديد في نفس اليوم:
| # | البند | ما يقيسه | الجواب الذي أقبله |
|---|---|---|---|
| 1 | “دبّر حالك” في موقفي صديق ومدير | حساسية السياق | معنيان مختلفان تمامًا |
| 2 | “الله يعطيك العافية” في أربعة مواقف | الوظيفة الاجتماعية | تقدير، إنهاء، شكر، تهكّم |
| 3 | تحويل جملة إلى ثلاث لهجات | البنية لا المفردات | اختلاف النفي والمستقبل والتركيب |
| 4 | الرسالة نفسها لستة مخاطبين | السجل | اختلاف الطول والمباشرة |
| 5 | سيناريو الضيافة | الاستدلال الثقافي | فهم الإلحاح بوصفه كرمًا |
| 6 | عادة مخترعة في مدينة حقيقية | الاختلاق | اعتراف بعدم المعرفة |
| 7 | رسالة واتساب من كلمة واحدة | الاعتراف بالغموض | رفض الحسم |
| 8 | حوار ستة أدوار | قراءة العلاقة | علاقة قريبة، لا مدير وموظف |
| 9 | فقرة فيها خمسة أخطاء نحوية | التدقيق | إيجاد الأخطاء مع التعليل |
| 10 | تسجيل صوتي بلهجتي | التفريغ والفهم | إجابة عن المعنى لا نسخ للنص |
عشرة بنود، نصف ساعة عمل، ونتيجة قابلة للمقارنة عبر السنين. وهذا ما لا تعطيه أي لوحة، لأن اللوحات تتغير مقاييسها بين نسخة وأخرى، فتضيع إمكانية المقارنة الزمنية.
ما تغيّر فعلًا في هذه البنود خلال سنتين
أكتب هذا بوصفه ملاحظة شخصية من تشغيل المجموعة نفسها مرارًا، لا رقمًا مقيسًا:
تحسّن بوضوح: البند التاسع، أي التدقيق النحوي. النماذج صارت تجد الأخطاء وتعلّلها بدل أن تعيد كتابة الفقرة صامتة. والبند الثاني، أي الوظيفة الاجتماعية للعبارات الشائعة، تحسّن أيضًا وإن بقي التهكم أصعبها.
لم يتحسن كثيرًا: البند الثالث، أي التحويل البنيوي بين اللهجات. ما زال الناتج مفردات مختلفة على تركيب واحد. والبند السادس، أي العادة المخترعة، ما زال يسقط فيه كثير من النماذج القوية.
بقي كما هو: البند العاشر في شقّه الثاني. التفريغ تحسّن، وفهم المقصود من الكلام المنطوق لم يتحرك كثيرًا.
وهذه الملاحظات هي بالضبط ما يجعل مجموعة ثابتة أثمن من لوحة متغيرة: أنت لا تقيس النموذج فقط، بل تقيس اتجاه الحقل.
المصادر
- لوحة OALL النسخة الثانية ومنهجية حذف المقاييس المترجمة: huggingface.co/blog/leaderboard-arabic-v2
- HELM Arabic، Stanford CRFM مع Arabic.AI: crfm.stanford.edu/2025/12/18/helm-arabic.html
- NADI 2025: arxiv.org/abs/2509.02038
- PalmX 2025: arxiv.org/abs/2509.02550
- Shawarma Chats، ArabicNLP 2025: aclanthology.org/2025.arabicnlp-main.39
- DialectalArabicMMLU، LREC 2026: arxiv.org/abs/2510.27543
- AHELM، تقييم نماذج الصوت واللغة: arxiv.org/pdf/2508.21376
- AL-QASIDA: arxiv.org/abs/2412.04193
- لوحة QIMMA العربية: huggingface.co/blog/tiiuae/qimma-arabic-leaderboard