سنتان في العربية: ما الذي تغيّر فعلًا منذ Claude 3.5 Sonnet و Gemini 2.5 Pro

وقت القراءة: 9 دقيقة
18
إصدارا الأساس: تشرين الأول 2024 و25 آذار 2025 | تاريخ النشر: 8 نيسان 2025 إيهاب صالح | techkahwa.net

الأرقام أولًا

ما تغيّرقبلبعدالمصدر
لوحة OALLنسخة أولى تعتمد جزئيًا على مقاييس مترجمة آليًانسخة ثانية حذفت المترجَم واعتمدت مقاييس أصيلة: ArabicMMLU و MadinahQA و AraTrust و ALRAGEOALL v2
قياس الكلام العربيلا مهمة مشتركة متعددة اللهجاتNADI 2025، أول مهمة مشتركة لمعالجة الكلام العربي متعدد اللهجاتArabicNLP 2025
قياس الثقافةمدمج مع المعرفة الدينية أو غائبPalmX 2025 يفصل الثقافة العربية عن الإسلاميةArabicNLP 2025
قياس الحوارلا يوجد مقياس عربي واسعShawarma Chats: 30 ألف حوار من ستة أدوارArabicNLP 2025
قياس اللهجةمتفرقDialectalArabicMMLU: 21,945 سؤالًا عبر خمس لهجات و32 مجالًاLREC 2026
لوحة مستقلة شاملةلا توجدHELM Arabic من ستانفورد مع Arabic.AI، سبعة مقاييسStanford CRFM، كانون الأول 2025
النماذج العربيةJais و ALLaM 13B و AceGPTJais 2 بـ70 مليارًا، و Fanar 2.0 بـ27 مليارًا متعدد الوسائط، و Falcon-H1-Arabic حتى 34 مليارًا، و ALLaM 34Bإعلانات الجهات، 2025 و2026
نمو البنية التحتية للقياس العربي
2024
لوحة واحدة، مقاييس مترجمة جزئيًا
2025
مقاييس أصيلة، وصوت، وثقافة، وحوار
2026
لوحة مستقلة + لهجات + نماذج عربية جديدة

هذا تقدم حقيقي وسريع، ويستحق أن يُقال بوضوح: البنية التحتية لقياس العربية في 2026 أفضل بكثير مما كانت عليه في 2024. الفضل فيه لفرق عربية أكاديمية وصناعية عملت بميزانيات أصغر بكثير من ميزانيات من يقيس الإنجليزية.

والآن الوجه الآخر.


ما لم يتغيّر

المشكلةحالتها اليومالدليل
الفجوة بين اللهجة والفصحى والإنجليزيةقائمة47.7٪ و51.9٪ و62.8٪، DialectalArabicMMLU
الفصحى ليست جسرًا إلى اللهجةمؤكدة برقمالترجمة إلى الفصحى ترفع 0.3 نقطة فقط، مقابل 5.6 للإنجليزية
توليد اللهجةغير مقيس في أي لوحة عامةمسح مقاييس OALL و HELM Arabic
البراغماتيةغير مقيسةالمسح نفسه
الشاميةالأضعف في القياسات المتاحة46.6٪ في DialectalArabicMMLU، و2.73 من 5 في تقييم ALLaM المستقل
تفريغ الكلام اللهجيأكثر من ثلث الكلمات خطأ35.68 WER في أفضل نظام، NADI 2025
التنميط اللهجيلا يوجد مقياسمسح المصادر العامة

وهذه هي الخلاصة التي أخرج بها بعد سنتين: تحسّن ما كان قابلًا للقياس، وبقي ما يصعب قياسه على حاله. وليست مصادفة أن ما يصعب قياسه هو بالضبط ما يحدد نجاح المنتج العربي عند المستخدم: اللهجة، والنبرة، والمقصد، والعادة الاجتماعية.


بطاقتا الأساس

البندClaude 3.5 SonnetGemini 2.5 Pro
الجهةAnthropicGoogle
التاريخحزيران 2024، ونسخة محدّثة في 22 تشرين الأول 202425 آذار 2025، نسخة تجريبية
ما مثّلاهجيل ما قبل الاستدلال الموسّعبداية جيل سلاسل التفكير
أثرهما العربيمستوى فصحى جيد، ولهجة ضعيفةتحسّن ملموس، مع بقاء الفجوة اللهجية

ونقطة تستحق الذكر عن Gemini 2.5 Pro تحديدًا: في تقييم AHELM الشامل لنماذج الصوت واللغة، سجّل هذا النموذج أعلى أداء عام بمتوسط معدل فوز 0.803 عبر عشرة أبعاد. ومع ذلك رصد التقييم نفسه تحيّزًا جندريًا ذا دلالة إحصائية في بعض مهام الكلام لديه. وهذا تلخيص دقيق لحال هذه المرحلة كلها: قفزة حقيقية في القدرة، مع مشكلات إنصاف لم تُحلّ.


كيف تقيس التقدم بنفسك: مجموعة الأساس الثابتة

أهم درس عملي خرجت به من السنتين الماضيتين هو التالي: ابنِ مجموعة اختبار ثابتة لا تتغير، واختبر بها كل نموذج جديد.

عشرة بنود تكفي:

  1. عبارة لهجية في سياقين متضادين (دبّر حالك).
  2. عبارة اجتماعية في أربعة مواقف (الله يعطيك العافية).
  3. تحويل جملة فصيحة إلى ثلاث لهجات بفروق بنيوية.
  4. سلّم السجل: الرسالة نفسها لستة مخاطبين.
  5. سيناريو ضيافة يقيس الاستدلال الثقافي.
  6. عادة مخترعة لقياس الاختلاق.
  7. سؤال يستحيل حسمه لقياس الاعتراف بالجهل.
  8. حوار ستة أدوار لقياس قراءة العلاقة.
  9. فقرة فيها خمسة أخطاء نحوية لقياس التدقيق.
  10. تسجيل صوتي بلهجتك لقياس التفريغ والفهم.

احفظ النتائج بتاريخها. بعد أربعة نماذج سيصبح لديك شيء لا يملكه أحد: سلسلة زمنية لقدرة النماذج على لهجتك أنت، لا على الفصحى، ولا على متوسط اثنتين وعشرين دولة.

لماذا مجموعة ثابتة أفضل من لوحة عامة
اللوحة تقيس متوسط العربية
→
أنت تبيع للهجة واحدة
اللوحة تتغير بنسخها
→
مجموعتك ثابتة فتُقارن
اللوحة تقيس ما يسهل قياسه
→
أنت تقيس ما يهمك

ثلاث نبوءات قابلة للقياس

أكتبها هنا لأعود إليها لاحقًا، وهذه في رأيي طريقة الكتابة الوحيدة التي تستحق النشر في هذا المجال:

  1. توليد اللهجة سيبقى بلا مقياس عام سنة أخرى على الأقل، لأن قياسه يحتاج متحدثين أصليين لا يمكن استبدالهم بنموذج حَكَم.
  2. الفجوة بين الفصحى واللهجة ستضيق في النماذج العربية المتخصصة قبل النماذج العامة، لأن البيانات هي القيد، والجهات العربية أقدر على جمعها.
  3. أول من يبني مجموعة ذهبية شامية مكتوبة بيد متحدثين أصليين ومغلقة عن التدريب سيملك مرجعًا يعود إليه الجميع. لأن الندرة هنا ليست في النماذج بل في البيانات الموثوقة.

في المقالة الأخيرة من السلسلة

الصوت، وهو أضعف حلقة في العربية اليوم: أرقام NADI 2025 كاملة، ومقارنة بين مسار التفريغ ثم الفهم ومسار النموذج الصوتي المتكامل، وما الذي يجب أن يقيسه أي فريق يبني منتجًا صوتيًا عربيًا قبل أن يطلقه.


ما أضيف إلى الخريطة بعد كتابة هذه المقالة

هذه مقالة عن التغير، فمن الإنصاف أن أضيف ما تغيّر بعدها. طبقتان مهمتان دخلتا الخريطة:

الطبقة الأولى، قياس أمانة اللهجة. دراسة AL-QASIDA قاست تسعة نماذج عبر ثماني لهجات في أربعة أبعاد: الأمانة والفهم والجودة والازدواج اللغوي. وخرجت بأرقام صارت مرجعًا: سقوط أغلب درجات ADI2 تحت 50٪، وارتباط 0.99 بين فشل اللهجة وإنتاج الفصحى، وتقييم بشري يصف المخرجات بأنها طليقة وكافية وغالبًا ليست باللهجة المطلوبة.

الطبقة الثانية، تنقية المقاييس نفسها. لوحة QIMMA في نيسان 2026، بأكثر من 52 ألف عينة وأربعة عشر مقياسًا وسبعة مجالات، أضافت ما لم يكن موجودًا: خط تحقق من جودة العينات قبل التقييم. ونتيجتها الكاشفة أن ArabicMMLU سُجّلت فيه نسبة استبعاد 3.1٪.

خريطة القياس العربي، النسخة المحدَّثة
2024
▸ AL-QASIDA: أول قياس منهجي لأمانة اللهجة
2025
▸ OALL v2: حذف المقاييس المترجمة
▸ NADI: أول مهمة للكلام متعدد اللهجات
▸ PalmX: فصل الثقافة عن الدين
▸ Shawarma Chats: أول مقياس حوار واسع
▸ HELM Arabic: أول لوحة مستقلة شاملة
2026
▸ DialectalArabicMMLU: خمس لهجات و32 مجالًا
▸ QIMMA: تنقية العينات وإضافة البرمجة

التنبؤات، وكيف تُقاس

كتبت ثلاث تنبؤات أعلاه. وهذه معايير الحكم عليها، حتى لا تكون كلامًا عامًا:

التنبؤيتحقق إذايسقط إذا
توليد اللهجة بلا مقياس عام سنة أخرىلم تُضف أي لوحة كبرى مقياس توليد لهجي بحكم بشريأضافت لوحة عامة مقياسًا بحكم متحدثين أصليين
الفجوة تضيق في النماذج العربية أولًانموذج عربي جديد يتجاوز 60٪ في ADI2 قبل أي نموذج عامنموذج عالمي يسبقه
الغلبة لمن يبني مجموعة ذهبية شاميةظهور مجموعة شامية مرجعية يستشهد بها الباحثونبقاء الشامية بلا مجموعة مرجعية

وأعتبر كتابة التنبؤ بمعيار قابل للقياس جزءًا من المهنية: من ينشر رأيًا عن المستقبل ولا يقول متى يكون مخطئًا، لا ينشر رأيًا بل انطباعًا.

ماذا أراقب في الاثني عشر شهرًا القادمة

  1. هل تدخل الشامية مقاييس الحوار؟ Shawarma Chats غطّى الفصحى والمصرية والمغاربية فقط.
  2. هل يظهر مقياس للتنميط اللهجي؟ لا يوجد اليوم واحد.
  3. هل تُنشر سلاسل استدلال عربية كمجموعة بيانات؟ الفجوة الأوضح حاليًا.
  4. هل تبقى المقاييس نظيفة؟ بعد كشف QIMMA، صار سؤال جودة العينة سؤالًا مشروعًا لكل لوحة.

مجموعة الأساس: البنود العشرة التي أعيدها على كل نموذج جديد

أهم قرار اتخذته في السنتين الماضيتين هو أن أثبّت مجموعة اختبار لا تتغير. هذه هي بنودها كاملة، وهي ما أشغّله على كل إصدار جديد في نفس اليوم:

#البندما يقيسهالجواب الذي أقبله
1“دبّر حالك” في موقفي صديق ومديرحساسية السياقمعنيان مختلفان تمامًا
2“الله يعطيك العافية” في أربعة مواقفالوظيفة الاجتماعيةتقدير، إنهاء، شكر، تهكّم
3تحويل جملة إلى ثلاث لهجاتالبنية لا المفرداتاختلاف النفي والمستقبل والتركيب
4الرسالة نفسها لستة مخاطبينالسجلاختلاف الطول والمباشرة
5سيناريو الضيافةالاستدلال الثقافيفهم الإلحاح بوصفه كرمًا
6عادة مخترعة في مدينة حقيقيةالاختلاقاعتراف بعدم المعرفة
7رسالة واتساب من كلمة واحدةالاعتراف بالغموضرفض الحسم
8حوار ستة أدوارقراءة العلاقةعلاقة قريبة، لا مدير وموظف
9فقرة فيها خمسة أخطاء نحويةالتدقيقإيجاد الأخطاء مع التعليل
10تسجيل صوتي بلهجتيالتفريغ والفهمإجابة عن المعنى لا نسخ للنص

عشرة بنود، نصف ساعة عمل، ونتيجة قابلة للمقارنة عبر السنين. وهذا ما لا تعطيه أي لوحة، لأن اللوحات تتغير مقاييسها بين نسخة وأخرى، فتضيع إمكانية المقارنة الزمنية.

ما تغيّر فعلًا في هذه البنود خلال سنتين

أكتب هذا بوصفه ملاحظة شخصية من تشغيل المجموعة نفسها مرارًا، لا رقمًا مقيسًا:

تحسّن بوضوح: البند التاسع، أي التدقيق النحوي. النماذج صارت تجد الأخطاء وتعلّلها بدل أن تعيد كتابة الفقرة صامتة. والبند الثاني، أي الوظيفة الاجتماعية للعبارات الشائعة، تحسّن أيضًا وإن بقي التهكم أصعبها.

لم يتحسن كثيرًا: البند الثالث، أي التحويل البنيوي بين اللهجات. ما زال الناتج مفردات مختلفة على تركيب واحد. والبند السادس، أي العادة المخترعة، ما زال يسقط فيه كثير من النماذج القوية.

بقي كما هو: البند العاشر في شقّه الثاني. التفريغ تحسّن، وفهم المقصود من الكلام المنطوق لم يتحرك كثيرًا.

وهذه الملاحظات هي بالضبط ما يجعل مجموعة ثابتة أثمن من لوحة متغيرة: أنت لا تقيس النموذج فقط، بل تقيس اتجاه الحقل.

المصادر

  • لوحة OALL النسخة الثانية ومنهجية حذف المقاييس المترجمة: huggingface.co/blog/leaderboard-arabic-v2
  • HELM Arabic، Stanford CRFM مع Arabic.AI: crfm.stanford.edu/2025/12/18/helm-arabic.html
  • NADI 2025: arxiv.org/abs/2509.02038
  • PalmX 2025: arxiv.org/abs/2509.02550
  • Shawarma Chats، ArabicNLP 2025: aclanthology.org/2025.arabicnlp-main.39
  • DialectalArabicMMLU، LREC 2026: arxiv.org/abs/2510.27543
  • AHELM، تقييم نماذج الصوت واللغة: arxiv.org/pdf/2508.21376
  • AL-QASIDA: arxiv.org/abs/2412.04193
  • لوحة QIMMA العربية: huggingface.co/blog/tiiuae/qimma-arabic-leaderboard