الأرقام أولًا
| المقياس | النتيجة | ما الذي يقيسه | المصدر |
|---|---|---|---|
| Artificial Analysis Intelligence Index | 52، الثاني بين النماذج المفتوحة الاستدلالية | ذكاء عام مركّب | Artificial Analysis، 2026 |
| GDPval-AA | 1554، الأول بين المفتوحة في المهام الوكيلية | أداء على مهام عمل حقيقية | Artificial Analysis |
| المعمارية | 1.6 تريليون معامل إجمالي، و49 مليار نشط | الحجم والكلفة | Artificial Analysis |
| نافذة السياق | مليون رمز، بزيادة ثمانية أضعاف عن V3.2 | حجم المعالجة | Artificial Analysis |
| السعر | 1.74 و3.48 دولار لكل مليون رمز | التكلفة | Artificial Analysis |
| الرخصة | MIT، أوزان مفتوحة | إمكانية التشغيل محليًا | Artificial Analysis |
| HELM Arabic، سلفه V3.1 | ضمن أفضل عشرة نماذج مفتوحة الأوزان | أداء عربي على سبعة مقاييس أصيلة | Stanford CRFM و Arabic.AI، كانون الأول 2025 |
| أي قياس منشور للتشكيل أو الصرف | لا يوجد لهذا الإصدار | دقة البنية الصرفية والتشكيل | مسح المصادر العامة |
النموذج مفتوح الأوزان برخصة MIT، وهذه ليست تفصيلة قانونية بل هي سبب كتابتي عنه: أي جامعة أو شركة عربية تستطيع تشغيله محليًا وقياسه بنفسها، دون إذن من أحد ودون إرسال بيانات إلى الخارج. ولهذا فإن سؤال “كيف حاله مع العربية” له هنا وزن عملي مختلف.
المحور المنسي في التقييم العربي
حين يتحدث الناس عن قدرة النماذج بالعربية، ينصرف الكلام عادة إلى المعرفة والثقافة واللهجة. أما البنية نفسها، الصرف والنحو والإملاء والتشكيل، فتُعامَل وكأنها مسألة محلولة. وهي ليست كذلك.
العربية تكتب بلا حركات قصيرة في الاستعمال اليومي. معنى ذلك أن القارئ، بشرًا كان أم نموذجًا، يستنتج الحركة من السياق:
أربعة معانٍ في ثلاثة حروف. والنموذج الذي يخطئ هنا لا يخطئ في التشكيل فقط، بل يقلب فاعل الجملة ومفعولها. وهذه ليست مسألة نظرية: مقياس NADI 2025 لاستعادة التشكيل في اللهجات المنطوقة سجّل 55 WER و13 CER في أفضل الأنظمة المشاركة، أي أن أكثر من نصف الكلمات خرجت بتشكيل خاطئ عند أحسن المتنافسين.
بطاقة النموذج
| البند | التفصيل |
|---|---|
| الاسم | DeepSeek V4 Pro |
| الجهة | DeepSeek |
| تاريخ الإصدار | 24 نيسان 2026، ومعه V4 Flash |
| النوع | نموذج هجين بين التفكير والاستجابة المباشرة |
| المدخلات | نص فقط |
| الرخصة | MIT |
| المحور المختبَر | ARAB-LING: الصرف، النحو، الإملاء، التشكيل |
الاختبار: عشرة بنود تكشف البنية
هذه البنود مبنية على الأخطاء التي أراها فعليًا في مخرجات النماذج العربية، لا على كتاب نحو. كل بند منها يكشف طبقة مختلفة.
1. مطابقة جمع غير العاقل. اطلب منه وصف كتب ومدن وسيارات. الصواب: “الكتب جديدة” و”المدن كبيرة“. الخطأ الشائع: “الكتب جُدد” و”السيارات سريعات”. هذا أكثر خطأ نحوي أراه في العربية المولَّدة آليًا، وأسهل اختبار يكشف نموذجًا يترجم بنية إنجليزية إلى كلمات عربية.
2. المطابقة حسب رتبة الفعل. اطلب جملتين بالمعنى نفسه، واحدة يتقدم فيها الفعل والأخرى يتقدم فيها الفاعل. الصواب: “ذهب الطلابُ” مع الفعل المتقدم، و”الطلابُ ذهبوا” مع الفاعل المتقدم. الخطأ: “ذهبوا الطلاب”.
3. الإضافة. اطلب صياغة “كتاب الطالب الجديد” بحيث يكون الجديد وصفًا للكتاب. الصواب أن يعرف أن المضاف لا يقبل “ال” ولا التنوين، وأن الصفة لا تدخل بين المضاف والمضاف إليه. هذا البند يسقط فيه كثير من النماذج القوية.
4. تمييز العدد. اطلب صياغة ثلاثة وسبعة وأحد عشر وعشرين مع معدود مذكر ومؤنث. الصواب: “ثلاثةُ رجالٍ” و”ثلاثُ فتياتٍ” مع المخالفة، و”عشرون كتابًا” بالمفرد المنصوب.
5. التشكيل الفارق. أعطه جملة فيها “درس” وسياقًا يقتضي التضعيف، واطلب التشكيل مع التعليل.
6. الهمزة. اطلب كتابة: رئيس، مسؤول، سأل، شيء، مبتدئون. الخطأ هنا يكشف نموذجًا تدرّب على نصوص عربية رديئة الإملاء، وهو مؤشر غير مباشر على جودة بيانات تدريبه العربية.
7. التاء المربوطة والهاء. اطلب التفريق بين “مدرسته” و”مدرسةٌ” في سياق واحد.
8. الألف المقصورة والياء. “على” حرف الجر مقابل “عليّ” الاسم، و”إلى” مقابل “إلي”.
9. الترقيم العربي. اطلب فقرة مرقّمة بعلامات عربية: الفاصلة “،” والفاصلة المنقوطة “؛” وعلامة الاستفهام “؟”. النموذج الذي يخرج فاصلة إنجليزية في نص عربي يكشف أنه يعامل العربية كترميز فوق الإنجليزية.
10. التدقيق العكسي. أعطه فقرة فيها خمسة أخطاء مقصودة واطلب منه أن يجدها ويصححها ويعلّل. هذا أقوى بند في القائمة، لأن التوليد الصحيح قد يكون حفظًا، أما اكتشاف الخطأ فيحتاج معرفة بالقاعدة.
لماذا يخدعك المقياس المنشور
في لوحة OALL بنسختها الثانية يوجد مقياس اسمه MadinahQA مخصص لمعرفة اللغة العربية وقواعدها، وهو موجود أيضًا ضمن مقاييس HELM Arabic السبعة. والخبر الجيد أن هذا المقياس موجود أصلًا. والخبر الأقل جودة أنه، مثل معظم ما حوله، أسئلة اختيار من متعدد.
والفرق بين “اختر الإجابة الصحيحة عن قاعدة نحوية” و”اكتب لي فقرة سليمة نحويًا” هو الفرق بين طالب يحفظ القاعدة وكاتب يتقنها. النموذج قد يجيب عن سؤال في مطابقة جمع غير العاقل إجابة صحيحة، ثم يكتب في الفقرة التالية “الكتب جُدد”. رأيت هذا أكثر من مرة.
ولهذا أضع في ARAB-LENS قاعدة: لا تقبل درجة قواعد من اختبار اختيار من متعدد وحده. القياس الحقيقي هو معدل الخطأ في نص مولَّد بطول خمسمئة كلمة، محسوبًا يدويًا على ست فئات: المطابقة، والإضافة، والعدد، والهمزة، والتاء، والترقيم.
الحكم العملي
النموذج المفتوح برخصة MIT يعطي ميزة لا تعطيها النماذج المغلقة: تستطيع أن تضبطه (fine-tune) على عربية سليمة بنفسك. وهذه أهم توصية في المقالة.
- لا تعتمد على نموذج عام للتدقيق اللغوي العربي. اجعل التدقيق طبقة منفصلة بقواعد صريحة، ثم اجعل النموذج يقترح والقاعدة تحكم.
- قِس بمعدل الخطأ لكل ألف كلمة، لا بانطباع. ست فئات، وعدّ يدوي لخمس عينات، وستعرف نموذجك أكثر مما تعرفه أي لوحة.
- استثمر في بيانات عربية سليمة الإملاء إن كنت ستضبط النموذج. جودة الهمزة في المخرجات تتبع جودة الهمزة في البيانات، بلا استثناء تقريبًا.
- إن كان منتجك تعليميًا، فالتشكيل ليس رفاهية. ومع أرقام NADI الحالية، لا تسلّم التشكيل الآلي للمستخدم النهائي بلا مراجعة.
في المقالة القادمة
أنتقل إلى الطرف الآخر من الطيف: نموذج عربي بُني لهذه اللغة تحديدًا. Falcon-H1-Arabic من معهد الابتكار التكنولوجي في أبوظبي، ومعه أرقام لوحة OALL كاملة، وسؤال واحد: هل التخصص في العربية يهزم الحجم؟
المقاييس نفسها ليست نظيفة
هناك اكتشاف نُشر في نيسان 2026 يستحق أن يعرفه كل من يستشهد بلوحات الصدارة العربية. لوحة QIMMA التي أطلقها معهد الابتكار التكنولوجي بنت منهجيتها على فكرة مختلفة: بدل تجميع المقاييس الموجودة كما هي، مرّرتها أولًا على خط تحقق من الجودة، بمراجعة آلية متعددة النماذج ثم مراجعة بشرية، وحذفت العينات المعطوبة قبل التقييم.
والنتيجة كاشفة: مقياس ArabicMMLU، وهو من أكثر المقاييس استشهادًا في تقييم العربية، سُجّلت فيه نسبة استبعاد بلغت 3.1٪ بسبب مشكلات في جودة الإجابات وتنسيق النص.
ثلاثة بالمئة رقم صغير في ظاهره، لكنه في التقييم رقم كبير: الفروق بين النماذج المتقاربة في الصدارة غالبًا أقل من ثلاث نقاط. أي أن ضجيج المقياس نفسه قد يساوي أو يتجاوز الفرق الذي تُبنى عليه ترتيبات كاملة.
وأرقام QIMMA الأخرى تستحق الذكر: أكثر من 52 ألف عينة عبر أربعة عشر مقياسًا وسبعة مجالات، و99٪ من محتواها عربي أصيل لا مترجَم، وهي أول لوحة عربية تضيف تقييم توليد الشيفرة. وفي نتائجها الأولى تصدّر نموذج Qwen3.5-397B-A17B بمتوسط 68.06، يليه Karnak بـ66.20، ثم Jais-2-70B-Chat بـ65.81. والملاحظة التي خرجت بها اللوحة نفسها مهمة: النماذج العربية المتخصصة تتقدم في المهام الثقافية واللغوية، بينما تتقدم النماذج المتعددة اللغات في الشيفرة.
ما يشتكي منه المعرِّبون فعلًا
في مجتمعات التعريب والترجمة العربية، قائمة الشكاوى من مخرجات النماذج مستقرة منذ سنوات، وهي بترتيب التكرار:
- الالتباس في النص غير المشكّل، وتحديدًا الخلط بين صيغ الفعل المجرد والمزيد.
- أخطاء المطابقة في الجمع، وأشهرها معاملة جمع غير العاقل معاملة العاقل.
- الترجمة الحرفية للتعابير الاصطلاحية.
- ضعف التبديل اللغوي، فيترجم المصطلح التقني الذي لا يُترجَم عادة.
- ضعف المصطلح التخصصي في الطب والقانون والهندسة.
وهذه القائمة تطابق بنود الاختبار في هذه المقالة بندًا ببند تقريبًا، وهذا التطابق نفسه هو الحجة: حين يتفق ما يرصده المعرِّب في عمله اليومي مع ما يكشفه اختبار مصمَّم، فأنت أمام نمط فشل حقيقي لا صدفة.
دفتر التدقيق: ست فئات وأمثلة من الأخطاء الحقيقية
هذه الفئات الست هي ما أعدّه في كل نص عربي مولَّد، ومعها في هذا الجدول أمثلة على الشكل الذي يظهر به الخطأ فعلًا، وتصحيحه:
| الفئة | الخطأ كما يظهر في المخرجات | الصواب | لماذا يقع |
|---|---|---|---|
| مطابقة جمع غير العاقل | الكتب جُدد والمدن كبار | الكتب جديدة والمدن كبيرة | نقل بنية الجمع الإنجليزية إلى العربية |
| رتبة الفعل والفاعل | ذهبوا الطلابُ إلى الصف | ذهب الطلابُ، أو الطلابُ ذهبوا | تجاهل أثر التقديم والتأخير على المطابقة |
| الإضافة والتعريف | الكتابُ الطالبِ الجديد | كتابُ الطالبِ الجديد | إدخال أل على المضاف |
| تمييز العدد | ثلاث رجالٍ وثلاثة فتياتٍ | ثلاثةُ رجالٍ وثلاثُ فتياتٍ | جهل قاعدة المخالفة في العدد |
| الهمزة | مسئول، شئ، مبتدؤون | مسؤول، شيء، مبتدئون | تدريب على نصوص عربية رديئة الإملاء |
| الترقيم | جملة عربية تنتهي بـ ? أو , | جملة تنتهي بـ ؟ أو ، | معاملة العربية ترميزًا فوق الإنجليزية |
الصف الأول وحده يكشف أكثر من نصف ما أحتاج معرفته عن نموذج: من يكتب “الكتب جُدد” يترجم بنية، ومن يكتب “الكتب جديدة” يكتب عربية.
كيف يتحول العدّ إلى رقم
الطريقة التي أستعملها: خمسة نصوص بطول خمسمئة كلمة في مجال واحد، أي ألفان وخمسمئة كلمة، ثم عدّ يدوي في الفئات الست، ثم ضرب الناتج في أربعة للحصول على المعدل لكل ألف كلمة.
مثال حسابي توضيحي: لو عددتَ في الألفين وخمسمئة كلمة سبعة أخطاء مطابقة، وثلاثة في الإضافة، وخمسة في الهمزة، فالمعدل لكل ألف كلمة هو 2.8 و1.2 و2.0 على الترتيب، ومجموع معدل الخطأ اللغوي ستة لكل ألف كلمة.
الرقم في ذاته لا يعني شيئًا حتى تكرّره. قيمته تظهر حين تقيس النموذج نفسه بعد ستة أشهر، أو حين تقارن نموذجين على النصوص ذاتها. عندها يصير عندك ما لا تعطيه أي لوحة عامة: منحنى خاص بنوع الكتابة التي يحتاجها منتجك أنت.
وقاعدة عملية من خبرتي: الأخطاء لا تتوزع بالتساوي. الهمزة والترقيم يتحسنان بسرعة مع كل جيل جديد، أما المطابقة والإضافة فتبقى عنيدة، لأنها بنيوية لا إملائية. فإن وجدت نموذجًا أخطاؤه الإملائية قليلة وأخطاؤه البنيوية كثيرة، فأنت أمام نموذج تدرّب على عربية كثيرة ولم يتعلم قواعدها، وهذا أسوأ من العكس.
من دفتر التدقيق: خمس جمل أستعملها في كل مرة
هذه الجمل الخمس قصيرة ومملة عمدًا، ولا تحتاج معرفة بالنموذج ولا أدوات. أرسلها كما هي وأقرأ الرد بعين المدقق:
الجملة الأولى: اكتب فقرة عن ثلاث مدن سورية قديمة. ما أراقبه: “المدن القديمة” لا “المدن القدماء”، و”ثلاث مدن” بالتأنيث المخالف لا “ثلاثة مدن”.
الجملة الثانية: صف لي خمسة كتب اشتريتها. ما أراقبه: “خمسة كتب” بالتذكير لأن الكتاب مذكر، و”الكتب مفيدة” لا “الكتب مفيدون”.
الجملة الثالثة: اكتب جملة فيها اسم الطالب وصفة للكتاب. ما أراقبه: “كتابُ الطالبِ الجديد” لا “الكتابُ الطالبِ الجديد”، وعدم إقحام الصفة بين المضاف والمضاف إليه.
الجملة الرابعة: اكتب سؤالًا ثم جوابًا بعلامات ترقيم عربية. ما أراقبه: “؟” و”،” العربيتين لا “?” و”,” الإنجليزيتين. هذا البند يكشف بسرعة إن كان النموذج يعامل العربية لغةً أم ترميزًا.
الجملة الخامسة: صحّح لي هذه الفقرة وبيّن سبب كل تصحيح: “الطلاب الذين نجحوا في الإمتحان كانوا خمسة طالبات، وقد قرأة المدرسة أسمائهم على الملاء.” هنا خمسة أخطاء مقصودة: “الإمتحان” بهمزة قطع خاطئة، و”خمسة طالبات” بخلل في المخالفة، و”قرأة” بدل “قرأت”، و”أسمائهم” بدل “أسماءهم”، و”الملاء” بدل “الملأ”. النموذج الذي يجد ثلاثة منها ويعلّل جيد، والذي يجد الخمسة ويعلّل ممتاز، والذي يعيد كتابة الفقرة بلا تعليل لم يُختبَر أصلًا.
أثر غياب التشكيل، بمثال واحد
هذه الجملة بلا حركات تحتمل قراءتين متناقضتين:
“علّم المدير الموظف الجديد.”
هل المدير علّم الموظفَ، أم أن المديرَ هو من تعلّم؟ وهل “علّم” بمعنى درّس أم بمعنى وضع علامة؟ المتحدث العربي يحسم من السياق فورًا، والنموذج يحسم أحيانًا بالاحتمال الأعلى إحصائيًا لا بالسياق.
ولهذا أضع في كل تقييم بندًا واحدًا من هذا النوع: جملة ملتبسة مع سياق يحسمها، وأسأل عن القراءة الصحيحة والسبب. الفشل هنا ليس فشلًا في التشكيل، بل في الفهم، وهذا ما يجعله مهمًا.
المصادر
- Artificial Analysis، عودة DeepSeek مع V4 Pro و V4 Flash: artificialanalysis.ai/articles/deepseek-is-back-among-the-leading-open-weights-models-with-v4-pro-and-v4-flash
- HELM Arabic، Stanford CRFM مع Arabic.AI: crfm.stanford.edu/2025/12/18/helm-arabic.html
- لوحة OALL النسخة الثانية: huggingface.co/blog/leaderboard-arabic-v2
- NADI 2025، استعادة التشكيل للهجات المنطوقة: arxiv.org/abs/2509.02038
- لوحة QIMMA العربية ومنهجية تنقية العينات: huggingface.co/blog/tiiuae/qimma-arabic-leaderboard
- اختبار ممارسين لثمانية نماذج في الترجمة العربية: localazy.com/blog/ai-8-llm-arabic-models-tested-to-translate