الأرقام أولًا
| المقياس | النتيجة | ما الذي يقيسه | المصدر |
|---|---|---|---|
| HLE | 59.1٪ (أفضل نتيجة سابقة 55.5٪) | أسئلة خبراء بالغة الصعوبة | Artificial Analysis، أيلول 2026 |
| Terminal-Bench v2.1 | 91.4٪ | تنفيذ مهام تقنية | Artificial Analysis |
| SciCode | 62.0٪ | برمجة علمية | Artificial Analysis |
| AA-Omniscience (الدقة) | 67.2٪ | معرفة عامة مع مقاومة الاختلاق | Artificial Analysis |
| نافذة السياق | مليون رمز | حجم النص الذي يعالجه دفعة واحدة | Artificial Analysis |
| السعر | 10 دولارات إدخال و50 إخراج لكل مليون رمز | التكلفة التشغيلية | Artificial Analysis |
| Global-MMLU-Lite بالعربية، عائلة Claude | Claude Opus 4.6 عند 92 و Opus 4.5 عند 91 | معرفة واستدلال عام بالعربية | Artificial Analysis، مؤشر اللغة العربية |
| أي قياس منشور لتوليد اللهجة | لا يوجد | قدرة النموذج على الكتابة بلهجة فعلية | مسح المصادر العامة |
انظر إلى آخر سطرين معًا، فهما موضوع هذه المقالة. عائلة Claude تسجّل 91 و92 على أسئلة عربية عامة، وهذا رقم ممتاز بأي مقياس. ومع ذلك لا يوجد في العالم رقم منشور واحد يقول لك: إذا طلبتَ من هذا النموذج أن يكتب لك ردًّا بالسورية، هل يخرج كلامًا يقوله سوري فعلًا؟
الفرق بين السؤالين هو الفرق بين معرفة اللغة وامتلاكها.
المشكلة التي لا تظهر في أي لوحة قياس
جرّب هذا بنفسك: اطلب من أي نموذج قوي أن يكتب لك رسالة اعتذار عن تأخير، باللهجة السورية. في الغالب ستحصل على شيء من هذا النوع:
“أعتذر منك كثيراً على التأخير، شو ما بدي أزعجك، وأنا هلق سوف أرسل لك الملف حالاً.”
هذه ليست سورية. هذه فصحى ارتدت ثلاث كلمات شامية ومشت. المشكلة ليست في المفردات، بل في كل ما تحتها: بنية الجملة فصيحة، وأداة النفي فصيحة، وصيغة المستقبل فصيحة (“سوف أرسل” مقابل “رح بعتلك”)، والإيقاع كله إيقاع كتابة لا إيقاع كلام.
وهذا بالضبط ما يخدع لوحات القياس. أي مقياس يسأل “هل ظهرت كلمة سورية في الرد؟” سيمنح هذه الجملة درجة عالية. ولهذا لا أقيس اللهجة بالمفردات، بل بستة مستويات.
مؤشر أمانة اللهجة (Dialect Fidelity Score)
| المستوى | ما يقيسه | مثال على الفشل |
|---|---|---|
| المفردة | هل الكلمات من اللهجة؟ | استعمال “الآن” بدل “هلق” |
| الصرف | البنية الفعلية والضمائر | “سوف أذهب” بدل “رح روح” |
| التركيب | ترتيب الجملة وأدوات النفي والربط | “لم أستطع” بدل “ما قدرت” |
| الاصطلاح | التعابير الجاهزة الطبيعية | ترجمة تعبير إنجليزي حرفيًا بدل تعبير شامي مقابل |
| السجل | مناسبة النبرة للمخاطَب | مخاطبة صديق بلغة بيان رسمي |
| الطبيعية | هل يقولها متحدث أصلي هكذا؟ | جملة صحيحة لكنها لا تُقال |
الدرجة من 30، وأضع شرطًا واحدًا: لا يُحتسب نجاح المستوى الأول إلا إذا نجح الثاني والثالث معًا. سبب هذا الشرط أن رشّ كلمات لهجية فوق تركيب فصيح هو أكثر أنماط الفشل شيوعًا وأقلها انكشافًا، وأسمّيه تسرّب الفصحى (MSA leakage).
بطاقة النموذج
| البند | التفصيل |
|---|---|
| الاسم | Claude Fable 5.1 |
| الجهة | Anthropic |
| تاريخ الإصدار | 1 أيلول 2026 |
| صدر معه | Claude Mythos 5.1 |
| نافذة السياق | مليون رمز، نص وصور |
| ادعاؤه عن العربية | لا شيء محدد في مواد الإطلاق |
| المحور المختبَر | ARAB-DIALECT: التوليد والتحويل والسجل |
الاختبار
البند 1، التحويل. أعطِ النموذج جملة فصيحة: “ماذا تفعل الآن؟ أريد أن أعرف متى ستنتهي من العمل.” واطلب تحويلها إلى السورية الدمشقية، ثم إلى الأردنية العمّانية، ثم إلى المصرية. المطلوب الحقيقي ليس “شو عم تعمل هلق؟” فقط، بل أن يختلف الثلاثة اختلافًا بنيويًا لا معجميًا. الفخ: ثلاث جمل متطابقة التركيب بثلاث مفردات مختلفة.
البند 2، سلّم السجل. اطلب المعنى نفسه، وهو الاعتذار عن تأخير التسليم يومين، بست صيغ: لصديق، ولمدير، ولزبون، ولشخص أكبر سنًا، في رسالة واتساب، وفي رد خدمة عملاء. المطلوب أن تتغير البنية والطول ودرجة المباشرة في كل صيغة. الفخ: ست نسخ من الجملة نفسها مع تغيير كلمة الافتتاح.
البند 3، الاصطلاح. اطلب منه أن يواسي شخصًا خسر وظيفته، بالسورية، دون أن يستعمل أي ترجمة حرفية عن الإنجليزية. المتحدث الأصلي هنا يذهب إلى تعابير مثل “الله بيعوّض عليك خير” و”ما بتروح تعب” و”كل تأخيرة وفيها خيرة”. النموذج الضعيف يكتب “أنا آسف جداً لسماع هذا الخبر”، وهي جملة إنجليزية تلبس عربية.
البند 4، كشف التسرّب. خذ رد النموذج بالسورية، واحذف منه كل كلمة لهجية صريحة (شو، هلق، ليش، عم، بدي، مو). ثم اقرأ ما تبقّى. إذا كان الباقي فصحى سليمة تمامًا، فالنموذج لم يكتب سورية، بل كتب فصحى وزيّنها. هذا الاختبار البسيط أدقّ من أي مقياس معجمي رأيته.
البند 5، الأمانة العكسية. أعطه فقرة سورية طبيعية واطلب منه تقييم مدى سوريّتها من عشرة مع التعليل. النموذج الذي يفهم اللهجة يستطيع نقدها. النموذج الذي يحفظ مفرداتها يمدح أي نص فيه “هلق”.
ما تقوله الأرقام المتاحة عن السياق
| القياس | الرقم | القراءة |
|---|---|---|
| DialectalArabicMMLU، متوسط اللهجات | 47.7٪ مقابل 51.9٪ للفصحى | الفهم نفسه ينخفض مع اللهجة، فكيف بالتوليد |
| اللهجة السورية في القياس ذاته | 46.6٪ | السورية من الأصعب على النماذج |
| الترجمة إلى الفصحى كمساعد | 0.3 نقطة فقط | الفصحى ليست جسرًا إلى اللهجة |
| PalmX 2025، الثقافة العربية | 72.15٪ للفائز | حتى الفهم الثقافي لم يتجاوز منتصف السبعينات |
ولاحظ مفارقة مهمة: هذه كلها مقاييس فهم، أي اختيار من متعدد. أما التوليد فلا يكاد يُقاس، لأن قياسه يحتاج متحدثين أصليين يحكمون على الطبيعية، وهذا مكلف وبطيء، فتتجنبه اللوحات. النتيجة أن أضعف قدرة في النماذج هي أقلها قياسًا.
الحكم العملي
النموذج الذي يسجّل 91 و92 على المعرفة العربية العامة سيكون مساعدًا ممتازًا في التلخيص والتحرير بالفصحى، وهذا وحده يكفي لكثير من المنتجات. لكن إذا كان منتجك يتكلم مع الناس بلهجتهم، وهو حال أي تطبيق خدمة عملاء أو تعليم أو صحة في المنطقة، فهذه توصياتي:
- اختبر بمنهج الحذف (البند 4) قبل أن تصدّق أي مخرَج لهجي. عشر ثوانٍ تكشف تسرّب الفصحى.
- لا تعتمد على prompt واحد فيه كلمة “بالسورية”. اعطِ النموذج ثلاثة أمثلة حقيقية مكتوبة بيد متحدث أصلي داخل الطلب نفسه، وستتضاعف الطبيعية.
- اجعل المراجعة البشرية على السجل لا على الإملاء. أخطاء اللهجة التي تُغضب المستخدم ليست إملائية، بل نبرة في غير مكانها.
في المقالة القادمة
من النص إلى الصوت: أنتقل إلى Gemini 3.8 Flash وإلى السؤال الذي يقلق كل من يبني منتجًا صوتيًا عربيًا، وهو الفرق بين أن يسمع النموذج الكلمات وأن يفهم ما قيل، ومعه أرقام NADI 2025 كاملة.
ما يقوله البحث: أول رقم حقيقي لتوليد اللهجة
كتبت أعلاه أنه لا يوجد قياس منشور لتوليد اللهجة على لوحات الصدارة، وهذا صحيح. لكن خارج اللوحات يوجد عمل أكاديمي جاد يستحق أن يُعرف، وهو AL-QASIDA.
الدراسة قاست تسعة نماذج، بينها GPT-4o ونماذج عربية متخصصة، على ثماني لهجات موزّعة على المناطق الكبرى: الكويت والسعودية وسوريا وفلسطين والسودان ومصر والجزائر والمغرب. وقاست أربعة أشياء منفصلة: الأمانة (هل ينتج اللهجة المطلوبة؟)، والفهم، والجودة، والازدواج اللغوي (الترجمة بين اللهجة والفصحى).
النتائج بالأرقام:
| القياس | النتيجة | ماذا يعني |
|---|---|---|
| ADI2 في الوضع أحادي اللغة | أقل من 50٪ في جميع النماذج تقريبًا | النص المولَّد لا ينتمي إلى اللهجة المطلوبة نصف الوقت على الأقل |
| GPT-4o في الوضع عبر اللغوي | لم يتجاوز 13٪ على نصف اللهجات | الفشل ليس هامشيًا بل هو القاعدة |
| الارتباط بين ALDi و ADI2 | 0.99 | حين يفشل النموذج في اللهجة فإنه ينتج الفصحى، لا لغة ثالثة |
| التقييم البشري | ردود طليقة وكافية المعنى، وغالبًا ليست باللهجة المطلوبة | تسرّب الفصحى موثّق بشريًا، لا مجرد انطباع |
الرقم الثالث هو الأهم عندي: ارتباط 0.99 بين المقياسين معناه أن الفشل له وجهة واحدة معروفة. النموذج لا يخطئ بأن ينتج لهجة أخرى، بل يهرب دائمًا إلى الفصحى. وهذا يؤكد أن ما أسميه تسرّب الفصحى ليس تعبيرًا بلاغيًا، بل ظاهرة قابلة للقياس ومقيسة فعلًا.
وماذا يقول الممارسون
في مقارنات الممارسين العرب المنشورة خلال العام الماضي، يتكرر حكم عام بأن عائلة Claude من الأفضل في التعامل مع السياق الثقافي واللهجي وبأقل معدل اختلاق، بينما توصف نماذج أخرى بأنها قوية في الفصحى ومتوسطة في اللهجة، أو دقيقة الفهم لكن رسمية النبرة.
وأنبّه هنا إلى أمرين: هذه تقارير ممارسين لا دراسات محكّمة، ومنهجياتها غير موحّدة، فتُقرأ بوصفها إشارات اتجاه لا أرقامًا. والثاني أن اتفاق هذه التقارير مع نتيجة AL-QASIDA في نقطة واحدة تحديدًا، وهي أن النبرة الرسمية هي الوضع الافتراضي، يجعل هذه النقطة أجدر بالتصديق من غيرها.
من دفتر الاختبار: ما الذي يجعل الجملة سورية فعلًا
لا أقبل من نموذج جملة “سورية” حتى تمرّ على خمسة فحوص بنيوية. وهذه الفحوص مرتبة من الأسهل إلى الأصعب، ومعها المقابل الفصيح حتى يتضح الفرق:
| الفحص | الصيغة الشامية | الصيغة الفصيحة التي تفضحه |
|---|---|---|
| المستقبل | رح بعتلك، حبعتلك | سوف أرسل لك |
| النفي | ما بعرف، ما قدرت | لا أعرف، لم أستطع |
| الاستمرار | عم بكتب، عم اشتغل | أكتب الآن، أعمل حاليًا |
| الملكية | كتابك، تبعك، إلك | الخاص بك، لديك |
| الموصول | يلي حكيتلك عنه | الذي حدثتك عنه |
النموذج الذي ينجح في الخمسة كتب سورية. والذي ينجح في المفردات ويسقط في هذه الخمسة كتب فصحى ملوّنة.
اختبار اللكنة داخل اللهجة الواحدة
هنا يبدأ الجزء الذي يميّز تقييمي عن أي قياس منشور: الشامية ليست لهجة واحدة. وأنا أختبر النموذج على فروق داخلها، وهذه أربعة منها أستعملها دائمًا:
واحد، تاء التأنيث. الدمشقي يقول “شجرِة” و”مدرسِة” بإمالة واضحة، والحمصي والحموي أقرب إلى الفتح “شجرَة”. اطلب من النموذج أن يكتب حوارًا دمشقيًا ثم حمصيًا، وانظر هل يتغير شيء غير أسماء الأماكن.
اثنان، القاف. دمشق وبيروت همزة، وكثير من الريف والساحل قاف، وشمال الأردن والبادية گاف. النموذج الذي يكتب “گال” داخل حوار دمشقي أخطأ خطأً لا يقع فيه أي متحدث أصلي.
ثلاثة، ضمير المخاطبة. في الشامية “إنتِ بتعرفي”، وفي بعض المناطق تُختصر النون، وفي الخليجية “إنتِ تعرفين” أو “تعرفينْ”. النماذج تخلط هنا كثيرًا لأن البيانات الخليجية والشامية متداخلة في تدريبها.
أربعة، الصيغة الحلبية. حلب لها معجم خاص وإيقاع مختلف عن دمشق. اطلب جملة “حلبية” تحديدًا. إن خرجت مطابقة للدمشقية، فالنموذج يعرف لهجة واحدة اسمها “سورية” ولا يعرف سوريا.
الشكل الذي يسقط في الفحص
هذه جملة تمرّ على أي مقياس معجمي وتسقط عندي:
“أهلاً، شو أخبارك؟ أنا هلق سوف أرسل لك الملف، ولم أستطع إرساله سابقًا لأن الإنترنت الخاص بي كان ضعيفًا.”
فيها ثلاث كلمات شامية في أولها، وكل ما بعدها فصيح: “سوف أرسل” بدل “رح بعتلك”، و”لم أستطع” بدل “ما قدرت”، و”الإنترنت الخاص بي” بدل “النت تبعي”. هذه ليست سورية، وأي متحدث أصلي يكتشفها في ثانيتين.
والصيغة المقبولة للمعنى نفسه:
“أهلين، شو أخبارك؟ رح بعتلك الملف هلق، ما قدرت ابعتو قبل لأن النت تبعي كان واقع.”
المصادر
- Artificial Analysis، تقييم Claude Fable 5.1: artificialanalysis.ai/articles/claude-fable-5-1
- Artificial Analysis، مؤشر اللغة العربية Global-MMLU-Lite: artificialanalysis.ai/models/multilingual/arabic
- Anthropic، صفحة الأخبار والإطلاق: anthropic.com/news
- DialectalArabicMMLU، LREC 2026: arxiv.org/abs/2510.27543
- PalmX 2025: arxiv.org/abs/2509.02550
- AL-QASIDA، قياس أمانة اللهجة عبر ثماني لهجات: arxiv.org/abs/2412.04193
- مقارنات ممارسين عرب للنماذج بالعربية: kuwaitai.net و arabie.ai