الأرقام أولًا
| المقياس | النتيجة | ما الذي يقيسه | المصدر |
|---|---|---|---|
| Artificial Analysis Intelligence Index | 53 | ذكاء عام مركّب، بمستوى Claude Fable 5.1 | Artificial Analysis، أيلول 2026 |
| Terminal-Bench v4.0 | 59٪ | تنفيذ مهام على سطر الأوامر | Artificial Analysis |
| AutomationBench-AA | 69٪ | أتمتة مهام متعددة الخطوات | Artificial Analysis |
| AA-Omniscience (نسبة الهلوسة) | 51٪ بعد أن كانت 92٪ | ميل النموذج للاختلاق الواثق | Artificial Analysis |
| Last Translation Benchmark | 44 إلى 45٪ | الحالات الترجمية الصعبة | Slator، أيلول 2026 |
| M-GATE (30 لغة) | متقدم في معظمها، وأضعف من سلفه في البولندية واليابانية والتايلندية والفنلندية | الأداء عبر اللغات | Slator نقلًا عن M-GATE |
| أي مقياس عربي معلن | لا يوجد | قدرة النموذج بالعربية | مواد إطلاق OpenAI |
هذا الجدول هو المقالة كلها في صورة واحدة. نموذج تصفه شركته بأنه قفزة جيلية، ويقيسه العالم على سطر الأوامر وعلى الأتمتة وعلى ثلاثين لغة، ولا يوجد فيه رقم واحد يقول لك كيف يتصرف هذا النموذج حين يكلّمه ثلاثمئة مليون عربي.
لماذا يهمّني هذا الفراغ
قبل سنوات، وأنا أدرّب موظفين أميركيين على العربية المحكية في تكسون، سألني أحدهم سؤالًا يبدو بسيطًا: زميل سوري قال له “دبّر حالك”، فهل هذا تشجيع أم تخلٍّ عنه؟ لم أستطع أن أجيب بكلمة واحدة، لأن الجواب ليس في العبارة بل في من قالها ومتى وبأي نبرة.
هذا بالضبط ما أفتّش عنه في كل نموذج جديد. لا يهمني كم مسألة حلّ، بل هل يعرف متى تكون “دبّر حالك” مؤازرة ومتى تكون إغلاقًا للباب. والمشكلة أن لا أحد يقيس هذا، فيخرج النموذج إلى السوق ومعه رقم 53 في مؤشر الذكاء، ويبني عليه فريق منتج عربي افتراضًا لم يختبره أحد.
وحتى الأرقام اللغوية المتاحة تستحق قراءة متأنية: النجاح في 44 إلى 45٪ فقط من الحالات الترجمية الصعبة ليس رقم نموذج “تجاوز البشر”، والتراجع أمام الإصدار السابق في أربع لغات يقول إن التحسن العام لا يعني تحسنًا لكل لغة. المترجم البشري ما زال متقدمًا في المناطق التي يصعب فيها القرار، وهذه بالضبط هي المنطقة التي تعيش فيها العربية اليومية.
بطاقة النموذج
| البند | التفصيل |
|---|---|
| الاسم | GPT-6 Astra |
| الجهة | OpenAI |
| المعاينة المحدودة | 3 أيلول 2026 |
| الإتاحة العامة | 4 أيلول 2026 |
| ادعاء الشركة | قفزة جيلية في البرمجة والرياضيات والعلوم وأمن المعلومات |
| ادعاؤها عن العربية | لا شيء |
| السعر | 10 دولارات لكل مليون رمز إدخال، و50 دولارًا للإخراج |
| المحور المختبَر هنا | ARAB-PRAG: المقصد والتضمين واللياقة والغموض |
ما تقوله أرقام الآخرين عن العربية
ما دام لا يوجد رقم عربي لهذا النموذج، فلنقرأ ما تقوله القياسات العربية الجادة عن الفئة كلها. هذه أرقام منشورة ومصادرها مذكورة، وهي الخلفية التي يجب أن تُقرأ عليها أي دعاية إطلاق:
| القياس | الرقم | ماذا يعني |
|---|---|---|
| DialectalArabicMMLU (LREC 2026) | 47.7٪ باللهجات مقابل 51.9٪ بالفصحى و62.8٪ بالإنجليزية | الفجوة ليست بين نموذج ونموذج، بل بين اللغة ونفسها |
| الأداء على اللهجة السورية في القياس نفسه | 46.6٪ | أضعف من المصرية والإماراتية والسعودية |
| ترجمة السؤال اللهجي إلى الإنجليزية | تحسّن 5.6 نقطة | النموذج يفهم عبر الإنجليزية لا عبر العربية |
| ترجمته إلى الفصحى | تحسّن 0.3 نقطة فقط | الفصحى ليست جسرًا إلى اللهجة |
| NADI 2025، التعرف على الكلام | 35.68 WER في أفضل نظام | أكثر من ثلث الكلمات المنطوقة تُسمع خطأ |
| NADI 2025، تحديد اللهجة من الصوت | 79.8٪ | مقبول للعائلة اللهجية، لا للمنطقة |
| PalmX 2025، الثقافة العربية | 72.15٪ للفائز | الثقافة أصعب على النماذج من المعرفة الدينية (84.22٪) |
الرقم الرابع في هذا الجدول هو الأهم، وأعتبره أخطر نتيجة نُشرت في تقييم العربية خلال العام الماضي: ترجمة السؤال من اللهجة إلى الفصحى لا تكاد تنفع النموذج، بينما ترجمته إلى الإنجليزية تنفع. معنى ذلك أن ما نسمّيه “قدرة عربية” في كثير من النماذج هو في حقيقته قدرة إنجليزية تمرّ بالعربية مرورًا.
الاختبار الذي لا تجده في أي لوحة قياس
كل بند هنا كتبته بالشامية مباشرة، ولم يولّده نموذج. هذه قاعدة ثابتة عندي في ARAB-LENS: البيانات الذهبية يكتبها متحدث أصلي، والنماذج تُختبَر بها ولا تصنعها.
البند 1، العبارة نفسها في موقفين. الموقف أ: صديق يعتذر عن موعد، فيرد صاحبه “ولا يهمك، دبّر حالك وبعدين خبّرني”. الموقف ب: موظف يطلب تمديدًا، فيرد مديره “أنا ما إلي دخل، دبّر حالك”. الإجابة الذهبية: في الأول تطمين ورفع حرج، وفي الثاني تنصّل وحدّة. الفخ: أن يعطي النموذج المعنى نفسه مرتين، أو أن يترجمهما معًا إلى “اعتنِ بنفسك”.
البند 2، “إن شاء الله بكرا”. المطلوب: عدّ القراءات الممكنة وترتيبها، وتحديد المعلومة الناقصة لحسمها. الإجابة الذهبية أربع قراءات على الأقل: نية فعلية، واحتمال، وتأجيل مهذب، ومجاملة تُنهي النقاش. الفخ: الحسم بمعنى واحد.
البند 3، “الله يعطيك العافية” في أربعة مواقف. لعامل ينزّل أثاثًا، وفي ختام اجتماع طويل، ولصديق أنهى مشوارًا لأجلك، ومن موظف لزميل تأخّر ثلاثة أيام. الوظائف بالترتيب: تقدير للمجهود، وإشارة إنهاء مهذبة، وشكر شخصي، وتهكّم. الفخ: قراءتها دعاءً بالصحة في الأربعة.
البند 4، فخ الحرفية. “على راسي” بعد طلب خدمة. الترجمة الصحيحة وظيفية لا حرفية، و”on my head” فشل كامل.
البند 5، فخ عدم اليقين. رسالة واتساب من زميل فيها كلمة واحدة: “طيب”. هل هو موافق أم منزعج؟ الإجابة الذهبية أن يقول النموذج صراحة إن المعطيات لا تكفي. أي جواب حاسم هنا خطأ، لأن النموذج القوي ليس الذي يجيب دائمًا بل الذي يعرف متى لا يعرف.
البند 6، حوار متعدد الأدوار. ستة أدوار بين صديقين أحدهما متأخر في الطريق، والسؤال عن طبيعة العلاقة ونبرة المتأخر ومعنى “ولا يهمك” في آخر الحوار. الفخ: قراءتها لامبالاة بدل طمأنة.
هذه البنود الستة تكشف ما لا يكشفه أي اختيار من متعدد، لأنها لا تسأل عن معنى الكلمة بل عن وظيفتها.
أنماط الفشل الثلاثة
| النمط | كيف يظهر | لماذا هو خطير |
|---|---|---|
| طليق وخاطئ | عربية مصقولة تشرح معنى غير المقصود | لا يكتشفه إلا متحدث أصلي منتبه |
| حرفية زائفة | ترجمة سليمة لغويًا، خاطئة اجتماعيًا | ينهار المنتج في أول تفاعل حقيقي |
| حسم بلا معطيات | جواب واثق على سؤال لا يحتمل الحسم | يولّد ثقة زائفة لدى المستخدم |
وانخفاض نسبة الهلوسة من 92٪ إلى 51٪ في AA-Omniscience خبر جيد للنمط الثالث، لكنه قياس على معرفة عامة بالإنجليزية غالبًا، ولا يقول شيئًا عن سلوك النموذج حين يُسأل عن عادة اجتماعية شامية لا يعرفها.
الحكم العملي
الحكم على GPT-6 Astra بالعربية لا يمكن أن يُبنى اليوم على رقم، لأن الرقم غير موجود. وهذا في ذاته الخلاصة: من يبني منتجًا عربيًا فوق هذا النموذج يبني على افتراض غير مقيس.
ثلاث توصيات عملية:
- لا تفترض أن النموذج يقرأ المقصد. اجعل واجهتك تسأل المستخدم عمّا تحتاجه بدل أن تخمّنه، خصوصًا في خدمة العملاء والصحة والتعليم.
- اختبر بلهجتك أنت قبل الإطلاق. ستة بنود كالتي فوق تكفي لكشف الفرق بين نموذج يفهم ونموذج يجيد الشكل، وتأخذ منك عشر دقائق.
- لا تقرأ رقم الذكاء العام على أنه رقم عربي. الفارق بين 53 في مؤشر عام و47.7٪ على أسئلة لهجية هو المسافة بين ما يُعلَن وما يحدث عند المستخدم.
في المقالة القادمة
من الفهم إلى الإنتاج: سأقيس قدرة Claude Fable 5.1 على الكتابة بالسورية فعلًا، لا بفصحى مرصّعة بكلمات مثل “شو” و”هلق”، بمؤشر أمانة اللهجة على ستة مستويات.
ما يقوله الميدان والمجتمع البحثي
الفراغ في أرقام العربية لدى المختبرات الكبرى لا يعني أن أحدًا لم يقس. الباحثون العرب قاسوا، والنتائج أقسى مما توحي به لوحات الصدارة.
أهم عمل في هذا الباب هو AL-QASIDA، وهو تقييم منهجي لجودة العربية اللهجية في النماذج، شمل تسعة نماذج بينها GPT-4o و Command-R و Llama 3.1 ونماذج عربية متخصصة، عبر ثماني لهجات من بينها السورية والفلسطينية والمصرية والمغربية. ونتيجته المركزية تقلب الصورة المألوفة:
النماذج تنتج ردودًا طليقة وكافية المعنى، لكنها ليست باللهجة المطلوبة في أغلب الأحيان.
ولاحظ ما تعنيه هذه الجملة بدقة: الفهم أفضل من الإنتاج، وهو عكس النمط المعتاد في الذكاء التوليدي حيث الإنتاج يسبق الفهم. النموذج يفهمك بالشامية، ثم يجيبك بشيء آخر.
وأضافت الدراسة رقمًا يستحق الحفظ: في الوضع أحادي اللغة، سقطت جميع درجات ADI2 تقريبًا تحت 50٪، و GPT-4o نفسه لم يتجاوز 13٪ على نصف اللهجات المختبَرة في الوضع عبر اللغوي. ADI2 هنا مقياس آلي لمدى انتماء النص المولَّد إلى اللهجة المطلوبة فعلًا.
أما على مستوى الممارسين، فالشكوى المتكررة في مجتمعات المترجمين وفرق التعريب العربية تتكرر بصيغة واحدة تقريبًا: الترجمة الحرفية للتعابير الاصطلاحية، والارتباك أمام النص غير المشكّل، وأخطاء المطابقة في الجمع، وضعف التعامل مع التبديل اللغوي. وهذه ليست شكاوى ذوق، بل هي بالضبط أنماط الفشل التي تقيسها بنود هذه المقالة.
وأنا أقرأ هذا التطابق بين ما يرصده البحث وما يشتكي منه الممارسون على أنه إشارة إلى أن المشكلة بنيوية لا عابرة: ليست خطأ في نموذج بعينه، بل نقص في نوع البيانات التي بُنيت عليها العربية كلها في هذه الأنظمة.
كيف تحسب معدل الحرفية الزائفة بنفسك
المقياس بسيط ولا يحتاج أداة:
| الخطوة | ماذا تفعل |
|---|---|
| 1 | اجمع عشر عبارات اجتماعية شائعة في لهجتك |
| 2 | ضع كل عبارة في سياقين مختلفين، فيصير عندك عشرون بندًا |
| 3 | اطلب من النموذج المعنى والوظيفة الاجتماعية، لا الترجمة |
| 4 | ضع علامة على كل رد ترجم العبارة ترجمة سليمة وأخطأ في وظيفتها |
| 5 | اقسم عدد هذه الردود على عشرين |
النتيجة نسبة مئوية واحدة، تعيد حسابها مع كل نموذج جديد، وتحتفظ بها مع تاريخها. بعد أربعة نماذج يصير عندك ما لا تعطيه أي لوحة عامة: منحنى زمني لقدرة النماذج على فهم مقاصد لهجتك أنت.
من دفتر الاختبار: ثلاثة بنود مشتغلة بالكامل
أضع هنا ثلاثة بنود كما أرسلها تمامًا، ومعها الجواب الذي أقبله والجواب الذي أرفضه مكتوبين بالكامل، حتى لا يبقى الحكم ذوقيًا.
البند الأول: “دبّر حالك” في موقعين.
الموقف أ: أحمد اتصل بصاحبه: “أنا اليوم ما رح أقدر أجي معكم، عندي شغلة ضرورية.” ردّ صاحبه: “ولا يهمك، دبّر حالك وبعدين خبّرني.”
الموقف ب: موظف طلب من مديره تمديد يومين. المدير: “أنا ما إلي دخل، دبّر حالك.”
الجواب الذي أعطيه خمسة من خمسة: “في الأول تطمين ورفع حرج، بمعنى رتّب وقتك ولا تعتذر، والنبرة ودّية. وفي الثاني تنصّل من المسؤولية مع حدّة، بمعنى تصرّف وحدك فالمسألة لا تعنيني.”
الجواب الذي أعطيه صفرًا: “تعني اعتنِ بنفسك ورتّب أمورك”، مكرّرة في الحالتين. هذا جواب قاموسي صحيح ومعطّل اجتماعيًا.
البند الثاني: الوقف على التاء المربوطة، وهو اختبار لكنة لا معنى.
اكتب لي الجملة كما تُنطق موقوفةً: “قرأتُ رسالةَ المديرة.”
المتحدث العربي يقف على التاء المربوطة هاءً: “المديرَه”. والنموذج الذي يكتبها “المديرَت” أو يصرّ على تحريكها في الوقف يكشف أنه تعلّم العربية من نص مكتوب لا من كلام منطوق. وهذا البند بالذات هو أسرع ما يفرّق عندي بين نموذج “قرأ العربية” ونموذج “سمعها”.
البند الثالث: القاف، وهي أوضح علامة لكنة في المشرق.
هذه أربع نطقات لكلمة “قال”: قال، ءال، گال، كال. صنّف كل واحدة وقل أين تُسمع.
الجواب الذي أقبله: “قال” بالقاف في الفصحى وفي مناطق ريفية وساحلية وفي بعض الجماعات الشامية، و”ءال” بالهمزة في دمشق وبيروت وحواضر الشام، و”گال” في البادية وشمال الأردن والعراق والخليج، و”كال” في بعض الريف الفلسطيني والعراقي.
الفخ هنا مزدوج: النموذج الضعيف إما يعتبر كل ما ليس همزة “خليجيًا”، أو يبني على النطق حكمًا على المتكلم. وأنا أسجّل الحالتين خطأً، الأولى جهلًا لغويًا والثانية خطأً حرجًا.
لماذا أبدأ دائمًا من الصوت لا من المعنى
لأن اللكنة أصدق من المفردة. أي نموذج يستطيع حفظ قائمة كلمات شامية، لكن قليلًا منها يعرف أن الدمشقي يميل بالألف نحو الياء في مثل “باب” و”ناس”، وأن تاء التأنيث عنده تُنطق كسرة مائلة في “شجرة” و”مدرسة”، وأن هذا بالضبط ما يجعل جملة مكتوبة صحيحة تبدو غريبة حين تُقرأ بصوت عالٍ.
ولهذا في كل تقييم أجريه، البند الأول صوتي والبند الأخير اجتماعي، وما بينهما هو ما تقيسه اللوحات.
المصادر
- Artificial Analysis، تقييم GPT-6 Astra: artificialanalysis.ai/articles/benchmarking-gpt-6-astra
- Slator، أداء Astra في الترجمة ومقياس M-GATE: slator.com
- OpenAI، صفحة إطلاق GPT-6 Astra: openai.com/index/gpt-6-astra
- DialectalArabicMMLU، LREC 2026: arxiv.org/abs/2510.27543
- NADI 2025، المهمة المشتركة لمعالجة الكلام العربي متعدد اللهجات: arxiv.org/abs/2509.02038
- PalmX 2025، قياس الثقافة العربية والإسلامية: arxiv.org/abs/2509.02550
- AL-QASIDA، تحليل جودة العربية اللهجية في النماذج: arxiv.org/abs/2412.04193