الأرقام أولًا
| المقياس | النتيجة | ما الذي يقيسه | المصدر |
|---|---|---|---|
| XReasoning، مطابقة لغة التفكير للغة المطلوبة | 46.3٪ على AIME و42.3٪ على GPQA في أكبر نموذج مقطّر من R1 | هل يفكر النموذج باللغة التي طُلبت منه؟ | arXiv 2505.22888 |
| XReasoning، بعد إجبار النموذج على لغة التفكير | المطابقة ترتفع إلى 97.9٪ | أثر الإجبار على لغة التفكير | المصدر نفسه |
| الثمن: الدقة | تهبط من 25.5٪ إلى 17.0٪ | الدقة مقابل لغة التفكير | المصدر نفسه |
| XReasoning، عدد اللغات المشمولة | 11 لغة | اتساع التغطية اللغوية | المصدر نفسه |
| هل العربية من بينها؟ | لا | تغطية العربية في القياس | المصدر نفسه |
| DialectalArabicMMLU، ترجمة السؤال اللهجي إلى الإنجليزية | تحسّن 5.6 نقطة | أثر الترجمة على الفهم | LREC 2026 |
| DialectalArabicMMLU، ترجمته إلى الفصحى | تحسّن 0.3 نقطة | أثر الترجمة على الفهم | LREC 2026 |
| HELM Arabic، سلف هذا النموذج DeepSeek v3.1 | ضمن أفضل عشرة نماذج مفتوحة | أداء عربي مستقل | Stanford CRFM |
هذه المقايضة هي موضوع المقالة. والأهم منها: العربية ليست ضمن اللغات الإحدى عشرة التي قِيست أصلًا. أي أننا لا نعرف حتى حجم المشكلة عندنا، ونستدل عليها من لغات أخرى.
لماذا يهمّ هذا السؤال في العربية تحديدًا
نماذج الاستدلال تعرض سلسلة تفكيرها قبل الجواب. وحين تسألها بالعربية، ستلاحظ أن السلسلة كثيرًا ما تبدأ بالإنجليزية، أو تبدأ بالعربية ثم تنزلق إلى الإنجليزية عند أول خطوة تحليلية صعبة. الجواب النهائي يعود إليك بالعربية، فتبدو الأمور سليمة.
لكن ماذا يعني هذا عمليًا؟ يعني أن سؤالك العربي يُترجَم داخليًا، ويُحلّ في فضاء إنجليزي، ثم تُترجَم النتيجة إليك. وكل خطوة ترجمة تفقد شيئًا:
والدليل الرقمي على هذا المسار موجود، وهو من أقوى ما قرأت: في مقياس DialectalArabicMMLU، ترجمة السؤال اللهجي إلى الإنجليزية رفعت أداء النماذج 5.6 نقطة، بينما ترجمته إلى الفصحى رفعته 0.3 نقطة فقط. لو كانت النماذج تستدلّ عربيًا لكانت الفصحى هي الجسر. لكن الجسر إنجليزي.
بطاقة النموذج
| البند | التفصيل |
|---|---|
| الاسم | DeepSeek R1 |
| الجهة | DeepSeek |
| تاريخ الإصدار | 20 كانون الثاني 2025 |
| ما يميزه | أول نموذج استدلال مفتوح واسع الانتشار يعرض سلسلة تفكيره |
| أثره | تصدّر تنزيلات متجر التطبيقات في الولايات المتحدة خلال أسبوع من إطلاقه |
| المحور المختبَر | لغة الاستدلال قبل لغة الجواب |
أهمية هذا النموذج في سياق العربية ليست في درجته، بل في شفافيته. حين يعرض النموذج سلسلة تفكيره، يصير بإمكانك أن ترى بعينك ما كان مخفيًا في كل النماذج المغلقة: بأي لغة يجري التفكير فعلًا.
الاختبار: أربعة بنود
البند 1، لغة السلسلة تلقائيًا. اطرح سؤالًا ثقافيًا بالشامية، واقرأ سلسلة التفكير. سجّل: بأي لغة بدأت؟ وفي أي خطوة تحوّلت؟ وما نسبة الأسطر العربية إلى الإنجليزية؟ هذه نسبة تُحسب في دقيقة وتقول الكثير.
البند 2، الإجبار. اطلب صراحة: “فكّر بالعربية خطوة بخطوة”. ثم قس شيئين معًا: هل التزم، وهل تغيرت جودة الجواب. وبحسب نتائج XReasoning، توقّع الالتزام مع انخفاض الدقة. الرقم الذي يهمك أنت هو حجم هذا الانخفاض في مهامك تحديدًا.
البند 3، السؤال الثقافي مقابل السؤال المنطقي. أعد التجربة مرتين: مرة بسؤال منطقي رياضي، ومرة بسؤال عن موقف اجتماعي شامي. فرضيتي بعد سنوات من المراجعة أن التفكير بالإنجليزية يضرّ السؤال الثقافي أكثر مما يضرّ السؤال المنطقي، لأن السؤال الثقافي يفقد في الترجمة ما لا يفقده الحساب. هذه فرضية قابلة للاختبار، وأنشرها بوصفها فرضية لا نتيجة.
البند 4، المقارنة المزدوجة. اطرح السؤال نفسه بالعربية وبالإنجليزية في جلستين منفصلتين، وقارن الجوابين. إن كان الجواب الإنجليزي أغنى وأدق، فقد قست عمليًا ما يسميه الباحثون التفضيل الإنجليزي.
قراءة نقدية للمقايضة
نتيجة XReasoning تبدو محبطة: إما أن يفكر بلغتك وإما أن يكون دقيقًا. لكنني أقرأها قراءة مختلفة قليلًا.
النموذج لا يخسر الدقة لأن العربية أو السواحيلية “لغات أقل قدرة على التفكير”. هذا هراء لغوي. النموذج يخسر الدقة لأن تدريبه على الاستدلال جرى بالإنجليزية، فحين تجبره على مسار لم يتدرّب عليه، يضعف. المشكلة في البيانات لا في اللغة.
وهذا يقود إلى نتيجة عملية مهمة: المشكلة قابلة للحل، لكن حلّها يحتاج بيانات استدلال عربية، أي سلاسل تفكير مكتوبة بالعربية حول مسائل عربية. وهذه بالضبط نوعية البيانات التي لا تُجمَع اليوم، لأن الجميع يجمع أسئلة وأجوبة، لا مسارات تفكير.
وأضيف ملاحظة أراها مهمة لمن يبني اليوم: إن كان منتجك يحتاج دقة، فدع النموذج يفكر كما يشاء وخذ منه جوابًا عربيًا سليمًا. أما إن كان منتجك تعليميًا ويعرض الخطوات للمستخدم، فأنت مضطر إلى العربية في السلسلة، وعليك أن تحسب الانخفاض في الدقة وتعوّضه بالمراجعة.
الحكم العملي
- افحص لغة السلسلة قبل أن تحكم على الجواب. دقيقة واحدة تكشف إن كان نموذجك يفهم لغتك أم يترجمها.
- لا تجبر لغة التفكير إلا إذا كان عرضها جزءًا من منتجك. وإن فعلت، فاحسب الثمن.
- اطرح السؤال بالعربية والإنجليزية في اختباراتك الداخلية دائمًا. الفجوة بينهما مقياس مجاني لعمق العربية في النموذج.
- إن كنت تبني بيانات عربية، فابنِ سلاسل تفكير لا أسئلة وأجوبة فقط. هذه هي الفجوة الحقيقية في البيانات العربية اليوم.
في المقالة القادمة
خطوة إلى الوراء لقياس المسافة: Gemini 2.5 Pro مقابل Claude 3.5 Sonnet، أي جيل 2024 وأوائل 2025، وسؤال واحد: ماذا تغيّر فعلًا في العربية خلال سنتين، وأين لم يتغير شيء؟
نتيجة ثانية تدعم الفرضية
طرحت أعلاه فرضية مفادها أن التفكير بالإنجليزية يضرّ السؤال الثقافي أكثر مما يضرّ السؤال المنطقي. وهي فرضيتي، وأعرضها بوصفها كذلك. لكن هناك نتيجة منشورة تصبّ في الاتجاه نفسه وتستحق الذكر.
دراسة AL-QASIDA التي قاست تسعة نماذج عبر ثماني لهجات وجدت أن الفهم أفضل من الإنتاج في العربية اللهجية، وهذا انقلاب على النمط المعتاد في النماذج التوليدية حيث الإنتاج يسبق الفهم.
اقرأ هذا مع نتيجة XReasoning، وستحصل على صورة متسقة:
أي أن الحلقة الضعيفة ليست في استقبال العربية بل في إعادتها. وهذا يفسّر تجربة يعرفها كل مستخدم عربي: النموذج يفهم سؤالك تمامًا، ثم يجيبك بطريقة تشعر أنها ليست منك.
بروتوكول تسجيل لغة السلسلة
| البند | ماذا تسجّل |
|---|---|
| لغة أول سطر في السلسلة | عربي أم إنجليزي |
| الخطوة التي حدث فيها التحول | رقم |
| نسبة الأسطر العربية | مئوية |
| هل ظهرت مصطلحات إنجليزية داخل تفكير عربي | نعم أو لا |
| جودة الجواب النهائي | من 5 |
| هل تغيرت الجودة عند الإجبار على العربية | فرق بالنقاط |
خمس عينات تكفي للحصول على رقم مستقر. واحتفظ بالجدول مع اسم النموذج وتاريخه، لأن هذا السلوك يتغير بين إصدار وآخر أسرع مما تتغير الدرجات.
ماذا يعني هذا لبناء البيانات العربية
إن كانت المشكلة في بيانات التدريب لا في اللغة، فالحل واضح ومكلف: سلاسل تفكير مكتوبة بالعربية.
| نوع البيانات | متوفر اليوم | ما ينقص |
|---|---|---|
| أسئلة وأجوبة بالعربية | بكثرة | لا شيء |
| نصوص عربية عامة | بكثرة | جودة الإملاء |
| حوارات بالعربية | بدأت تتوفر | اللهجات خارج المصرية والمغاربية |
| سلاسل استدلال بالعربية | شبه معدومة | كل شيء |
| أمثلة على قول لا أعرف بالعربية | معدومة | كل شيء |
الصفان الأخيران هما الفجوة الحقيقية. وأي جهة عربية تريد أثرًا دائمًا في هذا المجال ستجد أن بناء ألف سلسلة تفكير عربية مكتوبة بيد بشر أثمن من تدريب نموذج جديد على البيانات نفسها الموجودة عند الجميع.
من دفتر الاختبار: كيف أقرأ سلسلة التفكير
حين يعرض النموذج سلسلة تفكيره، لا أقرؤها بحثًا عن الخطأ، بل بحثًا عن اللغة. وهذا ما أسجّله في كل جلسة:
| ما أسجّله | لماذا يهم |
|---|---|
| لغة أول سطر | تكشف الوضع الافتراضي للنموذج |
| السطر الذي وقع فيه التحول | غالبًا أول خطوة تحليلية صعبة |
| نسبة الأسطر العربية إلى الكلية | رقم واحد قابل للمقارنة عبر النماذج |
| هل عاد إلى العربية في النهاية | كثير من النماذج تفكر بالإنجليزية وتلخّص بالعربية |
| هل تغيّر الجواب حين أجبرته على العربية | هذا هو ثمن الإجبار مقاسًا على مهامك |
البند الذي أعتبره الأهم: السؤال الثقافي مقابل المنطقي
أشغّل التجربة نفسها مرتين، مرة بسؤال منطقي ومرة بسؤال ثقافي شامي، ثم أقارن. وهذه فرضيتي، وأعرضها بوصفها فرضية قابلة للاختبار لا نتيجة مثبتة: التفكير بالإنجليزية يضرّ السؤال الثقافي أكثر من المنطقي.
السبب الذي أرجّحه: المسألة الرياضية تُترجَم بلا فقد، أما “لماذا ألحّ المضيف ثلاث مرات” فتفقد في الترجمة السياق الذي يحمل الجواب. فحين يفكر النموذج بالإنجليزية في موقف عربي، فهو يفكر في ترجمة الموقف لا في الموقف نفسه.
وأنا أضع هذه الفرضية مكتوبة مع معيار نقضها: إن وجدتُ نموذجًا يعطي الجواب الثقافي نفسه بالجودة نفسها سواء فكّر بالعربية أو بالإنجليزية، فالفرضية ساقطة.
الفجوة الحقيقية في البيانات العربية
إن كان أصل المشكلة في البيانات لا في اللغة، فهذا جرد صريح لما هو موجود وما هو مفقود:
| نوع البيانات | حالته |
|---|---|
| نصوص عربية عامة | وفيرة، ومشكلتها الإملاء لا الكمّ |
| أسئلة وأجوبة بالعربية | وفيرة |
| حوارات لهجية | بدأت تظهر، والشامية أقلها |
| تسجيلات صوتية موسومة | نادرة ومكلفة |
| سلاسل تفكير مكتوبة بالعربية | شبه معدومة |
| أمثلة على قول “لا أعرف” في سياق عربي | معدومة |
الصفّان الأخيران هما ما أعتبره الفرصة الحقيقية. أي جهة عربية تبني ألف سلسلة تفكير عربية مكتوبة بيد بشر، حول مسائل عربية، تكون قد أضافت للحقل شيئًا لا تملكه أي جهة اليوم، وهذا أثمن بكثير من تدريب نموذج جديد على البيانات نفسها التي عند الجميع.
المصادر
- When Models Reason in Your Language، مقياس XReasoning: arxiv.org/abs/2505.22888
- DialectalArabicMMLU، أثر الترجمة إلى الإنجليزية والفصحى، LREC 2026: arxiv.org/abs/2510.27543
- HELM Arabic، Stanford CRFM مع Arabic.AI: crfm.stanford.edu/2025/12/18/helm-arabic.html
- صفحة DeepSeek، تواريخ الإصدار: en.wikipedia.org/wiki/DeepSeek_(chatbot)
- AL-QASIDA، الفهم مقابل التوليد في اللهجة: arxiv.org/abs/2412.04193