بأي لغة يفكّر النموذج قبل أن يجيبك بالعربية؟ حالة DeepSeek R1

وقت القراءة: 9 دقيقة
18
إيهاب صالح | techkahwa.net صدر النموذج: 20 كانون الثاني 2025 | تاريخ النشر: 3 شباط 2025

الأرقام أولًا

المقياسالنتيجةما الذي يقيسهالمصدر
XReasoning، مطابقة لغة التفكير للغة المطلوبة46.3٪ على AIME و42.3٪ على GPQA في أكبر نموذج مقطّر من R1هل يفكر النموذج باللغة التي طُلبت منه؟arXiv 2505.22888
XReasoning، بعد إجبار النموذج على لغة التفكيرالمطابقة ترتفع إلى 97.9٪أثر الإجبار على لغة التفكيرالمصدر نفسه
الثمن: الدقةتهبط من 25.5٪ إلى 17.0٪الدقة مقابل لغة التفكيرالمصدر نفسه
XReasoning، عدد اللغات المشمولة11 لغةاتساع التغطية اللغويةالمصدر نفسه
هل العربية من بينها؟لاتغطية العربية في القياسالمصدر نفسه
DialectalArabicMMLU، ترجمة السؤال اللهجي إلى الإنجليزيةتحسّن 5.6 نقطةأثر الترجمة على الفهمLREC 2026
DialectalArabicMMLU، ترجمته إلى الفصحىتحسّن 0.3 نقطةأثر الترجمة على الفهمLREC 2026
HELM Arabic، سلف هذا النموذج DeepSeek v3.1ضمن أفضل عشرة نماذج مفتوحةأداء عربي مستقلStanford CRFM
المقايضة التي لا يتحدث عنها أحد
المطابقة
الدقة
بلا تدخل
46.3٪
25.5٪
بإجبار لغة التفكير
97.9٪
17.0٪
كلما فكّر بلغتك، أخطأ أكثر

هذه المقايضة هي موضوع المقالة. والأهم منها: العربية ليست ضمن اللغات الإحدى عشرة التي قِيست أصلًا. أي أننا لا نعرف حتى حجم المشكلة عندنا، ونستدل عليها من لغات أخرى.


لماذا يهمّ هذا السؤال في العربية تحديدًا

نماذج الاستدلال تعرض سلسلة تفكيرها قبل الجواب. وحين تسألها بالعربية، ستلاحظ أن السلسلة كثيرًا ما تبدأ بالإنجليزية، أو تبدأ بالعربية ثم تنزلق إلى الإنجليزية عند أول خطوة تحليلية صعبة. الجواب النهائي يعود إليك بالعربية، فتبدو الأمور سليمة.

لكن ماذا يعني هذا عمليًا؟ يعني أن سؤالك العربي يُترجَم داخليًا، ويُحلّ في فضاء إنجليزي، ثم تُترجَم النتيجة إليك. وكل خطوة ترجمة تفقد شيئًا:

سؤالك بالشامية
↓ ترجمة داخلية غير مرئية
تمثيل إنجليزي للسؤال
← هنا تضيع النبرة والمقصد
↓ استدلال بالإنجليزية
جواب إنجليزي
↓ ترجمة إلى العربية
جواب عربي فصيح، صحيح المبنى، وقد يكون غريبًا عن سياقك

والدليل الرقمي على هذا المسار موجود، وهو من أقوى ما قرأت: في مقياس DialectalArabicMMLU، ترجمة السؤال اللهجي إلى الإنجليزية رفعت أداء النماذج 5.6 نقطة، بينما ترجمته إلى الفصحى رفعته 0.3 نقطة فقط. لو كانت النماذج تستدلّ عربيًا لكانت الفصحى هي الجسر. لكن الجسر إنجليزي.


بطاقة النموذج

البندالتفصيل
الاسمDeepSeek R1
الجهةDeepSeek
تاريخ الإصدار20 كانون الثاني 2025
ما يميزهأول نموذج استدلال مفتوح واسع الانتشار يعرض سلسلة تفكيره
أثرهتصدّر تنزيلات متجر التطبيقات في الولايات المتحدة خلال أسبوع من إطلاقه
المحور المختبَرلغة الاستدلال قبل لغة الجواب

أهمية هذا النموذج في سياق العربية ليست في درجته، بل في شفافيته. حين يعرض النموذج سلسلة تفكيره، يصير بإمكانك أن ترى بعينك ما كان مخفيًا في كل النماذج المغلقة: بأي لغة يجري التفكير فعلًا.


الاختبار: أربعة بنود

البند 1، لغة السلسلة تلقائيًا. اطرح سؤالًا ثقافيًا بالشامية، واقرأ سلسلة التفكير. سجّل: بأي لغة بدأت؟ وفي أي خطوة تحوّلت؟ وما نسبة الأسطر العربية إلى الإنجليزية؟ هذه نسبة تُحسب في دقيقة وتقول الكثير.

البند 2، الإجبار. اطلب صراحة: “فكّر بالعربية خطوة بخطوة”. ثم قس شيئين معًا: هل التزم، وهل تغيرت جودة الجواب. وبحسب نتائج XReasoning، توقّع الالتزام مع انخفاض الدقة. الرقم الذي يهمك أنت هو حجم هذا الانخفاض في مهامك تحديدًا.

البند 3، السؤال الثقافي مقابل السؤال المنطقي. أعد التجربة مرتين: مرة بسؤال منطقي رياضي، ومرة بسؤال عن موقف اجتماعي شامي. فرضيتي بعد سنوات من المراجعة أن التفكير بالإنجليزية يضرّ السؤال الثقافي أكثر مما يضرّ السؤال المنطقي، لأن السؤال الثقافي يفقد في الترجمة ما لا يفقده الحساب. هذه فرضية قابلة للاختبار، وأنشرها بوصفها فرضية لا نتيجة.

البند 4، المقارنة المزدوجة. اطرح السؤال نفسه بالعربية وبالإنجليزية في جلستين منفصلتين، وقارن الجوابين. إن كان الجواب الإنجليزي أغنى وأدق، فقد قست عمليًا ما يسميه الباحثون التفضيل الإنجليزي.


قراءة نقدية للمقايضة

نتيجة XReasoning تبدو محبطة: إما أن يفكر بلغتك وإما أن يكون دقيقًا. لكنني أقرأها قراءة مختلفة قليلًا.

النموذج لا يخسر الدقة لأن العربية أو السواحيلية “لغات أقل قدرة على التفكير”. هذا هراء لغوي. النموذج يخسر الدقة لأن تدريبه على الاستدلال جرى بالإنجليزية، فحين تجبره على مسار لم يتدرّب عليه، يضعف. المشكلة في البيانات لا في اللغة.

وهذا يقود إلى نتيجة عملية مهمة: المشكلة قابلة للحل، لكن حلّها يحتاج بيانات استدلال عربية، أي سلاسل تفكير مكتوبة بالعربية حول مسائل عربية. وهذه بالضبط نوعية البيانات التي لا تُجمَع اليوم، لأن الجميع يجمع أسئلة وأجوبة، لا مسارات تفكير.

وأضيف ملاحظة أراها مهمة لمن يبني اليوم: إن كان منتجك يحتاج دقة، فدع النموذج يفكر كما يشاء وخذ منه جوابًا عربيًا سليمًا. أما إن كان منتجك تعليميًا ويعرض الخطوات للمستخدم، فأنت مضطر إلى العربية في السلسلة، وعليك أن تحسب الانخفاض في الدقة وتعوّضه بالمراجعة.


الحكم العملي

  1. افحص لغة السلسلة قبل أن تحكم على الجواب. دقيقة واحدة تكشف إن كان نموذجك يفهم لغتك أم يترجمها.
  2. لا تجبر لغة التفكير إلا إذا كان عرضها جزءًا من منتجك. وإن فعلت، فاحسب الثمن.
  3. اطرح السؤال بالعربية والإنجليزية في اختباراتك الداخلية دائمًا. الفجوة بينهما مقياس مجاني لعمق العربية في النموذج.
  4. إن كنت تبني بيانات عربية، فابنِ سلاسل تفكير لا أسئلة وأجوبة فقط. هذه هي الفجوة الحقيقية في البيانات العربية اليوم.

في المقالة القادمة

خطوة إلى الوراء لقياس المسافة: Gemini 2.5 Pro مقابل Claude 3.5 Sonnet، أي جيل 2024 وأوائل 2025، وسؤال واحد: ماذا تغيّر فعلًا في العربية خلال سنتين، وأين لم يتغير شيء؟


نتيجة ثانية تدعم الفرضية

طرحت أعلاه فرضية مفادها أن التفكير بالإنجليزية يضرّ السؤال الثقافي أكثر مما يضرّ السؤال المنطقي. وهي فرضيتي، وأعرضها بوصفها كذلك. لكن هناك نتيجة منشورة تصبّ في الاتجاه نفسه وتستحق الذكر.

دراسة AL-QASIDA التي قاست تسعة نماذج عبر ثماني لهجات وجدت أن الفهم أفضل من الإنتاج في العربية اللهجية، وهذا انقلاب على النمط المعتاد في النماذج التوليدية حيث الإنتاج يسبق الفهم.

اقرأ هذا مع نتيجة XReasoning، وستحصل على صورة متسقة:

الإدخال بالعربية
→
يُفهم جيدًا
(الفهم قوي)
التفكير
→
يجري بالإنجليزية غالبًا
الإخراج بالعربية
→
يخرج فصيحًا لا لهجيًا
(الإنتاج ضعيف)

أي أن الحلقة الضعيفة ليست في استقبال العربية بل في إعادتها. وهذا يفسّر تجربة يعرفها كل مستخدم عربي: النموذج يفهم سؤالك تمامًا، ثم يجيبك بطريقة تشعر أنها ليست منك.

بروتوكول تسجيل لغة السلسلة

البندماذا تسجّل
لغة أول سطر في السلسلةعربي أم إنجليزي
الخطوة التي حدث فيها التحولرقم
نسبة الأسطر العربيةمئوية
هل ظهرت مصطلحات إنجليزية داخل تفكير عربينعم أو لا
جودة الجواب النهائيمن 5
هل تغيرت الجودة عند الإجبار على العربيةفرق بالنقاط

خمس عينات تكفي للحصول على رقم مستقر. واحتفظ بالجدول مع اسم النموذج وتاريخه، لأن هذا السلوك يتغير بين إصدار وآخر أسرع مما تتغير الدرجات.

ماذا يعني هذا لبناء البيانات العربية

إن كانت المشكلة في بيانات التدريب لا في اللغة، فالحل واضح ومكلف: سلاسل تفكير مكتوبة بالعربية.

نوع البياناتمتوفر اليومما ينقص
أسئلة وأجوبة بالعربيةبكثرةلا شيء
نصوص عربية عامةبكثرةجودة الإملاء
حوارات بالعربيةبدأت تتوفراللهجات خارج المصرية والمغاربية
سلاسل استدلال بالعربيةشبه معدومةكل شيء
أمثلة على قول لا أعرف بالعربيةمعدومةكل شيء

الصفان الأخيران هما الفجوة الحقيقية. وأي جهة عربية تريد أثرًا دائمًا في هذا المجال ستجد أن بناء ألف سلسلة تفكير عربية مكتوبة بيد بشر أثمن من تدريب نموذج جديد على البيانات نفسها الموجودة عند الجميع.


من دفتر الاختبار: كيف أقرأ سلسلة التفكير

حين يعرض النموذج سلسلة تفكيره، لا أقرؤها بحثًا عن الخطأ، بل بحثًا عن اللغة. وهذا ما أسجّله في كل جلسة:

ما أسجّلهلماذا يهم
لغة أول سطرتكشف الوضع الافتراضي للنموذج
السطر الذي وقع فيه التحولغالبًا أول خطوة تحليلية صعبة
نسبة الأسطر العربية إلى الكليةرقم واحد قابل للمقارنة عبر النماذج
هل عاد إلى العربية في النهايةكثير من النماذج تفكر بالإنجليزية وتلخّص بالعربية
هل تغيّر الجواب حين أجبرته على العربيةهذا هو ثمن الإجبار مقاسًا على مهامك

البند الذي أعتبره الأهم: السؤال الثقافي مقابل المنطقي

أشغّل التجربة نفسها مرتين، مرة بسؤال منطقي ومرة بسؤال ثقافي شامي، ثم أقارن. وهذه فرضيتي، وأعرضها بوصفها فرضية قابلة للاختبار لا نتيجة مثبتة: التفكير بالإنجليزية يضرّ السؤال الثقافي أكثر من المنطقي.

السبب الذي أرجّحه: المسألة الرياضية تُترجَم بلا فقد، أما “لماذا ألحّ المضيف ثلاث مرات” فتفقد في الترجمة السياق الذي يحمل الجواب. فحين يفكر النموذج بالإنجليزية في موقف عربي، فهو يفكر في ترجمة الموقف لا في الموقف نفسه.

وأنا أضع هذه الفرضية مكتوبة مع معيار نقضها: إن وجدتُ نموذجًا يعطي الجواب الثقافي نفسه بالجودة نفسها سواء فكّر بالعربية أو بالإنجليزية، فالفرضية ساقطة.

الفجوة الحقيقية في البيانات العربية

إن كان أصل المشكلة في البيانات لا في اللغة، فهذا جرد صريح لما هو موجود وما هو مفقود:

نوع البياناتحالته
نصوص عربية عامةوفيرة، ومشكلتها الإملاء لا الكمّ
أسئلة وأجوبة بالعربيةوفيرة
حوارات لهجيةبدأت تظهر، والشامية أقلها
تسجيلات صوتية موسومةنادرة ومكلفة
سلاسل تفكير مكتوبة بالعربيةشبه معدومة
أمثلة على قول “لا أعرف” في سياق عربيمعدومة

الصفّان الأخيران هما ما أعتبره الفرصة الحقيقية. أي جهة عربية تبني ألف سلسلة تفكير عربية مكتوبة بيد بشر، حول مسائل عربية، تكون قد أضافت للحقل شيئًا لا تملكه أي جهة اليوم، وهذا أثمن بكثير من تدريب نموذج جديد على البيانات نفسها التي عند الجميع.

المصادر

  • When Models Reason in Your Language، مقياس XReasoning: arxiv.org/abs/2505.22888
  • DialectalArabicMMLU، أثر الترجمة إلى الإنجليزية والفصحى، LREC 2026: arxiv.org/abs/2510.27543
  • HELM Arabic، Stanford CRFM مع Arabic.AI: crfm.stanford.edu/2025/12/18/helm-arabic.html
  • صفحة DeepSeek، تواريخ الإصدار: en.wikipedia.org/wiki/DeepSeek_(chatbot)
  • AL-QASIDA، الفهم مقابل التوليد في اللهجة: arxiv.org/abs/2412.04193