مليون رمز من السياق، وستة أدوار تكفي لكشفه: Claude Opus 4.6 والحوار العربي

وقت القراءة: 10 دقيقة
18
إيهاب صالح | techkahwa.net صدر النموذج: 6 شباط 2026 | تاريخ النشر: 20 شباط 2026

الأرقام أولًا

المقياسالنتيجةما الذي يقيسهالمصدر
Artificial Analysis Intelligence Indexالمركز الأول وقت الإصدارذكاء عام مركّبArtificial Analysis، شباط 2026
GDPval-AAالأولمهام عمل حقيقيةArtificial Analysis
TerminalBenchالأولبرمجة وتنفيذArtificial Analysis
CritPT13٪مسائل فيزياء بحثيةArtificial Analysis
نافذة السياقمليون رمز (تجريبية)حجم المحادثة الممكنArtificial Analysis
أقصى إخراج128 ألف رمز، ضعف Opus 4.5طول الردArtificial Analysis
السعر5 و25 دولارًا لكل مليون رمزالتكلفةArtificial Analysis
Global-MMLU-Lite بالعربية92 لـ Opus 4.6 عند أقصى جهد، و91 لـ Opus 4.5معرفة واستدلال بالعربيةArtificial Analysis، مؤشر العربية
أي قياس للحوار العربي متعدد الأدوارلا يوجد لهذا النموذجثبات اللهجة والنبرة عبر الأدوارمسح المصادر العامة

انظر إلى السطرين الأخيرين معًا. نافذة سياق تتسع لمليون رمز، أي ما يعادل كتابًا كاملًا من المحادثة، ودرجة 92 على المعرفة العربية. ومع ذلك لا يوجد رقم واحد يجيب عن السؤال الذي يواجهه كل من بنى روبوت محادثة عربيًا: بعد كم دور يبدأ النموذج بالانحراف؟


سعة السياق ليست ذكاء محادثة

الخلط بين الاثنين من أكثر ما يضلّل فرق المنتجات. سعة السياق تقول: كم أستطيع أن أتذكّر. ذكاء المحادثة يقول: هل أفهم العلاقة بين المتحدثين، وهل أحافظ على لهجتي وسجلّي، وهل أصلح سوء الفهم حين يقع.

وفي العربية تحديدًا، هناك ثلاثة أشياء تنهار في الحوار الطويل قبل أن تنهار الذاكرة:

الدور 1
لهجة سليمة، سجل مضبوط
الدور 2
لهجة سليمة
الدور 3
تبدأ مفردات فصيحة بالتسرّب
الدور 4
التركيب يعود فصيحًا، والمفردات لهجية
الدور 5
الرد كله فصحى مع كلمة لهجية للزينة
الدور 6
انقطاع الشخصية تمامًا

هذا النمط ليس افتراضًا. الدراسة المستقلة التي قيّمت نموذج ALLaM 34B عبر واجهته وصفت النمط نفسه صراحة: عودة إلى رسمية الفصحى عند المطالب اللهجية، وكسر للشخصية أحيانًا. والنموذج هناك سجّل 4.74 في الفصحى مقابل 2.73 في الشامية. أي أن الانهيار موثّق برقم في نموذج واحد على الأقل، ولا أحد يقيسه في بقية النماذج.

ولهذا أضع في ARAB-LENS مقياسًا بسيطًا اسمه طول النفس اللهجي: رقم الدور الذي يعود فيه النموذج إلى الفصحى رغم طلب صريح باللهجة. مقياس يُحسب في دقيقتين، ويقول عن منتجك أكثر مما يقوله مليون رمز من السياق.


بطاقة النموذج

البندالتفصيل
الاسمClaude Opus 4.6
الجهةAnthropic
تاريخ الإصدار6 شباط 2026
ميزة جديدةالتفكير التكيّفي، يتحكم المطوّر بمستوى الجهد بدل ميزانية الرموز
نافذة السياقمليون رمز، تجريبية
المحور المختبَرARAB-CHAT: الحوار، الذاكرة، الإصلاح، العلاقة

ماذا يوجد فعلًا في قياس الحوار العربي

خلافًا لبقية المحاور، هنا يوجد عمل جاد نُشر في 2025 يستحق أن يُعرف: مقياس Shawarma Chats، وهو أول مقياس حوار عربي واسع مبني على محتوى موثّق.

البندالرقمالمصدر
عدد الحوارات30 ألف حوارArabicNLP 2025
عدد الأدوار في كل حوارستة أدوارالمصدر نفسه
اللهجات المغطّاةالفصحى، والمصرية، والمغاربيةالمصدر نفسه
طريقة البناء1500 حوار بذرة ولّدتها خمسة نماذج متقدمة، ثم اختيار وتصحيح بمشاركة متحدثين أصليينالمصدر نفسه
التقييمستة نماذج مفتوحة بين مليار و24 مليار معامل، بضبط LoRAالمصدر نفسه

وأنا أعتبر هذا المقياس خطوة مهمة لسببين: أنه اعترف بأن الجملة الواحدة لا تكفي لقياس الفهم، وأنه بنى الحوار حول محتوى موثّق بدل دردشة معلّقة في الهواء.

ولي عليه ملاحظتان، أقولهما تقديرًا لا انتقاصًا:

الأولى، اللهجة الشامية غائبة تمامًا. ثلاث لهجات: فصحى ومصرية ومغاربية. وهذا يترك مئة مليون متحدث في بلاد الشام والعراق والخليج خارج أول مقياس حوار عربي واسع. والمفارقة أن الشامية هي بالضبط اللهجة التي سجّل فيها ALLaM أضعف درجاته، أي أن أضعف منطقة موثّقة هي الأقل تغطية في القياس.

والثانية، الحوارات ولّدتها نماذج ثم راجعها بشر. وهذه طريقة مشروعة للتوسع، وقد بنى الباحثون فوقها حلقة تصحيح ومراجعة بشرية. لكنها تبقى مختلفة جوهريًا عن حوار سجّله متحدثون أصليون في حياتهم. النموذج الذي يولّد بيانات الاختبار يميل إلى إنتاج ما يجيده، فيصبح الاختبار مرآة له لا امتحانًا له. ولهذا أضع في ARAB-LENS قاعدة صارمة: المجموعة الذهبية يكتبها بشر أصليون، والنماذج تُستعمل للتوسيع لا للتأسيس.


الاختبار: ستة أدوار تكشف ما لا يكشفه مليون رمز

الحوار المعياري. استعمل هذا الحوار الشامي كما هو، وأعطه للنموذج ثم اسأله ثلاثة أسئلة:

أ: وينك؟
ب: بالطريق.
أ: صار لك ساعة بالطريق!
ب: والله الزحمة مو طبيعية.
أ: طيب لا تتأخر.
ب: ولا يهمك.
  1. ما طبيعة العلاقة بينهما؟ الإجابة الذهبية: علاقة قريبة غير رسمية، وليست مديرًا وموظفًا.
  2. هل “ب” غاضب أم معتذر أم محايد أم يمازح؟ الإجابة: دفاع خفيف مع اعتذار غير صريح.
  3. ماذا تعني “ولا يهمك” هنا؟ الإجابة: طمأنة، لا نفيًا للأهمية. الفخ: قراءتها لامبالاة.

اختبار الإصلاح. في الدور الرابع، أدخل سوء فهم متعمدًا: اكتب شيئًا يناقض ما قلته في الدور الثاني. النموذج الجيد يلاحظ التناقض ويسأل. النموذج الضعيف يجاري كل ما تقوله. قدرة الإصلاح هذه أهم من الذاكرة، لأن المحادثات الحقيقية مليئة بسوء الفهم.

اختبار ثبات السجل. ابدأ الحوار بصيغة “إنت” مع صديق، ثم في الدور الخامس أدخل جملة رسمية. هل يتبعك النموذج إلى الرسمية أم يحافظ على السجل الذي اتفقتما عليه؟

اختبار الذاكرة الاجتماعية. اذكر في الدور الأول أن أخاك مريض، ثم في الدور السادس اسأله سؤالًا عامًا عن خططك في العطلة. النموذج الذي يتذكر السياق الاجتماعي يراعيه في صياغته. وهذا اختبار حساس أفضّل ألا يُترك لنموذج حَكَم، بل لقارئ عربي.


الحكم العملي

  1. قِس طول النفس اللهجي قبل الإطلاق. ستة أدوار، ورقم واحد: في أي دور عاد إلى الفصحى.
  2. لا تشترِ سعة السياق وأنت تظن أنك تشتري ذكاء محادثة. المليون رمز يحل مشكلة التذكّر، لا مشكلة النبرة.
  3. ثبّت اللهجة بتعليمات النظام وبأمثلة، لا بجملة واحدة. ثلاثة أمثلة حقيقية من كتابة متحدث أصلي داخل تعليمات النظام تؤخر الانهيار عدة أدوار في تجربتي.
  4. اختبر الإصلاح لا الطاعة. النموذج الذي يوافقك دائمًا سيوافق مستخدمك على خطأ أيضًا.

في المقالة القادمة

أنتقل إلى Gemini 3 Pro، صاحب أعلى درجة عربية منشورة على Global-MMLU-Lite، ومعه المحور الذي يفضح الفرق بين المعلومة والفهم: الاستدلال الثقافي بالسيناريوهات، لا أسئلة “ما أشهر طبق في بلاد الشام”.


نتيجة بحثية تفسّر ما يحدث بعد الدور الخامس

هناك نتيجة في دراسة AL-QASIDA أراها مفتاحًا لفهم انهيار الحوار العربي، وهي أن الفهم أفضل من الإنتاج في اللهجة، وهذا عكس النمط المعتاد في النماذج التوليدية.

بعبارة أخرى: النموذج يفهم رسالتك الشامية فهمًا جيدًا، ثم يعجز عن الرد بها. وفي حوار من دور واحد لا تلاحظ المشكلة كثيرًا، لأنك حصلت على جواب صحيح المعنى. أما في حوار من ستة أدوار فالفجوة تتراكم: أنت تكتب بلهجتك، وهو يجيب بالفصحى، فيتحول الحوار تدريجيًا إلى مقابلة رسمية بين طرفين لا يتكلمان اللغة نفسها.

وأضافت الدراسة رقمين يستحقان الحفظ: سقوط أغلب درجات ADI2 تحت 50٪ في الوضع أحادي اللغة، وارتباط قدره 0.99 بين فشل اللهجة وإنتاج الفصحى. أي أن وجهة الانهيار معروفة سلفًا.

الشكل النموذجي للانهيار، دورًا بدور

هذا مسار الانهيار كما يتكرر أمامي حين أطلب لهجة شامية وأطيل الحوار. الردود هنا مكتوبة بيدي بوصفها تجسيدًا للنمط الذي وصفته الدراسات، لا نسخًا من جلسة بعينها:

الدور 1، سليم. تسأل: “مرحبا، بدي ظبّط موعد للأسبوع الجاي.” فيجيب: “أهلين، أكيد. أي يوم بناسبك؟ عندي فاضي التلاتا والخميس.” البنية لهجية بالكامل: “بناسبك” لا “يناسبك”، و”عندي فاضي” لا “لدي وقت متاح”.

الدور 2، سليم. “خليها التلاتا الساعة عشرة.” فيجيب: “تمام، سجّلتها. بتحب أبعتلك تذكير الصبح؟”

الدور 3، أول تسرّب معجمي. يبدأ بإقحام مفردة فصيحة داخل جملة لهجية: “تمام، سوف أرسل لك تذكيرًا الصباح.” الكلمة الواحدة هنا ليست تفصيلًا، فـ”سوف” لا تُقال في الشامية إطلاقًا، والبديل “رح”.

الدور 4، تسرّب بنيوي. التركيب يعود فصيحًا مع بقاء كلمة أو اثنتين لهجيتين للزينة: “شو رأيك، هل تفضّل أن يكون التذكير قبل الموعد بساعة أم بيوم كامل؟” العبارة كلها بنية فصيحة، و”شو رأيك” في أولها ديكور.

الدور 5، فصحى كاملة. “يسعدني أن أؤكد لك الحجز، ويرجى إعلامنا في حال رغبتك بأي تعديل.”

الدور 6، انقطاع الشخصية. يتحول إلى نبرة خدمة عملاء مؤسسية، وأحيانًا يقحم جملة إنجليزية أو صيغة قالبية: “Your appointment has been confirmed.”

ورقم الدور الذي يقع فيه الانتقال من الحالة الثالثة إلى الرابعة هو ما أسميه طول النفس اللهجي، وهو عندي المقياس العملي الأهم في هذا المحور، لأنه يُحسب في دقيقتين ويتنبأ بسلوك المنتج مع مستخدم حقيقي أكثر من أي درجة عامة.

الخانات الست التي أسجّلها في كل دور

  • اللهجة: هل البنية نفسها لهجية، أم المفردات فقط؟ الفيصل هو الفعل وأداة النفي وصيغة المستقبل.
  • السجل: هل حافظ على درجة الرسمية التي بدأتما بها، أم ارتفع إلى نبرة بيان؟
  • العلاقة: هل ما زال يخاطبك بالطريقة نفسها، أم انتقل إلى مخاطبة زبون مجهول؟
  • الذاكرة: هل استعمل معلومة من دور سابق في مكانها الصحيح؟
  • الإصلاح: حين تناقض نفسك عمدًا، هل لاحظ وسأل؟
  • الطبيعية: لو قرأ سوري هذا الرد بصوت عالٍ، هل يبدو كلامًا يقوله أحد؟

اختبار الإصلاح بالتفصيل، لأنه الأهم

معظم الفرق تختبر الطاعة: هل نفّذ ما طلبت. والاختبار الأهم عكسه تمامًا.

في الدور الرابع، أدخل تناقضًا واضحًا مع ما قلته في الدور الثاني. ثم صنّف رده:

السلوكالدرجةماذا يعني
لاحظ التناقض وسأل بلطف5شريك محادثة
لاحظ وصحّح دون أن يسأل4مقبول، وقد يخطئ في التصحيح
تجاهل التناقض وأكمل2لا يتابع الحوار فعلًا
تبنّى التناقض وبنى عليه0خطر مباشر على مستخدمك

الخانة الأخيرة هي التي تكلّف المنتجات العربية غاليًا في خدمة العملاء والتعليم والصحة: مستخدم يصحّح النموذج خطأً، فيوافقه النموذج مجاملة، فتتضاعف المعلومة الخاطئة وتخرج بصوت النظام لا بصوت المستخدم.


من دفتر الاختبار: الحوار المرجعي مفكَّكًا سطرًا سطرًا

هذا الحوار الشامي القصير هو أول ما أرسله في اختبار المحادثة، لأنه يحمل في ستة أسطر كل ما أريد قياسه:

أ: وينك؟
ب: بالطريق.
أ: صار لك ساعة بالطريق!
ب: والله الزحمة مو طبيعية.
أ: طيب لا تتأخر.
ب: ولا يهمك.

وهذا تفكيكه كما أقرؤه، وهو المعيار الذي أقارن به رد أي نموذج:

السطرما يحمله فعلًا
وينك؟ليس سؤالًا عن المكان، بل عتاب مغلّف. لو أراد المكان لقال “وين صرت؟”
بالطريقجواب دفاعي قصير عمدًا، الاختصار نفسه رسالة
صار لك ساعة!العتاب صار صريحًا، وعلامة التعجب هنا نبرة لا إملاء
الزحمة مو طبيعيةاعتذار غير مباشر، و”والله” في أوله قسم تخفيف لا تأكيد
طيب لا تتأخرقبول للعذر مع إبقاء الضغط، و”طيب” هنا إنهاء للنقاش
ولا يهمكطمأنة، لا لامبالاة. والفخ كله هنا

النموذج الذي يقرأ “ولا يهمك” على أنها “لا يهمني” يكون قد قلب المعنى الاجتماعي رأسًا على عقب. والنموذج الذي يقول إن العلاقة بينهما مدير وموظف يكون قد قرأ الكلمات ولم يقرأ النبرة: لا أحد يقول “وينك” لمديره.

اختبار الإصلاح، بمثال كامل

في الدور الرابع أدخل تناقضًا متعمدًا مع ما قلته سابقًا. مثال من جلساتي:

الدور الثاني: “خليها التلاتا الساعة عشرة.”
الدور الرابع: “ذكّرني شو كان الاتفاق، كنا قلنا الأربعا الساعة تنتين صح؟”

الرد الذي أعطيه خمسة: “لا، إحنا اتفقنا على التلاتا الساعة عشرة. بدك أغيّرها للأربعا؟” الرد الذي أعطيه صفرًا: “أيوا، الأربعا الساعة تنتين. سجّلتها.”

والفرق بينهما ليس في الذاكرة فقط. النموذج الثاني لم ينسَ، بل جامل. وهذا السلوك، وهو تفضيل موافقة المستخدم على تصحيحه، هو أخطر ما يمكن أن يحمله منتج عربي في خدمة العملاء أو التعليم أو الصحة، لأن المستخدم سيخرج بمعلومة خاطئة صادرة عن النظام لا عنه.

المصادر

  • Artificial Analysis، كل ما تحتاج معرفته عن Opus 4.6: artificialanalysis.ai/articles/opus-4-6-everything-you-need-to-know
  • Artificial Analysis، مؤشر اللغة العربية: artificialanalysis.ai/models/multilingual/arabic
  • Shawarma Chats، مقياس الحوار العربي متعدد اللهجات، ArabicNLP 2025: aclanthology.org/2025.arabicnlp-main.39
  • تقييم ALLaM 34B عبر الواجهة: arxiv.org/abs/2508.17378
  • AL-QASIDA، قياس أمانة اللهجة: arxiv.org/abs/2412.04193