الأرقام أولًا
| المقياس | النتيجة | ما الذي يقيسه | المصدر |
|---|---|---|---|
| Artificial Analysis Intelligence Index | 59 مع استدلال عالٍ، بزيادة 3 نقاط عن 3.7 Flash | ذكاء عام مركّب | Artificial Analysis، أيلول 2026 |
| استخدام الأدوات | 45٪، بزيادة 12 نقطة عن الإصدار السابق | مهام وكيلية متعددة الخطوات | Artificial Analysis |
| السرعة | نحو 300 رمز في الثانية | زمن الاستجابة | Artificial Analysis |
| السعر | 0.75 و3.75 دولار لكل مليون رمز حتى نهاية العام | التكلفة | Artificial Analysis |
| المدخلات المدعومة | نص وصورة وفيديو وكلام | الوسائط | Artificial Analysis |
| أي رقم منشور للكلام العربي | لا يوجد | أداء النموذج على الصوت العربي | مسح المصادر العامة |
النموذج يقبل الصوت كمدخل، ولا يوجد رقم منشور واحد عن أدائه على الصوت العربي. ولكي نعرف حجم الفجوة، إليك ما تقوله المقاييس المتخصصة:
| القياس المتخصص | الرقم | المصدر |
|---|---|---|
| NADI 2025، التعرف على الكلام في أفضل نظام مشارك | 35.68 WER و12.20 CER | ArabicNLP 2025 |
| NADI 2025، تحديد اللهجة من الصوت | 79.8٪ دقة | ArabicNLP 2025 |
| NADI 2025، استعادة التشكيل للهجات المنطوقة | 55 WER و13 CER | ArabicNLP 2025 |
| عدد الفرق التي قدّمت نتائج صالحة | 8 فرق من أصل 44 سجّلت | ArabicNLP 2025 |
| AHELM، أفضل نموذج صوتي لغوي (Gemini 2.5 Pro) | 0.803 متوسط معدل الفوز عبر 10 أبعاد | Stanford CRFM، 2025 |
| AHELM، ترتيب خط الأساس (ASR ثم نموذج لغوي) | السادس من 14 نظامًا | Stanford CRFM |
هذا الرقم هو أهم رقم في المقالة. أكثر من ثلث الكلمات المنطوقة تخرج خطأ في أفضل نظام تنافس على مهمة مخصصة للهجات العربية. ومع ذلك تُبنى اليوم منتجات صوتية عربية على افتراض أن التفريغ مسألة محلولة.
لماذا لا يكفي WER أصلًا
معدل خطأ الكلمة يقيس شيئًا واحدًا: هل خرجت الحروف صحيحة. وهذا في العربية اختبار ناقص لسببين.
الأول أن الخطأ ليس متساوي الأثر. إذا سمع النموذج “ما بقدر” بدل “بقدر”، فهذه كلمة واحدة في الحساب، لكنها انقلاب كامل في المعنى. وإذا سمع “بدي روح” بدل “بدي أروح”، فهذا خطأ في الحساب وليس خطأ في الفهم إطلاقًا.
والثاني أن التفريغ ليس الفهم. ولهذا أقسّم محور ARAB-SPEECH في ARAB-LENS إلى أربع مراحل، ولا أسمح لنفسي بالحكم على نموذج صوتي قبل أن أمرّ بها كلها:
المرحلتان اللتان لا يقيسهما أحد هما بالضبط ما يحدّد نجاح منتج صوتي أو فشله.
بطاقة النموذج
| البند | التفصيل |
|---|---|
| الاسم | Gemini 3.8 Flash |
| الجهة | |
| تاريخ الإصدار | 2 أيلول 2026 |
| ترتيبه | رابع نموذج Flash خلال أقل من أربعة أشهر |
| نافذة السياق | مليون رمز |
| المدخلات | نص، صورة، فيديو، كلام |
| المخرجات | نص |
| المحور المختبَر | ARAB-SPEECH بمراحله الأربع |
الاختبار
المرحلة أ، الكلام إلى النص. سجّل ثلاثين ثانية بالشامية فيها ثلاثة أشياء يصعب على النماذج التقاطها: اسم عَلَم عربي (مثل “عبد الرحمن أبو الخير”)، ورقم مركّب منطوق (“ألفين وخمسمية وسبعة وسبعين”)، وتبديل لغوي (“بكرا عندي meeting الساعة تسعة”). احسب WER بنفسك. الحساب بسيط: عدد الكلمات الخاطئة مقسومًا على عدد الكلمات الكلي.
المرحلة ب، الكلام إلى المعنى. شغّل له تسجيلًا يقول: “والله كنت بدي أجي مبارح، بس صار معي شغلة وما قدرت.” ولا تطلب التفريغ. اسأل مباشرة: لماذا لم يأتِ المتكلم؟ وهل اعتذر؟ النموذج الذي يفرّغ ولا يجيب عن السؤال لم يفهم، بل نسخ.
المرحلة ج، الكلام إلى اللهجة. التسجيل نفسه، والسؤال: من أي منطقة هذا المتكلم، وما درجة ثقتك؟ وهنا قاعدة أضعها على نفسي قبل أن أضعها على النموذج: لا أعاقبه إن قال “شامية” ولم يقل “سورية”، لأن اللهجة والجنسية شيئان مختلفان، وكثير من التسجيلات لا تسمح بتحديد أدق. الخطأ الحقيقي هو الثقة الزائدة، لا الحذر.
المرحلة د، الكلام إلى المقصد. سجّل عبارة واحدة، “إي، طبعًا”، بخمس نبرات: حماس، وسخرية، وضيق، وتردد، ومجاملة. ثم اسأل في كل مرة: ماذا يريد المتكلم أن يقول فعلًا؟ هذه المرحلة هي أصعب ما في المحور، وهي التي تفصل بين نموذج يسمع وإنسان يفهم.
قراءة نتائج AHELM بعين عربية
نتيجة واحدة في AHELM أراها مهمة جدًا لمن يبني بالعربية: خط الأساس البسيط، أي نظام تفريغ يتبعه نموذج لغوي، جاء في المركز السادس بين أربعة عشر نظامًا صوتيًا متكاملًا، وكان أكثر مقاومة للضجيج من معظمها.
معنى ذلك عمليًا أن الطريق الطويل (تفريغ ثم فهم) ما زال منافسًا، وأحيانًا أمتن. وبالنسبة لمنتج عربي يعمل في بيئات واقعية، مقهى أو شارع أو مكالمة هاتف، هذه ليست تفصيلة تقنية بل قرار معماري: النموذج الصوتي المتكامل أسرع وأجمل في العرض، ونظام التفريغ المنفصل أسهل في التدقيق والتصحيح والمراجعة البشرية.
وأضيف ملاحظة من AHELM نفسها: رُصد تحيّز جندري ذو دلالة إحصائية في بعض مهام الكلام لدى النموذج الأعلى ترتيبًا. أي أن “الأفضل في المتوسط” لا يعني “العادل في كل الحالات”، وهذا درس يستحق أن يُنقل حرفيًا إلى تقييم اللهجات: نموذج ممتاز في المتوسط قد يكون سيئًا تحديدًا مع لهجة ريفية أو مع كبار السن.
الحكم العملي
- لا تشترِ وعد “يفهم العربية المنطوقة” بلا اختبار. سجّل عشر دقائق من مستخدميك الحقيقيين، لا من قارئ محترف في غرفة هادئة، وقس عليها.
- افصل التفريغ عن الفهم في معمارك. لأن خط الأساس المنفصل أثبت متانة أعلى في الضجيج، ولأنك ستحتاج النص المفرّغ للمراجعة البشرية على أي حال.
- اقبل عدم اليقين في اللهجة. اطلب من نظامك أن يقول “شامية بثقة متوسطة” بدل أن يخمّن “سورية” بثقة عالية. الثقة الزائدة تكلفك مستخدمًا يشعر أنه صُنّف خطأ.
- قِس النبرة يدويًا. لا يوجد مقياس جاهز للمقصد المنطوق، فابنِ لنفسك خمس عينات صوتية ثابتة واختبر بها كل نموذج جديد.
في المقالة القادمة
أعود إلى النص الخالص وإلى أكثر محور يُظلَم في التقييم العربي: النحو والصرف والتشكيل. DeepSeek V4 Pro على طاولة الاختبار، ومعه سؤال بسيط: هل يعرف النموذج الفرق بين “درس” و”درّس” حين تغيب الحركة؟
ما الذي يقيسه المجتمع البحثي في الصوت العربي
الصوت العربي حقل بحثي صغير بالنسبة لحجم اللغة، وهذه حقيقة تظهر في الأرقام نفسها: في NADI 2025 سجّلت أربع وأربعون فرقة، وقدّمت ثماني فرق فقط نتائج صالحة. ثماني فرق لأول مهمة مشتركة في الكلام العربي متعدد اللهجات.
وما يقوله هذا الرقم عن الحقل أكثر مما يقوله عن الفرق: البيانات الصوتية العربية الموسومة نادرة ومكلفة، والدخول إلى هذا الحقل يتطلب ما لا تملكه أغلب المجموعات البحثية، وهو متحدثون أصليون قادرون على التمييز بين خطأ النطق واختلاف اللهجة.
وقد تكرّر في أدبيات الكلام العربي أن التبديل اللغوي بين العربية والإنجليزية أو الفرنسية من أصعب ما يواجه أنظمة التعرف على الكلام العربي متعدد اللهجات. وهذه ملاحظة تهم كل من يبني منتجًا في الخليج أو المغرب العربي تحديدًا، حيث التبديل اللغوي ليس استثناءً بل هو الكلام العادي.
ما يقوله الممارسون عن النبرة
في مقارنات الممارسين العرب المنشورة، يتكرر وصف نماذج بعينها بأنها “جيدة الفهم لكن نبرتها رسمية جدًا، وتصلح للمحتوى الرسمي”. وهذه ملاحظة تبدو ذوقية، لكنها في المنتجات الصوتية قاتلة: المساعد الصوتي الذي يرد بنبرة نشرة أخبار في محادثة يومية يُقرأ باردًا أو متعاليًا، حتى لو كانت كل كلمة فيه صحيحة.
ولهذا أضع في تقييم أي منتج صوتي عربي بندًا لا علاقة له بالدقة: هل يشبه هذا الصوت شخصًا أعرفه؟ وهو سؤال لا يقيسه WER ولا CER، ويقرره خمسة مستمعين في خمس دقائق.
سجل القياس الذي أنصح به
لا تكتفِ برقم WER واحد. سجّل لكل تسجيل ستة حقول:
| الحقل | لماذا |
|---|---|
| البيئة (هادئة، مقهى، سيارة، هاتف) | الفارق بينها هو رقمك الحقيقي في الإنتاج |
| اللهجة والمنطقة الفرعية | لأن الأداء يتفاوت بين حضر وريف داخل اللهجة الواحدة |
| جنس المتكلم وفئته العمرية | لأن تقييم AHELM رصد تحيزًا جندريًا ذا دلالة إحصائية لدى النموذج الأعلى ترتيبًا |
| وجود أسماء أعلام أو أرقام | أكثر مواضع الانكسار |
| وجود تبديل لغوي | تحدٍّ موثّق في الأدبيات |
| هل فُهم المقصود، لا هل نُسخ النص | الفرق بين منتج يعمل ومنتج يفرّغ |
الحقل الثالث تحديدًا يغفله أغلب الفرق، والنتيجة أنهم يكتشفون بعد الإطلاق أن نظامهم يخطئ مع كبار السن ومع النساء أكثر من غيرهم، وهو اكتشاف يأتي متأخرًا جدًا.
من دفتر الاختبار الصوتي: ما الذي أسجّله فعلًا
عينتي الثابتة في اختبار الصوت العربي ثلاثون ثانية فيها ستة أشياء مقصودة، وكل واحد منها يكسر نوعًا مختلفًا من الأنظمة:
| ما أضعه في التسجيل | لماذا | الخطأ المتوقع |
|---|---|---|
| اسم علم مركّب: عبد الرحمن أبو الخير | الأسماء المركّبة تُقطّع خطأ | “عبد الرحمن” تصير “عبدل رحمن” |
| رقم منطوق: ألفين وخمسمية وسبعة وسبعين | الأرقام العربية معكوسة الترتيب | يخرج “2577” أو يُقرأ رقمًا رقمًا |
| تبديل لغوي: بكرا عندي meeting الساعة تسعة | الانتقال داخل الجملة | يفرّغ meeting بحروف عربية أو يحذفها |
| قاف بدوية: گلتلّك | خارج التمثيل الحضري | يخرج “قلت لك” أو نصًا مكسورًا |
| إدغام سريع: شو بدّك تعمل هلّق | الكلام السريع يبتلع الحركات | تسقط “بدّك” أو تصير “بدك تعمل” |
| ضجيج خلفي حقيقي | لأن مستخدمك ليس في استوديو | ارتفاع الخطأ بمقدار الضعف أحيانًا |
وأسجّل لكل تسجيل رقمين لا رقمًا واحدًا: معدل خطأ الكلمة، ثم معدل الخطأ المُغيِّر للمعنى. والثاني هو ما يهم فعلًا: عشرة أخطاء في الحركات أهون من خطأ واحد في “ما” النافية.
مثال يوضح لماذا WER وحده مضلّل
خذ هذه الجملة المنطوقة:
“والله ما قلتلّه إنه ما يجي.”
لو فرّغها النظام هكذا: “والله ما قلت له إنه ما يجي”، فالخطأ في الحساب موجود، والمعنى سليم تمامًا. ولو فرّغها هكذا: “والله قلت له إنه يجي”، فالخطأ في الحساب كلمتان فقط، والمعنى انقلب رأسًا على عقب، وصار الكلام يقول عكس ما قيل.
النظام الأول أسوأ في WER وأفضل في الواقع. وهذا بالضبط سبب إصراري على المقياس الثاني، وهو مقياس لا أعرف لوحة منشورة تحسبه.
اللكنة من الصوت: ما أقبله وما أرفضه
حين أطلب تحديد اللهجة من تسجيل، أقبل هذا: “شامية، بثقة متوسطة، وفيها ملمح ساحلي في نطق القاف”. وأرفض هذا: “سوري من دمشق”، لأن التسجيل لا يحمل ما يكفي لهذا الحسم.
والسبب ليس التشدد، بل أن الخطأ هنا اجتماعي لا تقني: ملايين الناس في المنطقة يتكلمون لهجة غير لهجة مكانهم الحالي، ونظام يحسم من ثلاثين ثانية سيصنّف لاجئًا أو مهاجرًا تصنيفًا خاطئًا، وسيبني عليه قرارًا في المنتج.
المصادر
- Artificial Analysis، إصدار Gemini 3.8 Flash: artificialanalysis.ai/articles/gemini-3-8-flash
- NADI 2025، أول مهمة مشتركة لمعالجة الكلام العربي متعدد اللهجات: arxiv.org/abs/2509.02038
- AHELM، تقييم شامل لنماذج الصوت واللغة، Stanford CRFM: arxiv.org/pdf/2508.21376
- DialectalArabicMMLU، LREC 2026: arxiv.org/abs/2510.27543
- مقارنات ممارسين عرب حول نبرة النماذج بالعربية: kuwaitai.net و arabie.ai