الأرقام أولًا
| المقياس | النتيجة | ما الذي يقيسه | المصدر |
|---|---|---|---|
| Whisper large-v3، الفصحى على مجموعة SADA | 27.95٪ خطأ | أفضل حالات النموذج بالعربية | لوحة تفريغ الكلام العربي المفتوحة، Interspeech 2025 |
| Whisper large-v3، النجدي | 48.58٪ | أول درجات الانهيار | المصدر نفسه |
| Whisper large-v3، الحجازي | 49.99٪ | نصف الكلمات خطأ | المصدر نفسه |
| Whisper large-v3، المصري | 59.28٪ | أكبر لهجة عربية عددًا | المصدر نفسه |
| Whisper large-v3، الخليجي | 59.92٪ | الأسوأ، والضعف تقريبًا | المصدر نفسه |
| المتوسط العربي عبر ست مجموعات | 36.86٪ | المرتبة الثالثة من 16 نموذجًا | المصدر نفسه |
| SeamlessM4T v2 للمقارنة | 38.16٪ | المرتبة الرابعة | المصدر نفسه |
| ما نشرته OpenAI عن العربية | لا شيء | لا رقم واحد | صفحة DevDay وبطاقة النموذج |
| ما نشرته OpenAI عمومًا | خفض الأخطاء 10٪ إلى 20٪ مقابل large-v2 | عبر اللغات، بلا تفصيل | بطاقة النموذج على Hugging Face |
الفجوة: من 27.95 إلى 59.92، أي 2.1 ضعف. وهذه ليست فجوة بين لغتين، هذه فجوة داخل اللغة الواحدة.
خريطة الخطأ حسب اللهجة
اقرأ العمود الأخير كما يقرأه مستخدمك: ستّ كلمات من كل عشر تخرج غلط. لا يوجد منتج يُبنى على هذا.
بطاقة النموذج
| البند | التفصيل |
|---|---|
| النموذج | Whisper large-v3 |
| الجهة | OpenAI |
| تاريخ الإصدار | 6 تشرين الثاني 2023، في مؤتمر DevDay |
| الترخيص | مفتوح |
| ما أعلنته OpenAI | “أداء محسّن عبر اللغات” |
| أرقام عربية رسمية | لا توجد |
| مصدر الأرقام في هذه المقالة | ورقة أكاديمية من شركة علم السعودية، Interspeech 2025 |
| مجموعة SADA | بيانات كلام عربي سعودي متعدد اللهجات |
قراءة ARAB-LENS: لماذا الفجوة هنا أخطر من أي مكان آخر
في مقالات هذه السلسلة رأينا فجوات كثيرة بين الفصحى واللهجة. لكن فجوة الصوت مختلفة نوعيًا لثلاثة أسباب.
الأول: لا أحد يتكلم بالفصحى.
حين تكتب، قد تكتب بالفصحى. حين تتكلم، لا. لا أحد يقول لصديقه “أريد أن أحجز موعدًا في الساعة الثالثة”. يقول “بدي أحجز موعد الساعة تلاتة” أو “أبي موعد الساعة ثلاث”. أي أن الحالة التي يجيدها النموذج، 27.95٪، هي الحالة التي لا تحدث تقريبًا في الاستعمال الحقيقي. والحالة التي تحدث فعلًا هي التي يسجّل فيها ستين بالمئة خطأ.
في النص، الفصحى واقع كثير الحدوث. في الصوت، الفصحى استثناء.
الثاني: الخطأ الصوتي لا يُصحَّح ذاتيًا.
حين يخطئ نموذج نصي في كلمة، تقرأ الجملة وتفهم المقصود. حين يخطئ نظام تفريغ في كلمة، تختفي الكلمة وتحل محلها كلمة أخرى، ولا تعرف أن هناك خطأ. الفرق بين “حوّلت ألف” و”حوّلت ألفين” لا يُكتشف إلا بعد فوات الأوان.
الثالث، وهو الذي يزعجني أكثر: الترتيب معكوس.
انظر إلى ترتيب اللهجات في الجدول. الأسوأ هما المصري والخليجي. المصرية هي أكثر اللهجات العربية متحدثين على الإطلاق، والخليجية هي لهجة أكبر سوق إنفاق تقني في المنطقة. أي أن النظام أسوأ ما يكون في اللهجتين الأعلى قيمة تجارية.
وهذا ليس عبثًا. له تفسير واضح: بيانات التدريب الصوتية تأتي من الإنترنت، والعربية المنطوقة على الإنترنت أغلبها إما نشرات أخبار بالفصحى أو محتوى ترفيهي مختلط. المحتوى الذي فيه كلام يومي حقيقي بلهجة واحدة نظيفة ومكتوب نصه بدقة، نادر جدًا.
والملاحظة الأخيرة، وهي قاعدة أكررها: OpenAI لم تنشر رقمًا عربيًا واحدًا لهذا النموذج. الأرقام التي تقرأها أعلاه جاءت من فريق سعودي بعد سنة وتسعة أشهر من الإصدار. وأنا أحترم كثيرًا أن يكون المصدر الأدق عن العربية في هذا النموذج ورقة عربية. لكن السؤال يبقى: لماذا علينا دائمًا أن نقيس بأنفسنا ما تنشره الشركات عن كل لغة أخرى؟
من دفتر الاختبار: بناء اختبار صوتي عربي في ساعة
هذه منهجية كاملة تستطيع تشغيلها بهاتفك، وتعطيك رقمًا حقيقيًا لمنتجك بدل رقم عام.
الخطوة الأولى: اجمع عشرين جملة من عالمك.
لا تستعمل جملًا عامة. استعمل الجمل التي يقولها عميلك فعلًا. أمثلة من ثلاثة قطاعات:
| القطاع | جملة حقيقية |
|---|---|
| مطعم | “بدي طلب دليفري، تلات شاورما دجاج وواحد لحمة، وزودلي ثوم.” |
| صيدلية | “عندكم بديل لهاد الدوا؟ وبكم العلبة بعد الخصم؟” |
| بنك | “حوّلت ألفين وخمسمية من حسابي أمس وما وصلت.” |
| اتصالات | “الباقة خلصت وأنا لسا بنص الشهر، شو الحل؟” |
| حجوزات | “بدي أأجّل الحجز من الخميس للسبت، نفس الغرفة.” |
الخطوة الثانية: سجّلها بثلاثة أصوات.
الصوت نفسه ثلاث مرات لا يكفي. تحتاج: صوت رجل، صوت امرأة، وصوت شخص فوق الخمسين. لأن أنظمة التفريغ تتدهور مع الأصوات الأكبر سنًا بشكل ملحوظ، وهذه فئة لا يختبرها أحد.
الخطوة الثالثة: احسب الخطأ على ما يهم فقط.
لا تحسب كل الكلمات. احسب الكلمات الحرجة فقط:
| الفئة | لماذا حرجة |
|---|---|
| الأرقام | مبالغ وكميات ومواعيد |
| الأسماء | أسماء أشخاص ومنتجات وأماكن |
| النفي | “ما وصلت” مقابل “وصلت” |
| التواريخ والأيام | الخميس مقابل السبت |
نظام يخطئ في 40٪ من الكلمات لكنه يصيب كل الأرقام والنفي قد يكون صالحًا للاستعمال. ونظام يخطئ في 20٪ لكنه يقلب النفي، كارثي. معدل الخطأ العام مقياس مضلِّل لأي تطبيق حقيقي.
الخطوة الرابعة: اختبر الفخاخ الأربعة.
| الفخ | مثال | ما يكشفه |
|---|---|---|
| النفي القصير | “ما بدي” مقابل “بدي” | حرف واحد يقلب المعنى |
| الرقم المركّب | “ألفين وخمسمية” | تجزئة الأرقام |
| الاسم غير الشائع | “بدي أحكي مع أ. مهند” | أسماء عربية خارج القائمة الشائعة |
| الكلمة الأجنبية | “الـ appointment مؤجّل” | تبديل لغوي داخل الجملة |
الخطوة الخامسة: كرّر بعد ستة أشهر.
أنظمة التفريغ تتحسّن بسرعة، لكن ليس بالتساوي عبر اللهجات. احتفظ بتسجيلاتك العشرين كمجموعة ثابتة وأعد تشغيلها. هذه ستصير مسطرتك الخاصة، وهي أنفع من أي لوحة ترتيب عالمية، لأنها تقيس لهجتك أنت وعملاءك أنتم.
الخطوة السادسة: قِس التحيّز بين الجنسين والأعمار.
هذا بُعد لا تقيسه أي لوحة عربية، ورأيته يُسقط مشاريع كاملة:
| المتحدث | ما يحدث غالبًا |
|---|---|
| رجل، 25 إلى 45، لهجة شائعة | أفضل النتائج |
| امرأة، العمر نفسه | تدهور طفيف |
| فوق 60 | تدهور كبير |
| طفل | تدهور حاد |
| متحدث بلكنة إقليمية داخل اللهجة | غير متوقع |
إن كان منتجك يخدم خدمة حكومية أو صحية، فجمهورك فيه كبار سن بنسبة عالية. وقياسك على أصوات زملائك في المكتب لا يمثّلهم.
لماذا تفشل الفصحى في الصوت أصلًا
أريد أن أشرح شيئًا يُساء فهمه كثيرًا: حتى الرقم “الجيد”، 27.95٪، ليس جيدًا.
| المقارنة | معدل الخطأ التقريبي |
|---|---|
| الإنجليزية في ظروف نظيفة | أقل من 5٪ |
| العربية الفصحى، هذا النموذج | 27.95٪ |
| العربية الخليجية، هذا النموذج | 59.92٪ |
انظر إلى السطر الأول والثاني. أفضل حالات العربية أسوأ بخمسة أضعاف تقريبًا من الحالة العادية للإنجليزية. وهذا قبل أن ندخل في اللهجات أصلًا.
وأنا أذكر هذا لأن النقاش العربي ينشغل كثيرًا بفجوة الفصحى واللهجة، وينسى الفجوة الأكبر: فجوة العربية كلها أمام الإنجليزية. الأولى فجوة داخلية نستطيع سدّها ببيانات محلية. والثانية فجوة بنيوية تحتاج استثمارًا بحجم آخر.
الحكم العملي
إن كنت تبني مساعدًا صوتيًا عربيًا، لا تجعل الصوت المسار الوحيد. اجعل كل قرار مالي أو حرج يمر بتأكيد نصي. هذه ليست ضعفًا في التصميم، هذه هندسة تراعي معدل خطأ ستين بالمئة.
ولا تصدّق رقمًا واحدًا للعربية. اطلب من أي مورّد تفصيلًا بحسب اللهجة، ومن لا يملكه لم يختبر منتجك.
وإن كان جمهورك خليجيًا أو مصريًا، اعرف أنك في أصعب حالتين تحديدًا، وخطّط ميزانية تصحيح ومراجعة بشرية من البداية.
المقالة القادمة
بعد شهر واحد، أطلقت Mistral الفرنسية نموذج Mixtral 8x7B وأعلنت اللغات التي يتقنها: الإنجليزية والفرنسية والإيطالية والألمانية والإسبانية. خمس لغات. المقالة القادمة عن القائمة التي لم تكن العربية فيها، وعمّا يعنيه أن تُستبعد صراحة لا ضمنًا.
المصادر
- OpenAI، New models and developer products announced at DevDay، 6 تشرين الثاني 2023: openai.com
- إصدار Whisper v20231106 على GitHub: github.com/openai/whisper/releases
- Wang وAlhmoud وAlqurishi، Open Universal Arabic ASR Leaderboard، Interspeech 2025، آب 2025: isca-archive.org
- بطاقة النموذج openai/whisper-large-v3 على Hugging Face