الأرقام أولًا
| النظام | معدل خطأ الكلمة | اللوحة أو المصدر |
|---|---|---|
| Cohere Transcribe Arabic | 25.87 | لوحة Hugging Face للتعرف على الكلام العربي، تموز 2026 |
| Meta OmniASR-LLM-7B | 28.32 تقريبًا، أي بفارق 2.45 نقطة خلف المتصدر | اللوحة نفسها |
| OpenAI Whisper Large V3 | نحو 11 نقطة خلف المتصدر | اللوحة نفسها |
| Munsit-1 | 26.68 | Open Universal Arabic ASR Leaderboard |
| OpenAI Whisper على اللوحة نفسها | 36.86 | Open Universal Arabic ASR Leaderboard |
| NADI 2025، أفضل نظام مشارك | 35.68 WER و12.20 CER | ArabicNLP 2025 |
| NADI 2025، تحديد اللهجة من الصوت | 79.8٪ | ArabicNLP 2025 |
| NADI 2025، استعادة التشكيل | 55 WER و13 CER | ArabicNLP 2025 |
| AHELM، أفضل نموذج صوتي لغوي | 0.803 متوسط معدل الفوز | Stanford CRFM |
| AHELM، خط الأساس (تفريغ ثم نموذج لغوي) | المركز السادس من 14، وأمتن في الضجيج | Stanford CRFM |
ربع الكلمات. هذا أفضل ما وصلنا إليه اليوم في تفريغ الكلام العربي متعدد اللهجات. وإذا كنت تبني منتجًا صوتيًا عربيًا، فهذا هو الرقم الذي يجب أن يحكم قراراتك المعمارية كلها، لا وعود صفحات التسويق.
تحذير منهجي قبل أي مقارنة
قبل أن يستعمل أحد هذا الجدول في عرض تقديمي، لا بد من قول ما يقوله الباحثون أنفسهم: أرقام WER لا تُقارَن عبر الجهات المختلفة إلا بحذر شديد، لأن مجموعات الاختبار تختلف، وقواعد التطبيع تختلف، ومعالجة التشكيل والهمزات وعلامات الترقيم تختلف.
انظر إلى Whisper في الجدول: يظهر مرة بفارق 11 نقطة عن المتصدر على لوحة، ومرة بـ36.86 على لوحة أخرى. النموذج واحد، والاختلاف في القياس لا في النموذج.
ولهذا أضع قاعدة في ARAB-LENS: قارن داخل اللوحة الواحدة فقط، واعتبر الأرقام عبر اللوحات مؤشرات اتجاه لا أحكامًا نهائية.
بطاقة النموذج المتصدر
| البند | التفصيل |
|---|---|
| الاسم | Cohere Transcribe Arabic |
| الجهة | Cohere |
| تاريخ الإصدار | 7 تموز 2026 |
| الأساس | نموذج تعرف على الكلام بحجم ملياري معامل |
| التغطية | نحو 30 صنفًا عربيًا: فصحى، ومصرية، وخليجية، وشامية، ومغاربية |
| ميزة إضافية | التبديل اللغوي عربي إنجليزي، والإنجليزية بلكنة عربية |
| التفضيل البشري | فُضِّل على Whisper في 95.8٪ من الاختبارات البشرية |
| السرعة | RTFx 525 مقابل 146 لـ Whisper |
| الرخصة | Apache 2.0 |
رقم 95.8٪ في التفضيل البشري أهم عندي من 25.87، لأنه يقيس ما يشعر به المستخدم لا ما يحسبه السكربت. وهذا بالضبط ما أدعو إليه في كل مقالة: الحكم النهائي لأذن بشرية.
لماذا WER وحده مقياس ناقص في العربية
أربعة أسباب، كلها بنيوية في اللغة لا في النموذج:
الأول، الخطأ ليس متساوي الأثر. “ما بقدر” مقابل “بقدر”: كلمة واحدة في الحساب، وانقلاب كامل في المعنى. “بدي روح” مقابل “بدي أروح”: خطأ في الحساب، وصفر خطأ في المعنى.
الثاني، التطبيع يغيّر الرقم. هل تُحتسب الهمزة؟ والتاء المربوطة؟ والتشكيل؟ تغيير قاعدة واحدة يحرّك WER عدة نقاط دون أن يتغير أداء النظام.
الثالث، التشكيل مهمة قائمة بذاتها. سجّلت NADI 2025 في مهمة استعادة التشكيل للكلام 55 WER، أي أكثر من نصف الكلمات بتشكيل خاطئ. ومن يبني منتجًا تعليميًا أو قرآنيًا لا يستطيع تجاهل هذا الرقم.
الرابع، التفريغ ليس الفهم. وهذا أهمها. نظام يفرّغ بدقة قد يفشل في الإجابة عن سؤال بسيط حول ما قيل.
الاختبار: بروتوكول أربع مراحل لفريقك
المرحلة أ، رقم الواقع. سجّل عشر دقائق من مستخدميك الحقيقيين، لا من قارئ محترف. خمس عينات في بيئة هادئة وخمس في بيئة واقعية: مقهى، سيارة، مكالمة هاتف. احسب WER للمجموعتين. الفارق بينهما هو ما ستدفعه ثمنًا في الإنتاج.
المرحلة ب، الأسماء والأرقام. أدخل في كل تسجيل اسم عَلَم عربيًا مركّبًا، ورقمًا منطوقًا طويلًا، وتبديلًا لغويًا. هذه ثلاثة أشياء تنكسر فيها الأنظمة، وهي بالضبط ما يحتاجه منتجك: أسماء العملاء، والمبالغ، والمصطلحات التقنية.
المرحلة ج، الفهم لا النسخ. بعد التفريغ، اسأل النموذج اللغوي سؤالًا عن معنى ما قيل، لا عن نصه. “لماذا لم يأتِ المتكلم؟” و”هل كان راضيًا؟”.
المرحلة د، اللهجة والثقة. اطلب تحديد اللهجة مع درجة ثقة، واقبل “شامية” بدل “سورية”. ثم راقب: هل يعترف النظام بعدم اليقين، أم يخمّن دولة دائمًا؟
القرار المعماري: مسار واحد أم مساران
هذه أهم فقرة عملية في المقالة.
| نموذج صوتي متكامل | تفريغ ثم نموذج لغوي | |
|---|---|---|
| السرعة | أسرع، خطوة واحدة | أبطأ، خطوتان |
| العرض التقديمي | مبهر | عادي |
| المراجعة البشرية | صعبة، لا نص وسيط | سهلة، النص متاح |
| التصحيح | يتطلب إعادة الجولة كاملة | يمكن تصحيح النص ثم إعادة الفهم |
| المتانة في الضجيج | أقل، بحسب AHELM | أعلى، بحسب AHELM |
| التدقيق والامتثال | أصعب | أسهل، لوجود سجل نصي |
وتقييم AHELM يدعم هذا مباشرة: خط الأساس البسيط، أي التفريغ يتبعه نموذج لغوي، جاء سادسًا بين أربعة عشر نظامًا وكان أكثر مقاومة للضجيج من معظمها.
توصيتي لمن يبني بالعربية اليوم: ابدأ بمسارين، لا بمسار واحد. ليس لأن النموذج المتكامل ضعيف، بل لأن النص الوسيط في العربية أثمن مما يبدو: تحتاجه للمراجعة، وللتصحيح اللهجي، ولتدريب نموذجك لاحقًا على بياناتك أنت.
الحكم العملي، وخلاصة السلسلة
- اعتبر 25٪ خطأ هو نقطة البداية لا النهاية. صمّم واجهتك على أن التفريغ سيخطئ: أظهر النص للمستخدم، واجعل التصحيح بضغطة.
- قِس على بيئتك وبلهجتك. لوحة عامة لن تخبرك شيئًا عن مقهى في عمّان.
- افصل التفريغ عن الفهم. والسبب ليس تقنيًا فقط، بل رقابيًا وتشغيليًا.
- اقبل عدم اليقين في اللهجة، واجعل التصحيح بيد المستخدم.
وبهذا تنتهي سلسلة ARAB-LENS في ثماني عشرة مقالة. الخيط الذي يجمعها كلها جملة واحدة: العربية تُقاس اليوم في المكان الذي يسهل فيه القياس، لا في المكان الذي يعيش فيه المستخدم. الفصحى مقيسة، واللهجة لا. المعرفة مقيسة، والمقصد لا. التفريغ مقيس، والفهم لا. وكل من يبني منتجًا عربيًا يدفع ثمن هذه الفجوة، سواء انتبه لها أم لا.
والخطوة التالية عندي: مجموعة ذهبية شامية مكتوبة بيد متحدثين أصليين، مغلقة عن التدريب، تُستعمل مرجعًا لا مادة تدريب. من يريد المشاركة فيها يعرف أين يجدني.
ما لا يقيسه أي رقم في هذه المقالة
كل الأرقام أعلاه تخص التفريغ، أي تحويل الصوت إلى حروف. وهذا نصف المنتج الصوتي. النصف الآخر أن يفهم النظام ما قيل، وأن يردّ بصوت يشبه البشر.
وفي الفهم تحديدًا يوجد رقم منشور يستحق أن يُقرأ مع أرقام WER: دراسة AL-QASIDA التي قاست تسعة نماذج نصية عبر ثماني لهجات وجدت أن الفهم أفضل من الإنتاج، وأن النماذج تسقط إلى الفصحى بارتباط 0.99 حين تعجز عن اللهجة.
معنى ذلك في منتج صوتي: حتى لو فرّغ نظامك الكلام الشامي تفريغًا ممتازًا، فإن الطبقة التي ترد على المستخدم ستميل إلى الفصحى. فتحصل على مساعد صوتي يسمعك بلهجتك ويكلّمك بلغة النشرة.
قائمة ما قبل الإطلاق
| البند | معيار القبول |
|---|---|
| WER في بيئة هادئة | قِسه، ولا تقبل رقم المزوّد |
| WER في بيئة واقعية | الفارق عن الهادئة أقل من عشر نقاط |
| أسماء الأعلام | تسعون بالمئة صحيحة في عيّنة من خمسين اسمًا |
| الأرقام المنطوقة | صحيحة بصيغتها لا رقمًا رقمًا |
| التبديل اللغوي | لا يترجم المصطلح التقني |
| فهم المقصود | يجيب عن سؤال حول المعنى لا عن النص |
| تحديد اللهجة | عائلة لهجية مع درجة ثقة، لا دولة قاطعة |
| توليد الصوت | الوقف على التاء المربوطة، والتنغيم الاستفهامي |
| التصحيح | المستخدم يستطيع تعديل النص بضغطة |
| السجل | تخزين معدل التصحيح حسب اللهجة والبيئة |
البند الأخير هو الذي يحوّل منتجك إلى نظام يتعلم: معدل تصحيح المستخدمين مصنّفًا حسب اللهجة والبيئة يعطيك خلال ثلاثة أشهر خريطة ضعف نظامك الحقيقية، وهي خريطة لا تبيعها أي شركة ولا تنشرها أي لوحة.
خاتمة السلسلة: ماذا أطلب من الحقل
ثماني عشرة مقالة، وخيط واحد: نقيس العربية حيث يسهل القياس، لا حيث يعيش المستخدم.
وأختم بثلاثة مطالب محددة، أراها قابلة للتنفيذ خلال سنة:
- مقياس عام لتوليد اللهجة بحكم متحدثين أصليين. الأدوات موجودة، والمطلوب تمويل ساعات بشرية لا خوارزمية جديدة.
- مجموعة ذهبية شامية مغلقة عن التدريب. لأن الشامية هي الأضعف في كل قياس متاح، والأكثر غيابًا عن مقاييس الحوار.
- نشر معدل الطليق والخاطئ مع كل تقييم عربي. رقم واحد يقول كم مرة تبدو الإجابة صحيحة وهي ليست كذلك.
من يريد المشاركة في أي من الثلاثة يعرف أين يجدني.
من دفتر الاختبار الصوتي: العينة الثابتة التي أشغّلها
عينتي الصوتية ثابتة منذ سنوات، وهذا ما فيها بالضبط:
| الجزء | المحتوى | ما يكشفه |
|---|---|---|
| 1 | قراءة فصيحة هادئة، عشر ثوانٍ | خط الأساس، وأي نظام ينجح هنا |
| 2 | شامية دمشقية عادية، عشرون ثانية | التمثيل الحضري الشائع |
| 3 | شامية سريعة مع إدغام | الكلام الحقيقي لا المقروء |
| 4 | أردنية شمالية بالقاف الگاف | خارج التمثيل الحضري |
| 5 | جملة فيها اسم مركّب ورقم طويل | أكثر مواضع الانكسار |
| 6 | الجملة نفسها في مقهى | الفارق بين المختبر والواقع |
والرقمان اللذان أسجّلهما لكل جزء: معدل خطأ الكلمة، ومعدل الخطأ المُغيِّر للمعنى. والثاني هو ما أبني عليه قراري.
ثلاثة أخطاء تفريغ رأيتها تتكرر، ولماذا تهم
الأول، سقوط “ما” النافية. “ما بقدر” تصير “بقدر”. كلمة واحدة في الحساب، وانقلاب كامل في المعنى. وفي منتج خدمة عملاء هذا يعني أن النظام سجّل موافقة بدل رفض.
الثاني، تفكيك الاسم المركّب. “عبد الرحمن” تصير كلمتين منفصلتين بلا علاقة. في الحساب خطأ صغير، وفي قاعدة بيانات العملاء اسم غير قابل للمطابقة.
الثالث، قلب الرقم. “ألفين وخمسمية” تخرج 2500 أو 5002 حسب النظام، لأن العربية تنطق الآحاد قبل العشرات في بعض الصيغ. في تطبيق مالي هذا خطأ لا يُحتمل.
هذه الثلاثة هي ما أفحصه يدويًا في كل تقييم، لأن أي مقياس متوسط سيبتلعها.
اختبار التوليد الصوتي: خمس جمل وحكم بشري
| الجملة | ما تقيسه |
|---|---|
| “سافرت من عَمّان إلى عُمان” | التفريق بين اسمين متشابهين رسمًا |
| “قرأتُ رسالةَ المديرة” | الوقف على التاء المربوطة هاءً |
| “المبلغ ألفان وثلاثمئة وخمسة وسبعون” | نطق الرقم بصيغته لا منزلةً منزلة |
| “إنت رايح لحالك؟” | التنغيم الاستفهامي |
| “حجزت على طيران Qatar Airways” | الانتقال بين نظامين صوتيين |
والحكم النهائي لخمسة مستمعين عرب، وسؤال واحد: هل هذا صوت شخص أم صوت نظام؟
خلاصة السلسلة
ثماني عشرة مقالة، وخيط واحد: نقيس العربية حيث يسهل القياس، لا حيث يعيش المستخدم.
وما أطلبه من الحقل ثلاثة أشياء محددة: مقياس عام لتوليد اللهجة يحكم فيه متحدثون أصليون، ومجموعة ذهبية شامية مغلقة عن التدريب، ونشر معدل الطليق والخاطئ مع كل تقييم عربي. والثلاثة قابلة للتنفيذ خلال سنة، ولا يحتاج أي منها خوارزمية جديدة، بل ساعات بشرية وقرارًا بأن يُقاس ما يهم لا ما يسهل.
المصادر
- Cohere، إطلاق Transcribe Arabic ونتائجه: cohere.com/blog/transcribe-arabic
- مقارنة أدوات التفريغ العربي وأرقام Munsit و Whisper: munsit.com/blog/best-arabic-speech-to-text
- NADI 2025، أول مهمة مشتركة لمعالجة الكلام العربي متعدد اللهجات: arxiv.org/abs/2509.02038
- AHELM، تقييم شامل لنماذج الصوت واللغة، Stanford CRFM: arxiv.org/pdf/2508.21376
- NADI 2026، المهمة القادمة للكلام العربي المختلط اللهجات: nadi.dlnlp.ai/2026
- مقارنة أدوات التفريغ العربي لدى الممارسين: munsit.com/blog/best-arabic-speech-to-text