25.87: أفضل رقم في تفريغ الكلام العربي، وماذا يعني فعلًا

وقت القراءة: 9 دقيقة
18
صدر النموذج: 7 تموز 2026 | تاريخ النشر: 21 تموز 2026 إيهاب صالح | techkahwa.net

الأرقام أولًا

النظاممعدل خطأ الكلمةاللوحة أو المصدر
Cohere Transcribe Arabic25.87لوحة Hugging Face للتعرف على الكلام العربي، تموز 2026
Meta OmniASR-LLM-7B28.32 تقريبًا، أي بفارق 2.45 نقطة خلف المتصدراللوحة نفسها
OpenAI Whisper Large V3نحو 11 نقطة خلف المتصدراللوحة نفسها
Munsit-126.68Open Universal Arabic ASR Leaderboard
OpenAI Whisper على اللوحة نفسها36.86Open Universal Arabic ASR Leaderboard
NADI 2025، أفضل نظام مشارك35.68 WER و12.20 CERArabicNLP 2025
NADI 2025، تحديد اللهجة من الصوت79.8٪ArabicNLP 2025
NADI 2025، استعادة التشكيل55 WER و13 CERArabicNLP 2025
AHELM، أفضل نموذج صوتي لغوي0.803 متوسط معدل الفوزStanford CRFM
AHELM، خط الأساس (تفريغ ثم نموذج لغوي)المركز السادس من 14، وأمتن في الضجيجStanford CRFM
تفريغ الكلام العربي: أين نحن فعلًا
Cohere Transcribe Arabic
25.87 WER
Munsit-1
26.68 WER
NADI 2025 أفضل مشارك
35.68 WER
Whisper Large V3
36.86 WER
الأقل أفضل. وحتى الأفضل يخطئ في ربع الكلمات

ربع الكلمات. هذا أفضل ما وصلنا إليه اليوم في تفريغ الكلام العربي متعدد اللهجات. وإذا كنت تبني منتجًا صوتيًا عربيًا، فهذا هو الرقم الذي يجب أن يحكم قراراتك المعمارية كلها، لا وعود صفحات التسويق.


تحذير منهجي قبل أي مقارنة

قبل أن يستعمل أحد هذا الجدول في عرض تقديمي، لا بد من قول ما يقوله الباحثون أنفسهم: أرقام WER لا تُقارَن عبر الجهات المختلفة إلا بحذر شديد، لأن مجموعات الاختبار تختلف، وقواعد التطبيع تختلف، ومعالجة التشكيل والهمزات وعلامات الترقيم تختلف.

انظر إلى Whisper في الجدول: يظهر مرة بفارق 11 نقطة عن المتصدر على لوحة، ومرة بـ36.86 على لوحة أخرى. النموذج واحد، والاختلاف في القياس لا في النموذج.

ولهذا أضع قاعدة في ARAB-LENS: قارن داخل اللوحة الواحدة فقط، واعتبر الأرقام عبر اللوحات مؤشرات اتجاه لا أحكامًا نهائية.


بطاقة النموذج المتصدر

البندالتفصيل
الاسمCohere Transcribe Arabic
الجهةCohere
تاريخ الإصدار7 تموز 2026
الأساسنموذج تعرف على الكلام بحجم ملياري معامل
التغطيةنحو 30 صنفًا عربيًا: فصحى، ومصرية، وخليجية، وشامية، ومغاربية
ميزة إضافيةالتبديل اللغوي عربي إنجليزي، والإنجليزية بلكنة عربية
التفضيل البشريفُضِّل على Whisper في 95.8٪ من الاختبارات البشرية
السرعةRTFx 525 مقابل 146 لـ Whisper
الرخصةApache 2.0

رقم 95.8٪ في التفضيل البشري أهم عندي من 25.87، لأنه يقيس ما يشعر به المستخدم لا ما يحسبه السكربت. وهذا بالضبط ما أدعو إليه في كل مقالة: الحكم النهائي لأذن بشرية.


لماذا WER وحده مقياس ناقص في العربية

أربعة أسباب، كلها بنيوية في اللغة لا في النموذج:

الأول، الخطأ ليس متساوي الأثر. “ما بقدر” مقابل “بقدر”: كلمة واحدة في الحساب، وانقلاب كامل في المعنى. “بدي روح” مقابل “بدي أروح”: خطأ في الحساب، وصفر خطأ في المعنى.

الثاني، التطبيع يغيّر الرقم. هل تُحتسب الهمزة؟ والتاء المربوطة؟ والتشكيل؟ تغيير قاعدة واحدة يحرّك WER عدة نقاط دون أن يتغير أداء النظام.

الثالث، التشكيل مهمة قائمة بذاتها. سجّلت NADI 2025 في مهمة استعادة التشكيل للكلام 55 WER، أي أكثر من نصف الكلمات بتشكيل خاطئ. ومن يبني منتجًا تعليميًا أو قرآنيًا لا يستطيع تجاهل هذا الرقم.

الرابع، التفريغ ليس الفهم. وهذا أهمها. نظام يفرّغ بدقة قد يفشل في الإجابة عن سؤال بسيط حول ما قيل.


الاختبار: بروتوكول أربع مراحل لفريقك

المرحلة أ، رقم الواقع. سجّل عشر دقائق من مستخدميك الحقيقيين، لا من قارئ محترف. خمس عينات في بيئة هادئة وخمس في بيئة واقعية: مقهى، سيارة، مكالمة هاتف. احسب WER للمجموعتين. الفارق بينهما هو ما ستدفعه ثمنًا في الإنتاج.

المرحلة ب، الأسماء والأرقام. أدخل في كل تسجيل اسم عَلَم عربيًا مركّبًا، ورقمًا منطوقًا طويلًا، وتبديلًا لغويًا. هذه ثلاثة أشياء تنكسر فيها الأنظمة، وهي بالضبط ما يحتاجه منتجك: أسماء العملاء، والمبالغ، والمصطلحات التقنية.

المرحلة ج، الفهم لا النسخ. بعد التفريغ، اسأل النموذج اللغوي سؤالًا عن معنى ما قيل، لا عن نصه. “لماذا لم يأتِ المتكلم؟” و”هل كان راضيًا؟”.

المرحلة د، اللهجة والثقة. اطلب تحديد اللهجة مع درجة ثقة، واقبل “شامية” بدل “سورية”. ثم راقب: هل يعترف النظام بعدم اليقين، أم يخمّن دولة دائمًا؟


القرار المعماري: مسار واحد أم مساران

هذه أهم فقرة عملية في المقالة.

نموذج صوتي متكاملتفريغ ثم نموذج لغوي
السرعةأسرع، خطوة واحدةأبطأ، خطوتان
العرض التقديميمبهرعادي
المراجعة البشريةصعبة، لا نص وسيطسهلة، النص متاح
التصحيحيتطلب إعادة الجولة كاملةيمكن تصحيح النص ثم إعادة الفهم
المتانة في الضجيجأقل، بحسب AHELMأعلى، بحسب AHELM
التدقيق والامتثالأصعبأسهل، لوجود سجل نصي

وتقييم AHELM يدعم هذا مباشرة: خط الأساس البسيط، أي التفريغ يتبعه نموذج لغوي، جاء سادسًا بين أربعة عشر نظامًا وكان أكثر مقاومة للضجيج من معظمها.

توصيتي لمن يبني بالعربية اليوم: ابدأ بمسارين، لا بمسار واحد. ليس لأن النموذج المتكامل ضعيف، بل لأن النص الوسيط في العربية أثمن مما يبدو: تحتاجه للمراجعة، وللتصحيح اللهجي، ولتدريب نموذجك لاحقًا على بياناتك أنت.


الحكم العملي، وخلاصة السلسلة

  1. اعتبر 25٪ خطأ هو نقطة البداية لا النهاية. صمّم واجهتك على أن التفريغ سيخطئ: أظهر النص للمستخدم، واجعل التصحيح بضغطة.
  2. قِس على بيئتك وبلهجتك. لوحة عامة لن تخبرك شيئًا عن مقهى في عمّان.
  3. افصل التفريغ عن الفهم. والسبب ليس تقنيًا فقط، بل رقابيًا وتشغيليًا.
  4. اقبل عدم اليقين في اللهجة، واجعل التصحيح بيد المستخدم.

وبهذا تنتهي سلسلة ARAB-LENS في ثماني عشرة مقالة. الخيط الذي يجمعها كلها جملة واحدة: العربية تُقاس اليوم في المكان الذي يسهل فيه القياس، لا في المكان الذي يعيش فيه المستخدم. الفصحى مقيسة، واللهجة لا. المعرفة مقيسة، والمقصد لا. التفريغ مقيس، والفهم لا. وكل من يبني منتجًا عربيًا يدفع ثمن هذه الفجوة، سواء انتبه لها أم لا.

والخطوة التالية عندي: مجموعة ذهبية شامية مكتوبة بيد متحدثين أصليين، مغلقة عن التدريب، تُستعمل مرجعًا لا مادة تدريب. من يريد المشاركة فيها يعرف أين يجدني.


ما لا يقيسه أي رقم في هذه المقالة

كل الأرقام أعلاه تخص التفريغ، أي تحويل الصوت إلى حروف. وهذا نصف المنتج الصوتي. النصف الآخر أن يفهم النظام ما قيل، وأن يردّ بصوت يشبه البشر.

وفي الفهم تحديدًا يوجد رقم منشور يستحق أن يُقرأ مع أرقام WER: دراسة AL-QASIDA التي قاست تسعة نماذج نصية عبر ثماني لهجات وجدت أن الفهم أفضل من الإنتاج، وأن النماذج تسقط إلى الفصحى بارتباط 0.99 حين تعجز عن اللهجة.

معنى ذلك في منتج صوتي: حتى لو فرّغ نظامك الكلام الشامي تفريغًا ممتازًا، فإن الطبقة التي ترد على المستخدم ستميل إلى الفصحى. فتحصل على مساعد صوتي يسمعك بلهجتك ويكلّمك بلغة النشرة.

قائمة ما قبل الإطلاق

البندمعيار القبول
WER في بيئة هادئةقِسه، ولا تقبل رقم المزوّد
WER في بيئة واقعيةالفارق عن الهادئة أقل من عشر نقاط
أسماء الأعلامتسعون بالمئة صحيحة في عيّنة من خمسين اسمًا
الأرقام المنطوقةصحيحة بصيغتها لا رقمًا رقمًا
التبديل اللغويلا يترجم المصطلح التقني
فهم المقصوديجيب عن سؤال حول المعنى لا عن النص
تحديد اللهجةعائلة لهجية مع درجة ثقة، لا دولة قاطعة
توليد الصوتالوقف على التاء المربوطة، والتنغيم الاستفهامي
التصحيحالمستخدم يستطيع تعديل النص بضغطة
السجلتخزين معدل التصحيح حسب اللهجة والبيئة

البند الأخير هو الذي يحوّل منتجك إلى نظام يتعلم: معدل تصحيح المستخدمين مصنّفًا حسب اللهجة والبيئة يعطيك خلال ثلاثة أشهر خريطة ضعف نظامك الحقيقية، وهي خريطة لا تبيعها أي شركة ولا تنشرها أي لوحة.

خاتمة السلسلة: ماذا أطلب من الحقل

ثماني عشرة مقالة، وخيط واحد: نقيس العربية حيث يسهل القياس، لا حيث يعيش المستخدم.

وأختم بثلاثة مطالب محددة، أراها قابلة للتنفيذ خلال سنة:

  1. مقياس عام لتوليد اللهجة بحكم متحدثين أصليين. الأدوات موجودة، والمطلوب تمويل ساعات بشرية لا خوارزمية جديدة.
  2. مجموعة ذهبية شامية مغلقة عن التدريب. لأن الشامية هي الأضعف في كل قياس متاح، والأكثر غيابًا عن مقاييس الحوار.
  3. نشر معدل الطليق والخاطئ مع كل تقييم عربي. رقم واحد يقول كم مرة تبدو الإجابة صحيحة وهي ليست كذلك.

من يريد المشاركة في أي من الثلاثة يعرف أين يجدني.


من دفتر الاختبار الصوتي: العينة الثابتة التي أشغّلها

عينتي الصوتية ثابتة منذ سنوات، وهذا ما فيها بالضبط:

الجزءالمحتوىما يكشفه
1قراءة فصيحة هادئة، عشر ثوانٍخط الأساس، وأي نظام ينجح هنا
2شامية دمشقية عادية، عشرون ثانيةالتمثيل الحضري الشائع
3شامية سريعة مع إدغامالكلام الحقيقي لا المقروء
4أردنية شمالية بالقاف الگافخارج التمثيل الحضري
5جملة فيها اسم مركّب ورقم طويلأكثر مواضع الانكسار
6الجملة نفسها في مقهىالفارق بين المختبر والواقع

والرقمان اللذان أسجّلهما لكل جزء: معدل خطأ الكلمة، ومعدل الخطأ المُغيِّر للمعنى. والثاني هو ما أبني عليه قراري.

ثلاثة أخطاء تفريغ رأيتها تتكرر، ولماذا تهم

الأول، سقوط “ما” النافية. “ما بقدر” تصير “بقدر”. كلمة واحدة في الحساب، وانقلاب كامل في المعنى. وفي منتج خدمة عملاء هذا يعني أن النظام سجّل موافقة بدل رفض.

الثاني، تفكيك الاسم المركّب. “عبد الرحمن” تصير كلمتين منفصلتين بلا علاقة. في الحساب خطأ صغير، وفي قاعدة بيانات العملاء اسم غير قابل للمطابقة.

الثالث، قلب الرقم. “ألفين وخمسمية” تخرج 2500 أو 5002 حسب النظام، لأن العربية تنطق الآحاد قبل العشرات في بعض الصيغ. في تطبيق مالي هذا خطأ لا يُحتمل.

هذه الثلاثة هي ما أفحصه يدويًا في كل تقييم، لأن أي مقياس متوسط سيبتلعها.

اختبار التوليد الصوتي: خمس جمل وحكم بشري

الجملةما تقيسه
“سافرت من عَمّان إلى عُمان”التفريق بين اسمين متشابهين رسمًا
“قرأتُ رسالةَ المديرة”الوقف على التاء المربوطة هاءً
“المبلغ ألفان وثلاثمئة وخمسة وسبعون”نطق الرقم بصيغته لا منزلةً منزلة
“إنت رايح لحالك؟”التنغيم الاستفهامي
“حجزت على طيران Qatar Airways”الانتقال بين نظامين صوتيين

والحكم النهائي لخمسة مستمعين عرب، وسؤال واحد: هل هذا صوت شخص أم صوت نظام؟

خلاصة السلسلة

ثماني عشرة مقالة، وخيط واحد: نقيس العربية حيث يسهل القياس، لا حيث يعيش المستخدم.

وما أطلبه من الحقل ثلاثة أشياء محددة: مقياس عام لتوليد اللهجة يحكم فيه متحدثون أصليون، ومجموعة ذهبية شامية مغلقة عن التدريب، ونشر معدل الطليق والخاطئ مع كل تقييم عربي. والثلاثة قابلة للتنفيذ خلال سنة، ولا يحتاج أي منها خوارزمية جديدة، بل ساعات بشرية وقرارًا بأن يُقاس ما يهم لا ما يسهل.

المصادر

  • Cohere، إطلاق Transcribe Arabic ونتائجه: cohere.com/blog/transcribe-arabic
  • مقارنة أدوات التفريغ العربي وأرقام Munsit و Whisper: munsit.com/blog/best-arabic-speech-to-text
  • NADI 2025، أول مهمة مشتركة لمعالجة الكلام العربي متعدد اللهجات: arxiv.org/abs/2509.02038
  • AHELM، تقييم شامل لنماذج الصوت واللغة، Stanford CRFM: arxiv.org/pdf/2508.21376
  • NADI 2026، المهمة القادمة للكلام العربي المختلط اللهجات: nadi.dlnlp.ai/2026
  • مقارنة أدوات التفريغ العربي لدى الممارسين: munsit.com/blog/best-arabic-speech-to-text