تسمعك بالمصري ولا تردّ عليك به: قراءة في SeamlessM4T

وقت القراءة: 8 دقيقة
18
إيهاب صالح | techkahwa.net صدر النموذج: 22 آب 2023 | تاريخ النشر: 5 أيلول 2023

الأرقام أولًا

المقياس النتيجة ما الذي يقيسه المصدر
الفصحى، كلام داخل مدعوم هل يسمعك جدول اللغات الرسمي، مستودع seamless_communication
الفصحى، كلام خارج مدعوم هل يتكلم إليك الجدول نفسه
المصرية، كلام داخل مدعوم هل يسمع لهجتك الجدول نفسه
المصرية، كلام خارج غير مدعوم هل يتكلم لهجتك الجدول نفسه
المغربية، كلام داخل مدعوم هل يسمع الدارجة الجدول نفسه
المغربية، كلام خارج غير مدعوم هل ينطق الدارجة الجدول نفسه
تحسّن الترجمة الصوتية المباشرة +20٪ BLEU فوق أفضل نتيجة سابقة إنجاز النموذج عمومًا، لا عربيًا ملخص الورقة، arXiv:2308.11596
خفض معدل الخطأ مقابل Whisper-Large-V2 45٪ كمتوسط عبر 77 لغة مشتركة متوسط عالمي، ليس رقمًا عربيًا الورقة نفسها
SeamlessM4T v2، متوسط الخطأ العربي 38.16٪ عبر ست مجموعات اختبار تقييم مستقل، المرتبة الرابعة من 16 لوحة تفريغ الكلام العربي المفتوحة، Interspeech 2025
SeamlessM4T v2 على مجموعة SADA، الفصحى 39.87٪ خطأ الأساس المصدر نفسه
SeamlessM4T v2 على SADA، المصرية 72.98٪ خطأ الفجوة الحقيقية المصدر نفسه

انظر إلى الصفين الأخيرين: من 39.87 إلى 72.98. الخطأ يتضاعف تقريبًا حين تنتقل من الفصحى إلى المصرية. وثلاثة أرباع الكلمات خطأ يعني نصًا لا يصلح لشيء.


خريطة الدعم، كما نشرتها ميتا

ما تستطيعه العربية داخل SeamlessM4T
الفصحى، سماع
مدعوم
الفصحى، نطق
مدعوم
المصرية، سماع
مدعوم
المصرية، نطق
غير مدعوم
المغربية، سماع
مدعوم
المغربية، نطق
غير مدعوم

وهذا هو عنوان المقالة كله: اللهجة مسموعة، غير منطوقة.


بطاقة النموذج

البند التفصيل
النموذج SeamlessM4T
الجهة ميتا
تاريخ الإصدار 22 آب 2023
الورقة arXiv:2308.11596
المهام تفريغ كلام، ترجمة نص، ترجمة كلام إلى نص، كلام إلى كلام
الأصناف العربية المدعومة ثلاثة: فصحى، مصرية، مغربية
ما نشرته ميتا عن العربية تحديدًا لا رقم منفصل تمكّنتُ من تأكيده
مصدر الأرقام العربية تقييم أكاديمي مستقل، بعد سنتين

قراءة ARAB-LENS: الاعتراف الناقص

سأبدأ بالإنصاف، لأن هذا النموذج يستحقه.

إدراج المصرية والمغربية في جدول اللغات الرسمي كان خطوة حقيقية، ولم يكن مألوفًا سنة 2023. أغلب الأنظمة وقتها كانت تكتب “Arabic” سطرًا واحدًا وتنتهي. ميتا كتبت ثلاثة أسطر وأعطت كل واحد رمزه: arb وary وarz. هذا اعتراف صريح بأن العربية ليست لغة واحدة، وهو اعتراف نادر.

ثم توقّف الاعتراف عند منتصف الطريق.

انظر إلى الجدول مرة أخرى: المصرية والمغربية مدعومتان دخولًا فقط. تستطيع أن تتكلم بالمصرية فيفهمك، ويعطيك نصًا. لكنه لا يستطيع أن يردّ عليك بالمصرية. المخرج الصوتي الوحيد بالعربية هو الفصحى.

ما معنى هذا عمليًا؟ تخيّل مكالمة: أنت تتكلم بالمصري، والطرف الآخر يسمع فصحى. تقول “عايز أحجز أوضة لليلتين” فيسمع صوتًا يقول “أريد حجز غرفة لليلتين”. النظام نجح تقنيًا وفشل إنسانيًا، لأن أحدًا لا يتكلم هكذا.

وهنا رأيي: هذا ليس نقصًا تقنيًا بقدر ما هو نقص في البيانات، والبيانات نقصها نقص في القرار. تركيب الكلام يحتاج تسجيلات صوتية موسومة بدقة بلهجة واحدة، وهذه لم تكن موجودة، ولم يقرر أحد أن يصنعها. لأن العائد على الاستثمار في صوت مغربي اصطناعي لا يُحسب بنفس طريقة العائد على الإسبانية.

الملاحظة الثالثة، وهي الأهم منهجيًا: كل الأرقام اللامعة في الورقة عالمية لا عربية. “زيادة عشرين بالمئة” متوسط عبر عشرات اللغات. “خفض الخطأ خمسة وأربعين بالمئة مقابل Whisper” متوسط عبر سبع وسبعين لغة. وأنا حاولت أن أستخرج رقمًا عربيًا واحدًا من جداول الورقة فلم أصل إلى قيمة أثق بها بما يكفي لأنشرها. فحين تقرأ عنوانًا يقول “ميتا تحسّن الترجمة العربية بعشرين بالمئة”، اعرف أن هذا العنوان مخترَع.

الأرقام العربية الحقيقية جاءت بعد سنتين، من فريق في شركة علم السعودية، في مؤتمر Interspeech 2025. وهي أرقام غير مريحة: 38.16٪ خطأ كمتوسط، و72.98٪ على المصرية. والرقم الأخير يعني أن ثلاث كلمات من كل أربع خرجت غلط.


من دفتر الاختبار: اختبار الصوت العربي بلا مختبر

هذه بنود تشغّلها بميكروفون هاتفك فقط.

البند الأول: الجملة الواحدة بأربعة أصوات.

سجّل الجملة نفسها بأربع طرق نطق للقاف، واحسب كم مرة خرج النص صحيحًا:

النطق الجملة كما تُقال النص المتوقّع
بالقاف “قال لي قبل قليل” قال لي قبل قليل
بالهمزة “آل لي أبل أليل” قال لي قبل قليل
بالگاف “گال لي گبل گليل” قال لي قبل قليل
بالكاف “كال لي كبل كليل” قال لي قبل قليل

النظام الجيد يخرج السطر نفسه أربع مرات. النظام الضعيف يكتب “آل” أو “گال” كما سمعها، أو يخترع كلمات. وهذا اختبار قاسٍ ومنصف في الوقت نفسه، لأن الأربعة كلها عربية صحيحة.

البند الثاني: الأرقام المنطوقة.

الأرقام أكثر ما يُخطئ فيه التفريغ العربي، لأن صياغتها تختلف جذريًا بين اللهجات:

الفصحى الشامي المصري الخليجي
اثنان وعشرون تنين وعشرين اتنين وعشرين ثنين وعشرين
الساعة الثالثة والنصف الساعة تلاتة ونص الساعة تلاتة ونص الساعة ثلاث ونص
مئة وخمسون ريالًا مية وخمسين ليرة ميت جنيه وخمسين مية وخمسين ريال

سجّل عشرة مبالغ ومواعيد بلهجتك واحسب نسبة الخطأ. في تجربتي هذه أعلى نسبة خطأ في أي فئة، وهي بالضبط الفئة التي تهم أي تطبيق حقيقي: حجز، فاتورة، موعد.

البند الثالث: كلمة أجنبية داخل جملة عربية.

نحن نتكلم هكذا فعلًا:

“بعتلي الـ link على الواتساب وبعدين عملنا meeting ع الزوم.”
“الـ deadline بكرا، وأنا لسا ما خلّصت الـ presentation.”
“حجزتلك appointment عند الدكتور الساعة أربعة.”

النظام الضعيف يفعل واحدًا من اثنين: يكتب الكلمة الأجنبية بحروف عربية مشوّهة، أو يحذفها ويكمل. سجّل أيهما يحصل، لأن الأول قابل للإصلاح والثاني كارثي.

البند الرابع: الصمت والتردد.

الكلام العربي الحقيقي فيه “يعني” و”إيه” و”شو اسمه” و”الله يخليك”. سجّل جملة فيها ثلاث من هذه واطلب التفريغ. بعض الأنظمة تحذفها، وهذا مفيد. وبعضها يحوّلها إلى كلمات لها معنى، وهذا يخرّب النص كله. جرّب: “يعني أنا، إيه، شو اسمه، بدي أأجّل الموعد.”

البند الخامس: اختبار الأسماء العربية.

أنظمة التفريغ تُدرَّب على قوائم أسماء، والأسماء العربية خارجها غالبًا. سجّل عشرة أسماء وقِس:

الفئة أمثلة لماذا صعبة
شائعة جدًا محمد، أحمد، فاطمة تنجح غالبًا
متوسطة مهند، رزان، بشار تبدأ الأخطاء
نادرة ضرار، نائلة، صهيب تفشل كثيرًا
مركّبة عبد الرحمن، أم كلثوم تُقسم إلى كلمتين
بألقاب أبو خالد، الحاج سمير تُحذف الألقاب

الفئة الرابعة أخطر مما تبدو: نظام يكتب “عبد” و”الرحمن” منفصلتين سيخرّب أي بحث في قاعدة بيانات عملاء.

البند السادس: اختبار الضجيج الواقعي.

سجّل الجملة نفسها في أربع بيئات: غرفة هادئة، شارع، سيارة تسير، ومكالمة هاتفية. النسبة التي تهمّك ليست رقم الغرفة الهادئة، بل الفرق بين الأربعة. النظام الجيد يتدهور بهدوء، والضعيف ينهار فجأة في البيئة الثالثة.


ما الذي يلزم لبناء صوت عربي حقيقي

بعد قراءة هذه الأرقام، هذه قائمة ما ينقص فعلًا، وهي أقصر مما تظن:

الحاجة الحالة اليوم من يستطيع سدّها
تسجيلات لهجية موسومة بدقة نادرة جدًا جامعات ومؤسسات إعلامية
توزيع متوازن بين المناطق غائب تعاون إقليمي
تسجيلات لأصوات كبار السن شبه معدومة مشاريع مجتمعية
نصوص مطابقة للكلام لا مهذّبة نادرة تفريغ بشري مدفوع
صوت تركيبي لهجي غير موجود تجاريًا استثمار خاص

لاحظ العمود الأخير: لا شيء في هذه القائمة يحتاج اختراعًا تقنيًا. كلها تحتاج عملًا ميدانيًا وتمويلًا. وهذا في رأيي الخبر الجيد والسيئ في آن: المشكلة قابلة للحل، ولم يقرر أحد حلّها بعد.


الحكم العملي

إن كنت تبني تطبيقًا صوتيًا عربيًا، افترض من البداية أن لهجتك المستهدفة ستُفرَّغ بمعدل خطأ ضعف الفصحى. صمّم واجهتك على هذا الأساس: تأكيد بالنص، إعادة قراءة المبالغ، سؤال توضيحي بدل افتراض الفهم.

ولا تبنِ مخرجًا صوتيًا بالفصحى لمستخدم يتكلم باللهجة. هذا أسوأ من نص مكتوب. الصوت الفصيح في سياق لهجي يوحي بالبرودة والرسمية، وأحيانًا بالسخرية.

وإن كنت تقيّم مورّدًا، اطلب رقمه على مجموعة لهجية مسماة، لا على “العربية”. ومن لا يملك إلا رقمًا واحدًا للعربية كلها، لم يقس لهجتك أصلًا.


المقالة القادمة

بعد ثمانية أيام فقط من هذا الإصدار، أعلنت الإمارات عن Jais: أول نموذج لغوي ضخم بُني للعربية عن قصد، بمئة وستة عشر مليار رمز عربي. رقم يبدو كبيرًا جدًا. المقالة القادمة تفكّكه وتشرح كيف صار الخمسة والخمسون مليارًا مئة وستة عشر.


المصادر

  • ميتا، Introducing SeamlessM4T، آب 2023: about.fb.com/news/2023/08/seamlessm4t-ai-translation-model
  • SeamlessM4T: Massively Multilingual and Multimodal Machine Translation، arXiv:2308.11596، 22 آب 2023
  • جدول اللغات الرسمي، مستودع facebookresearch/seamless_communication، ملف docs/m4t/README.md
  • Wang وAlhmoud وAlqurishi، Open Universal Arabic ASR Leaderboard، Interspeech 2025، آب 2025: isca-archive.org