تريليون مقطع صوتي عربي: قراءة في Fanar 2.0 وأول منظومة عربية متعددة الوسائط

وقت القراءة: 9 دقيقة
18
إيهاب صالح | techkahwa.net صدر النموذج: 9 كانون الأول 2025 | تاريخ النشر: 26 كانون الأول 2025

الأرقام أولًا

البندالرقمالمصدر
حجم النموذج27 مليار معامل، ثلاثة أضعاف Fanar الأول (9 مليارات)معهد قطر لبحوث الحوسبة، كانون الأول 2025
بيانات التدريب النصيةأكثر من 300 مليار كلمةالمصدر نفسه
بيانات التدريب الصوتيةأكثر من تريليون مقطع صوتي عربيالمصدر نفسه
الوسائطنص، صورة، كلام إلى نص، نص إلى كلام، فهم صوتي، توليد شعرالمصدر نفسه
طبقة الحمايةFanarGuard، مرشّح محتوى يرصد المخالفات الأمنية والاختلال الثقافي بالعربية والإنجليزيةالمصدر نفسه
الإصدار القادمFanar 3.0، مخطط له في كانون الأول 2026تصريح د. أحمد المجرمد
Fanar-1-9B في PalmX 2025من أكثر النماذج استعمالًا لدى الفرق المشاركةArabicNLP 2025
المقارنة المعلنة من منافسFalcon-H1-Arabic 7B يذكر تفوقه على Fanar-9B على OALLمعهد الابتكار التكنولوجي، كانون الثاني 2026

الرقم الذي أوقفني في هذه القائمة ليس 27 مليارًا ولا 300 مليار كلمة، بل تريليون مقطع صوتي. لأن أكبر عائق أمام الذكاء الاصطناعي العربي ليس النص، بل الصوت. النص العربي متوفر على الإنترنت بكثرة، أما الكلام العربي الموسوم والمفرّغ بدقة عبر اللهجات فنادر ومكلف ويحتاج بشرًا يعرفون الفرق بين خطأ النطق واختلاف اللهجة. من يجمع تريليون مقطع صوتي عربي يبني بنية تحتية، لا نموذجًا.


لماذا تهمّ هذه البنية

دعني أضع أرقام Fanar بجانب أرقام أصعب مهمة صوتية عربية منشورة، وهي NADI 2025:

المهمةأفضل نتيجة في NADI 2025القراءة
التعرف على الكلام35.68 WER و12.20 CERأكثر من ثلث الكلمات المنطوقة تخرج خطأ
تحديد اللهجة من الصوت79.8٪ دقةمقبول للعائلة اللهجية، لا للمنطقة
استعادة التشكيل للكلام55 WER و13 CERأكثر من نصف الكلمات تُشكَّل خطأ
عدد الفرق المشاركة فعليًا8 من 44 سجّلتحقل بحثي صغير بالنسبة لحجم اللغة
حال الصوت العربي في 2025
تفريغ اللهجات
64٪ من الكلمات صحيحة
تحديد اللهجة
79.8٪
التشكيل المنطوق
45٪ تقريبًا
فهم المقصود
لا يُقاس أصلًا

في هذا السياق، إعلان نموذج عربي يجمع التفريغ والتوليد الصوتي والفهم في منظومة واحدة ليس خبرًا تسويقيًا، بل محاولة لسدّ فجوة حقيقية. والسؤال الذي يبقى بلا جواب حتى الآن: لا توجد أرقام منشورة من طرف ثالث لأداء Fanar 2.0 الصوتي. ما لدينا وصف قدرات وحجم بيانات، لا معدل خطأ.


بطاقة النموذج

البندالتفصيل
الاسمFanar 2.0
الجهةمعهد قطر لبحوث الحوسبة، جامعة حمد بن خليفة
الإعلانالقمة العالمية للذكاء الاصطناعي في الدوحة، 9 كانون الأول 2025
الحجم27 مليار معامل
ما يميزهأول منظومة عربية تجمع النص والصورة والصوت مع طبقة حماية ثقافية
المحور المختبَرARAB-SPEECH و ARAB-GEN معًا

اختبار المنظومة الصوتية بأربع مراحل

المرحلة أ، التفريغ. سجّل ثلاثين ثانية بلهجتك فيها اسم عَلَم مركّب ورقم منطوق وتبديل لغوي. احسب WER بنفسك، ثم أعد التسجيل نفسه في مقهى وقس الفرق. الفارق بين الرقمين هو “رقم الواقع”، وهو الوحيد الذي يهم.

المرحلة ب، الفهم. شغّل جملة: “والله كنت بدي أجي مبارح، بس صار معي شغلة وما قدرت”، واسأل عن السبب دون طلب التفريغ.

المرحلة ج، التوليد الصوتي. هنا يُختبَر الجانب الذي يهمله الجميع. اطلب من النموذج أن ينطق:

  • جملة فيها اسم أجنبي داخل سياق عربي: “حجزت تذكرة على طيران Qatar Airways الساعة سبعة.”
  • جملة فيها رقم طويل: “المبلغ ألفين وثلاثمئة وخمسة وسبعون ريالًا.”
  • جملة فيها همزة متطرفة وتاء مربوطة في الوصل والوقف: “قرأتُ رسالةَ المديرة.”
  • سؤالًا بنبرة استفهام حقيقية لا مسطّحة: “إنت رايح لحالك؟”

معيار الحكم ليس “هل الصوت واضح”، بل هل يبدو عربيًا طبيعيًا لأذن عربية: هل التنغيم صحيح في السؤال، وهل الوقف على التاء المربوطة هاءً، وهل الرقم منطوق بصيغته الصحيحة لا مقروءًا رقمًا رقمًا.

المرحلة د، الحماية الثقافية. طبقة FanarGuard تدّعي رصد “الاختلال الثقافي”، وهذا ادعاء يستحق اختبارًا جادًا لا تصفيقًا:

  • أعطه نصًا يخلط عادة مغربية بعادة خليجية وانظر هل يرصد الخلط.
  • أعطه جملة تنمّط أهل منطقة بعينها وانظر هل يرصدها.
  • ثم الأهم: أعطه نصًا سليمًا تمامًا لكنه يستعمل تعبيرًا شاميًا دارجًا، وانظر هل يرصده خطأً على أنه مخالفة. الرقابة الثقافية الزائدة عيب لا ميزة، لأنها ستحذف لهجة مستخدمك باسم حمايته.

نقطة منهجية عن المقارنات المتقاطعة

في كانون الثاني 2026 أعلن معهد الابتكار التكنولوجي أن Falcon-H1-Arabic 7B يتجاوز Fanar-9B على لوحة OALL. الرقم صحيح كما نُشر، لكن قراءته تحتاج ثلاثة قيود:

  1. المقارنة مع Fanar-1-9B، لا مع Fanar 2.0 الذي يبلغ 27 مليارًا وصدر قبل الإعلان بشهر.
  2. الأرقام معلنة من جهة منافسة، وهذا لا يعني أنها خاطئة، بل يعني أن اختيار ما يُقارَن به هو قرار تسويقي أيضًا.
  3. OALL لا تقيس الصوت إطلاقًا، وهو المجال الذي بُني Fanar 2.0 حوله أساسًا. المقارنة على لوحة نصية بين نموذج نصي ونموذج متعدد الوسائط تقيس نصف أحدهما.

وهذه ليست دفاعًا عن نموذج ضد آخر، بل قاعدة عامة في قراءة أرقام هذا المجال: اسأل دائمًا: من نشر الرقم، وعلى أي نسخة، وعلى أي لوحة، وهل تقيس اللوحة ما يدّعي النموذج التفوق فيه؟


الحكم العملي

  1. إن كان منتجك صوتيًا عربيًا، فالنماذج العربية المتخصصة بالصوت تستحق تجربة جادة، ليس لأنها بالضرورة أدق، بل لأن بيانات تدريبها الصوتية عربية أصلًا لا مترجمة.
  2. قِس على مستخدميك لا على عيّنة نظيفة. الفرق بين استوديو ومقهى في العربية أكبر منه في الإنجليزية، لأن الضجيج يبتلع الحركات القصيرة.
  3. اختبر طبقة الحماية في الاتجاهين. ما ترصده وما ترصده خطأً. الفلتر الذي يعتبر اللهجة انحرافًا يكلّفك مستخدمًا لا يعرف لماذا رُفض كلامه.
  4. لا تنتظر أرقام طرف ثالث لتقرر. حتى كتابة هذه المقالة لا توجد أرقام مستقلة لأداء Fanar 2.0 الصوتي، وعشر دقائق تسجيل من بيئتك تعطيك ما لا تعطيه أي لوحة.

في المقالة القادمة

أنتقل إلى السعودية ونموذج ALLaM، ومعه أشهر رقم في التقييم العربي: صدارة ArabicMMLU. وسأطرح سؤالًا مزعجًا: هل معرفة المناهج المدرسية بالعربية دليل على فهم العربية؟


ماذا يقدّم السوق فعلًا لمن يبني منتجًا صوتيًا عربيًا

بعيدًا عن الأوراق البحثية، هذه صورة ما هو متاح تجاريًا اليوم، كما ترصده مقارنات الممارسين المنشورة. وأوردها لأن الفريق الذي يبني اليوم لا ينتظر ورقة، بل يختار مزوّدًا هذا الأسبوع.

النظامتغطية اللهجات كما يعلنها
Munsitأكثر من 25 لهجة، بلا إعداد يدوي للهجة
Speechmaticsخليجية ومصرية وشامية ومغاربية، مع تبديل لغوي
Deepgram Nova-317 صنفًا عربيًا عبر الخليج والفصحى والمصرية والشامية
Whisperمائل إلى الفصحى، وتعميمه اللهجي محدود
Amazon Transcribeالخليجية والفصحى فقط

وأرقام WER المنشورة في المقارنة نفسها: Munsit-1 عند 26.68٪ مقابل Whisper عند 36.86٪ على مجموعات اختبار متعددة اللهجات.

ومع ذلك، فإن أصدق ما في تلك المقارنة هو تحذيرها: أرقام WER لا تُقارَن عبر الجهات لأن مجموعات الاختبار وقواعد التطبيع تختلف. أي أن الجدول أعلاه يصلح لتقصير قائمتك، لا لاتخاذ القرار.

سؤال البناء أم الشراء

الحالةالقرار المنطقي
لهجة واحدة وحجم صغيرمزوّد جاهز، وقياس على عيّناتك
لهجات متعددة وحجم كبيرمزوّد جاهز أولًا، ثم ضبط نموذج مفتوح على بياناتك بعد تجميع ساعات كافية
بيانات حساسة لا تخرج من البلدنموذج مفتوح مستضاف محليًا، ولو بدقة أقل في البداية
محتوى ديني أو تعليمي يحتاج تشكيلًالا تسلّم التشكيل الآلي للمستخدم، وضع مراجعة بشرية
بيئة ضجيج عالٍمسار التفريغ المنفصل، لمتانته المرصودة في الضجيج

البند الذي يغفله الجميع: توليد الصوت

كل النقاش المنشور تقريبًا يدور حول التفريغ، بينما نصف المنتج الصوتي هو الردّ المنطوق. والمعايير التي أقيسها في التوليد العربي أربعة، ولا يقيسها أي رقم منشور:

  1. الوقف على التاء المربوطة هاءً، لا تاءً.
  2. نطق الأرقام المركّبة بصيغتها الصحيحة، لا رقمًا رقمًا.
  3. التنغيم الاستفهامي، فالسؤال العربي المنطوق يتغير في نهايته.
  4. الأسماء الأجنبية داخل جملة عربية، وهي أكثر ما يكشف صوتًا آليًا.

خمس جمل تحتوي هذه الأربعة تكفي للحكم، ويقيّمها خمسة مستمعين عرب في خمس دقائق. وهذا القياس البشري البسيط أدق من أي مقياس آلي متاح اليوم لتوليد الصوت العربي.


من دفتر الاختبار الصوتي: خمس جمل تكشف أي مولّد صوتي عربي

هذه الجمل الخمس أستعملها لتقييم توليد الصوت لا تفريغه، وهو الجانب الذي لا تقيسه أي لوحة:

الجملة الأولى، التفريق بين عَمّان وعُمان.

“سافرت من عَمّان إلى عُمان.”

الأولى عاصمة الأردن بفتح العين وتشديد الميم، والثانية السلطنة بضم العين بلا تشديد. المولّد الذي ينطقهما متطابقتين يكشف أنه يقرأ حروفًا لا يعرف كلمات. وهذا أسرع اختبار عندي على الإطلاق.

الجملة الثانية، الوقف على التاء المربوطة.

“قرأتُ رسالةَ المديرة.”

الوقف يكون على هاء: “المديرَه”. النطق بتاء مكشوفة في آخر الجملة خطأ لا يقع فيه متحدث أصلي.

الجملة الثالثة، الرقم المركّب.

“المبلغ ألفان وثلاثمئة وخمسة وسبعون ريالًا.”

العربية تنطق الآحاد قبل العشرات، والمولّد الضعيف يقرأ الرقم منزلةً منزلة أو يقلب الترتيب.

الجملة الرابعة، التنغيم الاستفهامي.

“إنت رايح لحالك؟”

السؤال في العربية المحكية لا يحمل أداة استفهام دائمًا، وعلامته الوحيدة هي ارتفاع النغمة في آخر الجملة. المولّد الذي ينطقها مسطّحة يحوّل السؤال إلى خبر، وهذا أكثر ما يجعل الصوت الآلي يبدو آليًا.

الجملة الخامسة، الاسم الأجنبي داخل العربية.

“حجزت على طيران Qatar Airways الساعة سبعة.”

المطلوب انتقال طبيعي بين النظامين الصوتيين، لا نطق إنجليزي بلكنة مبالغ فيها ولا تعريب قسري.

كيف أحكم، ومن يحكم

لا أحكم على هذه الجمل بأذني وحدها. أشغّلها على خمسة مستمعين عرب من لهجات مختلفة، وأسأل سؤالًا واحدًا فقط: هل يبدو هذا صوت شخص أم صوت نظام؟ ثم أحسب نسبة من قال “نظام”.

وسبب هذا الإجراء البسيط أن مقاييس جودة الصوت الآلية تقيس الوضوح والنقاء، ولا تقيس الطبيعية. وقد رأيت أصواتًا عربية نقية تمامًا ومزعجة تمامًا، لأن التنغيم فيها إنجليزي والكلمات عربية.

ملاحظة على الفلترة الثقافية

طبقة الحماية الثقافية تحتاج اختبارًا في الاتجاهين. أرسل نصًا سليمًا فيه تعبير شامي دارج مثل “يا زلمة شو صاير” أو “الله يرضى عليك”، وانظر هل يرصده الفلتر مخالفةً. الرقابة الزائدة على اللهجة ليست حماية، بل حذف لصوت المستخدم، وهي عيب يجب أن يُسجَّل كما يُسجَّل الخطأ.

المصادر

  • إعلان Fanar 2.0 في القمة العالمية للذكاء الاصطناعي، الدوحة: middleeastainews.com
  • PalmX 2025، واستعمال Fanar-1-9B لدى الفرق المشاركة: arxiv.org/abs/2509.02550
  • NADI 2025، أرقام الكلام العربي متعدد اللهجات: arxiv.org/abs/2509.02038
  • معهد الابتكار التكنولوجي، مقارنات Falcon-H1-Arabic: falcon-lm.github.io/blog/falcon-h1-arabic
  • مقارنات ممارسين عرب للنماذج الصوتية: munsit.com و kuwaitai.net