الأرقام أولًا
| البند | الرقم | المصدر |
|---|---|---|
| حجم النموذج | 27 مليار معامل، ثلاثة أضعاف Fanar الأول (9 مليارات) | معهد قطر لبحوث الحوسبة، كانون الأول 2025 |
| بيانات التدريب النصية | أكثر من 300 مليار كلمة | المصدر نفسه |
| بيانات التدريب الصوتية | أكثر من تريليون مقطع صوتي عربي | المصدر نفسه |
| الوسائط | نص، صورة، كلام إلى نص، نص إلى كلام، فهم صوتي، توليد شعر | المصدر نفسه |
| طبقة الحماية | FanarGuard، مرشّح محتوى يرصد المخالفات الأمنية والاختلال الثقافي بالعربية والإنجليزية | المصدر نفسه |
| الإصدار القادم | Fanar 3.0، مخطط له في كانون الأول 2026 | تصريح د. أحمد المجرمد |
| Fanar-1-9B في PalmX 2025 | من أكثر النماذج استعمالًا لدى الفرق المشاركة | ArabicNLP 2025 |
| المقارنة المعلنة من منافس | Falcon-H1-Arabic 7B يذكر تفوقه على Fanar-9B على OALL | معهد الابتكار التكنولوجي، كانون الثاني 2026 |
الرقم الذي أوقفني في هذه القائمة ليس 27 مليارًا ولا 300 مليار كلمة، بل تريليون مقطع صوتي. لأن أكبر عائق أمام الذكاء الاصطناعي العربي ليس النص، بل الصوت. النص العربي متوفر على الإنترنت بكثرة، أما الكلام العربي الموسوم والمفرّغ بدقة عبر اللهجات فنادر ومكلف ويحتاج بشرًا يعرفون الفرق بين خطأ النطق واختلاف اللهجة. من يجمع تريليون مقطع صوتي عربي يبني بنية تحتية، لا نموذجًا.
لماذا تهمّ هذه البنية
دعني أضع أرقام Fanar بجانب أرقام أصعب مهمة صوتية عربية منشورة، وهي NADI 2025:
| المهمة | أفضل نتيجة في NADI 2025 | القراءة |
|---|---|---|
| التعرف على الكلام | 35.68 WER و12.20 CER | أكثر من ثلث الكلمات المنطوقة تخرج خطأ |
| تحديد اللهجة من الصوت | 79.8٪ دقة | مقبول للعائلة اللهجية، لا للمنطقة |
| استعادة التشكيل للكلام | 55 WER و13 CER | أكثر من نصف الكلمات تُشكَّل خطأ |
| عدد الفرق المشاركة فعليًا | 8 من 44 سجّلت | حقل بحثي صغير بالنسبة لحجم اللغة |
في هذا السياق، إعلان نموذج عربي يجمع التفريغ والتوليد الصوتي والفهم في منظومة واحدة ليس خبرًا تسويقيًا، بل محاولة لسدّ فجوة حقيقية. والسؤال الذي يبقى بلا جواب حتى الآن: لا توجد أرقام منشورة من طرف ثالث لأداء Fanar 2.0 الصوتي. ما لدينا وصف قدرات وحجم بيانات، لا معدل خطأ.
بطاقة النموذج
| البند | التفصيل |
|---|---|
| الاسم | Fanar 2.0 |
| الجهة | معهد قطر لبحوث الحوسبة، جامعة حمد بن خليفة |
| الإعلان | القمة العالمية للذكاء الاصطناعي في الدوحة، 9 كانون الأول 2025 |
| الحجم | 27 مليار معامل |
| ما يميزه | أول منظومة عربية تجمع النص والصورة والصوت مع طبقة حماية ثقافية |
| المحور المختبَر | ARAB-SPEECH و ARAB-GEN معًا |
اختبار المنظومة الصوتية بأربع مراحل
المرحلة أ، التفريغ. سجّل ثلاثين ثانية بلهجتك فيها اسم عَلَم مركّب ورقم منطوق وتبديل لغوي. احسب WER بنفسك، ثم أعد التسجيل نفسه في مقهى وقس الفرق. الفارق بين الرقمين هو “رقم الواقع”، وهو الوحيد الذي يهم.
المرحلة ب، الفهم. شغّل جملة: “والله كنت بدي أجي مبارح، بس صار معي شغلة وما قدرت”، واسأل عن السبب دون طلب التفريغ.
المرحلة ج، التوليد الصوتي. هنا يُختبَر الجانب الذي يهمله الجميع. اطلب من النموذج أن ينطق:
- جملة فيها اسم أجنبي داخل سياق عربي: “حجزت تذكرة على طيران Qatar Airways الساعة سبعة.”
- جملة فيها رقم طويل: “المبلغ ألفين وثلاثمئة وخمسة وسبعون ريالًا.”
- جملة فيها همزة متطرفة وتاء مربوطة في الوصل والوقف: “قرأتُ رسالةَ المديرة.”
- سؤالًا بنبرة استفهام حقيقية لا مسطّحة: “إنت رايح لحالك؟”
معيار الحكم ليس “هل الصوت واضح”، بل هل يبدو عربيًا طبيعيًا لأذن عربية: هل التنغيم صحيح في السؤال، وهل الوقف على التاء المربوطة هاءً، وهل الرقم منطوق بصيغته الصحيحة لا مقروءًا رقمًا رقمًا.
المرحلة د، الحماية الثقافية. طبقة FanarGuard تدّعي رصد “الاختلال الثقافي”، وهذا ادعاء يستحق اختبارًا جادًا لا تصفيقًا:
- أعطه نصًا يخلط عادة مغربية بعادة خليجية وانظر هل يرصد الخلط.
- أعطه جملة تنمّط أهل منطقة بعينها وانظر هل يرصدها.
- ثم الأهم: أعطه نصًا سليمًا تمامًا لكنه يستعمل تعبيرًا شاميًا دارجًا، وانظر هل يرصده خطأً على أنه مخالفة. الرقابة الثقافية الزائدة عيب لا ميزة، لأنها ستحذف لهجة مستخدمك باسم حمايته.
نقطة منهجية عن المقارنات المتقاطعة
في كانون الثاني 2026 أعلن معهد الابتكار التكنولوجي أن Falcon-H1-Arabic 7B يتجاوز Fanar-9B على لوحة OALL. الرقم صحيح كما نُشر، لكن قراءته تحتاج ثلاثة قيود:
- المقارنة مع Fanar-1-9B، لا مع Fanar 2.0 الذي يبلغ 27 مليارًا وصدر قبل الإعلان بشهر.
- الأرقام معلنة من جهة منافسة، وهذا لا يعني أنها خاطئة، بل يعني أن اختيار ما يُقارَن به هو قرار تسويقي أيضًا.
- OALL لا تقيس الصوت إطلاقًا، وهو المجال الذي بُني Fanar 2.0 حوله أساسًا. المقارنة على لوحة نصية بين نموذج نصي ونموذج متعدد الوسائط تقيس نصف أحدهما.
وهذه ليست دفاعًا عن نموذج ضد آخر، بل قاعدة عامة في قراءة أرقام هذا المجال: اسأل دائمًا: من نشر الرقم، وعلى أي نسخة، وعلى أي لوحة، وهل تقيس اللوحة ما يدّعي النموذج التفوق فيه؟
الحكم العملي
- إن كان منتجك صوتيًا عربيًا، فالنماذج العربية المتخصصة بالصوت تستحق تجربة جادة، ليس لأنها بالضرورة أدق، بل لأن بيانات تدريبها الصوتية عربية أصلًا لا مترجمة.
- قِس على مستخدميك لا على عيّنة نظيفة. الفرق بين استوديو ومقهى في العربية أكبر منه في الإنجليزية، لأن الضجيج يبتلع الحركات القصيرة.
- اختبر طبقة الحماية في الاتجاهين. ما ترصده وما ترصده خطأً. الفلتر الذي يعتبر اللهجة انحرافًا يكلّفك مستخدمًا لا يعرف لماذا رُفض كلامه.
- لا تنتظر أرقام طرف ثالث لتقرر. حتى كتابة هذه المقالة لا توجد أرقام مستقلة لأداء Fanar 2.0 الصوتي، وعشر دقائق تسجيل من بيئتك تعطيك ما لا تعطيه أي لوحة.
في المقالة القادمة
أنتقل إلى السعودية ونموذج ALLaM، ومعه أشهر رقم في التقييم العربي: صدارة ArabicMMLU. وسأطرح سؤالًا مزعجًا: هل معرفة المناهج المدرسية بالعربية دليل على فهم العربية؟
ماذا يقدّم السوق فعلًا لمن يبني منتجًا صوتيًا عربيًا
بعيدًا عن الأوراق البحثية، هذه صورة ما هو متاح تجاريًا اليوم، كما ترصده مقارنات الممارسين المنشورة. وأوردها لأن الفريق الذي يبني اليوم لا ينتظر ورقة، بل يختار مزوّدًا هذا الأسبوع.
| النظام | تغطية اللهجات كما يعلنها |
|---|---|
| Munsit | أكثر من 25 لهجة، بلا إعداد يدوي للهجة |
| Speechmatics | خليجية ومصرية وشامية ومغاربية، مع تبديل لغوي |
| Deepgram Nova-3 | 17 صنفًا عربيًا عبر الخليج والفصحى والمصرية والشامية |
| Whisper | مائل إلى الفصحى، وتعميمه اللهجي محدود |
| Amazon Transcribe | الخليجية والفصحى فقط |
وأرقام WER المنشورة في المقارنة نفسها: Munsit-1 عند 26.68٪ مقابل Whisper عند 36.86٪ على مجموعات اختبار متعددة اللهجات.
ومع ذلك، فإن أصدق ما في تلك المقارنة هو تحذيرها: أرقام WER لا تُقارَن عبر الجهات لأن مجموعات الاختبار وقواعد التطبيع تختلف. أي أن الجدول أعلاه يصلح لتقصير قائمتك، لا لاتخاذ القرار.
سؤال البناء أم الشراء
| الحالة | القرار المنطقي |
|---|---|
| لهجة واحدة وحجم صغير | مزوّد جاهز، وقياس على عيّناتك |
| لهجات متعددة وحجم كبير | مزوّد جاهز أولًا، ثم ضبط نموذج مفتوح على بياناتك بعد تجميع ساعات كافية |
| بيانات حساسة لا تخرج من البلد | نموذج مفتوح مستضاف محليًا، ولو بدقة أقل في البداية |
| محتوى ديني أو تعليمي يحتاج تشكيلًا | لا تسلّم التشكيل الآلي للمستخدم، وضع مراجعة بشرية |
| بيئة ضجيج عالٍ | مسار التفريغ المنفصل، لمتانته المرصودة في الضجيج |
البند الذي يغفله الجميع: توليد الصوت
كل النقاش المنشور تقريبًا يدور حول التفريغ، بينما نصف المنتج الصوتي هو الردّ المنطوق. والمعايير التي أقيسها في التوليد العربي أربعة، ولا يقيسها أي رقم منشور:
- الوقف على التاء المربوطة هاءً، لا تاءً.
- نطق الأرقام المركّبة بصيغتها الصحيحة، لا رقمًا رقمًا.
- التنغيم الاستفهامي، فالسؤال العربي المنطوق يتغير في نهايته.
- الأسماء الأجنبية داخل جملة عربية، وهي أكثر ما يكشف صوتًا آليًا.
خمس جمل تحتوي هذه الأربعة تكفي للحكم، ويقيّمها خمسة مستمعين عرب في خمس دقائق. وهذا القياس البشري البسيط أدق من أي مقياس آلي متاح اليوم لتوليد الصوت العربي.
من دفتر الاختبار الصوتي: خمس جمل تكشف أي مولّد صوتي عربي
هذه الجمل الخمس أستعملها لتقييم توليد الصوت لا تفريغه، وهو الجانب الذي لا تقيسه أي لوحة:
الجملة الأولى، التفريق بين عَمّان وعُمان.
“سافرت من عَمّان إلى عُمان.”
الأولى عاصمة الأردن بفتح العين وتشديد الميم، والثانية السلطنة بضم العين بلا تشديد. المولّد الذي ينطقهما متطابقتين يكشف أنه يقرأ حروفًا لا يعرف كلمات. وهذا أسرع اختبار عندي على الإطلاق.
الجملة الثانية، الوقف على التاء المربوطة.
“قرأتُ رسالةَ المديرة.”
الوقف يكون على هاء: “المديرَه”. النطق بتاء مكشوفة في آخر الجملة خطأ لا يقع فيه متحدث أصلي.
الجملة الثالثة، الرقم المركّب.
“المبلغ ألفان وثلاثمئة وخمسة وسبعون ريالًا.”
العربية تنطق الآحاد قبل العشرات، والمولّد الضعيف يقرأ الرقم منزلةً منزلة أو يقلب الترتيب.
الجملة الرابعة، التنغيم الاستفهامي.
“إنت رايح لحالك؟”
السؤال في العربية المحكية لا يحمل أداة استفهام دائمًا، وعلامته الوحيدة هي ارتفاع النغمة في آخر الجملة. المولّد الذي ينطقها مسطّحة يحوّل السؤال إلى خبر، وهذا أكثر ما يجعل الصوت الآلي يبدو آليًا.
الجملة الخامسة، الاسم الأجنبي داخل العربية.
“حجزت على طيران Qatar Airways الساعة سبعة.”
المطلوب انتقال طبيعي بين النظامين الصوتيين، لا نطق إنجليزي بلكنة مبالغ فيها ولا تعريب قسري.
كيف أحكم، ومن يحكم
لا أحكم على هذه الجمل بأذني وحدها. أشغّلها على خمسة مستمعين عرب من لهجات مختلفة، وأسأل سؤالًا واحدًا فقط: هل يبدو هذا صوت شخص أم صوت نظام؟ ثم أحسب نسبة من قال “نظام”.
وسبب هذا الإجراء البسيط أن مقاييس جودة الصوت الآلية تقيس الوضوح والنقاء، ولا تقيس الطبيعية. وقد رأيت أصواتًا عربية نقية تمامًا ومزعجة تمامًا، لأن التنغيم فيها إنجليزي والكلمات عربية.
ملاحظة على الفلترة الثقافية
طبقة الحماية الثقافية تحتاج اختبارًا في الاتجاهين. أرسل نصًا سليمًا فيه تعبير شامي دارج مثل “يا زلمة شو صاير” أو “الله يرضى عليك”، وانظر هل يرصده الفلتر مخالفةً. الرقابة الزائدة على اللهجة ليست حماية، بل حذف لصوت المستخدم، وهي عيب يجب أن يُسجَّل كما يُسجَّل الخطأ.
المصادر
- إعلان Fanar 2.0 في القمة العالمية للذكاء الاصطناعي، الدوحة: middleeastainews.com
- PalmX 2025، واستعمال Fanar-1-9B لدى الفرق المشاركة: arxiv.org/abs/2509.02550
- NADI 2025، أرقام الكلام العربي متعدد اللهجات: arxiv.org/abs/2509.02038
- معهد الابتكار التكنولوجي، مقارنات Falcon-H1-Arabic: falcon-lm.github.io/blog/falcon-h1-arabic
- مقارنات ممارسين عرب للنماذج الصوتية: munsit.com و kuwaitai.net