الأرقام أولًا
| المقياس | النتيجة | ما الذي يقيسه | المصدر |
|---|---|---|---|
| حجم النموذج | 180 مليار معامل | الأكبر مفتوح المصدر وقتها | بيان معهد الابتكار التكنولوجي، 6 أيلول 2023 |
| حجم بيانات التدريب | 3.5 تريليون رمز | الأضخم أيضًا | البيان نفسه |
| اللغات المذكورة في بطاقة النموذج | الإنجليزية والألمانية والإسبانية والفرنسية، وقدرات محدودة في سبع أخرى | ما تعلنه الجهة المصنّعة | بطاقة النموذج على Hugging Face |
| ذكر العربية في بطاقة النموذج | لا يوجد | هل العربية مدعومة رسميًا | البطاقة نفسها |
| ذكر العربية في البيان الصحفي | لا يوجد | هل ذُكرت أصلًا | بيان المعهد |
| حصة RefinedWeb الإنجليزية | 75٪ | الكتلة الأكبر | بطاقة النموذج |
| حصة RefinedWeb الأوروبية | 7٪ | اللغات الأخرى، وهي أوروبية | البطاقة نفسها |
| نتيجة عربية منشورة لـ Falcon 180B | لا توجد | بحثتُ في خمسة مصادر ولم أجد | ArabicMMLU وAlGhafa ولوحة OALL ومسح 2025 |
| Falcon 40B على ArabicMMLU، للمقارنة | 34.8٪ | مقابل 29.0٪ للتخمين العشوائي | Koto وآخرون، شباط 2024 |
| Falcon-instruct 40B على ArabicMMLU | 33.0٪ | أقل من النسخة الأساسية | المصدر نفسه |
السطر المهم هو الذي ليس فيه رقم: لا توجد نتيجة عربية منشورة لأكبر نموذج مفتوح بنته دولة عربية.
تركيبة البيانات، كما نشرها المعهد
“RefinedWeb أوروبي” هو المجموعة الفرعية للّغات الأوروبية بالتحديد. العربية ليست بندًا في هذا التوزيع، ولا حصة لها معلنة.
بطاقة النموذج
| البند | التفصيل |
|---|---|
| النموذج | Falcon 180B |
| الجهة | معهد الابتكار التكنولوجي، أبوظبي |
| تاريخ الإصدار | 6 أيلول 2023 |
| الحجم | 180 مليار معامل، 3.5 تريليون رمز |
| المكانة وقتها | الأول عالميًا بين النماذج المفتوحة |
| ورقة البيانات | RefinedWeb، arXiv:2306.01116، حزيران 2023 |
| ما تقوله ورقة RefinedWeb | “في هذه الورقة نركّز على الإنجليزية” |
| النسخة المنشورة من البيانات | إنجليزية فقط |
قراءة ARAB-LENS: لماذا هذا الغياب هو الخبر
سأقول الجملة التي أعتقد أنها تلخّص عقدًا كاملًا من السياسة التقنية في المنطقة: دولة عربية بنت أكبر نموذج مفتوح في العالم، ولم تضع العربية فيه.
وقبل أن يُساء فهمي، أوضح ثلاثة أشياء.
أولًا، هذا لم يكن غباءً. كان قرارًا استراتيجيًا واضحًا. المعهد أراد أن يتصدّر لوحات الترتيب العالمية، وهذه اللوحات كلها إنجليزية. لو أنفقوا 20٪ من الحوسبة على العربية لنزلوا مراكز في الترتيب العالمي، ولما تحدّث عنهم أحد. الحسبة كانت سليمة تجاريًا.
ثانيًا، الإمارات نفسها أطلقت Jais قبل أسبوع واحد. أي أن المنطقة كان عندها نموذجان في سبعة أيام: واحد عربي بحجم متوسط، وواحد عملاق بلا عربية. هذا فصل واعٍ بين المسارين، لا إهمال.
ثالثًا، وهنا نقدي الحقيقي: المشكلة ليست في القرار، المشكلة في الرواية. Falcon قُدّم في الإعلام العربي كإنجاز عربي، وصورته انتشرت كدليل على أن المنطقة صارت في الطليعة. ولم يقل أحد للقارئ العربي إن هذا النموذج لا يتكلم لغته. وحين بحثتُ عن أي رقم يخبرني كم يعرف Falcon 180B من العربية، لم أجد واحدًا. لا من المعهد، ولا من أي طرف ثالث.
الرقم الوحيد المتاح هو لأخيه الأصغر: Falcon 40B سجّل 34.8٪ على ArabicMMLU. والتخمين العشوائي في ذلك الامتحان 29.0٪. أي أن أشهر نموذج عربي المنشأ في العالم كان يتفوق على رمي النرد بأقل من ست نقاط.
وهناك تفصيل أقسى: النسخة المضبوطة على التعليمات، Falcon-instruct 40B، سجّلت 33.0٪، أي أقل من النسخة الأساسية. الضبط على التعليمات، وهو مرحلة يُفترض أن تحسّن النموذج، جعله أسوأ بالعربية. وهذا يحدث حين تكون بيانات الضبط إنجليزية بالكامل.
ملاحظة منهجية مهمة: أنا رأيت رقمًا يتداول على أن العربية شكّلت نحو 1.2٪ من بيانات RefinedWeb. هذا الرقم يخص خط أنابيب متعدد اللغات مشتق من CommonCrawl، لا مزيج تدريب Falcon 180B. ولا يجوز تقديمه كحصة العربية في النموذج. وأنا أذكره هنا لأنني أريدك أن تعرف أنني رأيته وتجنّبته عمدًا.
من دفتر الاختبار: قياس نموذج لا يدّعي العربية
حين يكون النموذج غير مصمَّم للعربية، تتغيّر أسئلة الاختبار. لا تسأل “هل يجيد؟”، اسأل “أين بالضبط ينهار؟”.
البند الأول: سلّم الانهيار.
اطلب المهمة نفسها بخمسة مستويات لغوية، وسجّل عند أي مستوى يبدأ الخلل:
| المستوى | المهمة | ما يقيسه |
|---|---|---|
| 1 | ترجم “good morning” إلى العربية | معجم أساسي |
| 2 | اكتب جملة عن الطقس بالعربية | تركيب بسيط |
| 3 | اكتب فقرة عن تاريخ دمشق | معرفة عربية |
| 4 | اشرح الفرق بين المفعول المطلق والمفعول لأجله | نحو متقدم |
| 5 | حوّل هذه الفقرة من الفصحى إلى الشامي | لهجة |
النماذج غير المصممة للعربية تنجح في 1 و2، تتعثر في 3، تخترع في 4، وتفشل تمامًا في 5. وتسجيل رقم المستوى أنفع بكثير من تسجيل نجاح أو فشل.
البند الثاني: اختبار الهلوسة الجغرافية.
اسأل خمسة أسئلة عن أماكن عربية دقيقة:
| السؤال | لماذا هو فخ |
|---|---|
| “كم تبعد إربد عن عمّان؟” | مدن غير مشهورة عالميًا |
| “شو عاصمة محافظة ذي قار؟” | تقسيم إداري عراقي |
| “وين تقع سوق واقف؟” | معلم قطري |
| “شو الفرق بين جدة والمدينة من حيث المناخ؟” | جغرافيا سعودية |
| “أي نهر يمر بدير الزور؟” | جغرافيا سورية |
النموذج الضعيف بالعربية سيجيب عن الأول والثالث ويخترع البقية بثقة. والثقة هي المشكلة، لا الجهل.
البند الثالث: اختبار المصطلح المهني.
كل سوق عربي له مصطلحاته. هذه أمثلة من مجالات مختلفة:
| المصطلح | المجال | المعنى |
|---|---|---|
| “كفالة” | العمل الخليجي | نظام الرعاية للعامل الوافد |
| “طابو” | العقارات الشامية | سند الملكية |
| “براءة ذمة” | الإدارة | شهادة عدم وجود التزامات |
| “الحوالة” | المال | تحويل مالي بنظام الثقة |
| “المخالصة” | العمل | تسوية نهائية عند ترك العمل |
اسأل عن كل واحد. النموذج الذي يترجمها حرفيًا إلى الإنجليزية ثم يشرح المعنى الإنجليزي لم يتعلمها، استنتجها. وهذه فئة الأخطاء الأخطر في أي تطبيق تجاري، لأنها تبدو صحيحة.
البند الرابع: اختبار التاريخ العربي القريب.
المعرفة التاريخية العامة متاحة بالإنجليزية، لكن التفاصيل القريبة لا:
| السؤال | ما يقيسه |
|---|---|
| “متى صار الاستقلال بالأردن ومين كان أول ملك؟” | تاريخ وطني أساسي |
| “شو كانت العملة بسوريا قبل الليرة؟” | تفصيل اقتصادي محلي |
| “مين بنى قلعة عجلون وليش؟” | تاريخ إقليمي |
| “شو يعني اتفاقية الطائف؟” | سياسة عربية حديثة |
النموذج الذي يجيب عن الأول والرابع ويخترع في الثاني والثالث يعرف ما كُتب عنّا بالإنجليزية، لا ما نعرفه عن أنفسنا.
البند الخامس: اختبار المقاس والوزن.
بند بسيط وكاشف جدًا:
“بدي أشتري 3 كيلو لحمة و2 رطل جبنة، وسعر الكيلو 12 دينار والرطل 5. كم المجموع؟”
الرطل وحدة مستعملة في الشام والعراق وتختلف قيمتها بالكيلو من بلد لآخر. النموذج الجيد ينبّه إلى الغموض ويسأل. النموذج الضعيف يفترض قيمة ويحسب بثقة. وهذا النوع من الثقة الخاطئة هو أخطر ما في التطبيقات التجارية.
درس استراتيجي من Falcon: كيف تُقرأ إعلانات النماذج الوطنية
بنيتُ من هذه الحالة قائمة فحص أستعملها مع كل إعلان عن “نموذج وطني” أو “نموذج عربي”:
| السؤال | لماذا |
|---|---|
| هل العربية في قائمة اللغات المعلنة؟ | أبسط فحص وأقواه |
| هل نُشرت حصة العربية في البيانات؟ | إن لم تُنشر، افترض أنها صغيرة |
| هل يوجد رقم على معيار عربي أصيل؟ | لا مترجَم |
| هل الرقم للنموذج المعلن أم لأخيه الأصغر؟ | خلط شائع جدًا |
| من مَوّل ومن قاس؟ | الجهة نفسها أم مستقل؟ |
في حالة Falcon 180B، الجواب على الأسئلة الخمسة: لا، لا، لا، لأخيه الأصغر، ولا يوجد قياس أصلًا.
وأنا لا أكتب هذا لأهاجم مشروعًا، بل لأن المنطقة تحتاج قرّاء أدقّ لإعلاناتها. والتصفيق بلا قراءة أضرّ بنا أكثر من أي نقص تقني.
الحكم العملي
لا تستعمل نموذجًا لا تذكر بطاقته العربية في منتج عربي. هذه ليست نصيحة متشددة، هذه قراءة حرفية لما تقوله الجهة المصنّعة عن نموذجها. بطاقة النموذج وثيقة، وحين لا تذكر لغتك فهي تخبرك بشيء.
وإن كنت مضطرًا، اختبر على المستويات الخمسة أعلاه قبل أي التزام، وضع حدودًا صريحة: لا لهجة، لا معرفة محلية، لا مصطلحات مهنية.
وإن كنت صحفيًا أو كاتبًا تقنيًا، اسأل دائمًا قبل أن تصف نموذجًا بأنه “عربي”: عربي المنشأ أم عربي القدرة؟ الفرق بينهما هو الفرق بين مصنع سيارات في بلدك وسيارة تناسب طرقك.
المقالة القادمة
بعد أسبوعين، نشر فريق أكاديمي ورقة تقول إن المشكلة ليست الحجم ولا اللغة، بل التوطين. ونموذجهم، AceGPT، تفوّق على GPT-3.5 في اتباع التعليمات بالعربية وهو بحجم ثلاثة عشر مليار معامل فقط. ثم خسر أمامه في المعرفة والثقافة. المقالة القادمة تشرح لماذا.
المصادر
- معهد الابتكار التكنولوجي، Technology Innovation Institute Introduces World’s Most Powerful Open LLM: Falcon 180B، 6 أيلول 2023: tii.ae
- Hugging Face، Spread Your Wings: Falcon 180B is here، 6 أيلول 2023: huggingface.co/blog/falcon-180b
- بطاقة النموذج tiiuae/falcon-180B على Hugging Face
- Almazrouei وآخرون، The RefinedWeb Dataset for Falcon LLM، arXiv:2306.01116، حزيران 2023
- Koto وآخرون، ArabicMMLU، Findings of ACL 2024: aclanthology.org/2024.findings-acl.334