27.95 مقابل 59.92: الضعف الذي يفصل فصحاك عن لهجتك

ARAB-LENS article illustration 27

إيهاب صالح | techkahwa.net صدر النموذج: 6 تشرين الثاني 2023 | تاريخ النشر: 20 تشرين الثاني 2023 الأرقام أولًا المقياس النتيجة ما الذي يقيسه المصدر Whisper large-v3، الفصحى على مجموعة SADA 27.95٪ خطأ أفضل حالات النموذج بالعربية لوحة تفريغ الكلام العربي المفتوحة، Interspeech 2025 Whisper large-v3، النجدي 48.58٪ أول درجات الانهيار المصدر نفسه Whisper large-v3، … اقرأ المزيد

تفوّق على GPT-3.5 في الأسلوب وخسر أمامه في المعرفة: حالة AceGPT

ARAB-LENS article illustration 26

إيهاب صالح | techkahwa.net صدرت الورقة: 21 أيلول 2023 | تاريخ النشر: 5 تشرين الأول 2023 الأرقام أولًا المقياس النتيجة ما الذي يقيسه المصدر AceGPT-13B-chat على Arabic Vicuna-80 100.88٪ من أداء GPT-3.5 اتباع التعليمات بالعربية، بحكم GPT-4 ورقة AceGPT، NAACL 2024 AceGPT-13B-chat على Arabic AlpacaEval 97.95٪ من أداء GPT-3.5 المقياس نفسه، مجموعة أخرى الورقة نفسها … اقرأ المزيد

أكبر نموذج مفتوح في العالم، بُني في أبوظبي، بلا عربية

ARAB-LENS article illustration 25

إيهاب صالح | techkahwa.net صدر النموذج: 6 أيلول 2023 | تاريخ النشر: 20 أيلول 2023 الأرقام أولًا المقياس النتيجة ما الذي يقيسه المصدر حجم النموذج 180 مليار معامل الأكبر مفتوح المصدر وقتها بيان معهد الابتكار التكنولوجي، 6 أيلول 2023 حجم بيانات التدريب 3.5 تريليون رمز الأضخم أيضًا البيان نفسه اللغات المذكورة في بطاقة النموذج الإنجليزية … اقرأ المزيد

مئة وستة عشر مليار رمز عربي: كيف صارت الخمسة والخمسون مئة وستة عشر

ARAB-LENS article illustration 24

إيهاب صالح | techkahwa.net صدر النموذج: 30 آب 2023 | تاريخ النشر: 13 أيلول 2023 الأرقام أولًا المقياس النتيجة ما الذي يقيسه المصدر مجموع رموز التدريب 395 مليارًا حجم النموذج الإجمالي ورقة Jais، arXiv:2308.16149، آب 2023 العربية الأصلية 55 مليارًا كم عربية حقيقية دخلت الورقة، الجدول 3 العربية بعد إضافة المترجَم 72 مليارًا أي 17 … اقرأ المزيد

تسمعك بالمصري ولا تردّ عليك به: قراءة في SeamlessM4T

ARAB-LENS article illustration 23

إيهاب صالح | techkahwa.net صدر النموذج: 22 آب 2023 | تاريخ النشر: 5 أيلول 2023 الأرقام أولًا المقياس النتيجة ما الذي يقيسه المصدر الفصحى، كلام داخل مدعوم هل يسمعك جدول اللغات الرسمي، مستودع seamless_communication الفصحى، كلام خارج مدعوم هل يتكلم إليك الجدول نفسه المصرية، كلام داخل مدعوم هل يسمع لهجتك الجدول نفسه المصرية، كلام خارج … اقرأ المزيد

أقل من خمسة من كل مئة ألف: العربية في بيانات Llama 2

ARAB-LENS article illustration 22

إيهاب صالح | techkahwa.net صدر النموذج: 18 تموز 2023 | تاريخ النشر: 1 آب 2023 الأرقام أولًا المقياس النتيجة ما الذي يقيسه المصدر حصة العربية في بيانات تدريب Llama 2 غير مدرجة، أي أقل من 0.005٪ كم عربية دخلت النموذج أصلًا ورقة Llama 2، الجدول 10، تموز 2023 حصة الإنجليزية 89.70٪ حجم الهيمنة الجدول نفسه … اقرأ المزيد

ثمانون بالمئة بالعربي: أول رقم رسمي، وأول رقم مضلِّل

ARAB-LENS article illustration 21

إيهاب صالح | techkahwa.net صدر النموذج: 14 آذار 2023 | تاريخ النشر: 28 آذار 2023 الأرقام أولًا المقياس النتيجة ما الذي يقيسه المصدر GPT-4 على MMLU بالعربية 80٪ معرفة عامة، لكن بامتحان مترجَم آليًا التقرير التقني لـ GPT-4، الشكل 5، آذار 2023 GPT-4 على MMLU بالإنجليزية، الشرط نفسه 85.5٪ المرجع الذي يقارَن به الرقم العربي … اقرأ المزيد

ضريبة الحرف: لماذا كلّفك ChatGPT ثلاثة أضعاف من اليوم الأول

ARAB-LENS article illustration 20

إيهاب صالح | techkahwa.net صدر النموذج: 30 تشرين الثاني 2022 | تاريخ النشر: 14 كانون الأول 2022 الأرقام أولًا المقياس النتيجة ما الذي يقيسه المصدر كلفة ترميز العربي مقابل الإنجليزي 3 أضعاف عدد الرموز اللازمة للنص نفسه بالمعنى نفسه Petrov وLa Malfa وTorr وBibi، NeurIPS 2023 كلفة الإيطالي مقابل الإنجليزي 1.6 ضعف للمقارنة، لغة أوروبية … اقرأ المزيد

قبل أن تصل النماذج الكبيرة: ماذا كانت العربية تملك فعلًا

ARAB-LENS article illustration 19

إيهاب صالح | techkahwa.net صدر العمل: أيار 2022 (ACL 2022) | تاريخ النشر: 5 حزيران 2022 الأرقام أولًا المقياس النتيجة ما الذي يقيسه المصدر AraBERT، حجم بيانات التدريب 70 مليون جملة، نحو 24 غيغابايت حجم المدخل العربي لأول نموذج عربي جاد Antoun وBaly وHajj، ورشة OSACT4، أيار 2020 AraBERT على تحليل المشاعر HARD 96.2٪ مقابل … اقرأ المزيد