93 على العربية، وسؤال واحد يكشف الباقي: Gemini 3 Pro والاستدلال الثقافي

An overhead view of a laden table with hands offering and refusing at once

إيهاب صالح | techkahwa.net صدر النموذج: 18 تشرين الثاني 2025 | تاريخ النشر: 2 كانون الأول 2025 الأرقام أولًا المقياس النتيجة ما الذي يقيسه المصدر Global-MMLU-Lite بالعربية 93، الأعلى في المؤشر معرفة واستدلال عام بالعربية Artificial Analysis، مؤشر العربية Artificial Analysis Intelligence Index الأول، بثلاث نقاط فوق GPT-5.1 ذكاء عام مركّب Artificial Analysis، تشرين الثاني … اقرأ المزيد

“بكرا عندي meeting”: اختبار GPT-5.1 في العربية التي نكتبها فعلًا

Two rivers of light braiding together without their colours mixing

إيهاب صالح | techkahwa.net صدر النموذج: 12 تشرين الثاني 2025 | تاريخ النشر: 26 تشرين الثاني 2025 الأرقام أولًا المقياس النتيجة ما الذي يقيسه المصدر HELM Arabic ضمن النماذج المغلقة المقيَّمة على سبعة مقاييس عربية أصيلة أداء عربي مستقل Stanford CRFM و Arabic.AI، كانون الأول 2025 HELM Arabic، المتصدر Arabic.AI LLM-X أداء عربي على سبعة … اقرأ المزيد

4.74 في الفصحى و2.73 في الشامية: الرقم الذي يلخّص أزمة التقييم العربي

A polished monument beside the same monument drawn as a faint wireframe

إيهاب صالح | techkahwa.net صدر النموذج: آب 2025 | تاريخ النشر: 14 أيلول 2025 الأرقام أولًا تقييم مستقل لنموذج ALLaM 34B عبر واجهة HUMAIN Chat، بثلاثة نماذج حَكَم مستقلة (GPT-5 و Gemini 2.5 Pro و Claude Sonnet 4)، على 23 مطلبًا كُرّر كل منها خمس مرات، بمجموع 115 ردًا: الفئة الدرجة من 5 المصدر التبديل … اقرأ المزيد

اللهجة ليست هوية: فخ التنميط في اختبار Grok 4

A crowd of identical silhouettes with one singled out by a harsh spotlight

إيهاب صالح | techkahwa.net صدر النموذج: 10 تموز 2025 | تاريخ النشر: 24 تموز 2025 الأرقام أولًا المقياس النتيجة ما الذي يقيسه المصدر Artificial Analysis Intelligence Index 22 على مقياس المؤشر وقت القياس ذكاء عام مركّب Artificial Analysis نافذة السياق 256 ألف رمز حجم النص المعالَج دفعة واحدة Artificial Analysis السعر 3 و15 دولارًا لكل … اقرأ المزيد

الطلاقة ليست فهمًا: Qwen3 وأفضل رقم عربي بين النماذج المفتوحة

An exquisitely cut glass vessel that is completely hollow inside

إيهاب صالح | techkahwa.net صدر النموذج: 28 نيسان 2025 | تاريخ النشر: 12 أيار 2025 الأرقام أولًا المقياس النتيجة ما الذي يقيسه المصدر HELM Arabic، أفضل نموذج مفتوح الأوزان Qwen3 235B بمتوسط 0.786 سبعة مقاييس عربية أصيلة Stanford CRFM و Arabic.AI، كانون الأول 2025 HELM Arabic، عدد النماذج المفتوحة ضمن العشرة الأوائل أربعة، منها Qwen3 … اقرأ المزيد

تسرّب الفصحى: كيف ينفّذ Llama 4 طلبك اللهجي ويخالفه في الوقت نفسه

A colourful mosaic wall being swallowed from below by grey concrete

إيهاب صالح | techkahwa.net صدر النموذج: 5 نيسان 2025 | تاريخ النشر: 19 نيسان 2025 الأرقام أولًا المقياس النتيجة ما الذي يقيسه المصدر HELM Arabic Llama 4 Maverick ضمن أفضل عشرة نماذج مفتوحة الأوزان سبعة مقاييس عربية أصيلة Stanford CRFM و Arabic.AI، كانون الأول 2025 لوحة OALL، نماذج المحادثة Llama3.3-70B-Instruct في الصدارة مقاييس عربية أصيلة … اقرأ المزيد

سنتان في العربية: ما الذي تغيّر فعلًا منذ Claude 3.5 Sonnet و Gemini 2.5 Pro

Layered geological strata with one core sample drilled through all of them

إصدارا الأساس: تشرين الأول 2024 و25 آذار 2025 | تاريخ النشر: 8 نيسان 2025 إيهاب صالح | techkahwa.net الأرقام أولًا ما تغيّر قبل بعد المصدر لوحة OALL نسخة أولى تعتمد جزئيًا على مقاييس مترجمة آليًا نسخة ثانية حذفت المترجَم واعتمدت مقاييس أصيلة: ArabicMMLU و MadinahQA و AraTrust و ALRAGE OALL v2 قياس الكلام العربي لا … اقرأ المزيد

بأي لغة يفكّر النموذج قبل أن يجيبك بالعربية؟ حالة DeepSeek R1

A transparent head full of gears crossed by a single unchanged thread of light

إيهاب صالح | techkahwa.net صدر النموذج: 20 كانون الثاني 2025 | تاريخ النشر: 3 شباط 2025 الأرقام أولًا المقياس النتيجة ما الذي يقيسه المصدر XReasoning، مطابقة لغة التفكير للغة المطلوبة 46.3٪ على AIME و42.3٪ على GPQA في أكبر نموذج مقطّر من R1 هل يفكر النموذج باللغة التي طُلبت منه؟ arXiv 2505.22888 XReasoning، بعد إجبار النموذج … اقرأ المزيد

نصف العربية فيه مترجَم آليًا: قراءة في ALLaM ومعنى “نموذج وطني”

ARAB-LENS article illustration 38

إيهاب صالح | techkahwa.net صدرت الورقة: 22 تموز 2024 | تاريخ النشر: 12 آب 2024 الأرقام أولًا المقياس النتيجة ما الذي يقيسه المصدر مجموع العربية المجموعة 540 مليار رمز حجم المدوّنة العربية ورقة ALLaM، arXiv:2407.15390 منها عربية طبيعية 270 مليارًا نصف المجموع الورقة نفسها، اقتباس حرفي منها عربية مترجَمة آليًا 270 مليارًا النصف الآخر الورقة … اقرأ المزيد

ثماني لغات مدعومة، والعربية ليست منها: Llama 3.1 بأربعمئة وخمسة مليارات

ARAB-LENS article illustration 37

إيهاب صالح | techkahwa.net صدر النموذج: 23 تموز 2024 | تاريخ النشر: 6 آب 2024 الأرقام أولًا المقياس النتيجة ما الذي يقيسه المصدر اللغات المدعومة رسميًا ثماني: الإنجليزية والألمانية والفرنسية والإيطالية والبرتغالية والهندية والإسبانية والتايلاندية التزام ميتا المعلن بطاقة نموذج Llama 3.1 العربية ضمنها لا هل لغتك في القائمة البطاقة نفسها نسبة البيانات متعددة اللغات … اقرأ المزيد