من 53 رمزًا إلى 26: اليوم الذي انخفضت فيه ضريبة الحرف

وقت القراءة: 8 دقيقة
18
إيهاب صالح | techkahwa.net صدر النموذج: 13 أيار 2024 | تاريخ النشر: 27 أيار 2024

الأرقام أولًا

المقياس النتيجة ما الذي يقيسه المصدر
العربية، قبل المجزّئ الجديد 53 رمزًا الجملة النموذجية نفسها صفحة إطلاق GPT-4o، 13 أيار 2024
العربية، بعد المجزّئ الجديد 26 رمزًا انخفاض بمقدار الضعف المصدر نفسه
عامل التحسّن المعلن للعربية 2.0 ضعف كما كتبته OpenAI المصدر نفسه
الإنجليزية، قبل وبعد 27 إلى 24 رمزًا، 1.1 ضعف المرجع المصدر نفسه
الغوجاراتية، أعلى تحسّن 145 إلى 33، 4.4 ضعف من استفاد أكثر المصدر نفسه
الهندية 90 إلى 31، 2.9 ضعف للمقارنة الإقليمية المصدر نفسه
الأردية 82 إلى 33، 2.5 ضعف لغة بحروف عربية المصدر نفسه
الفارسية 61 إلى 32، 1.9 ضعف لغة أخرى بحروف عربية المصدر نفسه
المجزّئ الجديد o200k_base اسمه التقني المصدر نفسه

ملاحظة منهجية لازمة: هذه الأرقام لجملة نموذجية واحدة لكل لغة، لا لقياس على مدوّنة كاملة. فلا تقل “العربية صارت أرخص بالضعف” كقاعدة عامة، قل “على الجملة التي نشرتها OpenAI، انخفضت من 53 إلى 26”.


قبل وبعد، على الجملة المنشورة

عدد الرموز للجملة النموذجية
العربية، المجزّئ القديم
53
العربية، المجزّئ الجديد
26
الإنجليزية، القديم
27
الإنجليزية، الجديد
24

وهذا هو الرقم الذي يستحق أن يُحسب: على هذه الجملة تحديدًا، كانت العربية تكلّف 1.96 ضعف الإنجليزية، وصارت تكلّف 1.08 ضعف. الفجوة لم تُلغَ، لكنها ضاقت كثيرًا.


بطاقة النموذج

البند التفصيل
النموذج GPT-4o
الجهة OpenAI
تاريخ الإصدار 13 أيار 2024
الجديد فيه متعدد الوسائط أصلًا، وأسرع، ومجزّئ جديد
المجزّئ o200k_base بدل cl100k_base
ما نُشر عن العربية جدول التجزئة، وهو رقم عربي رسمي صريح
ما لم يُنشر وقت الإطلاق أي معيار أداء عربي للنسخة الصادرة في أيار

قراءة ARAB-LENS: أول مرة تُحسب العربية

في المقالة العشرين من هذه السلسلة كتبتُ أن ضريبة الحرف ليست مؤامرة بل إهمال، وأن الإهمال يحتاج أن ينتبه له أحد. هذه المقالة عن اليوم الذي انتبه فيه أحد.

ثلاث ملاحظات، الأولى إيجابية بصدق.

الأولى: العربية كانت في الجدول، بالاسم، ومن اليوم الأول.

هذا ليس تفصيلًا شكليًا. صفحة إطلاق GPT-4o عرضت عشرين لغة مع أرقامها قبل وبعد، والعربية واحدة منها، بجملة عربية حقيقية مكتوبة في الصفحة. وهذه أول مرة في هذه السلسلة كلها أقرأ فيها رقمًا عربيًا نشرته شركة كبرى عن نموذجها يوم الإطلاق، بلا انتظار ورقة أكاديمية بعد سنتين.

قارنها بما سبق: GPT-4 أعطانا رقمًا داخل رسم بياني. Claude 3 لم يفصّل العربية. Falcon لم يذكرها. Mixtral أخرجها من القائمة. وهنا: جدول نصي واضح، ورقمان، وعامل تحسّن.

الثانية: من استفاد أكثر يكشف من كان أكثر ظلمًا.

انظر إلى ترتيب التحسينات. الغوجاراتية 4.4 ضعف، التيلوغوية 3.5، التاميلية 3.3، المراثية والهندية 2.9، الأردية 2.5، ثم العربية 2.0. اللغات التي تحسّنت أكثر هي التي كانت أسوأ حالًا.

وهذا يؤكد ما قلته في المقالة العشرين: العربية، بكل شكواها، لم تكن في القاع. كانت الأردية والهندية والتاميلية أسوأ منها بكثير. والمجزّئ الجديد لم يُصنع للعربية، صُنع للغات الهندية أساسًا، والعربية استفادت في الطريق.

الثالثة، ولا بد من قولها: التحسّن في التجزئة ليس تحسّنًا في الفهم.

هذه نقطة أخشى أن تضيع. تجزئة أفضل تعني: كلفة أقل، سرعة أعلى، سياق أوسع. ولا تعني أن النموذج صار يعرف اللهجة الشامية، أو يفهم أن “خلينا نشوف” تعني لا، أو يجيد جمع غير العاقل.

بل إن المجزّئ الجديد أثار نقاشًا تقنيًا واسعًا لأن بعض الرموز التي تعلّمها في لغات معيّنة جاءت من نصوص منخفضة الجودة. والدرس أن توسيع المفردات بلا تنظيف بيانات يُدخل مشاكل من نوع آخر.


أين نقف الآن: مقارنة ثلاث لحظات

اللحظة التاريخ حالة العربية
ChatGPT تشرين الثاني 2022 ضريبة حرف مرتفعة، لا رقم عربي منشور
GPT-4 آذار 2023 رقم واحد داخل رسم، على امتحان مترجَم
GPT-4o أيار 2024 جدول تجزئة صريح، ولا معيار أداء عربي يوم الإطلاق

الاتجاه صحيح لكنه بطيء. وحتى في 2024، السؤال “كم يعرف هذا النموذج من العربية؟” ما زال بلا جواب رسمي يوم الإطلاق.

ملاحظة عن رقم لاحق قد تصادفه: يوجد اليوم رقم منشور لأداء GPT-4o على نسخة MMLU مترجمة بشريًا إلى أربع عشرة لغة، والعربية منها. لكن ذلك الرقم يخص لقطة تشرين الثاني 2024 من النموذج، لا النسخة الصادرة في أيار. ونسبته إلى إطلاق أيار خطأ شائع. وهذا يقودني إلى قاعدة عامة: اسم النموذج ليس هوية، اللقطة هي الهوية.


من دفتر الاختبار: قياس أثر المجزّئ على منتجك أنت

الأرقام المنشورة لجملة واحدة. منتجك ليس جملة واحدة. هذه طريقة قياس حقيقية.

الخطوة الأولى: هات مئة نص من منتجك.

ليس نصوصًا عامة. رسائل عملائك، أوصاف منتجاتك، أسئلتكم الشائعة. مئة نص تكفي لقياس مستقر.

الخطوة الثانية: صنّفها إلى خمس فئات.

الفئة مثال لماذا تختلف
فصحى رسمية شروط وأحكام جمل طويلة ومفردات قياسية
فصحى صحفية وصف منتج متوسط
لهجة مكتوبة رسالة عميل كلمات خارج القاموس
عربيزي رسالة شاب حروف لاتينية وأرقام
مختلط عربي فيه إنجليزي تبديل داخل الجملة

عدّ الرموز في كل فئة، وقسّم على عدد الكلمات. سيظهر لك أن الفئة الثالثة والرابعة أغلى بكثير، لأن المجزّئ لم يتعلمهما. وهذا يخبرك أين تذهب فاتورتك فعلًا.

الخطوة الثالثة: قِس الفرق بين نموذجين.

شغّل النصوص المئة على مجزّئين مختلفين. الفرق الذي ستجده أهم من أي رقم إعلان، لأنه فرق بياناتك أنت.

الخطوة الرابعة: أعد حساب سياقك.

إن كان تطبيقك يمرّر تاريخ محادثة، احسب كم دورًا يتسع فعلًا بالعربية مقابل الإنجليزية. ثم اضبط حد القطع على أساس الرقم العربي لا الإنجليزي. أكثر خطأ هندسي رأيته في تطبيقات عربية: حد سياق مضبوط على تقدير إنجليزي، فيبدأ النموذج بنسيان أول المحادثة في الدور الرابع بدل العاشر.

البند الأخير: اختبار العربيزي مرة أخرى.

في المقالة العشرين وجدنا أن العربيزي غالبًا أرخص من العربي. أعد هذا الاختبار مع المجزّئ الجديد:

بالعربي بالعربيزي
“شو أخبارك؟ كيف الشغل؟” “shu akhbarak? kif el shoghol?”
“بدي أحجز موعد بكرا الصبح” “biddi ehjez maw3ad bukra el sob7”
“الطلبية وصلت ناقصة” “el talabiyye wislat na2sa”

إن انقلبت النتيجة وصار العربي أرخص، فهذه أهم إشارة على أن المجزّئ صار يفهم العربية فعلًا، لا أن الأرقام تحسّنت فقط.

البند الخامس: اختبار الأثر على التكلفة الحقيقية.

لا تكتفِ بعدّ الرموز، احسب الفاتورة:

البند الطريقة
متوسط رموز الطلب من مئة عيّنة حقيقية
متوسط رموز الجواب من مئة جواب حقيقي
عدد الطلبات المتوقع شهريًا من تقديرك
الفرق بين مجزّئين اضرب واطرح

كثير من الفرق العربية اكتشفت بعد تغيير المجزّئ أن ميزانيتها انخفضت بنحو الثلث. وقليل منها أعاد حساب التسعير ليعكس ذلك.

البند السادس: اختبار تحسّن الجودة، لا الكلفة فقط.

هذه فرضية أنصح باختبارها بنفسك: حين تتحسّن التجزئة، هل يتحسّن النحو أيضًا؟

الطريقة: شغّل عشر جمل تحتوي كل واحدة على كلمة عربية طويلة ومركّبة، مثل “وبمدارسهم” و”فسيكتبونها” و”ليستخرجوها”. اطلب تحليلًا صرفيًا لكل واحدة. قارن النتيجة بين نموذجين بمجزّئين مختلفين.

إن تحسّن التحليل مع المجزّئ الأفضل، فهذا يدعم الفكرة التي طرحتُها في المقالة العشرين: تقطيع الكلمة إلى شظايا لا يكلّف مالًا فقط، بل يكلّف دقة. وإن لم يتحسّن، فالمحوران منفصلان تمامًا. وأنا لا أملك رقمًا منشورًا يحسم هذا، وأذكره كسؤال مفتوح لا كنتيجة.


جدول ضريبة الحرف عبر ثلاث سنوات

اللحظة ما نعرفه عن الكلفة العربية
ChatGPT، 2022 نحو 3 أضعاف الإنجليزية، بحث NeurIPS 2023، قياس على مدوّنة
GPT-4، 2023 المجزّئ نفسه، فالكلفة نفسها
GPT-4o، 2024 على الجملة المنشورة: 1.08 ضعف الإنجليزية

تحذير منهجي صريح: لا يجوز أن تقسم ثلاثة على واحد وثمانية من مئة وتقول إن التحسّن ثلاثة أضعاف. الرقم الأول قياس على مدوّنة كاملة بمجزّئ قديم، والثاني عدّ على جملة واحدة بمجزّئ جديد. هذان قياسان مختلفا المنهج ولا يُقسم أحدهما على الآخر.

وأنا أضع هذا التحذير لأنني أرى هذه العملية الحسابية تُجرى كثيرًا في التغطية العربية، وتنتج أرقامًا لا أساس لها.


الحكم العملي

أعد حساب تكلفتك عند كل تغيير مجزّئ. تقديرات الميزانية القديمة تصير غلطًا بالضعف، في الاتجاهين.

ولا تخلط بين رخص التجزئة وجودة اللغة. هذان محوران منفصلان تمامًا، ونموذج رخيص بالعربية قد يظل جاهلًا بها.

وسمّ اللقطة دائمًا. “GPT-4o” وحده اسم عائلة لا نموذج. وأي مقارنة بلا تاريخ لقطة هي مقارنة بلا معنى.


المقالة القادمة

في اليوم نفسه تقريبًا، أطلق معهد الابتكار التكنولوجي في أبوظبي نموذج Falcon 2 بأحد عشر مليار معامل. وفي تقريره التقني رقم عربي واحد فقط، وهو رقم يستحق أن يُقرأ ببطء: 25.32. والتخمين العشوائي في ذلك الاختبار 25.


المصادر

  • OpenAI، Hello GPT-4o، 13 أيار 2024: openai.com/index/hello-gpt-4o
  • جدول مقارنة التجزئة في الصفحة نفسها
  • openai/simple-evals، نتائج MMMLU متعددة اللغات، للإشارة إلى لقطة تشرين الثاني 2024: github.com/openai/simple-evals