- CatBoost
- + LightGBM، تحقق متقاطع k-fold
- macro-F1
- هدف مضبوط بالعتبة
- 5+
- مصادر بيانات مدموجة
التقنيات المستخدمة
- Python
- pandas
- NumPy
- scikit-learn
- CatBoost
- LightGBM
- SHAP
المشكلة
التنبؤ بجنس المستخدم انطلاقاً من إشارات سلوكية متباينة — الموقع الجغرافي، ومتجهات المُحيل، وسمات جدولية أخرى — موزّعة على عدة ملفات منفصلة يجب تنظيفها ودمجها أولاً في مجموعة تدريب واحدة. ومقياس التقييم هو macro-F1، أي أن على النموذج أن يؤدي جيداً عبر الفئات كلها لا على الفئة الأكثر شيوعاً فحسب.
المنهجية
بنيتُ مساراً متكاملاً: استيعاب الملفات الخام وتنظيفها، ودمج مصادر التدريب والاختبار والتسميات والبيانات الجغرافية ومتجهات المُحيل وفق مفاتيحها، وهندسة السمات على الجدول المدموج، وتدريب نماذج تعزيز تدرّجي (CatBoost وLightGBM). وجرى التحقق من النماذج بتحقق متقاطع k-fold، وضُبطت عتبة القرار تحديداً لتعظيم مقياس macro-F1 بدل الدقة الخام، مع مقارنة النتائج بخطوط أساس أبسط.
النتائج
مسار قابل لإعادة الإنتاج ينقل البيانات الخام متعددة المصادر إلى مصنّف مضبوط ومُتحقَّق منه بالتحقق المتقاطع. وقد حسّن ضبط العتبة وفق macro-F1 الأداء المتوازن بشكل ملموس مقارنةً بالعتبة الافتراضية 0.5، كما جعل تحليل SHAP والمنحنيات سلوك النموذج قابلاً للتفسير.
أبرز الحلول الهندسية
- مسار متكامل: استيعاب البيانات وتنظيفها ودمج مصادر التدريب والاختبار والتسميات والبيانات الجغرافية ومتجهات المُحيل.
- هندسة سمات عبر مدخلات متباينة، ثم نماذج تعزيز تدرّجي (CatBoost وLightGBM).
- تحقق متقاطع k-fold مع ضبط العتبة وفق macro-F1، بالمقارنة مع خطوط الأساس.
- فحص قائم على SHAP وتقييم بمنحنيات ROC وprecision-recall.
لقطات الشاشة والمخططات
لقطات ورسوم حقيقية من الواجهة — الشيفرة خاصة ولا تُعرض علامات العملاء التجارية.
تفاصيل تقنية معمّقة
الجانب الهندسي المثير هنا ليس اختيار النموذج بل تجهيز البيانات والهدف المطلوب تحسينه. فالمدخلات الخام تصل في عدة ملفات منفصلة يجب دمجها بشكل صحيح قبل أي نمذجة، والمقياس المستهدف — macro-F1 — يكافئ الأداء المتوازن عبر الفئات. وهذا يعيد صياغة المسألة من «درّب مصنّفاً» إلى «هندس سمات نظيفة واختر نقطة التشغيل التي تعظّم F1 المتوازن» — وهو بالضبط موضع العائد من ضبط العتبة والتحقق المتقاطع.