إنفيديا تطلق نموذج Kumo Tabular المفتوح للبيانات الجدولية
يقدّم نموذج Kumo Tabular من إنفيديا نهجاً جديداً في التنبؤ بالبيانات الجدولية عبر التعلم السياقي، متجاوزاً حدود النماذج التقليدية.

إطلاق نموذج Kumo Tabular المفتوح
أعلنت شركة إنفيديا عن إطلاق نموذج Kumo Tabular، وهو نموذج أساسي مفتوح المصدر مخصص للبيانات الجدولية، ليكون جزءاً من مجموعة نماذج Kumo Structured. يتيح هذا النموذج للمستخدمين التنبؤ بملفات البيانات الجديدة في مسار واحد للأمام، دون الحاجة إلى تدريب مسبق أو ضبط معلمات أو هندسة ميزات، سواء للتمثيل أو الانحدار. تم إطلاق النموذج رسمياً على منصة Hugging Face، حيث يمكن الوصول إلى أوزانه ومصدره المفتوح.
تجاوز حدود النماذج التقليدية
لطالما اعتمدت المؤسسات على أشجار التدرج المعزز (Gradient-boosted trees) للتعامل مع البيانات الجدولية، مثل سجلات العملاء والمعاملات وسجلات المستشعرات. وعلى الرغم من فاعلية هذه النماذج، إلا أن دورة حياتها تتطلب جمع التسميات وهندسة الميزات وضبط المعلمات لكل مهمة جديدة. يقدم Kumo Tabular بديلاً يعتمد على التعلم السياقي، حيث يمكن للنموذج قراءة جدول مسمّى كسياق والتنبؤ بملفات الصفوف الجديدة مباشرة، مما يقلل من التعقيد التشغيلي بشكل كبير. ويمكن الرجوع إلى Hugging Face Blog للاطلاع على التفاصيل الأصلية للمصدر.
معمارية مخصصة للبيانات الجدولية
يعتمد Kumo Tabular على معمارية Transformer مبنية حول بنية الجدول، مستفيدة من الانتباه السياقي (In-context attention) كما تم تقديمه في نماذج TabICL و TabPFN. يتطلب التنبؤ فهم معنى كل قيمة داخل عمودها، وفهم تفاعل الأعمدة في الصف، وربط الصفوف السياقية بالصفوف الاستعلام. يتم تحقيق ذلك من خلال تضمين الخلايا (Cell Embedding) الذي يعالج القيم الرقمية والفئوية باستخدام ميزات فورييه، وتضمين الصفوف (Row Embedding) الذي يجمع بين الانتباه العمودي والصفوي لفهم التوزيعات والتفاعلات.
التعلم السياقي وكفاءة الحساب
يعمل النموذج من خلال مرحلة التعلم السياقي النهائية، حيث تنتبه الصفوف السياقية لبعضها البعض، بينما تنتبه صفوف الاستعلام إلى الصفوف السياقية فقط. هذا التصميم يضمن أن يعتمد كل تنبؤ على السياق والصف نفسه فقط، مما يسمح بإعادة استخدام مفاتيح وقيم السياق للتنبؤات اللاحقة. كما يستخدم النموذج تقنية Test-GQA لتقليل حجم ذاكرة التخزين المؤقت، مما يحسن من كفاءة الحساب ويقلل من التكاليف التشغيلية.
التدريب على البيانات الاصطناعية
تم تدريب Kumo Tabular بالكامل على جداول اصطناعية مولدة من نموذج سببي هيكلي (SCM). يتضمن هذا العملية سحب إعدادات عشوائية للجداول، وربط المتغيرات المخفية عبر رسوم بيانية سببية، وتقييمها من الجذر إلى الورقة باستخدام دوال عشوائية. يتم حقن قيم مفقودة وضوضاء واقعية في البيانات لمحاكاة تعقيدات العالم الحقيقي. هذا النهج يسمح للنموذج بتعلم التعامل مع النواقص والتباينات دون الحاجة إلى تنظيف البيانات مسبقاً.
الأداء على المعايير الرئيسية
أظهر Kumo Tabular أداءً استثنائياً عند اختباره على لوحة TabArena، متفوقاً على أشجار التدرج المعزز ونماذج AutoGluon والنماذج الأساسية الأخرى للبيانات الجدولية. حقق النموذج المرتبة الأولى بشكل عام بمعدل ELO يبلغ 1950، مما يؤكد تفوقه في دقة التنبؤ وكفاءة الحساب. كما تصدر النموذج معايير BeyondArena و TALENT و ScoringBench، مما يجعله الخيار الأمثل للمهام الجدولية في بيئات المؤسسات.
التوفر والاستخدام التجاري
يتوفر Kumo Tabular بثلاثة أحجام مختلفة، تتراوح من 28 مليون إلى 215 مليون معلمة، مما يتيح للمستخدمين اختيار الحجم المناسب لمتطلباتهم. يمكن تشغيل النموذج عبر مكتبة إنفيديا مفتوحة المصدر، وهو متاح للاستخدام التجاري تحت رخصة OpenMDW-1.1. يوفر هذا التوفر المرن للمطورين والمؤسسات إمكانية دمج النموذج في أنظمتهم الحالية بسهولة، مع الحفاظ على مرونة الأداء والتكلفة.
المصادر
- Hugging Face BlogNVIDIA Kumo Tabular Sets a New Accuracy-Efficiency Frontier for Tabular Prediction