إنفيديا: نموذج Nemotron يتفوق في أولمبيادتي البرمجة والرياضيات
أثبتت نماذج Nemotron من إنفيديا قدرتها على التكيف العالي، حيث حققت نتائج بمستوى الميدالية الذهبية في مسابقتين دوليتين مختلفتين تماماً: أولمبياد المعلومات (IOI) وأولمبياد الرياضيات (IMO).

تحدي المسابقتين الدوليتين
تختلف متطلبات أولمبياد المعلومات (IOI) وأولمبياد الرياضيات (IMO) جذرياً؛ فالأول يتطلب خوارزميات ورموزاً تجتاز اختبارات خفية ضمن قيود زمنية صارمة، بينما يتطلب الثاني إثباتات رياضية دقيقة باللغة الطبيعية. النجاح في أي منهما صعب، لكن النجاح في كليهما يشير إلى قدرة أوسع للنماذج اللغوية الكبيرة. أظهرت نتائج حديثة أن عائلة نماذج Nemotron من إنفيديا تشكل أساساً قوياً وقابلاً للتكيف لبناء أنظمة متخصصة عالمية المستوى.
منهجية الضبط الدقيق
بدأت فرق العمل من نموذج Nemotron 3 الأساسي، مستخدمةً تقنيات الضبط الإشرافي (SFT) والتعلم المعزز (RL) والاستدلال المدعوم بالتغذية الراجعة. بدلاً من بناء نموذج أساسي جديد لكل تحدٍ، تخصصت النماذج الحالية للمهمة المطلوبة. تضمنت الوصفة أربع خطوات: اختيار مشاكل محددة المجال ومسارات استدلال عالية الجودة، تطبيق تقنيات ما بعد التدريب القياسية، وربط النموذج المتخصص بحلقة استدلال تولّد وتقيّم وتحسّن الإجابات المرشحة. كانت عمليات التدريب والاستدلال ضخمة، لكن النهج الأساسي مألوف وقابل للتكرار.
النتائج في أولمبياد المعلومات
للبرمجة التنافسية، تم اختيار 22,000 مشكلة وتوليد مسارات استدلال اصطناعية لتدريب متخصصين. تلقى نموذج Nemotron-3-Nano-CC، بـ 30 مليار معامل إجمالي و3 مليارات نشطة، كلا من SFT وRL. بينما تلقى Nemotron-3-Ultra-CC، بـ 550 مليار معامل إجمالي و55 ملياراً نشطة، تدريب SFT فقط. أظهرت النتائج على IOI 2025 قيمة التخصص بوضوح؛ تحسن Nano من 130 نقطة قبل التدريب إلى 280 بعد SFT و291 بعد RL. باستخدام استراتيجية GenCorrect التكرارية، وصل إلى 468 نقطة متجاوزاً عتبة الذهب (438.3). أما Ultra-CC فوصل إلى 502 نقطة بنفس الاستراتيجية.
أظهرت التجارب أن التكيف لا يجب أن يبدو متشابهاً في كل المقاييس. أنتج SFT معظم مكاسب Nano، بينما أضاف RL تحسيناً أصغر لكنه ثابت. بالنسبة لنموذج Ultra الأقوى، كان جولة SFT واحدة كافية لتفوق النموذج Nano بعد التدريب الكامل عبر IOI وICPC وLiveCodeBench Pro. قاد هذا الاكتشاف إلى تصميم نظام Ultra-CC المحدد للمنافسة، الذي سجل 535.4 من 600 نقطة في IOI 2026. جاءت هذه النتيجة من تشغيل مباشر واستباقي تحت نفس قيود الوقت والوصول للإنترنت والإرسال التي يواجهها المتسابقون البشر، وكانت غير رسمية وغير مشمولة في الترتيب الرسمي لـ IOI.
تعليم النماذج على البرهنة والتحقق
طبّق مشروع IMO الفكرة نفسها على الرياضيات الأولمبية. بدءاً من Nemotron 3 Ultra، تم تدريب متخصص واحد بـ SFT وآخر بـ RL. تضمنت مجموعة بيانات SFT 414,890 مثالاً مرشحاً بجودة عالية عبر 15,818 مشكلة برهان فريدة. لم يعلّم النموذج الإجابات النهائية فقط، بل غطى توليد البراهين، وتحسينها، والتحقق منها، والتحقق الميتا، مما مكن النموذج من بناء الحجج وتحديد الفجوات والاستجابة للنقد. تم تدريب نموذج RL على 9,597 مشكلة برهان مختارة قرب حدود قدرة النموذج.
تفوق كلا نقطة التحقق بعد التدريب على النموذج العام في التجارب التطويرية. كان نقطة SFT الأقوى في جولة البحث الأولى، بينما حقق نقطة RL أفضل نتيجة عامة لنقطة تحقق واحدة. نظراً لتكامل نقاط قوتهم، استخدم النظام النهائي كلا المتخصصين جنباً إلى جنب مع النموذج العام. لكل مشكلة IMO، ولّد النماذج براهين مرشحة، وقامت بتقييمها، وإنتاج انتقادات، وتحسين المحاولات الأكثر وعوداً. اختارت مرحلة حسابية عالية الحوسبة الإرسال النهائي. عمل النظام بالكامل باللغة الطبيعية دون أدوات خارجية أو وصول للإنترنت، مسجلاً 30 من 42 نقطة، بما في ذلك تقدير كامل لأربع من أصل ست مشاكل، متجاوزاً عتبة الميدالية الذهبية الرسمية.
التكامل بين الضبط والحوسبة
أضافت النتائج الجديدة عنصراً مهماً لما أظهرته منشورات سابقة: التخصص الأفضل يمنح نظام الاستدلال مرشحين أفضل، ونقاداً أفضل، وتحسينات أفضل. في IOI، حوّلت GenCorrect مكاسب الضبط الدقيق إلى تحسينات أكبر عبر جولات تغذية راجعة متعددة. في IMO، كان استخدام نقاط تحقق SFT وRL مكملة أكثر قيمة من مجرد سحب عينات أكثر من نقطة واحدة. في الحالتين، جاء أفضل نتيجة من دمج متخصص قادر مع نظام قادر على البحث والتحقق والتحسين. هذا التمييز مهم؛ فالميداليات لم تنتج عن الضبط الدقيق وحده، ولا عن العينة القسرية وحدها، بل عن التصميم المشترك للنموذج والبيانات وحلقة الاستدلال.
الموارد المفتوحة والمجتمع
تسعى إنفيديا لجعل هذه النتائج مفيدة خارج المسابقات. تجمع مجموعة Nemotron Labs IMO 2026 نقاط تحقق SFT وRL، ومجموعتي بيانات التدريب، وNemotron-IMO-Bench، وهو معيار جديد يضم 200 مشكلة بمستوى أولمبي. تصف ورقة IMO نهج التدريب ونظام التوليد والتحقق والتحسين، بينما يتضمن مستودع NeMo-Skills خط أنابيب استدلال IMO، والأوامر، والبراهين المقدمة، وبداية سريعة قابلة للتكرار. للبرمجة التنافسية، يتوفر نموذج Nemotron-3-Ultra-CC على Hugging Face، وتوفر ورقة IOI وصفة التدريب ومنهجية GenCorrect. تتوفر أيضاً تقيمات IOI وخط أنابيب الاستدلال في NeMo-Skills. توفر IMO وIOI معاً دليلاً صارماً على فكرة بسيطة: يمكن ضبط Nemotron إلى متخصصين عالميين، ثم دمجهم مع مسارات استدلال شفافة لحل مشاكل في طليعة المنافسة البشرية.
المصادر
- Hugging Face BlogOne Model Family, Two Gold-Level Results: Fine-Tuning Nemotron for IOI and IMO
تابع التسلسل الزمني




