ضغط نماذج LLMs عبر الفيزياء: نهج جديد لتقليم الكتل البرمجية
تستخدم تقنية جديدة مستوحاة من فيزياء الأنظمة الدوارة لحل معضلة اختيار الكتل البرمجية في النماذج الضخمة، مما يحقق تفوقاً ملموساً في الأداء مقارنة بالأساليب التقليدية.

تحدي تقليم النماذج: ما وراء التخلص من الكتل
تعتبر عملية حذف كتل المحولات بالكامل، والمعروفة بـ block removal، واحدة من أكثر الطرق فاعلية لتسريع نماذج اللغة الكبيرة (LLMs). هذه العملية لا تكتفي بتقليل استهلاك الذاكرة فحسب، بل تمنح سرعة استنتاج متوقعة لأن النموذج يصبح أقصر فعلياً. ورغم بساطة المفهوم، إلا أن تحديد الكتل التي يجب التخلص منها يمثل تحدياً هندسياً معقداً؛ فإزالة الكتل الخاطئة قد تؤدي إلى انهيار دقة النموذج، كما أن تأثير إزالة كتلة معينة يعتمد بشكل مباشر على الكتل الأخرى التي يتم حذفها بالتزامن. تشير الأبحاث المنشورة عبر [Hugging Face Blog](https://huggingface.co/blog/MultiverseComputingCAI/pruning-llms-like-a-physicist-block-removal-as-an) إلى أن هذا التفاعل يجعل من التقليم مشكلة توافقية (Combinatorial) معقدة وليست مجرد عملية ترتيب بسيطة.
في النماذج العميقة وغير المتجانسة، تتجاهل معظم الطرق التقليدية التفاعلات بين الكتل، حيث تعتمد على 'متوسطات الحقل' (Mean-field methods) التي تقيم أهمية كل كتلة بمعزل عن الأخريات. هذا التبسيط يؤدي غالباً إلى فقدان جودة النموذج، خاصة عند محاولة ضغط النموذج بشكل مكثف. يوضح فريق [MultiverseComputingCAI](https://huggingface.co/MultiverseComputingCAI) أن تجاهل هذه الاقترانات (Couplings) يترك فرصاً ضائعة لتحسين الأداء، وهو ما دفعهم للبحث عن حلول مستمدة من الفيزياء الإحصائية.
الفيزياء في خدمة الذكاء الاصطناعي: محاكاة زجاج الإيسينغ
لحل معضلة التفاعلات، أعاد الباحثون صياغة مشكلة اختيار الكتل كمسألة تحسين ثنائي مقيد (CBO). في هذا النموذج، يتم تخصيص متغير ثنائي لكل كتلة (0 للاحتفاظ، 1 للحذف)، وهو ما يحاكي نظاماً فيزيائياً من 'الدوران' (Spin). ومن خلال إجراء توسيع تايلور من الدرجة الثانية لخسارة النموذج، استطاع الفريق استخراج مصفوفة هسيان (Hessian matrix) تقريبية، حيث يمثل القطر أهمية الكتلة الفردية، بينما تمثل المداخل خارج القطر التفاعلات المتبادلة بين الكتل.
هذا التحويل الرياضي، الموثق في ورقة [LLM Compression by Block Removal with Constrained Binary Optimization](https://huggingface.co/papers/2602.00161)، يسمح بمعاملة النموذج كـ 'زجاج إيسينغ' (Ising glass)، حيث ترتبط الكتل جميعها ببعضها البعض. الطاقة الناتجة عن هذا النظام الفيزيائي تعمل كوكيل قوي وقليل التكلفة لجودة النموذج بعد التقليم. بعبارة أخرى، حالات الطاقة المنخفضة في هذا النظام الفيزيائي تتوافق مع حالات الأداء العالي للنموذج المقلّم، مما يلغي الحاجة إلى إجراء اختبارات أداء (Benchmarking) مكلفة لكل احتمالية.
الكفاءة الحسابية: السرعة دون التضحية بالدقة
من المزايا الجوهرية لهذا النهج هي تكلفته المنخفضة. يتم حساب مصفوفة الهسيان مرة واحدة فقط باستخدام مجموعة بيانات معايرة صغيرة عبر تمريرات أمامية وخلفية. بعد ذلك، تصبح عملية تقييم أي تكوين مقترح مجرد حساب طاقة بسيط وسريع. لا يتطلب هذا النهج تشغيل النموذج الفعلي لاختباره، كما يمكن إعادة استخدام نفس مصفوفة الهسيان لاستكشاف قيم مختلفة لعدد الكتل المراد حذفها، مما يجعله مرناً للغاية في سيناريوهات الضغط المتفاوت.
فيما يتعلق بـ [block removal](https://huggingface.co/papers/2602.00161)، يتيح هذا النموذج إمكانية استكشاف مليارات التكوينات في وقت قياسي. بالنسبة للنماذج ذات الحجم المتوسط، يمكن استخدام الحوسبة بالقوة الغاشمة (Brute-force) على معالج رسوميات واحد، بينما في الحالات الأكثر تعقيداً، يتم الانتقال إلى حلول متقدمة مثل البحث الممنوع (Tabu search) أو خوارزميات مستوحاة من الكم، مما يوفر أدوات قوية للتعامل مع مساحات الاحتمالات الضخمة التي لا يمكن حصرها يدوياً.
النتائج والآفاق المستقبلية في ضغط النماذج
حقق تطبيق هذه التقنية على نموذج Llama-3.3-70B-Instruct نتائج مبهرة، حيث تفوق على أفضل الطرق المنافسة في تقليم الكتل بنسبة 23 نقطة مئوية في اختبارات MMLU عند مستوى ضغط 50%. الأهم من ذلك، يرى الباحثون أن الوصول إلى 'الحالة الأرضية' (Ground state) للطاقة ليس الغاية القصوى؛ بل إن استكشاف حالات الطاقة المنخفضة يعطي مجموعة متنوعة من النماذج المقلمة عالية الجودة، مما يتيح للمهندسين اختيار التوازن الأمثل بين السرعة والدقة حسب متطلبات التطبيق.
إن هذا الدمج بين الفيزياء الإحصائية وهندسة النماذج اللغوية يفتح آفاقاً جديدة؛ فبدلاً من الاعتماد على التجربة والخطأ، أصبح لدينا إطار رياضي صلب يمكنه التنبؤ بسلوك النماذج تحت ظروف الضغط. ومع استمرار نمو النماذج اللغوية، ستصبح هذه الأدوات التي توفرها فرق مثل [MultiverseComputingCAI](https://huggingface.co/MultiverseComputingCAI) حيوية لجعل النماذج فائقة الضخامة متاحة للعمل على أجهزة ذات موارد محدودة، مع الحفاظ على كفاءة استدلال لا تضحي بجودة المخرجات.
المصادر
- Hugging Face BlogPruning LLMs Like a Physicist: Block Removal as an Ising Optimization Problem