إنتل تكشف عن مخطط مفتوح لتحويل نماذج الذكاء الاصطناعي إلى تطبيقات إنتاجية
تؤكد إنتل أن نجاح الذكاء الاصطناعي المؤسسي يعتمد على تكامل البرمجيات المفتوحة مع الأداء العتادي، وليس على أرقام المعايير المرجعية وحدها.

تجاوز أرقام المعايير نحو التكامل البرمجي
تتجه الشركات الكبرى في قطاع الذكاء الاصطناعي بعيداً عن السعي وراء أرقام الأداء القصوى (Benchmarks) نحو بناء أنظمة متكاملة وقابلة للإنتاج. وفقاً لما أوضحه بيل بيرسون، نائب رئيس برمجيات مراكز البيانات في [Intel Newsroom](https://www.intel.com/content/www/us/en/newsroom/news/artificial-intelligence/software-connects-open-blueprint-for-production-ai.html)، فإن النموذج البرمجي ليس سوى جزء واحد من منظومة معقدة. في بيئات العمل الفعلية، تتطلب الطلبات المؤسسية استرجاع مستندات داخلية، والتحقق من الصلاحيات، والبحث في قواعد بيانات متجهية، وتطبيق حواجز أمنية قبل توليد الردود النهائية.
يشير المسؤولون التنفيذيون في إنتل إلى أن المرحلة القادمة من الذكاء الاصطناعي المؤسسي ستشكلها البرمجيات التكاملية جنباً إلى جنب مع الأداء العتادي. قادة تقنية المعلومات لا يهتمون بتثبيت معايير مرجعية، بل يبنون تطبيقات موثوقة تدير التكاليف وتلبي متطلبات الأمن السيبراني، مما يخلق مساراً سلساً من مرحلة التجارب إلى التشغيل الفعلي.
استراتيجية 'الجاهزية من اليوم الأول' عبر البرمجيات المفتوحة
تتبنى إنتل نهجاً يهدف إلى تقليل الاحتكاك الذي يواجهه المطورون عند اعتماد تقنياتها الجديدة. يتمثل هذا النهج في ما تسميه الشركة بـ'الجاهزية من اليوم الأول' (Day 0 readiness)، والتي تعني تمكين النماذج الجديدة من العمل ضمن النظم البيئية البرمجية التي يعتمد عليها المطورون بالفعل، دون الحاجة لإعادة كتابة الكود أو تعلم لغات برمجة خاصة.
بدلاً من إجبار المطورين على استخدام أدوات حصرية، تلتزم إنتل بالمساهمة في تحسينات البرمجيات داخل المشاريع المفتوحة المصدر مثل PyTorch وSGLang وvLLM. هذا يتيح للمطورين تقييم النماذج في أطر مألوفة واستخدام أنماط النشر القياسية، مما يقلل من جهد التكامل بين إصدار النموذج وتطبيقه في بيئة الإنتاج. كما يساعد هذا النهج المؤسسات على تجنب ربط معمارية تطبيقاتها طويلة الأمد بأدوات مورد واحد فقط.
دور معالجات Xeon كمنصة تحكم للمهام الوكيلية
يتجاوز مستقبل الذكاء الاصطناعي المؤسسي مجرد تشغيل استعلامات على نموذج واحد، ليصبح نظاماً برمجياً 'وكيلياً' (Agentic) يعمل عبر سير عمل غير متزامنة ومعقدة. تقوم هذه الأنظمة بتفكيك الطلبات الكبيرة إلى مهام أصغر وتوزيعها على أدوات مختلفة. في هذا السياق، تلعب معالجات Intel Xeon دوراً أساسياً لا يقتصر على كونها مضيفاً للبطاقات المتسارعة، بل تعمل كمستوى تحكم (Control Plane) يربط عملية الاستدلال ببقية العمليات التجارية.
تتولى المعالجات مهام حاسمة مثل تحضير البيانات ونقلها، وإدارة الطلبات غير المتزامنة، وتنسيق استدعاء الأدوات الخارجية، وتطبيق الحواجز الأمنية، ودعم شبكات منخفضة الكمون. تعتمد إنتل على النضج التاريخي لنظام Xeon البيئي، بما في ذلك بنية الذاكرة المتقدمة والأمن الجذري في العتاد، للسماح للمؤسسات بنشر أنظمة وكيلية معقدة على بنية تحتية تعرفها وتديرها بفعالية.
تسهيل الوصول إلى بطاقات GPU عبر المعايير المفتوحة
على الرغم من أن نظام برمجيات بطاقات GPU المنفصلة لدى إنتل أحدث من نظام Xeon، إلا أن الشركة تبنيه مع إدراك كامل لهذه الحقيقة. يهدف التصميم إلى جعل بطاقات إنتل متاحة بسهولة عبر المعايير المفتوحة والأدوات المألوفة، دون فرض بيئة برمجة خاصة على سير عمل الذكاء الاصطناعي الشائعة. مع تقدم منصات الجيل القادم، بما في ذلك بطاقة مركز البيانات القادمة التي تحمل الاسم الرمزي Crescent Island، تركز إنتل على ثلاثة محاور رئيسية.
أولاً، التكامل الأصلي مع الأطر البرمجية، حيث يمكن للمطورين الكتابة لبطاقات إنتل عبر محركات الاستدلال المفتوحة، بينما تبقى التفاصيل التقنية مثل النواة (Kernels) وآليات الانتباه خلف الكواليس. ثانياً، تسهيل ضبط الأداء من خلال أدوات مثل Intel GPU AI Skills، التي تتيح للمطورين تحليل وضبط النماذج عبر التفاعل باللغة الطبيعية، مما يقلل حاجز الدخول للفريق التقني.
مرونة نقل الأحمال والاستدلال المنفصل
المحور الثالث هو قابلية نقل الأحمال (Workload Portability)، حيث يجب ألا تضطر المؤسسات لإعادة كتابة منطق التطبيقات عند قرار نقل جزء من سير العمل من المعالج المركزي إلى بطاقة GPU أو عتاد متخصص. تهدف البرمجيات إلى تسهيل وضع الأحمال في المكان الذي يحقق أفضل قيمة تشغيلية واقتصادية. كما تتكيف البنية مع نمو النماذج وتغير أنماط الطلب على الاستدلال، مما يدفع العديد من المنظمات لتبني مفهوم 'الاستدلال المنفصل' (Disaggregated Inference).
في الاستدلال المنفصل، يتم فصل مرحلة 'التعبئة' (Prefill) التي تعالج السياق، عن مرحلة 'التفكيك' (Decode) التي تولد الرموز واحداً تلو الآخر. رغم أن تشغيلهما على نفس البنية قد يكون أبسط، إلا أن فصلهما يمكن أن يحسن الاستفادة من الموارد على نطاق واسع. التحدي الحقيقي لا يكمن في وصف هذه المعمارية، بل في تشغيلها بكفاءة، مما يتطلب إدارة فعالة لحالة الذاكرة المؤقتة (KV-cache) وإدارة الكمون الشبكي وجدولة الطلبات عبر العقد المختلفة.
من نقطة التفتيش إلى الخدمة التجارية الموثوقة
تعمل البرمجيات على تحويل مجموعة من الخوادم إلى خدمة استدلال متكاملة، حيث تقوم بتوجيه العمل وإدارة الحالة وتوفير القابلية للمراقبة (Observability). تتطلب هذه البيئة بنية تحتية تطابق العتاد المناسب مع الجزء المناسب من الحمولة، وهو ما يتحقق عبر محركات التشغيل المفتوحة التي تمنح العملاء مرونة اختيار نموذج النشر الذي يناسب احتياجاتهم وتغييره لاحقاً كما تتطور المتطلبات.
لتحويل نموذج الذكاء الاصطناعي من مجرد ملف أوزان (Checkpoint) إلى خدمة أعمال موثوقة، حددت إنتل ثلاثة متطلبات أساسية: التحسين والتقديم، حيث يجب أن يعمل النموذج بكفاءة في إطار العمل المختار عبر مقاييس متعددة مثل الإنتاجية والكمون وتكلفة الذاكرة؛ والتغليف التشغيلي، حيث يحتاج الفريق إلى خدمات حاوية، وأتمتة نشر، وفحوصات صحة، وسجلات، وسلوك توسعة، ومسار تشغيلي لبيئات مثل Kubernetes. صُممت خدمات Intel Inference Microservices لتوفير هذه البنية التحتية التشغيلية بشكل استباقي.
المصادر
- Intel NewsroomSoftware Connects the System to the Open Model: An Open Blueprint for Production AI
تابع التسلسل الزمني




