أمازون SageMaker AI تستعرض 13 تحديثاً تقنياً لتعزيز استدلال الذكاء الاصطناعي
أعلنت AWS عن حزمة من التحسينات التي شملت 13 ميزة جديدة عبر مسارات النشر المدارة وخدمة HyperPod، بهدف تبسيط تحديات تشغيل النماذج الضخمة في بيئات الإنتاج.

تحديات الاستدلال في عصر الذكاء الاصطناعي
يواجه المطورون تحديات استثنائية عند نشر نماذج الذكاء الاصطناعي التوليدي في بيئات الإنتاج؛ إذ تتجاوز أحجام النماذج عشرات أو مئات الجيجابايت، مما يجعل متطلبات الاستجابة تُقاس بعدد الرموز (Tokens) في الثانية الواحدة. علاوة على ذلك، تؤدي فترات "البداية الباردة" (Cold starts) الناتجة عن تحميل الحاويات والأوزان إلى تأخير قد يصل لعدة دقائق، في ظل محدودية موارد وحدات معالجة الرسوميات (GPU).
استجابةً لهذه التحديات، قدمت أمازون SageMaker AI حلولاً متكاملة عبر مسارين؛ الأول هو النقاط النهائية المدارة (Managed Endpoints) التي تتولى فيها AWS إدارة البنية التحتية، والثاني هو SageMaker HyperPod Inference المخصص للفرق التي تحتاج إلى تحكم دقيق على مستوى مجموعات GPU المخصصة باستخدام تقنيات Kubernetes.
أتمتة توصيات الاستدلال والقياس
يعد اختيار نوع المعالج المناسب وإعدادات الحاوية لنموذج ضخم عملية معقدة تستغرق عادةً أسابيع من الاختبار اليدوي. ولحل هذه المعضلة، أطلقت SageMaker خدمة التوصيات المؤتمتة التي تقوم بفلترة أنواع المعالجات المتاحة بناءً على بنية النموذج وحجمه، ثم تطبيق تقنيات تحسين مثل الاستدلال التنبؤي (EAGLE 3.0) وتوازي المصفوفات.
تنتج هذه العملية حزمة جاهزة للنشر تحتوي على مقاييس دقيقة، مثل زمن الرمزة الأولى (TTFT) وفترات التأخير بين الرموز، مما يسمح للشركات برفع معدل الرموز في الثانية الواحدة للنماذج المعقدة بمقدار الضعف دون زيادة في زمن الاستجابة، ودون الحاجة لخبرات برمجية عميقة في ضبط التكوينات.
المرونة في إدارة السعة وتجنب الفشل
قدمت أمازون ميزة "التوسع الواعي بالسعة" لإنهاء مشكلة التوقف المفاجئ عند نقص الموارد. بدلاً من الاعتماد على نوع واحد من المعالجات، أصبح بإمكان المطورين تحديد قائمة أولويات تضم حتى خمسة أنواع من المعالجات؛ حيث يقوم النظام تلقائياً بالتبديل بينها في حالات توسيع أو تقليص النطاق. يضمن هذا التوجه استمرار الخدمة حتى في ظل وجود نقص مؤقت في أنواع معينة من الأجهزة.
علاوة على ذلك، يتيح النظام تخصيص إعدادات مختلفة لكل نوع من المعالجات داخل المجموعة الواحدة، مثل تفعيل التوازي في المعالجات ذات الذاكرة العالية، واستخدام تقنيات التكميم (Quantization) في المعالجات الأقل قوة، مما يحقق توازناً مثالياً بين التكلفة والأداء.
تسهيل التكامل مع معايير OpenAI
سعت AWS إلى كسر حاجز الهجرة التقنية عبر دعم مسارات OpenAI البرمجية (OpenAI-compatible API) مباشرة داخل SageMaker. هذا يعني أن التطبيقات التي بُنيت باستخدام أدوات مثل LangChain أو OpenAI SDK لم تعد بحاجة إلى تعديلات جذرية أو مهايئات مخصصة للعمل مع نماذج SageMaker.
من خلال تغيير عنوان الرابط (Endpoint URL) فقط، يمكن للمطورين الاستفادة من ميزات مثل تدفق البيانات (Streaming) وإدارة النماذج المتعددة، مع استخدام بيانات اعتماد AWS الحالية للمصادقة. وتدعم هذه الخاصية الآن 14 منطقة جغرافية حول العالم، مما يسهل تشغيل الوكلاء الأذكياء (Agents) على بنية تحتية يملكها العميل بالكامل.
تحسينات سرعة التشغيل والمراقبة
تعتبر ميزة "التخزين المؤقت للحاويات" (Container Caching) واحدة من أهم الإضافات لتقليل وقت بدء التشغيل. فبدلاً من سحب صورة الحاوية كاملة عند كل عملية توسع، تقوم أمازون بسحب الصور مسبقاً لجعلها جاهزة محلياً. أدى هذا التعديل إلى خفض زمن بدء التشغيل من 525 ثانية إلى 258 ثانية في حالات تجريبية، وهو ما يمثل تحسيناً بنسبة تزيد عن 50%.
بالإضافة إلى السرعة، وسعت أمازون من قدرات المراقبة عبر CloudWatch، حيث أصبح النظام يصدر أكثر من 100 مقياس تفصيلي تتعلق بمستوى الرموز وضغط الذاكرة المؤقتة (KV Cache)، مما يمنح فرق الهندسة رؤية شاملة للمشاكل التقنية فور حدوثها وقبل أن تؤثر على تجربة المستخدم النهائي.
المصادر
- AWS Machine Learning BlogAmazon SageMaker Inference: 2026 year-to-date launches in review