مِخبارMIKHBAR
الذكاء الاصطناعي

توليد الصور والفيديوهات عبر vLLM-Omni على SageMaker AI

تتيح أمازون وبلاتفورم vLLM-Omni للمطورين إمكانية نشر نماذج توليد الوسائط المتعددة عبر نقاط نهاية متخصصة للوقت الفعلي والاستدلال غير المتزامن.

توليد الصور والفيديوهات عبر vLLM-Omni على SageMaker AI

مقدمة حول دمج vLLM-Omni مع SageMaker AI

في إطار التطور المستمر لتقنيات الذكاء الاصطناعي التوليدي، أصبح بإمكان المطورين تحويل النصوص الوصفية إلى صور ثابتة ثم تحريكها بمرونة لتصبح مقاطع فيديو قصيرة على منصة Amazon SageMaker AI. يعتمد هذا النهج المتقدم على نشر نقطتي نهاية منفصلتين ولكن من نفس حاوية التعلم العميق AWS vLLM-Omni DLC، مما يقلل من تباين حزمة التوجيه ويسهل عملية إدارة النماذج المتخصصة.

تعتبر هذه المقالة امتداداً لسلسلة تقنية متخصصة تتناول حاويات التعلم العميق من أمازون، حيث ركز الجزء الأول على تطبيقات الصوت الفورية باستخدام البث ثنائي الاتجاه، بينما يركز الجزء الحالي على آليات الاستدلال المباشر وغير المتزامن للصور والفيديوهات.

آلية توليد الصور الثابتة عبر الاستدلال الفوري

يبدأ سير العمل بإرسال موجه نصي إلى نقطة نهاية مخصصة للوقت الفعلي لتوليد الصور باستخدام نموذج FLUX.2-klein-4B. تقوم نقطة النهاية هذه بمعالجة الطلب وإرجاع صورة بصيغة PNG مشفرة بنظام base64 مباشرة إلى التطبيق، وهو ما يتطلبه سير العمل لضمان توفر الصورة قبل الانتقال للخطوة التالية.

تستفيد هذه المرحلة من سرعة الاستجابة المباشرة التي توفرها نقاط النهاية الفورية، مما يتيح للمستخدم معاينة الصورة وتعديل الأبعاد قبل تحويلها إلى فيديو متحرك عبر النماذج اللاحقة.

توليد الصور والفيديوهات عبر vLLM-Omni على SageMaker AI
صورة مرتبطة بالخبر من AWS Machine Learning Blog · المصدر: AWS Machine Learning Blog

تحويل الصور إلى فيديوهات باستخدام الاستدلال غير المتزامن

بمجرد الحصول على الصورة الثابتة وتعديل أبعادها، يقوم التطبيق بتمريرها مع موجه حركي إلى نموذج Wan2.1-VACE-1.3B المخصص لإنشاء الفيديوهات. نظراً لأن عمليات توليد الفيديو تستغرق وقتاً أطول وتحمل حمولات مركبة، يتم استخدام الاستدلال غير المتزامن عبر Amazon S3.

تتولى منصة الاستدلال غير المتزامن طابور الطلبات وتخزين المخرجات بصيغة MP4 في التخزين السحابي، مما يتيح للعميل استطلاع حالة الطلب واسترجاع الملف النهائي بسلاسة دون الحاجة لفتح اتصال متزامن طويل الأمد.

توليد الصور والفيديوهات عبر vLLM-Omni على SageMaker AI
صورة مرتبطة بالخبر من AWS Machine Learning Blog · المصدر: AWS Machine Learning Blog

تكوين البنية التحتية ونشر الحاويات

تعتمد هذه التجربة على استخدام AWS Deep Learning Containers لتغليف كافة الحزم والتبعيات اللازمة للتدريب والاستدلال. يضمن استخدام نفس صورة الحاوية عبر متغيرات البيئة توحيد البيئة التشغيلية مع تخصيص أنواع المثيلات حسب متطلبات كل نموذج.

يوفر نموذج الكود المتاح للمستخدمين إمكانية استنساخ المستودع، ضبط الأذونات، وتشغيل سكريبت النشر الذي يقوم بإنشاء نقطتي النهاية للصور والفيديوهات وحفظ حالتهما لاستخدامها لاحقاً.

خطوات التنفيذ والأوامر البرمجية للاستخدام

لبدء العمل، يتعين على المطور استنساخ المستودع الخاص بأمثلة الاستضافة، ثم إنشاء بيئة افتراضية بايثون وتثبيت المتطلبات اللازمة عبر مدير الحزم لتفادي أي تعارض في الإصدارات.

بعد ضبط دور التنفيذ الخاص بـ SageMaker وتنفيذ سكريبت النشر، يمكن تشغيل سير العمل النهائي عبر سطر الأوامر باستخدام الموجهات النصية والحركية المطلوبة للوصول إلى النتيجة المرجوة وتخزين ملفات الفيديو بنجاح.

المصادر