مِخبارMIKHBAR
الذكاء الاصطناعي

إطلاق نموذج EmbeddingGemma 2 للذكاء الاصطناعي متعدد الوسائط

أعلنت Google DeepMind رسمياً عن إطلاق نموذج EmbeddingGemma 2، وهو نموذج تعددي خفيف الوزن ومفتوح المصدر مخصص لتوليد التمثيلات الضمنية على الأجهزة الطرفية، مع دعم شامل للنصوص، والصور، والصوت، والفيديو.

إطلاق نموذج EmbeddingGemma 2 للذكاء الاصطناعي متعدد الوسائط

إطلاق الجيل الثاني من نموذج التضمين المتعدد

في خطوة جديدة لتعزيز قدرات الذكاء الاصطناعي المحمول محلياً، كشفت شركة Google DeepMind النقاب عن نموذج EmbeddingGemma 2 كأحدث إصداراتها المفتوحة والمصممة خصيصاً للعمل بكفاءة على عتاد الأجهزة الاستهلاكية. يعتمد هذا الإصدار على الهندسة البرمجية المتقدمة لنموذج Gemma 4، ويأتي مرخصاً بموجب رخصة Apache 2.0 ذات الاستخدام التجاري المرن، مما يتيح للمطورين بناء تطبيقات بحث واسترجاع متقدمة تراعي خصوصية المستخدمين وتحافظ على سرية بياناتهم على الأجهزة المحلية دون الحاجة لاتصال مستمر بالخحادم السحابية.

يأتي هذا الإطلاق استكمالاً للنجاح الكبير الذي حققه الإصدار السابق الذي تجاوز حاجز 20 مليون عملية تنزيل واستخدم في تطوير أدوات بحث محلية ذكية. ويوسع الجيل الجديد النطاق ليشمل توحيد الأكواد البرمجية، والصور، ومقاطع الفيديو، والملفات الصوتية في مساحة تمثيل ضمني مشتركة، مما يسهل عمليات البحث المتقاطع دون التأثير سلباً على أداء الأجهزة الطرفية أو استنزاف مواردها المحدودة.

أداء رائد ومواصفات تقنية متقدمة للصناعة

يحتوي نموذج EmbeddingGemma 2 على 740 مليون معامل، وهو مُصمم خصيصاً لتحقيق أقصى كفاءة ممكنة أثناء الاستدلال المباشر على الأجهزة. وقد حقق نتائج متقدمة للغاية مقارنة بنظيراته من النماذج التي تقل عن مليار معامل في معايير قياسية مثل MTEB (معيار التضمين النصي الهائل) ومعيار MAEB للصوت. وقد شهد أداء الأكواد البرمجية تحسناً ملحوظاً بنسبة تجاوزت 9.9 نقطة، مما يجعله خياراً مثالياً لفهرسة قواعد البيانات البرمجية محلياً والبحث الدلالي المتقدم.

تم تصميم النموذج بهندسة معيارية تتيح اقتصار الاستخدام على 270 مليون معامل للأحمال النصية البحتة، مع إمكانية إضافة مُشفِّرات بصرية بحجم 170 مليون معامل وصوتية بحجم 300 مليون معامل حسب الحاجة الوظيفية للتطبيقات المختلفة. كما يتيح استخدام تقنية التعلم التمثيلي Matryoshka للجهات المندمجة تقليص الأبعاد المتجهة للمخرجات ديناميكياً من 768 بُعداً إلى 512 أو 256 أو 128 بُعداً، مما يوفر خفضاً في سعة التخزين محلياً يصل إلى ستة أضعاف.

كفاءة عالية واستهلاك منخفض للذاكرة على الأجهزة

تم تحسين النموذج بدقة ليعمل بفاعلية ضمن قيود الموارد الضيقة للأجهزة الذكية؛ فعلى سبيل المثال، يتطلب تشغيل الأوزان النصية على جهاز Google Pixel 11 Pro نحو 191 ميجابايت فقط من الذاكرة العشوائية النشطة عند استخدام تقنيات التكميم، بينما لا يتجاوز استهلاك النموذج المتعدد الوسائط بالكامل 567 ميجابايت تقريباً. علاوة على ذلك، يمتلك النموذج نافذة سياق تبلغ 8 آلاف رمز، وهي أوسع بأربعة أضعاف مقارنة بالإصدار الأول، مما يمكنه من معالجة ما يصل إلى خمس دقائق ونصف من الصوت، أو 29 صورة، أو 58 إطار فيديو دفعة واحدة.

تمكين تطبيقات البحث والتوليد المعزز محلياً

يتيح النموذج للمطورين ابتكار تطبيقات بحث واسترجاع متقدمة تعمل كلياً دون اتصال بالإنترنت، مما يعزز خصوصية البيانات ويقلل زمن الاستجابة في التطبيقات الحية. وعند ربطه بنماذج التوليد مثل Gemma 4، يمكن للمطورين إنشاء خطوط أنابيب RAG معقدة تفهم البيانات المتعددة الوسائط وتجري عمليات استدلال سياقي دقيقة على الأجهزة الطرفية للمستخدمين بسلاسة تامة ومستوى أداء مرتفع.

تتنوع مجالات استخدام هذه التقنية لتشمل البحث الفوري في الوسائط، وتحديد اللقطات المرئية الدقيقة باستخدام الأوامر الصوتية أو النصية، وإنشاء محركات قرارات لحظية للمهام التصنيفية والتوجيهية والتنبؤية عبر واجهات برمجة التطبيقات المخصصة لمثل هذه الأغراض التفاعلية على الحواف.

التوافر وخيارات النشر والتطوير للمجتمع التقني

أشارت المنصة إلى توفير أوزان النماذج والملفات المرتبطة عبر منصات شهيرة مثل Hugging Face وKaggle، مع وجود خطط لإتاحتها قريباً عبر منصة Gemini Enterprise Agent Platform Model Garden. كما يمكن للمطورين الاستفادة من بيئات النشر المختلفة عبر الأنظمة الأساسية باستخدام أدوات Google AI Edge MediaPipe للتعامل المباشر مع مهام التضمين والاسترجاع، أو استخدام مكتبة LiteRT لعمليات دمج النماذج المخصصة.

يدعم النموذج مجموعة واسعة من أدوات التطوير الشهيرة بما في ذلك خوادم الاستدلال المتنوعة ومكتبات تخزين المتجهات مثل Qdrant، إلى جانب توفير إرشادات متكاملة لعمليات الضبط الدقيق لملائمة الاحتياجات الخاصة بمختلف المشاريع والتطبيقات البرمجية المستقبلية.

المصادر

  • Google DeepMindEmbeddingGemma 2: an open, lightweight multimodal embedding model

تابع التسلسل الزمني

تغطية الكيانات المرتبطة