جوجل تطلق Android Bench 2.0 لاختبار مهام أندرويد المعقدة
أعلنت جوجل تحديث Android Bench إلى الإصدار 2.0، مع توسيع الاختبارات لتشمل مهاماً هندسية طويلة تمتد لأيام، وإضافة تقييم أداء وكلاء البرمجة.

مقياس جديد لمهام تطوير أندرويد
أعلنت جوجل، عبر مدونة Android Developers، إطلاق Android Bench 2.0 بوصفه تحديثاً رئيسياً لمنصة قياس أداء نماذج اللغة الكبيرة ووكلاء البرمجة في تطوير تطبيقات أندرويد. ويأتي الإصدار الجديد مع أول مجموعة من مهام الأفق الطويل، وهي مهام عالية التعقيد قد تحتاج إلى عدة أيام أو أسبوع كامل حتى ينجزها مهندس بشري.
بدأ Android Bench كمحاولة منظمة لقياس قدرة نماذج الذكاء الاصطناعي على مساعدة المطورين في أعمال واقعية. وكانت النسخة الأولى تركز بدرجة أكبر على التغييرات المحدودة داخل مستودعات قائمة، مثل إصلاح الأخطاء أو إضافة خصائص صغيرة. وتقول جوجل إن تطور النماذج والوكلاء، إلى جانب توسع استخداماتها في العمل الهندسي، دفعها إلى رفع مستوى الاختبارات بما يطابق المهام التي يمكن للمطورين تفويضها فعلياً إلى أدوات الذكاء الاصطناعي.
يتماشى إطار القياس المحدث مع إطار Harbor، كما يوسع نطاق التقييم ليشمل مشكلات متعددة الخطوات وذات قدر أكبر من الغموض. وتشمل مهام الإصدار الجديد ترقية الاعتماديات، وإضافة خصائص جديدة، وبناء تطبيقات من الصفر، وتحويل تطبيقات متعددة المنصات إلى تطبيقات أندرويد.
درجات مستمرة بدلاً من حكم ثنائي
ترى جوجل أن نظام النجاح أو الفشل لا يعكس بصورة كافية أداء وكيل يعمل على مهمة تمتد عدة أيام. فقد ينجح الوكيل، على سبيل المثال، في إعادة هيكلة 40 شاشة إلى Jetpack Compose وإعداد جداول قاعدة البيانات، ثم يخفق في تأكيد واحد لحالة طرفية. في هذه الحالة، يؤدي التقييم الثنائي إلى احتساب النتيجة صفراً، رغم أن معظم العمل المعماري قد أُنجز بنجاح.
لذلك يعتمد Android Bench 2.0 على تسجيل مستمر يقدّم نسبة إنجاز أكثر تفصيلاً. ويُحتسب هذا المعدل من مجموعة عوامل، من بينها الوظائف المطلوبة، ودقة المظهر البصري، وتجنب التراجعات التي قد تؤثر في أجزاء أخرى من التطبيق. كما تفرض المنهجية خصومات موضوعية عند مخالفة تعليمات التقييم أو القيود الهيكلية المحددة للمهمة.
وتتيح لوحة النتائج المحدثة الاطلاع على أكثر من مؤشر لكل نموذج، بما في ذلك معدل النجاح، ونسبة الإنجاز، ومتوسط التكلفة لكل نموذج ولكل مهمة. ووفق البيانات التي أعلنتها جوجل، لا تتجاوز أعلى نسبة نجاح في مهام الأفق الطويل نحو 28%، بينما كانت النسبة تقارب 91% في المهام الأصلية الأقصر.
الكتابة الجديدة أسهل من إعادة الهيكلة
تكشف مجموعة مهام الأفق الطويل، بحسب جوجل، فروقاً عملية بين أنواع العمل التي تؤديها النماذج بصورة أفضل. فعبر مستويات النماذج المختلفة، يظهر أداء أقوى عند كتابة تعليمات برمجية جديدة مقارنة بإعادة هيكلة التعليمات الموجودة. وتزداد صعوبة عمليات الترحيل وإعادة البناء عندما تعتمد النتيجة على تعقيد المعمارية، وليس على عدد الأسطر أو الملفات التي يجري تعديلها.
وتحقق النماذج نتائج قوية في التحويلات المحددة والقابلة للتنبؤ، مثل تحويل Java إلى Kotlin، واستبدال Retrofit بـ Ktor، وإضافة طبقة ViewModel. ووفق النتائج التي أوردتها جوجل، يمكن للنماذج تطبيق هذه الأنماط بصورة متسقة على أكثر من 125 ملفاً وما يزيد على 8 آلاف سطر من التعليمات البرمجية.
في المقابل، تتعثر النماذج عندما تحتاج المهمة إلى تحقق أثناء التشغيل، مثل اكتشاف رسوم بيانية ناقصة لحقن الاعتماديات، أو عندما تتضمن تغييرات تكسر أطر العمل المستخدمة. كما تظهر فجوات معرفية عند التعامل مع مكتبات لم تُطرح بعد. ويظل نقل التطبيقات متعددة المنصات إلى أندرويد تحدياً مفتوحاً؛ إذ لم يحقق أي نموذج معدل نجاح كامل، بينما وصلت النماذج المتقدمة إلى نسبة إنجاز لا تتجاوز 80%.
إدخال وكلاء البرمجة في الاختبارات
تضيف جوجل في Android Bench 2.0 تقييماً يعتمد على الوكلاء، وبدأت بتشغيل النماذج الجديدة مع وكلاء تابعين لمزودي النماذج أنفسهم. ويهدف هذا الأسلوب إلى قياس الأداء عندما يعمل النموذج ضمن سير عمل وكيلي متكامل، لا عند اختباره منفرداً فقط.
وتورد الشركة أمثلة على هذا الاقتران، من بينها تشغيل GPT 5.6 Sol على Codex، وGemini 3.8 Flash على Google Antigravity. وتشير نتائجها إلى أن تصميم بيئة التشغيل يمكن أن يؤثر إيجاباً في نتائج المطورين؛ إذ ساعد التخزين المؤقت للمطالبات وتقليص نافذة الأدوات على خفض عدد الرموز المستخدمة.
تخطط جوجل لتوسيع هذا الجانب مستقبلاً عبر عرض نتائج مجموعات مختلفة من النماذج والوكلاء، بما يساعد المطورين والفرق على مقارنة التركيبات الأنسب لسير عملهم. ويعني ذلك أن القياس لن يقتصر على سؤال أي نموذج يحقق نتيجة أفضل، بل سيمتد إلى معرفة أي نموذج يحققها ضمن وكيل وبيئة تشغيل محددين.
توسيع لوحة المتصدرين
وسعت جوجل لوحة Android Bench بإضافة نماذج جديدة، تشمل Gemini 3.8 Flash وGemini 3.7 Flash من جوجل، وGPT-6 من OpenAI، وFable 5.1 من Anthropic، وKimi K3، وQwen 3.8 Max. وذكرت الشركة أن GPT-6 Astra من OpenAI تصدر النتائج بأعلى معدل نجاح في مهام الأفق الطويل، عند 28%.
تقدم Android Bench 2.0 بيئة أوسع لقياس الذكاء الاصطناعي المخصص لتطوير أندرويد، من خلال الجمع بين المهام الممتدة، والتقييم متعدد الوسائط، واختبارات الوكلاء، والتسجيل المستمر. وتقول جوجل إن هذه المنهجية تهدف إلى منح فرق أبحاث الذكاء الاصطناعي إشارات أدق لتطوير شركاء برمجة أكثر قدرة واعتمادية، مع توفير معلومات أوضح للمطورين عند اختيار أدواتهم.
كما أعلنت الشركة استمرار تحديث المنهجية ولوحة النتائج، ودعت مجتمع المطورين إلى مشاركة الملاحظات عبر GitHub وقنواتها على منصتي X وLinkedIn.
المصادر
- Android DevelopersAndroid Bench 2.0: Pushing the frontier with challenging long-horizon tasks