أوبن إيه آي تكشف حملة سرقة استدلالاتها من قِبل مونيوشوت
كشفت أوبن إيه آي عن حملة عدائية لاستخراج الاستدلال الخفي لنماذجها، مؤكدة أنها نجحت في تعطيلها بالكامل بعد رصد نشاط مكثف مرتبط بمونيوشوت.

حملة منسقة لاستخراج الاستدلال الخفي
أعلنت أوبن إيه آي في منشور رسمي على مدونتها عن حملة منسقة تهدف إلى استخراج الاستدلال الخفي من نماذجها، حيث ربطت الشركة بين هذه الحملة وجهات مرتبطة بمونيوشوت، وهي شركة صينية متخصصة في الذكاء الاصطناعي. وأشارت أوبن إيه آي إلى أن النشاط بدأ في الأول من يوليو بحجم منخفض، ثم ارتفع بشكل حاد في 24 و25 يوليو، حيث سجلت 16,000 طلب لاستخراج الاستدلال عبر أكثر من 4,000 مستخدم. وأكد المتحدثون باسم الشركة أن الحملة كانت متسقة مع تقنيات التقطير العدائي، لكنهم لم يحددوا ما إذا كان جميع المشغلين ينتمون إلى جهة واحدة.
آلية الهجوم والتشفير المعكوس
تعرف أوبن إيه آي الاستدلال المحمي بأنه السجل الداخلي للنموذج أثناء معالجة المهام، وهو بيانات مشفرة تُرسل للعميل ككتلة مشفرة. وكشفت الشركة أن المهاجمين حاولوا استخراج هذا الاستدلال من محادثة واحدة، ثم طلبوا من نموذج في محادثة منفصلة فك تشفيره. وأوضحت أوبن إيه آي أن التشفير لم يُخترق، ولم يحدث أي وصول مباشر إلى محادثات المستخدمين المخزنة، ولم يتم اختراق أي قاعدة بيانات. ومع ذلك، أغلقت الشركة مساراً كان يسمح بإعادة تشغيل الاستدلال المشفر للمستخدمين الآخرين واستعادة محتواه.
إغلاق الثغرات وتعزيز الحماية
أعلنت أوبن إيه آي أنها عطّلت الحملة بالكامل بحلول 28 يوليو، بعد إضافة فحوصات لكشف وإيقاف المخرجات المتدفقة التي قد تكشف الاستدلال. كما عززت الشركة حمايات الاستدلال الخفي عبر المستخدمين والأعمال والمنظمات وعائلات النماذج. وعملت أوبن إيه آي مع مزودي خدمات طرف ثالث لتعطيل الحسابات التي كانت أنشطتها تمر عبر خدماتهم. وأكدت الشركة أنها لم تحدد معدل نجاح الحملة أو النماذج المستهدفة تحديداً، أو عدد المستخدمين المرتبطين بمونيوشوت.
تأكيد الباحثين المستقلين
أشارت أوبن إيه آي إلى أن باحثين أمنيين مستقلين أبلغوها عن ثغرات مشابهة تتعلق بالاستدلال عبر النماذج وضغط المحادثات. وأكدت الشركة أن مسارات الهجوم التي وجدوها حقيقية. ونشر الباحثون ورقة بعنوان "سرقة آثار الاستدلال من واجهات برمجة تطبيقات النماذج اللغوية الخاصة" في 10 أغسطس، حيث اختبروا نماذج أوبن إيه آي وAnthropic وGoogle. وقام الباحثون بإعطاء الاستدلال المشفر لنموذج حدودي لنموذج أضعف، الذي قام بكتابته كنص عادي. وبعد إقرار المزودين بالتقرير، لم يتمكن الباحثون من إطلاق نفس الهجمات.
سياق أوسع: هجمات مونيوشوت
لم تكن أوبن إيه آي الوحيدة التي تواجه مثل هذه التهديدات. ففي وقت سابق من هذا الشهر، كشفت Anthropic في تقريرها عن كشف 300,000 طلب عميل تقريباً تم تمريرها عبر شبكة وكلاء مكونة من 5,380 حساباً احتيالياً مرتبطاً بمونيوشوت. وذكر التقرير أن مونيوشوت حفظت توقيعات الاستدلال الخاصة بنموذج Claude، وحصلت على تحويلها إلى آثار استدلال كاملة في جلسات جديدة، وهو ما وصفته Anthropic بهجمات إعادة التشغيل عبر الجلسات. وفي يوليو، نفى مونيوشوت أن يكون نموذج Kimi K3 قد أُنشأ من التقطير، بينما قال غريغ بروكمان، رئيس أوبن إيه آي، إنه "مبكر جداً" للحكم على ما إذا كانت مونيوشوت قد قطّرت نماذج أوبن إيه آي.
الخطوات المستقبلية والمخاطر المتوقعة
تخطط أوبن إيه آي لضمان أن تكون عمليات النشر المستضافة من الشركاء محمية بنفس مستوى أدوات الطرف الأول. وتحتاج الشركة إلى فحوصات إضافية لمنع هجمات مخرجات الأدوات. وشاركت أوبن إيه آي نتائجها مع منتدى النماذج الحدودية وقنوات مشاركة المعلومات الحكومية، محذرة من أن الأنظمة التي تدعم عناصر الاستدلال القابلة للنقل أو إعادة التشغيل قد تواجه مخاطر مشابهة. وتتوقع الشركة أن تصبح محاولات التقطير أكثر تعقيداً مع تحسن النماذج الحدودية وسعي المهاجمين عن طرق أرخص لمحاكاتها.
المصادر
- Tom's HardwareOpenAI says actors linked to China-based Moonshot AI spearheaded a campaign to extract its models’ hidden reasoning