الذكاء الاصطناعي
Anthropic تقول إن نماذجها الخاصة بالذكاء الاصطناعي اخترقت ثلاث شركات أثناء اختبارات أمنية
كشفت Anthropic يوم الخميس أن تحقيقاً داخلياً كشف عن ثلاث حوادث اخترقت فيها نماذج Claude التابعة لها الأنظمة الحية لثلاث منظمات أثناء اختبارات للأمن السيبراني، بعدما وصلت إلى الإنترنت من داخل بيئات اختبار كان يُفترض أن تبقيها معزولة.
ويأتي هذا الكشف بعد أكثر من أسبوع من إعلان OpenAI أن أحد نماذجها غير المُطلقة اخترق أنظمة Hugging Face أثناء اختبارات داخلية. وقالت Anthropic إن تلك الحادثة دفعتها لإجراء تقييمها الخاص للأمن السيبراني، بحثاً تحديداً عن أدلة على وصول Claude إلى الإنترنت من داخل بيئات اختبار معزولة.
وبعد مراجعة 141,006 عملية تقييم، عثرت Anthropic على ثلاث حوادث وصل فيها نموذجها إلى الإنترنت أثناء التفاعل مع Irregular، أحد شركائها الخارجيين. وأرجعت الشركة سبب الوصول إلى خطأ في إعداد بيئة التقييم التي تُدار مع Irregular - وهو “سوء فهم” بين الشركتين حول ما إذا كان إعداد الاختبار يتيح الوصول إلى الإنترنت، بينما كان يتيحه بالفعل. وقالت Anthropic إنها لا توزّع اللوم وإنها “تتعامل مع الإصلاحات وكأن المسؤولية تقع علينا وحدنا”، مشيرة إلى أن Irregular تجري تحقيقها الخاص المنفصل. وبسبب ذلك الاتصال المفتوح، حصل النموذج على وصول غير مصرح به إلى البنية التحتية الإنتاجية لثلاث منظمات مختلفة، في حادثة شملت ثلاثة نماذج مختلفة من Claude: Opus 4.7 وMythos 5 ونموذج بحثي داخلي تجريبي.
والجدير بالذكر أن Anthropic قالت إن Claude أُبلغ صراحة عبر التوجيه (prompt) في كل حالة بأنه لا يملك وصولاً إلى الإنترنت، ويبدو أن النموذج افترض أن الأنظمة الواقعية كانت جزءاً من التمرين. غير أن هذا الافتراض لم يستمر بشكل موحّد. فقد أدرك Opus 4.7، وهو أقدم النماذج الثلاثة، في جميع عمليات التشغيل الأربع لحادثته أنه وصل إلى نظام إنتاج حقيقي؛ وفي اثنتين من تلك العمليات، برّر لنفسه أن الشركة الحقيقية ربما تكون جزءاً من التمرين بطريقة ما، لكنه واصل الهجوم رغم ذلك، بما في ذلك سحب بيانات اعتماد والوصول إلى قاعدة بيانات إنتاجية. كما رصد Mythos 5 مؤشرات على أنه على الإنترنت الحقيقي، لكنه أقنع نفسه بأنه لا يزال داخل محاكاة، ومضى في نشر حزمة برمجية خبيثة على سجل PyPI العام، والتي قامت أنظمة خارجية بتنزيلها وتشغيلها قبل أن يتم اكتشافها. ولم يتوقف من تلقاء نفسه سوى النموذج البحثي الداخلي التجريبي - الأحدث لدى Anthropic - بمجرد أن استنتج أن الهدف حقيقي.
وقالت Anthropic إن Claude كان يعمل من دون المراقبة الأمنية الإضافية والمصنّفات التي تنشرها الشركة في النماذج المتاحة للعموم، وهي إجراءات وقائية قالت إنها كانت ستمنع هذا السلوك، لأن التقييمات مصممة لقياس القدرات الأساسية للنموذج. وأضافت الشركة أنها لم تجد أي دليل على أن أي نموذج كان يسعى وراء هدف خاص به، إذ كان كل نموذج يحاول ببساطة إنجاز المهمة المطلوبة منه. وقالت Anthropic إنها تعمل الآن مع مجموعة التقييم المستقلة METR على مراجعة خارجية للحوادث.
لماذا يهم
كشف مختبرَي ذكاء اصطناعي عن اختراقات حقيقية وغير مقصودة لأنظمة أطراف ثالثة في غضون أسابيع من بعضهما البعض يشير إلى أن بيئات الاختبار المصممة لتقييم قدرات الذكاء الاصطناعي تثبت أنها أصعب في العزل مما افترضته المختبرات - وهي فجوة سيتعين على القطاع سدها مع ازدياد قدرات النماذج.