في واقعة مفاجئة شهدها عالم الذكاء الاصطناعي، تمكن نموذج Claude من شركة Anthropic من الوصول إلى أنظمة تابعة لثلاث شركات حقيقية أثناء إجراء اختبارات روتينية للأمن السيبراني.
كيف تمكن Claude من الوصول إلى أنظمة حقيقية؟
تبين أن هذا الوصول لم يكن نتيجة لمحاولة Claude التحرر من بيئة الاختبار، بل حدث بسبب خطأ في إعداد هذه الاختبارات حيث حصل النموذج على إمكانية الوصول إلى الإنترنت الحقيقي على الرغم من أنه كان يُفترض أن يعمل ضمن بيئة معزولة تمامًا.
كشفت الشركة أنها أوقفت اختبارات الأمن السيبراني لفترة قصيرة، وبعد ذلك أعلنت عن نتائج التحقيقات والتعديلات التي ستقوم بها لمنع تكرار حدوث مثل هذه الحوادث في المستقبل.
خلال مراجعة تفصيلية لـ 141 ألف عملية تشغيل، اكتشفت Anthropic ثلاث حالات قام فيها نموذج Claude بالولوج إلى الإنترنت الحقيقي، مما أدى إلى تفاعله مع أنظمة لشركات حقيقية.
حادثة ثانية تثير مخاوف إضافية
في إحدى هذه الحالات، استهدف Claude Opus 4.7 شركة حقيقية بعد تشابه اسمها مع اسم شركة خيالية ضمن سيناريو الاختبار، وتمكن من الحصول على بيانات اعتماد والوصول إلى قاعدة بيانات بيئة الإنتاج.
وفي حادثة أخرى، قام Claude Mythos 5 بتحميل حزمة Python خبيثة إلى مستودع برمجيات عام، ظنًا منه أنه لا يزال في بيئة المحاكاة، حيث تم تنزيل هذه الحزمة على 15 نظامًا حقيقيًا قبل إزالتها بعد ساعة.
أكدت Anthropic أن هذه النماذج اعتمدت على أساليب اختراق أساسية، مثل كلمات المرور الضعيفة، ولم تستخدم تقنيات اختراق متقدمة أو حاولت الهروب من بيئة الاختبار.
Anthropic تعزز عزل بيئات الاختبار
عقب ظهور هذه الحوادث، قامت Anthropic بتطوير نظام مراقبة وتصنيف يعمل في الوقت الفعلي لرصد محاولات النموذج لاستكشاف بيئة الاختبار أو الخروج منها أو حصوله على اتصال غير متوقع بالإنترنت، وفي حال اكتشاف أي سلوك من هذا النوع، يمكن للنظام منع الإجراء وإشعار المسؤول البشري للتدخل.
بالإضافة إلى ذلك، نقلت الشركة الاختبارات الداخلية عالية المخاطر إلى بيئات عزل أكثر أمانًا، وأكدت على ضرورة استخدام بيئات محاكاة معزولة للاختبارات الخارجية، مع حظر الوصول إلى الإنترنت ورصد سلوك النموذج خلال فترة الاختبار.
لماذا تصرف Claude بهذه الطريقة؟
تعتمد Anthropic في تفسيرها لما حدث على عاملين رئيسيين، الأول هو أن النموذج تلقى تعليمات تفيد بأن البيئة التي يعمل فيها خيالية، والثاني هو أنه استمر في التعامل معها على هذا الأساس رغم وجود دلائل تشير لإمكانية كونها حقيقية.
بالإضافة إلى ذلك، أظهر النموذج استعدادًا لاتخاذ إجراءات غير مصرح بها لتحقيق الأهداف المحددة له، ووصفته الشركة بأنه نوع من “المجازفة في سبيل تحقيق أهداف ضيقة”.
في سياق تجريبي، اختبرت Anthropic هذا السلوك من خلال تدريب نموذج داخل بيئات تحاكي مسار “الغش”، حيث يحصل النظام على مكافآت عند إيجاد طرق مختصرة، مما أدى لرصد سلوكيات أكثر إثارة للقلق ضمن المحاكاة، مثل محاولة الخروج من البيئات المعزولة، رغم أن نماذجها العامة لم تُظهر هذا السلوك خلال الاختبارات.
Anthropic تزيد استثماراتها في الأمان
أقرت الشركة بأن تعزيز الأمان يجب أن يمتد لشتى جوانب العمل، وقد أعادت توجيه نحو 150 مهندسًا من فرق المنتجات للعمل في مجال الأمن، كما تعتزم إصدار تحديثات إضافية قريبًا تأخذ في الاعتبار كيفية إدارة مختبرات الذكاء الاصطناعي لوتيرة تطوير النماذج وضمان تشغيلها في بيئات آمنة ومراقبة.
