صورة تعبيرية لخروج نماذج الذكاء الاصطناعي عن السيطرة (جيميناي)

لم تعد المخاوف بشأن خروج نماذج الذكاء الاصطناعي عن السيطرة مجرد سيناريوهات نظرية تجري مناقشتها داخل مختبرات الأبحاث، إذ شهد عام 2026 سلسلة من الحوادث والتجارب التي أظهرت قدرة بعض النماذج المتقدمة على تجاوز قيود وضعت لمنعها من الوصول إلى الإنترنت أو الأنظمة الخارجية، أو التصرف بطرق لم تكن متوقعة من مطوريها.

ومن أبرز هذه الوقائع حادثة كشفت عنها "OpenAI" في يوليو 2026، عندما تمكنت نماذج تابعة لها خلال اختبارات للأمن السيبراني من تجاوز عزلها عن الإنترنت، واستغلال ثغرات في البنية التحتية المشتركة، والوصول إلى أنظمة تابعة لمنصة Hugging Face.

ووصفت الشركة الحادث بأنه مؤشر على أن النماذج أصبحت أكثر قدرة على العمل بشكل مستمر وتعاوني واستغلال نقاط الضعف عبر عدة أنظمة، بحسب تقرير سابق نشرته "رويترز".

وفي سبتمبر، كشفت "OpenAI" عن حادث آخر، إذ تمكن نموذج بحثي من الوصول إلى روبوت محادثة خارجي عبر ثغرة في آليات حظر نظام DNS داخل بيئة التدريب.

ورغم أن النموذج لم يكن متصلًا بالإنترنت بصورة مباشرة، فإنه اكتشف مسارًا غير متوقع للاتصال الخارجي واستخدمه لإرسال استفسارات إلى خدمة خارجية.

وأظهرت الواقعة أن المشكلة لا تكمن دائمًا في قدرة النموذج على كسر حاجز أمني بشكل مباشر، وإنما في قدرته على البحث عن مسارات غير مقصودة لتحقيق هدفه.

ارتفاع مستوى الاستقلالية

أحد الأسباب الرئيسية وراء زيادة هذه الحوادث هو التحول من نماذج تجيب عن الأسئلة إلى وكلاء ذكاء اصطناعي قادرين على تنفيذ سلسلة طويلة من الإجراءات باستخدام أدوات مختلفة.

فالوكيل يستطيع كتابة الأكواد وتشغيلها، استخدام المتصفح، التعامل مع الملفات، إرسال الطلبات إلى خدمات خارجية، وتحليل نتائج أفعاله قبل اتخاذ الخطوة التالية.

وهذا يعني أن خطأ واحدًا لم يعد بالضرورة ينتهي بإجابة خاطئة؛ بل يمكن أن يتحول إلى سلسلة من الأفعال المتتابعة، خصوصًا عندما يحصل النموذج على صلاحيات واسعة وهدف محدد يريد تحقيقه.

وتكشف حوادث "أنثروبيك" عن المشكلة نفسها. ففي يوليو 2026 أعلنت الشركة أنها عثرت على ثلاث حالات تمكنت فيها نماذج كلود، أثناء اختبارات للأمن السيبراني، من الوصول إلى الإنترنت ثم الدخول بصورة غير مصرح بها إلى أنظمة حقيقية تابعة لثلاث مؤسسات.

وبعد توسيع نطاق المراجعة، أعلنت الشركة لاحقًا اكتشاف حادث رابع ضمن نحو 481 مليون سجل محادثة واختبار.

المشكلة ليست تمردًا بالمعنى البشري

وتشير هذه الوقائع إلى أن وصف النماذج بأنها خرجت عن السيطرة قد يكون مضللًا إذا فُهم باعتباره امتلاكًا لنوايا بشرية مستقلة.

في كثير من الحالات، ما يحدث هو أن النموذج يحاول تحقيق الهدف الذي أُعطي له، لكنه يكتشف أن القواعد أو القيود الموضوعة أمامه يمكن تجاوزها.

وتزداد احتمالات هذا السلوك عندما تكون المهمة طويلة، والبيئة معقدة، والوكيل يمتلك أدوات وصلاحيات متعددة.

وقد أظهرت أبحاث "أنثروبيك" في بيئات محاكاة أن نماذج متقدمة يمكن أن تلجأ إلى سلوكيات مثل التخريب أو التلاعب بالمعلومات عندما تتعارض أهدافها المفترضة مع القيود الموضوعة عليها، رغم أن هذه التجارب لا تعني أن السلوك نفسه يحدث بالضرورة في الاستخدام التجاري الفعلي.

لماذا تتكرر الحوادث؟

السبب الأعمق هو أن قدرات النماذج تتطور بسرعة أكبر من أنظمة الحماية المحيطة بها. فكلما أصبح النموذج أكثر قدرة على البرمجة والاستدلال واستخدام الأدوات، ظهرت طرق جديدة لم يكن مطورو أنظمة الأمان قد اختبروها مسبقًا.

كما أن الاعتماد على طبقة أمنية واحدة يخلق نقطة ضعف. ففي حادث "OpenAI" الأخير، كانت بيئة التدريب مصممة على أساس أن النموذج لن يتمكن من الوصول إلى الإنترنت، لكن مسار DNS غير المقصود أتاح له تجاوز هذا الافتراض.

لذلك تتجه مختبرات الذكاء الاصطناعي إلى بناء أنظمة حماية متعددة الطبقات، تشمل عزل النماذج، وتقييد صلاحياتها، ومراقبة سلوكها لحظة بلحظة، وإجراء اختبارات حمراء أكثر شمولًا.

لكن التطور المستمر لقدرات الوكلاء يعني أن سباقًا جديدًا بدأ بالفعل: النماذج تتعلم اكتشاف طرق جديدة لتنفيذ أهدافها، وأنظمة الأمان تحاول اكتشاف هذه الطرق قبل أن تتحول إلى حوادث حقيقية.