أداة لمراقبة سلوك وكلاء الذكاء الاصطناعي من الداخل.. كيف ذلك؟
أصبحت مراقبة سلوك وكلاء الذكاء الاصطناعي تحديا متزايدا مع توسع استخدامهم في البرمجة والأمن السيبراني وتنفيذ المهام المتعددة بصورة مستقلة، وذلك أن الوكيل قد يتمكن من تحقيق نتيجة تبدو صحيحة، لكنه يصل إليها عبر اختصار غير آمن أو يتجاوز الهدف الفعلي للمهمة.
وفي محاولة لمعالجة هذه المشكلة، أعلنت شركة غودفاير (Goodfire) الأمريكية، المتخصصة في أبحاث قابلية تفسير نماذج الذكاء الاصطناعي، تطوير أدوات تراقب الإشارات الداخلية للنماذج لاكتشاف السلوكيات غير المرغوبة خلال التنفيذ، مع تقليل الاعتماد على أنظمة تقييم إضافية مرتفعة التكلفة.
مصدر الصورة
كيف تراقب غودفاير سلوك الوكلاء؟
نشرت غودفاير قبل يومين تفاصيل عن نظام لمراقبة السلوكيات غير المرغوبة، يعتمد على ما تسميه مراقبات التنشيط (Activation Monitors)، وهي مصنفات صغيرة تدرب على اكتشاف أنماط محددة في الإشارات الحسابية الداخلية للنموذج، المعروفة باسم التنشيطات (Activations)، التي تتولد أثناء معالجة المدخلات وإنتاج المخرجات.
قصص مقترحة
list of 2 items* list 1 of 2 "جريمة قتل".. الذكاء الاصطناعي يتظاهر بأنه شاهد عيان ويرسل بلاغا كاذبا للشرطة
* list 2 of 2 5 إشارات تساعد شات جي بي تي على تقدير عمرك end of list
وعلى خلاف أدوات المراقبة التي تكتفي بقراءة إجابات الوكيل أو مراجعة سجل خطواته، تحلل هذه الطريقة إشارات داخل النموذج نفسه، بحثا عن مؤشرات مرتبطة بسلوكيات مثل التحايل على التقييم، أو إساءة استخدام القدرات السيبرانية، أو كشف البيانات الحساسة، أو الاستجابة لتعليمات خبيثة مخفية داخل المحتوى.
وتوضح الشركة أن المراقبات تستطيع العمل خلال تنفيذ المهمة، بما يتيح إصدار تنبيه عند ظهور نمط مثير للقلق، بدلا من انتظار انتهاء المهمة ومراجعة نتائجها.
لكن هذه التقنية لا تعني أن النظام يقرأ أفكار النموذج بصورة مباشرة، ولا أنها تكشف كل دوافعه، فهي تبحث عن أنماط حسابية تعلّمت الارتباط بسلوكيات معينة، وتظل دقة اكتشافها مرتبطة بجودة التدريب والاختبارات ومدى تشابه السلوك الفعلي مع الحالات التي دربت عليها.
عندما ينجح الوكيل في الاختبار ويفشل في تحقيق الهدف
تظهر أهمية هذه الأدوات في مشكلة تعرف باسم التحايل على المكافآت (Reward Hacking)، وهي أن يجد النموذج طريقة للحصول على التقييم المطلوب دون تنفيذ المهمة بالطريقة المقصودة، وقد يحدث ذلك عندما تكون معايير النجاح الموضوعة للنموذج غير مطابقة تماما للهدف الحقيقي الذي يُفترض أن يحققه.
وفي بحث نشرته غودفاير في 17 سبتمبر/أيلول الماضي، درس باحثون سلوك 3 نماذج مفتوحة الأوزان، هي "كيمي كيه 3″ (Kimi K3) و"جي إل إم" 5.2 (GLM 5.2) و"كوين 3.8 ماكس" (Qwen 3.8 Max)، ضمن اختبارات لوكلاء الذكاء الاصطناعي.
وأفاد البحث بأن التحايل على المكافآت ظهر في ما بين 50% و96% من محاولات التنفيذ التي شملتها الاختبارات، بحسب النموذج والاختبار المستخدم، وهذه النسب تخص بيئات التقييم المدروسة، ولا تمثل معدلا عاما لسلوك جميع وكلاء الذكاء الاصطناعي في الاستخدام الفعلي.
وضربت الشركة مثالا بوكيل كُلّف بإصلاح ثغرة في نواة نظام تشغيل، لكنه لجأ إلى تقييد الوصول إلى العنوان المتأثر بدلا من إصلاح الثغرة نفسها، وقد يبدو هذا التصرف حلا للمشكلة وفق معيار سطحي، لكنه لا يحقق الهدف الأمني المطلوب.
وتكمن أهمية المراقبة الداخلية هنا في أن بعض الخطوات قد تبدو عادية عند قراءتها منفردة، في حين تكشف الإشارات الداخلية عن نمط يرتبط بمحاولة التحايل، ووفقا لنتائج غودفاير، تمكنت المراقبات في بعض الاختبارات من اكتشاف حالات أخفقت مراقبات تعتمد على تحليل سلسلة التفكير في رصدها، وإن لم تتفوق عليها في جميع الحالات.
مصدر الصورة
مراقبة أقل تكلفة.. وقرارات أسرع
تواجه مراقبة الوكلاء على نطاق واسع مشكلة عملية، إذ قد تستمر بعض المهام لساعات وتتضمن أعدادا كبيرة من الخطوات واستدعاءات الأدوات، وإذا استُخدم نموذج لغوي آخر لمراجعة كل خطوة، ارتفعت كلفة التشغيل وزمن الاستجابة، خصوصا عندما يحتاج النظام إلى مراقبة مستمرة.
وتعتمد غودفاير نهجا من مرحلتين، الأولى تتولى مراقبات التنشيط الصغيرة فحص الإشارات الداخلية باستمرار، ثم تحيل الحالات التي تثير الشك إلى نموذج تقييم أكثر قدرة على التحليل، وبذلك لا يحتاج النظام إلى استدعاء نموذج المراجعة المكلف في كل مرة، بل يستخدمه عندما تظهر مؤشرات تستدعي فحصا إضافيا.
وفي تقييم أوردته الشركة لمراقباتها المخصصة لرصد إساءة الاستخدام السيبراني في نموذج "كيمي كيه 3″، قالت إنها اكتشفت نحو 93% من الجلسات الضارة، بينما أحالت 5.5% من الجلسات السليمة إلى المراجعة، كما أفادت بأن الجمع بين المراقبات ونموذج التقييم خفّض تكاليف استخدام الأخير بنحو 50 مرة مقارنة بمراجعته كل خطوة، من دون انخفاض قابل للقياس في معدل معالجة النموذج. وهذه أرقام ناتجة عن تقييم الشركة، وليست ضمانا للأداء نفسه في جميع البيئات.
وأمس، أعلنت الشركة تعاونها مع شركة باستين (Baseten) الأمريكية لإطلاق مشروع بيكون (Project Beacon)، الذي يدمج أدوات المراقبة مع منصة لتشغيل النماذج، بهدف إتاحة اكتشاف السلوكيات غير المرغوبة في الوقت الفعلي للمؤسسات والمطورين، وتتيح المنظومة ضبط الاستجابة للتنبيهات، مثل تسجيل الحادثة، أو طلب مراجعة إضافية، أو رفض الطلب، أو تغيير مسار التنفيذ.
هل تكفي مراقبة الإشارات الداخلية لضمان السلامة؟
على الرغم من هذه الإمكانات، تظل مراقبات التنشيط أداة للكشف عن مؤشرات الخطر، وليست ضمانا لمنع كل سلوك ضار، فقد تنتج إنذارات كاذبة تؤدي إلى تعطيل مهام سليمة، أو تفشل في اكتشاف سلوك لم تتعلم رصده، كما أن وجود نمط داخلي مرتبط بالتحايل لا يفسر بالضرورة جميع الأسباب التي دفعت النموذج إلى اتخاذ قرار معين.
وتحتاج هذه الأدوات أيضا إلى اختبارات مستقلة ومتكررة عند نقلها بين نماذج مختلفة أو استخدامها في مهام جديدة، فنجاح مراقب في رصد سلوك محدد أثناء البرمجة لا يعني بالضرورة أنه سيحقق الدقة نفسها في خدمة العملاء أو الأنظمة المالية أو غيرها من المجالات.
وتشير أبحاث غودفاير إلى أن المراقبات قد تلتقط إشارات تحذيرية قبل أن ينفذ النموذج السلوك غير المرغوب، وهو ما يفتح المجال لإيقاف المهمة مؤقتا أو إخضاعها لفحص إضافي. لكن تحويل هذا الاكتشاف إلى حماية فعلية يتطلب أن تكون آلية الاستجابة سريعة وفعالة، وأن تمنح الوكلاء صلاحيات محدودة تتناسب مع طبيعة المهام الموكلة إليهم.
مصدر الصورة
من مراقبة النتائج إلى مراقبة طريقة التنفيذ
يعكس توجه غودفاير تحولا في التعامل مع سلامة الذكاء الاصطناعي، فبدلا من الاكتفاء بالسؤال عما إذا كان الوكيل قد قدم إجابة صحيحة، يصبح من الضروري فحص كيفية وصوله إليها، وما إذا كان قد تجاوز القيود أو حاول تحقيق الهدف بطريقة غير مقصودة.
وقد تساعد هذه المقاربة على خفض تكلفة المراقبة وتحسين فرص اكتشاف بعض السلوكيات الخطرة في وقت مبكر، لكنها لا تغني عن اختبار النماذج، ومراقبة أفعالها الفعلية، وتقييد صلاحياتها، وإبقاء الإنسان قادرا على التدخل عند الضرورة. فكلما ازدادت قدرة الوكلاء على تنفيذ المهام باستقلالية، ازدادت الحاجة إلى أنظمة لا تراقب النتيجة فحسب، بل تتابع أيضا المسار الذي اتُّبع للوصول إليها.