غوغل تكشف أقوى نماذجها للذكاء الاصطناعي.. قدرات جديدة تتجاوز المألوف
أطلقت شركة غوغل نموذج "جيميناي 4 أرغون" (Gemini 4 Argon) الذي تقدمه بوصفه أحدث نماذجها الرائدة وأكثرها قدرة حتى الآن، مع تركيز على تنفيذ المهام المعقدة التي تمتد عبر خطوات متعددة، بدلا من الاكتفاء بإنتاج إجابات قصيرة أو تنفيذ أوامر منفردة، ويستهدف النموذج بصورة خاصة هندسة البرمجيات، والعمل المعرفي المتخصص، والدفاع السيبراني.
مصدر الصورة
مليون رمز لمهام أطول
تتمثل إحدى أبرز التحسينات التقنية في رفع حد الإخراج إلى مليون رمز (Token) مقارنة بـ64 ألف رمز في النموذج السابق، وفقا لغوغل. وتقول الشركة إن زيادة المساحة المتاحة للنموذج تسمح له بالاستمرار في عمليات استدلال طويلة، وتنفيذ مئات الآلاف من الرموز ضمن مسار واحد، وهو ما يستهدف المشكلات التي تتطلب تحليلا متتابعا بدلا من سلسلة قصيرة من التعليمات.
ويعني ذلك عمليا قدرة النموذج على التعامل مع مشاريع برمجية ضخمة أو مهام بحثية متعددة المراحل ضمن سياق واحد، مع الاحتفاظ بقدر أكبر من المعلومات اللازمة لمواصلة المهمة. وتؤكد غوغل أن هذا التوجه يمثل جزءا أساسيا من تصميم أرغون، وليس مجرد زيادة في حجم نافذة السياق.
قصص مقترحة
list of 2 items* list 1 of 2 الشركات تنفق تريليونات الدولارات على الذكاء الاصطناعي فأين تذهب؟
* list 2 of 2 مكالمة واحدة كلفت 108 ملايين دولار.. كيف يخدع الذكاء الاصطناعي البنوك؟ end of list
من كتابة الشيفرة إلى إعادة بناء المشاريع
تضع غوغل البرمجة في مقدمة الاستخدامات المستهدفة للنموذج، وتقول إن مهندسيها يستخدمونه في تصحيح الأخطاء، وتصميم الخوارزميات، وترحيل قواعد شيفرة ضخمة بين لغات البرمجة.
وتذكر الشركة أن وكلاء أرغون يعملون على ترحيل قواعد شيفرة مكتوبة بلغتيْ سي (C) وسي++ (C++) إلى رَست (Rust)، ووصل حجم إحدى عمليات الترحيل إلى أكثر من 800 ألف سطر في نواة نظام فوشيا زيركون (Fuchsia Zircon)، كما تقول إن النموذج حقق نتيجة بلغت 77.9% في اختبار ديب إس دبليو إي 1.1 (DeepSWE v1.1) المخصص لقياس أداء النماذج في مهام هندسة البرمجيات الواقعية طويلة المدى.
وفي مثال آخر، تقول غوغل إن وكلاء أرغون أعادوا كتابة 32 ألف سطر من شيفرة إس آي إم دي (SIMD) في مشروع ليب غاف 1 (libgav1)، مما أدى إلى نسخة رَست أسرع بنحو 2.7 مرة من نسخة رَست السابقة، مع الحفاظ على المخرجات نفسها. وتؤكد الشركة أن عمليات إعادة الكتابة واسعة النطاق تخضع لمراجعة واختبارات آلية ويدوية قبل اعتمادها في بيئات الإنتاج.
العمل المالي والقانوني
لا يقتصر النموذج على البرمجة، إذ صممته غوغل لتنفيذ مهام معرفية متخصصة في مجالات مثل التمويل والقانون والضرائب، وتقول الشركة إن أرغون حقق أداء متقدما في اختبارات تشمل البحث المالي متعدد الخطوات، والبحث والصياغة القانونية، ومهام الأعمال التي تتطلب تنفيذ سلسلة كاملة من الإجراءات.
كما تشير غوغل إلى قدرات متعددة الوسائط، بينها تحليل الرسوم البيانية وفهم مقاطع الفيديو الطويلة، حيث سجل النموذج 91.7% في اختبار إل في بنش (LVBench) المخصص لقياس فهم مقاطع الفيديو الطويلة.
الذكاء الاصطناعي في مواجهة الثغرات
يحتل الأمن السيبراني موقعا محوريا في إطلاق أرغون، وتقول غوغل إن النموذج قادر على اكتشاف الثغرات البرمجية والتحقق منها وإعداد إصلاحات لها بصورة ذاتية، كما حقق 68% في اختبار سي دبليو إي بنش 1 (CWE-bench v1) الخاص بمعالجة الثغرات، وهي النتيجة التي تقول الشركة إنها تعادل أفضل نتيجة مسجلة في الاختبار.
وتستخدم غوغل هذه القدرات ضمن برنامج فيرويند (Fairwind) الذي يتيح النموذج لمجموعة مختارة من المدافعين السيبرانيين، ويشترط البرنامج ضوابط وصول صارمة، ويقصر الاستخدام على فرق الأمن السيبراني والاستجابة للحوادث واختبارات الاختراق، مع السماح بمهام دفاعية وبحثية محددة.
مصدر الصورة
طرح تدريجي بسبب المخاطر
على خلاف إطلاق نموذج للمستخدمين مباشرة، اختارت غوغل طرح أرغون تدريجيا. وبدأت الشركة إتاحته لمختبرين موثوقين ومدافعين سيبرانيين ضمن برنامج فيرويند، بينما تعمل على اختبار إجراءات الحماية قبل توسيع الوصول إلى المطورين والشركات والمستخدمين.
وتشمل إجراءات الحماية -بحسب غوغل- مقاومة إساءة الاستخدام والهجمات المعروفة باسم حقن التعليمات غير المباشر (Indirect Prompt Injection)، إضافة إلى أنظمة لمراقبة سلوك النموذج وإيقاف التنفيذ عند رصد انحراف عن حدود المهمة، واستخدام بيئات اختبار معزولة للعمليات عالية الخطورة.
وتشير وكالة رويترز إلى أن الشركة لم تحدد موعدا لإطلاق عام كامل للنموذج، فيما قالت غوغل إن الإتاحة ستتوسع تدريجيا، بدءا من عملاء واجهة برمجة التطبيقات (API) المدفوعة ومشتركي غوغل إيه آي ألترا (Google AI Ultra).
من الإجابة إلى تنفيذ المهمة
يعكس إطلاق جيميناي 4 أرغون توجها متزايدا لدى غوغل نحو نماذج لا تركز فقط على جودة الإجابة، وإنما على الاستمرار في العمل عبر مراحل متعددة للوصول إلى نتيجة نهائية، وتظهر تطبيقات البرمجة والبحث المالي والقانوني والأمن السيبراني هذا الاتجاه بوضوح.
لكن نتائج الأداء ليست متفوقة في كل الاختبارات، إذ نقلت رويترز عن الشركة أن أرغون يتفوق على نماذج منافسة في بعض المؤشرات، لكنه يتأخر عنها في مؤشرات أخرى، بينها اثنان من أربعة اختبارات مرتبطة بالبرمجة التي أوردتها غوغل. لذلك، فإن أهمية النموذج لا ترتبط فقط بنتائج معيارية منفردة، وإنما بمحاولة تحويل النماذج اللغوية إلى أنظمة قادرة على تنفيذ أعمال طويلة ومعقدة بدرجة أكبر من الاستقلالية.