تدفع غوغل نماذج الذكاء الاصطناعي خطوة جديدة باتجاه تنفيذ الأعمال المعقدة، مع إطلاقها «جيميناي 4 أرغون» (Gemini 4 Argon)، الذي تقدمه الشركة باعتباره أحدث نماذجها الرائدة والأكثر قدرة حتى الآن على التعامل مع المهام التي تمتد عبر مراحل متعددة.
ولا تركز غوغل في النموذج الجديد على إنتاج إجابة سريعة لسؤال واحد، بل على قدرته على مواصلة العمل عبر سلسلة طويلة من عمليات التحليل والتنفيذ للوصول إلى نتيجة نهائية. وتضع الشركة هندسة البرمجيات والعمل المعرفي المتخصص والأمن السيبراني ضمن أبرز المجالات التي يستهدفها النموذج.
مليون رمز لمسارات عمل أطول
من أبرز التغييرات التي تقدمها غوغل مع «أرغون» رفع حد الإخراج إلى مليون رمز (Token)، مقارنة بـ64 ألف رمز في النموذج السابق، بحسب الشركة.
وتقول غوغل إن هذه المساحة الأكبر تتيح للنموذج الاحتفاظ بكمية أكبر من المعلومات أثناء تنفيذ المهام الممتدة، ومواصلة عمليات الاستدلال والعمل ضمن مسار واحد قد يصل إلى مئات الآلاف من الرموز.
وتستهدف هذه القدرة مشروعات لا يمكن اختزالها في مجموعة قصيرة من التعليمات، مثل تحليل قواعد شيفرة ضخمة أو تنفيذ بحث متعدد المراحل، إذ يستطيع النموذج، وفق غوغل، مواصلة المهمة مع الاحتفاظ بالسياق والمعلومات التي يحتاج إليها في المراحل اللاحقة.
البرمجة.. من إصلاح الأخطاء إلى إعادة بناء الشيفرات
تضع غوغل هندسة البرمجيات في صدارة التطبيقات العملية لـ«أرغون»، وتقول إن مهندسيها يستخدمونه في تصحيح الأخطاء، وتصميم الخوارزميات، والعمل على عمليات ترحيل واسعة لقواعد الشيفرة بين لغات البرمجة.
ومن بين الأمثلة التي تستشهد بها الشركة استخدام وكلاء «أرغون» لترحيل شيفرات مكتوبة بلغتي C وC++ إلى Rust، بما في ذلك عملية تجاوزت 800 ألف سطر من الشيفرة في نواة نظام Fuchsia Zircon.
كما تقول غوغل إن النموذج سجل 77.9% في اختبار DeepSWE v1.1، المخصص لتقييم أداء نماذج الذكاء الاصطناعي في مهام هندسة البرمجيات الواقعية طويلة المدى.
وفي تجربة أخرى، أفادت الشركة بأن وكلاء النموذج أعادوا كتابة 32 ألف سطر من شيفرة SIMD في مشروع libgav1، وأسفرت العملية، وفق نتائج غوغل، عن نسخة Rust أسرع بنحو 2.7 مرة من النسخة السابقة، مع الحفاظ على المخرجات نفسها.
وتشير الشركة إلى أن عمليات إعادة الكتابة واسعة النطاق لا تُعتمد مباشرة، وإنما تخضع لمراجعات واختبارات آلية ويدوية قبل استخدامها في بيئات الإنتاج.
قدرات تتجاوز الشيفرة
لا تحصر غوغل «أرغون» في أعمال البرمجة، بل تستهدف به أيضاً مهام معرفية متخصصة في مجالات التمويل والقانون والضرائب.
وتقول الشركة إن النموذج حقق أداءً متقدماً في اختبارات تتعلق بالبحث المالي متعدد الخطوات، والبحث والصياغة القانونية، ومهام الأعمال التي تتطلب تنفيذ سلسلة من الإجراءات بدلاً من معالجة طلب منفرد.
ويمتد نطاقه كذلك إلى المهام متعددة الوسائط، بما في ذلك تحليل الرسوم البيانية وفهم مقاطع الفيديو الطويلة. ووفق غوغل، سجل النموذج 91.7% في اختبار LVBench الخاص بقياس قدرات فهم الفيديوهات الطويلة.
نموذج للتعامل مع الثغرات
يحتل الأمن السيبراني موقعاً بارزاً في استراتيجية طرح «أرغون»، إذ تقول غوغل إن النموذج يستطيع اكتشاف الثغرات البرمجية والتحقق منها واقتراح إصلاحات لها بصورة ذاتية.
وفي اختبار CWE-bench v1 الخاص بمعالجة الثغرات، سجل النموذج 68%، وهي نتيجة تقول غوغل إنها تعادل أفضل نتيجة مسجلة في الاختبار.
وتختبر الشركة هذه القدرات ضمن برنامج «فيرويند» (Fairwind)، الذي يتيح النموذج لمجموعة مختارة من المدافعين السيبرانيين، مع فرض ضوابط وصول صارمة وقصر الاستخدام على فرق الأمن السيبراني والاستجابة للحوادث واختبارات الاختراق، إضافة إلى مهام دفاعية وبحثية محددة.
طرح حذر بسبب مخاطر الاستخدام
اختارت غوغل عدم إتاحة النموذج على نطاق واسع منذ اليوم الأول، وبدأت بدلاً من ذلك بطرحه أمام مختبرين موثوقين ومدافعين في مجال الأمن السيبراني، بالتوازي مع اختبار إجراءات الحماية قبل توسيع نطاق الوصول.
وتشمل إجراءات الأمان، بحسب الشركة، وسائل لمقاومة إساءة الاستخدام والهجمات المعروفة باسم «حقن التعليمات غير المباشر» (Indirect Prompt Injection)، إلى جانب أنظمة لمراقبة سلوك النموذج وإيقاف التنفيذ عندما يخرج عن حدود المهمة المحددة.
كما تعتمد غوغل بيئات اختبار معزولة للعمليات التي تراها عالية الخطورة.
وبحسب رويترز، لم تحدد الشركة موعداً لإطلاق عام كامل للنموذج، فيما قالت غوغل إن الإتاحة ستتوسع تدريجياً، بدءاً من عملاء واجهة برمجة التطبيقات (API) المدفوعة ومشتركي Google AI Ultra.
رهان على الذكاء الاصطناعي الذي يواصل العمل.
يعكس «جيميناي 4 أرغون» توجهاً يتجاوز نموذج الذكاء الاصطناعي الذي ينتظر سؤالاً ثم يقدم إجابة، نحو أنظمة تستطيع الاحتفاظ بسياق أطول وتنفيذ سلسلة من الخطوات للوصول إلى نتيجة مركبة.
وتظهر تطبيقات البرمجة والبحث المالي والقانوني والأمن السيبراني هذا التوجه بوضوح، لكن أداء النموذج لا يبدو متفوقاً في جميع الاختبارات التي عرضتها غوغل. ووفق ما نقلته رويترز عن الشركة، يتفوق «أرغون» على نماذج منافسة في بعض المؤشرات، بينما يتأخر عنها في مؤشرات أخرى، من بينها اثنان من أربعة اختبارات برمجية أوردتها غوغل.
وبذلك، لا تقتصر دلالة النموذج على رقم واحد في اختبارات الأداء، وإنما على محاولة غوغل تطوير أنظمة ذكاء اصطناعي قادرة على إدارة أعمال طويلة ومعقدة والاستمرار في تنفيذها عبر مراحل متعددة، مع إبقاء الوصول إلى القدرات الأكثر حساسية تحت ضوابط واختبارات تدريجية.


