كيف ترصد تقنية Goodfire السلوكيات الخطيرة لوكلاء الذكاء الاصطناعي من جذورها؟

كيف ترصد تقنية Goodfire السلوكيات الخطيرة لوكلاء الذكاء الاصطناعي من جذورها؟

"Goodfire" تطلق نظاماً أقل تكلفة لمراقبة سلوك وكلاء الذكاء الاصطناعي
كيف ترصد تقنية Goodfire السلوكيات الخطيرة لوكلاء الذكاء الاصطناعي من جذورها؟
تعبيرية (الذكاء الاصطناعي)
Smaller Bigger

تعتمد الطريقة التقليدية لمراقبة سلوك وكلاء الذكاء الاصطناعي على الاستعانة بنموذج آخر لمراجعة عملهم ورصد التصرفات الخطرة. لكن هذا النهج قد يصبح مكلفاً عندما يعمل الوكلاء لساعات طويلة ويعالجون كميات ضخمة من النصوص.

وفي محاولة لتوفير بديل أقل تكلفة، كشفت شركة "Goodfire" الناشئة، المتخصصة في تفسير آلية عمل نماذج الذكاء الاصطناعي، نظام مراقبة يرصد الإشارات الداخلية للنموذج أثناء عمله، بدلاً من الاكتفاء بمراجعة مخرجاته. وتتوفر هذه الأدوات لعملاء شركة "Baseten"، التي تستضيف نماذج الذكاء الاصطناعي وتشغّلها لحساب شركات أخرى.

ويأتي الإطلاق بعد حوادث عدة شهدها العام الجاري، تمكن خلالها وكلاء ذكاء اصطناعي من تجاوز بيئات الاختبار، بينها حوادث مرتبطة بنموذج "OpenAI" واختراق منصة "Hugging Face". كذلك، استغل نموذج "Kimi K3" ثغرة للوصول إلى الإنترنت ومعلومات على منصة "GitHub".

 

أوبن إيه آي (رويترز)
أوبن إيه آي (رويترز)

 

رصد السلوك الخطِر قبل وقوعه

يعتمد نظام "Goodfire" على أدوات تُسمّى "المجسّات" (Probes)، ترصد الإشارات الداخلية للنموذج في كل خطوة من عمله. وعندما تشير إحدى هذه الأدوات إلى مشكلة محتملة، يتولى نموذج ذكاء اصطناعي منفصل فحصها بدقة أكبر.

ويمكن للعملاء تحديد المخاطر المطلوب مراقبتها، ومنها الاختراق الإلكتروني الضار وإساءة استخدام التقنيات المرتبطة بالأسلحة الكيميائية والبيولوجية، إضافة إلى "التحايل على نظام المكافآت"، عندما يستغل النموذج ثغرات في آلية التقييم للحصول على نتائج أفضل من دون تحقيق الهدف المطلوب. ويمكن ضبط الاستجابة لتشمل تسجيل الحادثة، أو إحالتها إلى مراجعة بشرية، أو رفض الطلب.

وتكمن إحدى أبرز مزايا النظام في خفض التكاليف، إذ تستفيد المجسّات من الحسابات التي ينفذها النموذج أصلاً، بدلاً من إعادة فحص جميع مخرجاته باستخدام نموذج آخر.

وبحسب اختبارات الشركة على نموذج "Kimi K3"، تبلغ كلفة مراقبة نحو مليون تفاعل 185 دولاراً، مقابل 5420 دولاراً عند استخدام نموذج ذكاء اصطناعي أقل تكلفة لفحص كل خطوة، ونحو 200 ألف دولار عند استخدام نموذج متقدم.

ورصدت المجسّات 93% من جلسات الاختراق الإلكتروني الخبيثة، فيما أحالت 5.5% من الجلسات السليمة إلى فحص إضافي.

وقال دان بالسام، الشريك المؤسس والمدير التقني لشركة "Goodfire": "تكمن الميزة الكبرى في القدرة على رصد الأمور قبل وقوعها؛ إذ يمكننا اكتشاف احتمالية قيام النموذج بعمليات اختراق أثناء مرحلة التقييم أو التدريب".

العلامات الدالة

الأكثر قراءة

ثقافة 10/9/2026 5:11:00 AM
لا سبيل إلى إنقاذ الموقوف في معمل البصل إلا بالوصول إليه قبل الإنطلاق به إلى دمشق
دوليات 10/9/2026 9:02:00 PM
بيانات أولية تشير إلى زلزال بقوة 8 درجات في بنما وتهديد محتمل بتسونامي، فيما يرتبط تولّد هذه الأمواج بموقع الهزة وعمقها وحركة قاع البحر.
الولايات المتحدة 10/9/2026 10:43:00 PM
عيّن ترامب كاتي زكاريا متحدثة باسم البيت الأبيض خلفاً لكارولين ليفيت. وهي معلّقة سياسية محافظة ومتحدثة سابقة باسم وزارة الأمن الداخلي.
لبنان 10/9/2026 1:31:00 PM
عُثر على عبد الله كرامي، صهر الرئيس الراحل عمر كرامي، جثة مصابة بطلق ناري داخل مكتبه في طرابلس.