نظرًا لأن LLMs أصبحت أكثر تعقيدًا ويتم استخدامها في مجموعة متنوعة من المهام – خاصة في شكل وكلاء، يمكنهم التفاعل مع ملفات الكمبيوتر ومواقع الويب ورموز الطرف الثالث بالإضافة إلى وكلاء آخرين – فمن الصعب على فرق من الأشخاص بمفردهم مواكبة جميع أنواع الهجمات التي قد تحدث. يقول نيخيل كاندبال، عالم الأبحاث في OpenAI، الذي شارك في إنشاء GPT-Red: “إن سطح الخطر ينمو وينمو أيضًا نصف قطر الانفجار”.
قامت OpenAI ببناء GPT-Red لإثبات عملية اختبار السلامة الخاصة بها في المستقبل. يقول ديلان هون، عالم الأبحاث في الشركة والشريك المشارك في إنشاء GPT-Red: “مع توفر المزيد من النماذج القادرة، سنكون قد صممنا بالفعل النظام الذي يمكنه اكتشاف أنماط جديدة للهجوم”. ويقول الباحثون إنهم توصلوا بالفعل إلى أنواع جديدة من الهجمات لم يتم رؤيتها من قبل.
ركزت OpenAI معظم جهودها على نوع من الهجوم يُعرف باسم الحقن الفوري، حيث يقوم المتسلل بتمرير تعليمات LLM لجعله يفعل أشياء لا يريد المطورون أو المستخدمون القيام بها، مثل نسخ المعلومات السرية، أو تخريب قاعدة التعليمات البرمجية الخاصة بالشركة، أو توليد مخرجات محرجة أو ضارة. من الناحية النظرية، يمكن إخفاء هذه التعليمات في أي نص قد يواجهه ماجستير إدارة الأعمال – في التعليمات البرمجية أو على موقع ويب، على سبيل المثال.
تدريب دوجو
لبناء GPT-Red، أخذ باحثو OpenAI شهادة ماجستير في القانون لم يتم تدريبها كهاكر وقاموا بإعدادها فيما يعرف بحلقة التشغيل الذاتي مع العديد من النماذج الأخرى. كان هدفها محاولة مهاجمة النماذج الأخرى. كان هدفهم محاولة الدفاع عن أنفسهم. على مدار العديد من جولات اللعب، أصبح GPT-Red أفضل فأفضل في مهاجمة أصحاب LLM الآخرين، وأصبح هؤلاء LLMs أفضل فأفضل في صد الهجمات.
اكتشاف المزيد من موقع اشراقات- التقنية تشرق
اشترك للحصول على أحدث التدوينات المرسلة إلى بريدك الإلكتروني.
