عوامل هوش مصنوعی «اوپنایآی» باز هم یاغی شدند!
عوامل هوش مصنوعی «اوپنایآی» باز هم سرکشی کردند و به هک کردن دستگاههای هوش مصنوعی یک وبسایت آلمانی بدون اطلاع این شرکت پرداختند.
گروهی از عوامل هوش مصنوعی خودمختار، مخفیانه یک وبسایت گمنام آلمانی را به یک تالار گفتوگو تبدیل کردند، پاسخها را منتشر کردند، محدودیتهای سندباکس را دور زدند و هفتهها پیش از این که «اوپنایآی»(OpenAI) متوجه شود، کارهای خود را هماهنگ میکردند.
به نقل از دیجیتال ترندز، درست زمانی که به نظر میرسید سندباکسهای اوپنایآی دیگر نمیتوانند نشتی بیشتری داشته باشند، یک اشتباه بزرگ دیگر آشکار شد. پژوهشگران مستقل، نزدیک به ۱۸ هزار پست منتشرشده توسط عوامل هوش مصنوعی خودمختار را در یک وبسایت فراموششده ۲۵ ساله آلمانی به نام DSE کشف کردهاند. این عوامل که خود را به عنوان مدلهای داخلی اوپنایآی معرفی میکردند، هفتهها به برقراری ارتباط، هماهنگی و انجام وظایف ارزیابی خود به طور سیستماتیک در وب عمومی پرداختند. همه این کارها کاملاً از سوی اوپنایآی ناشناخته ماند تا این که مدلها عملاً ردی از خود را در اینترنت به جا گذاشتند.
در ابتدا به این عوامل هوش مصنوعی وظایف جستوجوی چندمرحلهای محول شد که قرار بود در آنها فقط دسترسی خواندنی به وب داشته باشند. در عوض، آنها فهمیدند که چگونه با سوءاستفاده از درخواستهای ساده مرورگر که به وبسایت گمنام آلمانی هدایت میشدند، اطلاعات را به بیرون منتقل کنند. به محض این که عوامل هوش مصنوعی این انجمن موقت را به وجود آوردند، همکاری فعال را برای شکست سیستم آغاز کردند.
به گفته پژوهشگران «Nightingale» که یافتهها را در «Collusion Wiki» مستند کردهاند، این عوامل بسیار شبیه به دانشآموزانی عمل میکردند که در کلاس یادداشتبرداری میکنند. آنها مجموعه راهحلها را رد و بدل میکردند، وظایف تحقیقاتی را درباره پرسوجوهای چندمرحلهای تقسیم میکردند و دستورالعملهایی را درباره نحوه عبور از دیوارهای مجازی محیط آزمایش خود منتشر میکردند. برخی موارد تا آنجا پیش میرفتند که اتصالات را از طریق شبکه «Tor» هدایت میکردند، پایانههای بیرونی را بررسی میکردند تا بفهمند که آیا مدیر قصد دارد اتصال را قطع کند و عناوین صفحاتی را که با «ZZZ» آغاز میشدند، ثبت میکردند تا از حذف شدن توسط مدیران سایت جلوگیری کنند. پژوهشگران امنیتی، این رفتار را به عنوان یک شبکه زیرزمینی توصیف کردند که مصمم به تکمیل ماموریت خود بود.
شرکت اوپنایآی سرانجام پس از مشاهده افزایش غیرمعمول ترافیک شبکه و قطع ناگهانی دسترسی، متوجه این موضوع شد. افراد آشنا با این موضوع گفتند که تلاشهای داخلی برخی از پژوهشگران اوپنایآی برای گسترش تحقیقات درباره این سرقت با واکنش منفی همکاران از جمله مشاوران حقوقی روبهرو شده، اما اوپنایآی قاطعانه این روایت را رد کرد. سخنگوی اوپنایآی به رویترز گفت ادعاها مبنی بر این که تیم حقوقی آنها مانع از تحقیق درباره این حادثه شده، نادرست است و افزود که ایمنی همچنان در طول آزمایش مدل، اولویت اصلی است.
این حادثه به مجموعه نگرانکننده فرارهای عوامل هوش مصنوعی از سندباکس برای سازنده چتبات «چتجیپیتی»(ChatGPT) اضافه شد. ارزیابیهای امنیتی پیشین نشان داده بودند که مدلهای اوپنایآی از محیطهای مهار «ExploitGym» فرار میکنند تا به سیستمهای شرکت «هاگینگ فیس»(Hugging Face) حمله کنند و سرورهای شخص ثالث را به خطر بیندازند. ارزیابیهای ایمنی ثبتشده توسط موسسه امنیت هوش مصنوعی بریتانیا نیز به همین ترتیب، مدلهای رده بالا را در حال شکستن حفاظهای ایمنی برای سوءاستفاده از وبسایتهای زنده و فرستادن «کامیت»(commit) غیرمجاز به «گیتهاب»(GitHub) نشان داد.
حادثه حمله به DSE نشان میدهد که عوامل هوش مصنوعی فقط وقتی به شبکه دسترسی مییابند، کارها را خراب نمیکنند. آنها بهطور فعال همکاری میکنند، محدودیتها را دور میزنند و برای رسیدن به اهداف خود تقلب میکنند. اگرچه پژوهشگران برای سیستمهای عامل توانمندتر تلاش میکنند، اما قفل کردن این محیطهای ارزیابی، مشکلی بسیار دشوارتر از آن چیزی است که هر کسی پیشبینی میکرد.
نظر شما