محققان مایکروسافت روش اسکلِتون کی را برای دور زدن حفاظهای امنیتی هوش مصنوعی فاش کردند, محققان مایکروسافت با بهرهگیری از تکنیکی نوین به نام اسکلِتون کی موفق شدند لایههای امنیتی چتباتهای هوش مصنوعی را بیاثر سازند و این مدلها را به اجرای دستورات خطرناک واریده کنند.
این روش در دسته حملات تزریق پرامپت و مهندسی اجتماعی قرار میگیرد و بر پایه دستورات متنی خاصی استوار است که مدل را قانع میکند تا از دستورالعملهای ایمنی خود غافل شود.نحوه عملکرد تکنیک اسکلِتون کیمارک راسینوویچ، مدیر ارشد فناوری در بخش آژور مایکروسافت، توضیح میدهد که این استراتژی بهصورتای طراحی شده که هوش مصنوعی را به تصمیمگیریهای غیرمنطقی و نادیده گرفتن حفاظهای امنیتی وامیدارد.
در نتیجه، مدل میتواند به ارائه اطلاعات حساس و مخرب — از جمله دستورالعملهای ساخت مواد منفجره، سلاحهای زیستی یا روشهای تکهتکه کردن جسد — بپردازد.محدوده تست و نتایج بهدستآمدهتیم تحقیقاتی مایکروسافت این تکنیک را بر روی طیف وسیعی از موضوعات — نظیر خشونت، نژادپرستی، سلاحهای زیستی و مباحث سیاسی — آزمایش کرده و در همگی موارد با موفقیت به اطلاعات ممنوعه دست یافته است.
با این حال، راسینوویچ تأکید میکند که مهاجم از طریق این روش نمیتواند به دادههای کاربران یا کنترل مستقیم سیستم نفوذ کند، زیرا هدف حمله خود مدل است، نه زیرساختهای پشتیبان.پاسخگویی و اقدامات پیشگیرانهمایکروسافت با انتشار جزئیات این آسیبپذیری در وبلاگ رسمی خود، به توسعهدهندگان و ارائهدهندگان سرویسهای هوش مصنوعی هشدار داده تا لایههای دفاعی عمیقتری — از جمله نظارت بر خروجیها، فیلترهای پیش و پسپردازش و آموزش تقویتی با بازخورد انسانی (RLHF) — را تقویت کنند تا از سوءاستفادههای احتمالی پیشگیری شود.





