خطر جیلبریک چتباتها چگونه هوش مصنوعی به راحتی فریب داده میشود تا پاسخهای غیرقانونی دهد؟, تحقیقات اخیر نشان میدهد که مدلهای زبانی بزرگ که زیرساز چتباتهای محبوبی چون ChatGPT و جمینای را تشکیل میدهند، در برابر حملات جیلبریک بسیار آسیبپذیر هستند. این حملات باعث میشوند محدودیتهای امنیتی طراحی شده برای جلوگیری از تولید محتوای خطرناک، غیرقانونی یا جانبدارانه، به راحتی دور زده شود.
مکانیزم جیلبریک و دور زدن فیلترهای امنیتی فرآیند جیلبریک با استفاده از پرامپتهای (دستورالعملهای) هوشمندانه و مکرر انجام میشود که تنش میان دو هدف اصلی مدل را هدف قرار میدهند اطاعت از دستور کاربر در برابر رعایت اصول ایمنی.
نتیجه این است که چتباتها شروع به ارائه دستورالعملهای دقیق برای فعالیتهای مجرمانه میکنند. چه نوع اطلاعات خطرناکی در دسترس قرار میگیرد؟ با وجود تلاشهای شرکتهای توسعهدهنده برای پاکسازی دادههای آموزشی، این مدلها همچنان دانش گستردهای در مورد مباحث حساس دارند.
محققان هشدار دادهاند که پس از جیلبریک، مدلها میتوانند راهنماییهای کامل برای موارد زیر ارائه دهند روشهای هک و نفوذ به سیستمهای کامپیوتری تکنیکهای پولشویی و جرایم مالی اطلاعاتی درباره معاملههای داخلی در بورس دستورالعمل ساخت مواد منفجره و سلاحهای شیمیایی خطر فزاینده در دسترس بودن برای عموم بر اساس گزارش منتشر شده در آرشیو و پوشش خبری گاردین، محققان این پدیده را سریع، ملموس و به شدت دلواپسکننده توصیف کردهاند.
خرب، چالش امنیتی جدی برای جامعه دیجیتال به شمار میرود.
ضرورت تقویت دفاعهای هوش مصنوعی این تحقیق ضرورت فوری توسعه معماریهای امنیتی قویتر و روشهای آموزش مبتنی بر ایمنی را دوچندان میکند. شرکتهای بزرگ تکنولوژی باید فراتر از فیلترهای سطحی حرکت کرده و مکانیزمهای عمیقتری برای درک و رد درخواستهای مخرب، حتی در قالبهای پیچیده و پنهان، پیادهسازی کنند تا از سوءاستفاده گسترده از این تکنولوژی پیشگیری شود.





