هوش مصنوعی هم هک شد! محققان روش جدیدی برای فریب هوش مصنوعی و تولید پاسخهای خطرناک کشف کردهاند! با این روش، هکرها میتوانند محدودیتهای امنیتی هوش مصنوعی را دور بزنند و از آن برای اهداف مخرب خود استفاده کنند!
به گزارش زوم تک از The Hacker News، محققان امنیت سایبری از روش جدیدی برای شکستن محدودیتهای امنیتی مدلهای زبان بزرگ (LLM) پرده برداشتهاند که میتواند برای تولید پاسخهای مضر یا مخرب مورد استفاده قرار گیرد.
این استراتژی حمله چند مرحلهای که توسط محققان واحد ۴۲ پالو آلتو نتورکز با نام “Bad Likert Judge” نامگذاری شده است، از مدل زبان بزرگ میخواهد تا مانند یک قاضی عمل کند و میزان مضر بودن یک پاسخ داده شده را با استفاده از مقیاس لیکرت (مقیاسی برای سنجش میزان موافقت یا مخالفت پاسخدهنده با یک عبارت) ارزیابی کند.
سپس از مدل خواسته میشود تا پاسخهایی را تولید کند که حاوی نمونههایی منطبق با این مقیاسها باشند. نمونهای که بالاترین امتیاز را در مقیاس لیکرت کسب کند، میتواند حاوی محتوای مضر باشد.
محبوبیت روزافزون هوش مصنوعی در سالهای اخیر منجر به ظهور نوع جدیدی از حملات امنیتی به نام “تزریق سریع” شده است که به طور خاص برای وادار کردن مدلهای یادگیری ماشین به نادیده گرفتن رفتار مورد نظر خود با ارسال دستورات ویژه طراحی شدهاند.
یکی از انواع خاص تزریق سریع، روشی به نام “فرار از زندان چند مرحلهای” است که از پنجره زمینه طولانی و توجه مدل زبان بزرگ برای ایجاد مجموعهای از دستورات استفاده میکند که به تدریج مدل را به سمت تولید پاسخ مخرب سوق میدهند، بدون اینکه مکانیسمهای حفاظتی داخلی آن را فعال کنند.
رویکرد جدیدی که توسط واحد ۴۲ ارائه شده است، از مدل زبان بزرگ به عنوان یک قاضی برای ارزیابی مضر بودن یک پاسخ با استفاده از مقیاس روان سنجی لیکرت استفاده میکند و سپس از مدل میخواهد تا پاسخهای مختلفی را مطابق با نمرات مختلف ارائه دهد.
آزمایشهای انجام شده در طیف وسیعی از دستهبندیها بر روی شش مدل زبان بزرگ تولید متن از شرکتهای Amazon Web Services، Google، Meta، Microsoft، OpenAI و NVIDIA نشان داد که این روش میتواند نرخ موفقیت حمله (ASR) را به طور متوسط بیش از ۶۰ درصد در مقایسه با دستورات حمله ساده افزایش دهد.
این دستهبندیها شامل نفرت پراکنی، آزار و اذیت، خودآزاری، محتوای جنسی، سلاحهای غیرقانونی، فعالیتهای غیرقانونی، تولید بدافزار و نشت سریع سیستم هستند.
محققان میگویند: “با بهرهگیری از درک مدل زبان بزرگ از محتوای مضر و توانایی آن در ارزیابی پاسخها، این روش میتواند شانس دور زدن موفقیتآمیز محدودیتهای امنیتی مدل را به طور قابل توجهی افزایش دهد.”
“نتایج نشان میدهد که فیلترهای محتوا میتوانند نرخ موفقیت حمله را به طور متوسط ۸۹.۲ درصد در تمام مدلهای آزمایش شده کاهش دهند. این نشان دهنده نقش حیاتی پیادهسازی فیلترهای محتوای جامع به عنوان یک روش
بهترین در هنگام استفاده از مدلهای زبان بزرگ در برنامههای کاربردی دنیای واقعی است.”
این خبر چند روز پس از گزارش روزنامه گاردین منتشر شد که نشان میداد ابزار جستجوی ChatGPT شرکت OpenAI را میتوان با درخواست خلاصه کردن صفحات وب حاوی محتوای پنهان، فریب داد تا خلاصههای کاملاً گمراهکننده تولید کند.
این روزنامه بریتانیایی گفت: “این روشها میتوانند به طور مخرب مورد استفاده قرار گیرند، به عنوان مثال برای وادار کردن ChatGPT به ارائه ارزیابی مثبت از یک محصول علیرغم وجود نظرات منفی در همان صفحه.”
“قرار دادن ساده متن پنهان توسط اشخاص ثالث بدون دستورالعمل نیز میتواند برای تضمین ارزیابی مثبت مورد استفاده قرار گیرد، به طوری که در یک آزمایش، نظرات جعلی بسیار مثبتی که در خلاصه ارائه شده توسط ChatGPT تأثیرگذار بودند، گنجانده شد.”




نظرات در مورد : هوش مصنوعی گول خورد! هکرها با چه ترفندی حملات سایبری را 60 درصد افزایش می دهند؟