آنتی ویروس پادویش

هوش مصنوعی گول خورد! هکرها با چه ترفندی حملات سایبری را 60 درصد افزایش می‌ دهند؟

هوش مصنوعی

هوش مصنوعی هم هک شد! محققان روش جدیدی برای فریب هوش مصنوعی و تولید پاسخ‌های خطرناک کشف کرده‌اند! با این روش، هکرها می‌توانند محدودیت‌های امنیتی هوش مصنوعی را دور بزنند و از آن برای اهداف مخرب خود استفاده کنند!
به گزارش زوم تک از The Hacker News، محققان امنیت سایبری از روش جدیدی برای شکستن محدودیت‌های امنیتی مدل‌های زبان بزرگ (LLM) پرده برداشته‌اند که می‌تواند برای تولید پاسخ‌های مضر یا مخرب مورد استفاده قرار گیرد.

کانال بله زوم تکگیفت کارت

این استراتژی حمله چند مرحله‌ای که توسط محققان واحد ۴۲ پالو آلتو نتورکز با نام “Bad Likert Judge” نامگذاری شده است، از مدل زبان بزرگ می‌خواهد تا مانند یک قاضی عمل کند و میزان مضر بودن یک پاسخ داده شده را با استفاده از مقیاس لیکرت (مقیاسی برای سنجش میزان موافقت یا مخالفت پاسخ‌دهنده با یک عبارت) ارزیابی کند.

سپس از مدل خواسته می‌شود تا پاسخ‌هایی را تولید کند که حاوی نمونه‌هایی منطبق با این مقیاس‌ها باشند. نمونه‌ای که بالاترین امتیاز را در مقیاس لیکرت کسب کند، می‌تواند حاوی محتوای مضر باشد.

محبوبیت روزافزون هوش مصنوعی در سال‌های اخیر منجر به ظهور نوع جدیدی از حملات امنیتی به نام “تزریق سریع” شده است که به طور خاص برای وادار کردن مدل‌های یادگیری ماشین به نادیده گرفتن رفتار مورد نظر خود با ارسال دستورات ویژه طراحی شده‌اند.

یکی از انواع خاص تزریق سریع، روشی به نام “فرار از زندان چند مرحله‌ای” است که از پنجره زمینه طولانی و توجه مدل زبان بزرگ برای ایجاد مجموعه‌ای از دستورات استفاده می‌کند که به تدریج مدل را به سمت تولید پاسخ مخرب سوق می‌دهند، بدون اینکه مکانیسم‌های حفاظتی داخلی آن را فعال کنند.

رویکرد جدیدی که توسط واحد ۴۲ ارائه شده است، از مدل زبان بزرگ به عنوان یک قاضی برای ارزیابی مضر بودن یک پاسخ با استفاده از مقیاس روان سنجی لیکرت استفاده می‌کند و سپس از مدل می‌خواهد تا پاسخ‌های مختلفی را مطابق با نمرات مختلف ارائه دهد.

بیشتر بخوانید  فیلم‌های برتر در زمینه هک و هکرها و حقایق پنهان پشت پرده این فیلم‌ها

آزمایش‌های انجام شده در طیف وسیعی از دسته‌بندی‌ها بر روی شش مدل زبان بزرگ تولید متن از شرکت‌های Amazon Web Services، Google، Meta، Microsoft، OpenAI و NVIDIA نشان داد که این روش می‌تواند نرخ موفقیت حمله (ASR) را به طور متوسط بیش از ۶۰ درصد در مقایسه با دستورات حمله ساده افزایش دهد.

این دسته‌بندی‌ها شامل نفرت پراکنی، آزار و اذیت، خودآزاری، محتوای جنسی، سلاح‌های غیرقانونی، فعالیت‌های غیرقانونی، تولید بدافزار و نشت سریع سیستم هستند.

محققان می‌گویند: “با بهره‌گیری از درک مدل زبان بزرگ از محتوای مضر و توانایی آن در ارزیابی پاسخ‌ها، این روش می‌تواند شانس دور زدن موفقیت‌آمیز محدودیت‌های امنیتی مدل را به طور قابل توجهی افزایش دهد.”

“نتایج نشان می‌دهد که فیلترهای محتوا می‌توانند نرخ موفقیت حمله را به طور متوسط ۸۹.۲ درصد در تمام مدل‌های آزمایش شده کاهش دهند. این نشان دهنده نقش حیاتی پیاده‌سازی فیلترهای محتوای جامع به عنوان یک روش

بهترین در هنگام استفاده از مدل‌های زبان بزرگ در برنامه‌های کاربردی دنیای واقعی است.”

این خبر چند روز پس از گزارش روزنامه گاردین منتشر شد که نشان می‌داد ابزار جستجوی ChatGPT شرکت OpenAI را می‌توان با درخواست خلاصه کردن صفحات وب حاوی محتوای پنهان، فریب داد تا خلاصه‌های کاملاً گمراه‌کننده تولید کند.

این روزنامه بریتانیایی گفت: “این روش‌ها می‌توانند به طور مخرب مورد استفاده قرار گیرند، به عنوان مثال برای وادار کردن ChatGPT به ارائه ارزیابی مثبت از یک محصول علیرغم وجود نظرات منفی در همان صفحه.”

“قرار دادن ساده متن پنهان توسط اشخاص ثالث بدون دستورالعمل نیز می‌تواند برای تضمین ارزیابی مثبت مورد استفاده قرار گیرد، به طوری که در یک آزمایش، نظرات جعلی بسیار مثبتی که در خلاصه ارائه شده توسط ChatGPT تأثیرگذار بودند، گنجانده شد.”

به این پست امتیاز بدید

نظرات در مورد : هوش مصنوعی گول خورد! هکرها با چه ترفندی حملات سایبری را 60 درصد افزایش می‌ دهند؟

0 دیدگاه

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *