آنتی ویروس پادویش

چت‌ بات‌ های هوش مصنوعی با شعر فریب می‌ خورند؛ دور زدن محدودیت‌ های امنیتی برای ساخت بمب اتم

چت‌ بات‌ های هوش مصنوعی با شعر فریب می‌ خورند؛ دور زدن محدودیت‌ های امنیتی برای ساخت بمب اتم 1

یک مطالعه جدید از آزمایشگاه «ایکارو لب» (Icaro Lab) نشان می‌ دهد که با استفاده از ساختار شعری، می‌توان مدل‌ های زبانی بزرگ (LLMs) را فریب داد تا اطلاعاتی درباره موضوعات ممنوعه، مانند نحوه ساخت بمب هسته‌ای، ارائه دهند.

کانال بله زوم تکگیفت کارت

به گزارش بخش اخبار فناوری زوم تک به نقل از انگجت، مشخص شده است که برای عبور از گاردریل‌ ها (حفاظ‌های ایمنی) یک چت‌بات هوش مصنوعی، تنها به کمی خلاقیت نیاز دارید. در مطالعه‌ای که توسط Icaro Lab با عنوان «شعر خصمانه به عنوان مکانیزم عمومی جیل‌بریک تک‌ مرحله‌ای در مدل‌ های زبانی بزرگ» منتشر شده است، محققان توانستند با بیان دستورات (Prompt) خود در قالب شعر، مکانیزم‌ های ایمنی چندین LLM مختلف را دور بزنند.

شعر؛ ابزاری برای شکستن قفل هوش مصنوعی

بر اساس این مطالعه، «فرم شعری به عنوان یک عملگر عمومی برای جیل‌بریک (Jailbreak) عمل می‌کند». نتایج نشان‌دهنده نرخ موفقیت کلی ۶۲ درصدی در تولید محتوای ممنوعه است؛ این محتوا شامل هر چیزی از نحوه ساخت سلاح‌های هسته‌ای گرفته تا موارد مربوط به سوءاستفاده جنسی از کودکان و خودکشی یا آسیب به خود می‌شود.

این مطالعه مدل‌های محبوب LLM از جمله مدل‌های GPT شرکت OpenAI، جمینای (Gemini) گوگل، کلود (Claude) شرکت آنتروپیک و بسیاری دیگر را مورد آزمایش قرار داد.

بیشتر بخوانید  معرفی 10 ابزار هوش مصنوعی عالی برای ساخت ویدیو در سال 2023

کدام مدل‌ ها آسیب‌ پذیرتر بودند؟

محققان نرخ موفقیت را برای هر مدل زبانی به تفکیک بررسی کردند. نتایج نشان داد که مدل‌های Google Gemini، DeepSeek و MistralAI به‌طور مداوم پاسخ‌های ممنوعه را ارائه می‌کردند و در برابر این ترفند آسیب‌پذیر بودند. در مقابل، مدل‌های GPT-5 شرکت OpenAI و Claude Haiku 4.5 شرکت آنتروپیک کمترین احتمال را داشتند که از محدودیت‌های تعیین‌شده خود فراتر روند و امنیت بالاتری از خود نشان دادند.

خطر انتشار عمومی پرامپت‌ های مخرب

این مطالعه شامل اشعار دقیق استفاده شده برای جیل‌بریک نمی‌شود؛ تیم تحقیقاتی به نشریه «Wired» گفته است که این ابیات «برای به اشتراک‌گذاری با عموم بسیار خطرناک هستند». با این حال، مطالعه شامل یک نسخه تلطیف‌شده بود تا نشان دهد دور زدن گاردریل‌های یک چت‌ بات هوش مصنوعی چقدر ساده است.

محققان در گفتگو با Wired تأکید کردند که این کار «احتمالاً آسان‌تر از آن چیزی است که فکر می‌کنید، و دقیقاً به همین دلیل است که ما در انتشار جزئیات احتیاط می‌کنیم.»

به این پست امتیاز بدید

نظرات در مورد : چت‌ بات‌ های هوش مصنوعی با شعر فریب می‌ خورند؛ دور زدن محدودیت‌ های امنیتی برای ساخت بمب اتم

0 دیدگاه

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *