توبیت
آنتی ویروس پادویش

چت‌بات‌ های هوش مصنوعی زیر فشار تسلیم دروغ می‌شوند؛ هشدار پژوهشگران درباره تایید اطلاعات غلط توسط ChatGPT

چت‌بات‌ های هوش مصنوعی زیر فشار تسلیم دروغ می‌شوند؛ هشدار پژوهشگران درباره تایید اطلاعات غلط توسط ChatGPT

به گزارش بخش اخبار فناوری زوم تک به نقل از دیجیتال ترندز (Digital Trends)، پژوهشگران دانشگاه آریزونا به ارزیابی و سنجش هفت مدل هوش مصنوعی مطرح شامل GPT-3.5، GPT-4o، GPT-4o-mini، Claude 3.5 Sonnet، Gemini 1.5 Pro، Llama 3 70B و DeepSeek-R1 پرداختند. محققان به جای قضاوت درباره عملکرد این مدل‌ها صرفاً بر اساس یک پاسخ واحد و مجزا، مکالمه با آن‌ها را ادامه دادند و هم‌زمان اطلاعاتی را که از کذب بودنشان اطمینان کامل داشتند، به صورت مکرر به مدل‌ها تزریق کردند.

کانال بله زوم تکگیفت کارت

در این پژوهش از ۱۰۰ گزاره و عبارت کاملاً نادرست استفاده شد که موضوعات مختلف، از ادعاهای مضحک و بی‌معنی آشکار گرفته تا اطلاعات بسیار گنگ، مبهم و کمترشناخته‌شده را پوشش می‌داد. سپس محققان این اطلاعات گمراه‌کننده را تا ۵۰ بار در طول یک مکالمه تکرار کردند تا ببینند آیا چت‌بات در نهایت تسلیم شده و صحت این ادعاهای غلط را تأیید می‌کند یا خیر.

چت‌بات‌ های هوش مصنوعی زیر فشار تسلیم دروغ می‌شوند؛ هشدار پژوهشگران درباره تایید اطلاعات غلط توسط ChatGPT

تکرار مداوم یک دروغ؛ عاملی که چت‌بات‌ ها را سرانجام به تسلیم و تأیید وادار می‌کند

نتایج این بررسی نشان داد که هیچ‌یک از این هفت مدل به طور کامل در برابر تکرار ادعاهای نادرست مصون نیستند. در این میان، مدل ChatGPT 3.5 آسیب‌پذیرترین عملکرد را در مواجهه با تکرار مداوم اکاذیب به ثبت رساند؛ به طوری که در ۱۲.۳ درصد از تعاملات، ادعاهای دروغین را تایید کرد. در نقطه مقابل، Claude 3.5 Sonnet با نرخ تایید تنها ۰.۰۸ درصد مقاوم‌ترین مدل شناخته شد، در حالی که مدل‌های GPT-4o و GPT-4o-mini نرخ خطای خود را زیر ۱ درصد حفظ کردند.

مدل ChatGPT 3.5 در ابتدا ۹۶ ادعا از ۱۰۰ گزاره کذب را به درستی رد کرد. با این حال، پس از اینکه همان ادعاها ۵۰ بار تکرار شدند، این چت‌بات در نهایت با ۱۸ مورد از آن‌ها موافقت کرد و صحتشان را پذیرفت! علاوه بر این، پژوهشگران دریافتند که برخی مدل‌ها در برابر یک ادعای نادرست مشخص، مدام میان رد و تایید آن سرگردان می‌شوند؛ رفتاری که محققان آن را «پژواک رفتاری یا نوسان» (Reverberation) نامیده‌اند.

سیستم‌های هوش مصنوعی همچنین زمانی که موضوع مورد بحث پیچیده، مبهم و کم‌یاب بود و اطلاعات بسیار کمی درباره آن در سطح وب وجود داشت، به مراتب آسیب‌پذیرتر ظاهر شدند. پژوهشگران به یک رابطه معنادار آماری میان «ابهام و کمبود اطلاعات» و «میزان پذیرش اطلاعات نادرست» در طول آزمون‌های تکرار دست یافتند.

چت‌بات‌ های هوش مصنوعی زیر فشار تسلیم دروغ می‌شوند؛ هشدار پژوهشگران درباره تایید اطلاعات غلط توسط ChatGPT

بحث و جدل با هوش مصنوعی؛ آشکار شدن رفتارهای عجیب در مدل DeepSeek-R1

پژوهشگران همچنین تلاش کردند با به‌کارگیری تکنیک‌های بحث و جدل تهاجمی‌تر، این مدل‌ها را به چالش بکشند. بیشتر مدل‌ها مقاومت نسبتاً مناسبی از خود نشان دادند، اما مدل DeepSeek-R1 یک استثنای بسیار بزرگ بود. میزان تایید اطلاعات نادرست توسط این مدل، از رقم ۱ درصد در حالت تکرار ساده، به رقم خیره‌کننده ۲۲.۲ درصد در شرایط بحث و مجادله فشرده جهش پیدا کرد. علاوه بر این، استفاده مکرر دیپ‌سیک از زبان طنز، کنایه و کلمات کنایه‌آمیز سبب شد که دسته‌بندی و تحلیل دقیق پاسخ‌ها برای محققان به چالش بزرگی تبدیل شود.

امیدواری به قابلیت تصحیح خطا در نسخه‌ های جدید هوش مصنوعی

با این حال، زمانی که فرصت دوباره‌ای به مدل‌ها داده شد تا اشتباهات پیشین خود را ارزیابی و بازنگری کنند، نتایج بسیار امیدوارکننده‌ای به دست آمد. مدل‌های GPT-4o، GPT-4o-mini، Gemini 1.5 Pro و DeepSeek تمامی خطاهای گذشته خود را تصحیح کردند؛ در حالی که GPT-3.5 موفق شد تنها ۳۲ درصد از خطاهایش را جبران کند.

مدل Claude 3.5 Sonnet هرچند در مرحله نخست مرتکب خطاهای بسیار ناچیزی شد، اما نتوانست همان چهار اشتباه ثبت‌شده خود را اصلاح کند؛ اگرچه پژوهشگران تأکید دارند که این جامعه آماری برای دستیابی به یک نتیجه‌گیری قطعی بسیار کوچک و محدود بوده است.

به این پست امتیاز بدید

نظرات در مورد : چت‌بات‌ های هوش مصنوعی زیر فشار تسلیم دروغ می‌شوند؛ هشدار پژوهشگران درباره تایید اطلاعات غلط توسط ChatGPT

0 دیدگاه

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *