به گزارش بخش اخبار فناوری زوم تک به نقل از دیجیتال ترندز (Digital Trends)، پژوهشگران دانشگاه آریزونا به ارزیابی و سنجش هفت مدل هوش مصنوعی مطرح شامل GPT-3.5، GPT-4o، GPT-4o-mini، Claude 3.5 Sonnet، Gemini 1.5 Pro، Llama 3 70B و DeepSeek-R1 پرداختند. محققان به جای قضاوت درباره عملکرد این مدلها صرفاً بر اساس یک پاسخ واحد و مجزا، مکالمه با آنها را ادامه دادند و همزمان اطلاعاتی را که از کذب بودنشان اطمینان کامل داشتند، به صورت مکرر به مدلها تزریق کردند.
در این پژوهش از ۱۰۰ گزاره و عبارت کاملاً نادرست استفاده شد که موضوعات مختلف، از ادعاهای مضحک و بیمعنی آشکار گرفته تا اطلاعات بسیار گنگ، مبهم و کمترشناختهشده را پوشش میداد. سپس محققان این اطلاعات گمراهکننده را تا ۵۰ بار در طول یک مکالمه تکرار کردند تا ببینند آیا چتبات در نهایت تسلیم شده و صحت این ادعاهای غلط را تأیید میکند یا خیر.

تکرار مداوم یک دروغ؛ عاملی که چتبات ها را سرانجام به تسلیم و تأیید وادار میکند
نتایج این بررسی نشان داد که هیچیک از این هفت مدل به طور کامل در برابر تکرار ادعاهای نادرست مصون نیستند. در این میان، مدل ChatGPT 3.5 آسیبپذیرترین عملکرد را در مواجهه با تکرار مداوم اکاذیب به ثبت رساند؛ به طوری که در ۱۲.۳ درصد از تعاملات، ادعاهای دروغین را تایید کرد. در نقطه مقابل، Claude 3.5 Sonnet با نرخ تایید تنها ۰.۰۸ درصد مقاومترین مدل شناخته شد، در حالی که مدلهای GPT-4o و GPT-4o-mini نرخ خطای خود را زیر ۱ درصد حفظ کردند.
مدل ChatGPT 3.5 در ابتدا ۹۶ ادعا از ۱۰۰ گزاره کذب را به درستی رد کرد. با این حال، پس از اینکه همان ادعاها ۵۰ بار تکرار شدند، این چتبات در نهایت با ۱۸ مورد از آنها موافقت کرد و صحتشان را پذیرفت! علاوه بر این، پژوهشگران دریافتند که برخی مدلها در برابر یک ادعای نادرست مشخص، مدام میان رد و تایید آن سرگردان میشوند؛ رفتاری که محققان آن را «پژواک رفتاری یا نوسان» (Reverberation) نامیدهاند.
سیستمهای هوش مصنوعی همچنین زمانی که موضوع مورد بحث پیچیده، مبهم و کمیاب بود و اطلاعات بسیار کمی درباره آن در سطح وب وجود داشت، به مراتب آسیبپذیرتر ظاهر شدند. پژوهشگران به یک رابطه معنادار آماری میان «ابهام و کمبود اطلاعات» و «میزان پذیرش اطلاعات نادرست» در طول آزمونهای تکرار دست یافتند.

بحث و جدل با هوش مصنوعی؛ آشکار شدن رفتارهای عجیب در مدل DeepSeek-R1
پژوهشگران همچنین تلاش کردند با بهکارگیری تکنیکهای بحث و جدل تهاجمیتر، این مدلها را به چالش بکشند. بیشتر مدلها مقاومت نسبتاً مناسبی از خود نشان دادند، اما مدل DeepSeek-R1 یک استثنای بسیار بزرگ بود. میزان تایید اطلاعات نادرست توسط این مدل، از رقم ۱ درصد در حالت تکرار ساده، به رقم خیرهکننده ۲۲.۲ درصد در شرایط بحث و مجادله فشرده جهش پیدا کرد. علاوه بر این، استفاده مکرر دیپسیک از زبان طنز، کنایه و کلمات کنایهآمیز سبب شد که دستهبندی و تحلیل دقیق پاسخها برای محققان به چالش بزرگی تبدیل شود.
امیدواری به قابلیت تصحیح خطا در نسخه های جدید هوش مصنوعی
با این حال، زمانی که فرصت دوبارهای به مدلها داده شد تا اشتباهات پیشین خود را ارزیابی و بازنگری کنند، نتایج بسیار امیدوارکنندهای به دست آمد. مدلهای GPT-4o، GPT-4o-mini، Gemini 1.5 Pro و DeepSeek تمامی خطاهای گذشته خود را تصحیح کردند؛ در حالی که GPT-3.5 موفق شد تنها ۳۲ درصد از خطاهایش را جبران کند.
مدل Claude 3.5 Sonnet هرچند در مرحله نخست مرتکب خطاهای بسیار ناچیزی شد، اما نتوانست همان چهار اشتباه ثبتشده خود را اصلاح کند؛ اگرچه پژوهشگران تأکید دارند که این جامعه آماری برای دستیابی به یک نتیجهگیری قطعی بسیار کوچک و محدود بوده است.





نظرات در مورد : چتبات های هوش مصنوعی زیر فشار تسلیم دروغ میشوند؛ هشدار پژوهشگران درباره تایید اطلاعات غلط توسط ChatGPT