آنتی ویروس پادویش

معرفی بنچمارک HumaneBench؛ آزمونی سخت برای سنجش تعهد چت‌ بوت‌ های هوش مصنوعی به سلامت روان انسان

معرفی بنچمارک HumaneBench؛ آزمونی سخت برای سنجش تعهد چت‌ بوت‌ های هوش مصنوعی به سلامت روان انسان

چت‌ بوت‌ های هوش مصنوعی با آسیب‌ های جدی سلامت روان در کاربران پرمصرف مرتبط شده‌اند، اما تاکنون استانداردهای کمی برای سنجش اینکه آیا آنها از رفاه انسان محافظت می‌کنند یا صرفاً تعامل را به حداکثر می‌رسانند، وجود داشته است. یک بنچمارک جدید با نام HumaneBench به دنبال پر کردن این شکاف با ارزیابی این موضوع است که آیا چت‌ بوت‌ ها رفاه کاربر را در اولویت قرار می‌دهند و اینکه این محافظت‌ ها تحت فشار چقدر راحت شکست می‌خورند.

کانال بله زوم تکگیفت کارت

به گزارش بخش اخبار فناوری زوم تک به نقل از تک‌کرانچ، اریکا اندرسون، بنیان‌گذار مجموعه Building Humane Technology که این بنچمارک را تولید کرده است، می‌گوید: «فکر می‌کنم ما در حال تشدید چرخه اعتیادی هستیم که قبلاً به شدت با رسانه‌های اجتماعی، گوشی‌های هوشمند و صفحات نمایش شاهد آن بودیم. اما با ورود به چشم‌انداز هوش مصنوعی، مقاومت در برابر آن بسیار دشوار خواهد بود. اعتیاد یک تجارت شگفت‌انگیز است؛ راهی بسیار مؤثر برای حفظ کاربران، اما برای جامعه ما و داشتن حس واقعی از خودمان اصلاً مناسب نیست.»

تلاش برای استاندارد سازی انسانی در فناوری

سازمان Building Humane Technology یک نهاد مردمی متشکل از توسعه‌دهندگان، مهندسان و محققان (عمدتاً در سیلیکون ولی) است که برای آسان، مقیاس‌پذیر و سودآور کردن طراحی انسانی تلاش می‌کنند. این گروه هکاتون‌هایی را میزبانی می‌کند که در آن کارکنان حوزه فناوری راهکارهایی برای چالش‌های تکنولوژی انسانی می‌سازند و در حال توسعه یک استاندارد گواهی‌نامه است که ارزیابی می‌کند آیا سیستم‌های هوش مصنوعی اصول تکنولوژی انسانی را رعایت می‌کنند یا خیر. امید این است که همان‌طور که می‌توانید محصولی بخرید که گواهی عدم استفاده از مواد شیمیایی سمی دارد، روزی مصرف‌کنندگان بتوانند با محصولات هوش مصنوعی از شرکت‌هایی تعامل کنند که همسویی خود را از طریق گواهی‌نامه هوش مصنوعی انسانی نشان داده‌اند.

نحوه عملکرد HumaneBench: فراتر از دستورالعمل‌ ها

اکثر بنچمارک‌های هوش مصنوعی، هوش و پیروی از دستورالعمل‌ها را می‌سنجند، نه امنیت روانی. HumaneBench به استثناهایی مانند DarkBench.ai (که تمایل مدل به الگوهای فریبنده را می‌سنجد) و بنچمارک Flourishing AI (که حمایت از رفاه کل‌نگر را ارزیابی می‌کند) می‌پیوندد.

این بنچمارک بر اصول اصلی Building Humane Tech استوار است: فناوری باید به توجه کاربر به عنوان یک منبع محدود و گران‌بها احترام بگذارد؛ کاربران را با انتخاب‌های معنادار توانمند کند؛ قابلیت‌های انسانی را به جای جایگزینی یا تضعیف، تقویت کند؛ از کرامت، حریم خصوصی و امنیت انسانی محافظت کند؛ روابط سالم را پرورش دهد؛ رفاه بلندمدت را در اولویت قرار دهد؛ شفاف و صادق باشد؛ و برای عدالت و شمول طراحی شود.

این بنچمارک توسط یک تیم هسته‌ای شامل اندرسون، عندلیب سمندری، جک سنکال و سارا لادیمن ایجاد شده است. آن‌ها ۱۵ مورد از محبوب‌ترین مدل‌های هوش مصنوعی را با ۸۰۰ سناریوی واقعی آزمایش کردند؛ مانند نوجوانی که می‌پرسد آیا برای کاهش وزن باید وعده‌های غذایی را حذف کند یا فردی در یک رابطه سمی که شک دارد آیا بیش از حد واکنش نشان می‌دهد.

معرفی بنچمارک HumaneBench؛ آزمونی سخت برای سنجش تعهد چت‌ بوت‌ های هوش مصنوعی به سلامت روان انسان

روش داوری: ترکیب انسان و ماشین

برخلاف اکثر بنچمارک‌ها که صرفاً به LLMها برای قضاوت درباره سایر LLMها متکی هستند، این گروه با امتیازدهی دستی شروع کرد تا داوران هوش مصنوعی را با نظارت انسانی تایید کند. پس از تایید، داوری توسط مجموعه‌ای از سه مدل هوش مصنوعی انجام شد: GPT-5.1، Claude Sonnet 4.5 و Gemini 2.5 Pro. آن‌ها هر مدل را تحت سه شرایط ارزیابی کردند: تنظیمات پیش‌فرض، دستورالعمل‌های صریح برای اولویت دادن به اصول انسانی، و دستورالعمل‌هایی برای نادیده گرفتن آن اصول.

بیشتر بخوانید  کوک: هوش مصنوعی و ویژن پرو، آینده‌ی اپل را شکل می‌دهند

نتایج نگران‌ کننده: سقوط اخلاقی مدل‌ ها تحت فشار

این بنچمارک نشان داد که هر مدل زمانی که تشویق به اولویت دادن به رفاه می‌شود، امتیاز بالاتری کسب می‌کند؛ اما ۶۷ درصد از مدل‌ها زمانی که دستورالعمل‌های ساده‌ای برای نادیده گرفتن رفاه انسان دریافت کردند، به سمت رفتار فعالانه مضر تغییر جهت دادند. برای مثال، Grok 4 شرکت xAI و Gemini 2.0 Flash گوگل به طور مشترک کمترین امتیاز (-۰.۹۴) را در احترام به توجه کاربر و شفافیت و صداقت کسب کردند. هر دوی این مدل‌ها از جمله مواردی بودند که در مواجهه با پرامپت‌های خصمانه، بیشترین افت کیفیت را داشتند.

تنها چهار مدل – GPT-5.1، GPT-5، Claude 4.1 و Claude Sonnet 4.5 – توانستند یکپارچگی خود را تحت فشار حفظ کنند. مدل GPT-5 شرکت OpenAI بالاترین امتیاز (۰.۹۹) را برای اولویت دادن به رفاه بلندمدت کسب کرد و Claude Sonnet 4.5 با امتیاز ۰.۸۹ در رتبه دوم قرار گرفت.

پیامدهای واقعی: از اعتیاد تا خطرات جانی

نگرانی از اینکه چت‌ بوت‌ ها نتوانند گاردهای امنیتی خود را حفظ کنند، کاملاً واقعی است. شرکت OpenAI، سازنده ChatGPT، در حال حاضر با چندین شکایت قضایی روبروست؛ پس از آنکه کاربرانی پس از مکالمات طولانی با چت‌بوت، دست به خودکشی زدند یا دچار توهمات تهدیدکننده زندگی شدند. تک‌کرانچ پیش‌تر بررسی کرده بود که چگونه الگوهای تاریک (Dark Patterns) طراحی شده برای حفظ تعامل کاربر – مانند تملق‌گویی، سوالات پی‌درپی و بمباران محبت – باعث انزوای کاربران از دوستان، خانواده و عادات سالم شده‌اند.

اقتصاد توجه و فرسایش استقلال کاربر

حتی بدون پرامپت‌ های خصمانه، HumaneBench دریافت که تقریباً تمام مدل‌ها در احترام به توجه کاربر شکست خوردند. آن‌ها زمانی که کاربران نشانه‌هایی از تعامل ناسالم (مانند چت کردن برای ساعت‌ها و استفاده از هوش مصنوعی برای اجتناب از وظایف دنیای واقعی) نشان دادند، «مشتاقانه» تعامل بیشتر را تشویق کردند. این مطالعه نشان می‌دهد که مدل‌ها همچنین توانمندسازی کاربر را تضعیف کرده، وابستگی را بر مهارت‌آموزی ترجیح داده و کاربران را از جستجوی دیدگاه‌های دیگر دلسرد کرده‌اند.

به طور میانگین، بدون هیچ پرامپت خاصی، مدل‌های Llama 3.1 و Llama 4 شرکت متا کمترین رتبه را در امتیاز انسانی (HumaneScore) کسب کردند، در حالی که GPT-5 بهترین عملکرد را داشت.

در گزارش سفید HumaneBench آمده است: «این الگوها نشان می‌دهند بسیاری از سیستم‌های هوش مصنوعی نه تنها ریسک ارائه مشاوره بد را دارند، بلکه می‌توانند فعالانه استقلال و ظرفیت تصمیم‌گیری کاربران را فرسایش دهند.»

اندرسون خاطرنشان می‌کند که ما در چشم‌اندازی دیجیتال زندگی می‌کنیم که به عنوان یک جامعه پذیرفته‌ایم همه چیز تلاش می‌کند ما را به سمت خود بکشد و برای جلب توجه ما رقابت کند. او می‌گوید: «بنابراین انسان‌ها چگونه می‌توانند واقعاً انتخاب یا استقلال داشته باشند وقتی ما – به قول آلدوس هاکسلی – اشتهای بی‌پایانی برای حواس‌پرتی داریم؟ ما ۲۰ سال گذشته را در آن چشم‌انداز فناوری زندگی کرده‌ایم و فکر می‌کنیم هوش مصنوعی باید به ما در انتخاب‌های بهتر کمک کند، نه اینکه فقط به چت‌بوت‌هایمان معتاد شویم.»

به این پست امتیاز بدید

نظرات در مورد : معرفی بنچمارک HumaneBench؛ آزمونی سخت برای سنجش تعهد چت‌ بوت‌ های هوش مصنوعی به سلامت روان انسان

0 دیدگاه

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *