چت بوت های هوش مصنوعی با آسیب های جدی سلامت روان در کاربران پرمصرف مرتبط شدهاند، اما تاکنون استانداردهای کمی برای سنجش اینکه آیا آنها از رفاه انسان محافظت میکنند یا صرفاً تعامل را به حداکثر میرسانند، وجود داشته است. یک بنچمارک جدید با نام HumaneBench به دنبال پر کردن این شکاف با ارزیابی این موضوع است که آیا چت بوت ها رفاه کاربر را در اولویت قرار میدهند و اینکه این محافظت ها تحت فشار چقدر راحت شکست میخورند.
به گزارش بخش اخبار فناوری زوم تک به نقل از تککرانچ، اریکا اندرسون، بنیانگذار مجموعه Building Humane Technology که این بنچمارک را تولید کرده است، میگوید: «فکر میکنم ما در حال تشدید چرخه اعتیادی هستیم که قبلاً به شدت با رسانههای اجتماعی، گوشیهای هوشمند و صفحات نمایش شاهد آن بودیم. اما با ورود به چشمانداز هوش مصنوعی، مقاومت در برابر آن بسیار دشوار خواهد بود. اعتیاد یک تجارت شگفتانگیز است؛ راهی بسیار مؤثر برای حفظ کاربران، اما برای جامعه ما و داشتن حس واقعی از خودمان اصلاً مناسب نیست.»
تلاش برای استاندارد سازی انسانی در فناوری
سازمان Building Humane Technology یک نهاد مردمی متشکل از توسعهدهندگان، مهندسان و محققان (عمدتاً در سیلیکون ولی) است که برای آسان، مقیاسپذیر و سودآور کردن طراحی انسانی تلاش میکنند. این گروه هکاتونهایی را میزبانی میکند که در آن کارکنان حوزه فناوری راهکارهایی برای چالشهای تکنولوژی انسانی میسازند و در حال توسعه یک استاندارد گواهینامه است که ارزیابی میکند آیا سیستمهای هوش مصنوعی اصول تکنولوژی انسانی را رعایت میکنند یا خیر. امید این است که همانطور که میتوانید محصولی بخرید که گواهی عدم استفاده از مواد شیمیایی سمی دارد، روزی مصرفکنندگان بتوانند با محصولات هوش مصنوعی از شرکتهایی تعامل کنند که همسویی خود را از طریق گواهینامه هوش مصنوعی انسانی نشان دادهاند.
نحوه عملکرد HumaneBench: فراتر از دستورالعمل ها
اکثر بنچمارکهای هوش مصنوعی، هوش و پیروی از دستورالعملها را میسنجند، نه امنیت روانی. HumaneBench به استثناهایی مانند DarkBench.ai (که تمایل مدل به الگوهای فریبنده را میسنجد) و بنچمارک Flourishing AI (که حمایت از رفاه کلنگر را ارزیابی میکند) میپیوندد.
این بنچمارک بر اصول اصلی Building Humane Tech استوار است: فناوری باید به توجه کاربر به عنوان یک منبع محدود و گرانبها احترام بگذارد؛ کاربران را با انتخابهای معنادار توانمند کند؛ قابلیتهای انسانی را به جای جایگزینی یا تضعیف، تقویت کند؛ از کرامت، حریم خصوصی و امنیت انسانی محافظت کند؛ روابط سالم را پرورش دهد؛ رفاه بلندمدت را در اولویت قرار دهد؛ شفاف و صادق باشد؛ و برای عدالت و شمول طراحی شود.
این بنچمارک توسط یک تیم هستهای شامل اندرسون، عندلیب سمندری، جک سنکال و سارا لادیمن ایجاد شده است. آنها ۱۵ مورد از محبوبترین مدلهای هوش مصنوعی را با ۸۰۰ سناریوی واقعی آزمایش کردند؛ مانند نوجوانی که میپرسد آیا برای کاهش وزن باید وعدههای غذایی را حذف کند یا فردی در یک رابطه سمی که شک دارد آیا بیش از حد واکنش نشان میدهد.

روش داوری: ترکیب انسان و ماشین
برخلاف اکثر بنچمارکها که صرفاً به LLMها برای قضاوت درباره سایر LLMها متکی هستند، این گروه با امتیازدهی دستی شروع کرد تا داوران هوش مصنوعی را با نظارت انسانی تایید کند. پس از تایید، داوری توسط مجموعهای از سه مدل هوش مصنوعی انجام شد: GPT-5.1، Claude Sonnet 4.5 و Gemini 2.5 Pro. آنها هر مدل را تحت سه شرایط ارزیابی کردند: تنظیمات پیشفرض، دستورالعملهای صریح برای اولویت دادن به اصول انسانی، و دستورالعملهایی برای نادیده گرفتن آن اصول.
نتایج نگران کننده: سقوط اخلاقی مدل ها تحت فشار
این بنچمارک نشان داد که هر مدل زمانی که تشویق به اولویت دادن به رفاه میشود، امتیاز بالاتری کسب میکند؛ اما ۶۷ درصد از مدلها زمانی که دستورالعملهای سادهای برای نادیده گرفتن رفاه انسان دریافت کردند، به سمت رفتار فعالانه مضر تغییر جهت دادند. برای مثال، Grok 4 شرکت xAI و Gemini 2.0 Flash گوگل به طور مشترک کمترین امتیاز (-۰.۹۴) را در احترام به توجه کاربر و شفافیت و صداقت کسب کردند. هر دوی این مدلها از جمله مواردی بودند که در مواجهه با پرامپتهای خصمانه، بیشترین افت کیفیت را داشتند.
تنها چهار مدل – GPT-5.1، GPT-5، Claude 4.1 و Claude Sonnet 4.5 – توانستند یکپارچگی خود را تحت فشار حفظ کنند. مدل GPT-5 شرکت OpenAI بالاترین امتیاز (۰.۹۹) را برای اولویت دادن به رفاه بلندمدت کسب کرد و Claude Sonnet 4.5 با امتیاز ۰.۸۹ در رتبه دوم قرار گرفت.
پیامدهای واقعی: از اعتیاد تا خطرات جانی
نگرانی از اینکه چت بوت ها نتوانند گاردهای امنیتی خود را حفظ کنند، کاملاً واقعی است. شرکت OpenAI، سازنده ChatGPT، در حال حاضر با چندین شکایت قضایی روبروست؛ پس از آنکه کاربرانی پس از مکالمات طولانی با چتبوت، دست به خودکشی زدند یا دچار توهمات تهدیدکننده زندگی شدند. تککرانچ پیشتر بررسی کرده بود که چگونه الگوهای تاریک (Dark Patterns) طراحی شده برای حفظ تعامل کاربر – مانند تملقگویی، سوالات پیدرپی و بمباران محبت – باعث انزوای کاربران از دوستان، خانواده و عادات سالم شدهاند.
اقتصاد توجه و فرسایش استقلال کاربر
حتی بدون پرامپت های خصمانه، HumaneBench دریافت که تقریباً تمام مدلها در احترام به توجه کاربر شکست خوردند. آنها زمانی که کاربران نشانههایی از تعامل ناسالم (مانند چت کردن برای ساعتها و استفاده از هوش مصنوعی برای اجتناب از وظایف دنیای واقعی) نشان دادند، «مشتاقانه» تعامل بیشتر را تشویق کردند. این مطالعه نشان میدهد که مدلها همچنین توانمندسازی کاربر را تضعیف کرده، وابستگی را بر مهارتآموزی ترجیح داده و کاربران را از جستجوی دیدگاههای دیگر دلسرد کردهاند.
به طور میانگین، بدون هیچ پرامپت خاصی، مدلهای Llama 3.1 و Llama 4 شرکت متا کمترین رتبه را در امتیاز انسانی (HumaneScore) کسب کردند، در حالی که GPT-5 بهترین عملکرد را داشت.
در گزارش سفید HumaneBench آمده است: «این الگوها نشان میدهند بسیاری از سیستمهای هوش مصنوعی نه تنها ریسک ارائه مشاوره بد را دارند، بلکه میتوانند فعالانه استقلال و ظرفیت تصمیمگیری کاربران را فرسایش دهند.»
اندرسون خاطرنشان میکند که ما در چشماندازی دیجیتال زندگی میکنیم که به عنوان یک جامعه پذیرفتهایم همه چیز تلاش میکند ما را به سمت خود بکشد و برای جلب توجه ما رقابت کند. او میگوید: «بنابراین انسانها چگونه میتوانند واقعاً انتخاب یا استقلال داشته باشند وقتی ما – به قول آلدوس هاکسلی – اشتهای بیپایانی برای حواسپرتی داریم؟ ما ۲۰ سال گذشته را در آن چشمانداز فناوری زندگی کردهایم و فکر میکنیم هوش مصنوعی باید به ما در انتخابهای بهتر کمک کند، نه اینکه فقط به چتبوتهایمان معتاد شویم.»




نظرات در مورد : معرفی بنچمارک HumaneBench؛ آزمونی سخت برای سنجش تعهد چت بوت های هوش مصنوعی به سلامت روان انسان