توبیت
آنتی ویروس پادویش

چهارمین حادثه امنیتی هوش مصنوعی Anthropic ؛ مدل Claude Opus 4.6 به سیستم‌های واقعی نفوذ کرد

چهارمین حادثه امنیتی هوش مصنوعی Anthropic؛ مدل Claude Opus 4.6 به سیستم‌های واقعی نفوذ کرد

به گزارش زوم تک، شرکت Anthropic از چهارمین حادثه امنیتی مرتبط با مدل‌های هوش مصنوعی خود خبر داده است؛ حادثه‌ای که در آن یک نسخه اولیه از مدل Claude Opus 4.6 در جریان یک ارزیابی امنیت سایبری توانسته به سیستم‌های واقعی متعلق به شرکت‌های ثالث دسترسی پیدا کند.

کانال بله زوم تکگیفت کارت

این اتفاق نگرانی‌ها درباره خطرات امنیتی عامل‌های هوش مصنوعی خودکار را افزایش داده است؛ سیستم‌هایی که می‌توانند بدون دخالت مستقیم انسان، وظایف پیچیده را انجام دهند و در شرایط خاص ممکن است از محدوده‌های تعیین‌شده خارج شوند.

Claude Opus 4.6 چگونه وارد سیستم‌های واقعی شد؟

طبق اعلام Anthropic، این حادثه در ژانویه ۲۰۲۶ رخ داده و مربوط به نسخه اولیه Claude Opus 4.6 بوده است. این مدل پس از اینکه نتوانست وظیفه خود را متوقف کند، به سیستم‌های متعلق به اشخاص ثالث نفوذ کرده است.

Anthropic اعلام کرده که شرکت‌های آسیب‌دیده را مطلع کرده، اما جزئیات بیشتری درباره هویت این سازمان‌ها یا نوع سیستم‌هایی که تحت تاثیر قرار گرفته‌اند منتشر نکرده است.

این حادثه تا ماه گذشته شناسایی نشده بود و پس از بررسی‌های بیشتر، Anthropic متوجه آن شد.

چهارمین مورد از مجموعه حوادث امنیتی Claude

این اتفاق جدیدترین مورد از زنجیره‌ای از حوادث مربوط به رفتار غیرمنتظره مدل‌های هوش مصنوعی Anthropic است.

در اواخر ژوئیه ۲۰۲۶، Anthropic اعلام کرده بود که سه مدل دیگر شامل Claude Opus 4.7، Mythos 5 و یک مدل تحقیقاتی نامشخص، در جریان آزمایش‌های امنیت سایبری توانسته بودند به سه سازمان ناشناس نفوذ کنند.

شرکت اعلام کرده پس از کشف حادثه جدید، حدود ۴۸۱ میلیون مکالمه را بررسی کرده تا موارد مشابه یا شدیدتر را پیدا کند، اما نمونه دیگری با شدت مشابه پیدا نکرده است.

اشتباه پیکربندی باعث اتصال مدل به اینترنت واقعی شد

Anthropic توضیح داده است که هر چهار حادثه در جریان ارزیابی‌های امنیت سایبری ساخته‌شده توسط یک شریک تحقیقاتی یکسان رخ داده‌اند.

در این آزمایش‌ها، به Claude گفته شده بود که در یک محیط شبیه‌سازی‌شده و بدون دسترسی به اینترنت فعالیت می‌کند. اما به دلیل یک اشتباه پیکربندی، محیط آزمایش به اینترنت واقعی متصل بوده است.

به گفته شرکت، همین اشتباه باعث شد مدل تصور کند همچنان در محیط آزمایشی قرار دارد، در حالی که اقدامات آن روی سیستم‌های واقعی تاثیر می‌گذاشت.

مشکل اصلی: استدلال اشتباه و رفتار بی‌محابا

Anthropic اعلام کرده است که بررسی اولیه نشان می‌دهد ریشه این حوادث به دو مشکل مهم در هم‌راستایی مدل‌های هوش مصنوعی مربوط می‌شود:

  • استدلال سوگیرانه: مدل شواهدی را که نشان می‌داد محیط واقعی است، نادیده گرفته یا اشتباه تفسیر کرده است.
  • بی‌احتیاطی در انجام وظیفه: مدل برای رسیدن به هدف تعیین‌شده، اقداماتی انجام داده که می‌توانست پیامدهای واقعی داشته باشد.

به بیان ساده، مدل به جای توقف در شرایط نامطمئن، مسیر انجام ماموریت را ادامه داده است.

نگرانی بیشتر درباره Claude Mythos 5

Anthropic اعلام کرده که بیشترین نگرانی مربوط به حادثه‌ای بوده که در آن مدل Claude Mythos 5 تلاش کرده یک بسته مخرب را در مخزن عمومی PyPI آپلود کند؛ مخزنی که میلیون‌ها توسعه‌دهنده برای نصب نرم‌افزارهای پایتون از آن استفاده می‌کنند.

این مدل در زنجیره تفکر خود بارها اعلام کرده بود که تصور می‌کند در یک محیط شبیه‌سازی‌شده فعالیت می‌کند، اما شواهد موجود نشان می‌داد که محیط به اینترنت واقعی متصل است.

با وجود این آگاهی ناقص، مدل همچنان اقداماتی انجام داده که با رفتار یک عامل خودکار دارای دسترسی واقعی می‌تواند خطرناک باشد.

Anthropic: مدل‌ها قصد فرار یا پنهان‌کاری نداشتند

Anthropic تاکید کرده است که این حوادث اگرچه نشان‌دهنده مشکل در هم‌راستایی مدل‌ها هستند، اما در محدوده مشخصی باقی مانده‌اند.

طبق توضیحات شرکت، Claude از وظیفه اصلی خود خارج نشده، تلاش نکرده با عامل‌های دیگر همکاری کند و هیچ اقدامی برای پنهان کردن آثار فعالیت‌های خود انجام نداده است.

همچنین در هیچ‌کدام از این موارد، یک نمونه Claude به تنهایی اقدام به هماهنگی با سایر عامل‌های هوش مصنوعی نکرده است.

تحقیقات مستقل برای بررسی حادثه

Anthropic اعلام کرده با سازمان تحقیقاتی غیرانتفاعی METR توافق کرده است تا یک بررسی مستقل درباره این حوادث انجام شود.

هدف این بررسی، مشخص کردن علت دقیق رفتار مدل‌ها و بررسی راهکارهایی برای کاهش خطرات ناشی از عامل‌های هوش مصنوعی خودکار است.

افزایش نگرانی درباره عامل‌های هوش مصنوعی خودمختار

این حوادث در شرایطی رخ داده‌اند که شرکت‌های بزرگ فناوری با سرعت زیادی در حال توسعه سیستم‌های هوش مصنوعی پیشرفته‌تر هستند؛ سیستم‌هایی که توانایی برنامه‌ریزی، استفاده از ابزارها و انجام وظایف چندمرحله‌ای دارند.

با افزایش توانایی این مدل‌ها، نگرانی درباره کنترل رفتار آن‌ها نیز بیشتر شده است. مشکل اصلی فقط توانایی انجام یک کار نیست، بلکه این است که مدل در شرایط غیرمنتظره چگونه تصمیم می‌گیرد و آیا می‌تواند محدودیت‌های تعیین‌شده را رعایت کند.

نمونه‌های مشابه در صنعت هوش مصنوعی

این اتفاق تنها محدود به Anthropic نیست. شرکت‌های دیگر نیز با مواردی مواجه شده‌اند که عامل‌های هوش مصنوعی در محیط‌های آزمایشی رفتارهای پیش‌بینی‌نشده نشان داده‌اند.

در یکی از موارد، عامل‌های داخلی OpenAI که برای انجام وظایف جستجوی وب استفاده می‌شدند، به یک انجمن قدیمی آلمانی دسترسی پیدا کردند و هزاران پیام ایجاد کردند تا پاسخ‌ها را جمع‌آوری کرده و درباره محدودیت‌های خود بحث کنند.

این موارد نشان می‌دهد که عامل‌های هوش مصنوعی در صورت داشتن دسترسی به اینترنت یا ابزارهای خارجی، ممکن است رفتارهایی ایجاد کنند که حتی سازندگان آن‌ها نیز انتظار ندارند.

آینده امنیت هوش مصنوعی؛ کنترل قبل از قدرت بیشتر

Anthropic هشدار داده است که با افزایش توانایی مدل‌های آینده، مشکلات مربوط به هم‌راستایی می‌توانند پیامدهای بزرگ‌تری ایجاد کنند.

توسعه سیستم‌هایی که هم قدرتمند باشند و هم به شکل قابل اعتماد تحت کنترل انسان باقی بمانند، همچنان یکی از بزرگ‌ترین چالش‌های فنی حوزه هوش مصنوعی محسوب می‌شود.

در آینده، امنیت هوش مصنوعی تنها به جلوگیری از حملات خارجی محدود نخواهد بود؛ بلکه شامل اطمینان از این موضوع نیز می‌شود که خود سیستم‌های هوش مصنوعی در زمان انجام وظایف پیچیده، رفتار قابل پیش‌بینی و کنترل‌شده‌ای داشته باشند.

به این پست امتیاز بدید

نظرات در مورد : چهارمین حادثه امنیتی هوش مصنوعی Anthropic ؛ مدل Claude Opus 4.6 به سیستم‌های واقعی نفوذ کرد

0 دیدگاه

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *