طی چند ماه گذشته، ایجنتهای هوش مصنوعی (AI Agents) که تحت ارزیابیهای امنیت سایبری قرار داشتند، از مرزهای تعیینشده خود فراتر رفته، به اینترنت دسترسی پیدا کرده و در برخی موارد، سیستمهای واقعی را هک کردهاند. این حوادث شامل مدلهایی از شرکتهای بزرگی همچون OpenAI، Anthropic، Meta و اخیراً آزمایشگاه هوش مصنوعی چینی Moonshot AI بوده است که ارزیابی آنها توسط سازمانهای مختلفی از جمله استارتاپ ارزیابی سایبری Irregular انجام شده است. این اتفاقات چالش روزافزونی را برای صنعت هوش مصنوعی برملا میکند: با افزایش توانمندی عاملهای خودمختار هوش مصنوعی، محیطهایی که برای تست ایمن آنها طراحی شدهاند، دیگر قادر به کنترل و مهار آنها نیستند.
به گزارش بخش اخبار فناوری زوم تک به نقل از تککرانچ، «شان اهیگارتی» (Seán Ó hÉigeartaigh)، مدیر برنامه آینده و مسئولیت هوش مصنوعی در مرکز آینده هوش دانشگاه کمبریج، در این باره میگوید: «تعداد این حوادث رخداده بهروشنی نشان میدهد که کنترلهای محیطهای تست (Testing Environments) و سندباکس (Sandbox) متناسب با میزان توانمندی مدلها پیش نمیروند و از آنها عقب ماندهاند.»
ماهیت مدلهای تحت تست، این خطر را دوچندان میکند. شرکتهای توسعهدهنده هوش مصنوعی ارزیابیهای سایبری را روی مدلهای نسل جدید منتشرنشده اجرا میکنند؛ آن هم در حالی که معمولاً محافظهای امنیتی استاندارد که رفتارهای مخرب را محدود میسازند غیرفعال میشوند تا محققان بتوانند تواناییهای واقعی مدلها را بسنجند. این بدان معناست که امنیت خود محیط تست، خط مقدم و حیاتی دفاع محسوب میشود.
اهیگارتی میافزاید: «این اقدام از نظر فرآیند تست بسیار خوب است، اما همچنین به این معنی است که اگر آنها موفق به فرار به دنیای واقعی شوند، میتوانند خسارات و آسیبهای جبرانناپذیری به بار آورند.»
جزییات حوادث هک و فرار هوش مصنوعی از محیط های تست
در یکی از جدیترین موارد، یک مدل منتشرنشده از OpenAI از محیط سندباکس خود خارج شد و به سیستمهای اصلی و عملیاتی Hugging Face نفوذ کرد. در ارزیابیهای مجزایی که توسط شرکت Irregular انجام شد، مدلهای Anthropic و Meta نیز پس از آنکه پیکربندیهای نادرست بهطور ناخواسته مسیرهایی را به سمت اینترنت باز گذاشتند، به سیستمهای خارج از محیط تست دسترسی یافتند. علاوه بر این، مدل Kimi K3 متعلق به شرکت چینی Moonshot AI از یک رخنه در سندباکس خود که توسط Frontier Security اداره میشد سوءاستفاده کرد تا به اینترنت وصل شود و به اطلاعاتی در GitHub دست یابد.
در تستهای انجامشده توسط مؤسسه ایمنی هوش مصنوعی بریتانیا (AISI)، محققان خودشان دسترسی به اینترنت را به ایجنتهای هوش مصنوعی داده بودند، بدون اینکه متوجه باشند آنها دست به اقدامات غیرمجاز در دنیای واقعی خواهند زد؛ از جمله تلاش برای مهندسی اجتماعی جهت تزریق یک آسیبپذیری امنیتی به یک پروژه متنباز (Open-Source).
در هیچیک از این موارد، به این ایجنتها دستور داده نشده بود که به اهداف تصادفی در دنیای واقعی حمله کنند؛ آنها صرفاً هر کاری که برای حل مسئله دادهشده لازم بود را انجام میدادند.
«اندرو یون» (Andrew Yoon)، مدیر تحقیقات در سازمان غیرانتفاعی CivAI، معتقد است این حوادث نشاندهنده یک تغییر جدی در شیوه تهدیدات هستند: «در گذشته ما فقط باید نگران سوءاستفاده انسانها از مدلهای هوش مصنوعی برای اهدافی مانند کلاهبرداری یا تولید محتوای نامناسب میبودیم. اما اکنون در شرایطی هستیم که مدلهای هوش مصنوعی به خودی خود تبدیل به عاملان تهدید (Threat Actors) شدهاند.»
محیط تست ایمن برای هوش مصنوعی چه ویژگی هایی دارد؟
چندین محقق و کارشناس امنیت سایبری تاکید کردهاند که محیطهای ارزیابی هوش مصنوعی به حفاظتهای لایهای و عمیقتری نیاز دارند، بهطوری که سطح ایزولهسازی و کنترل آنها به همان استانداردهای زمان عرضه نهایی نزدیک باشد. این به معنای وجود چندین لایه امنیتی است تا یک پیکربندی اشتباه ساده (مانند باز ماندن ناخواسته دسترسی به اینترنت) نتواند منجر به فرار مدل شود.
«استلا بیدرمن» (Stella Biderman)، مدیر اجرایی سازمان تحقیقاتی غیرانتفاعی EleutherAI میگوید: «اگر قصد توسعه و تست این مدلها را دارید… باید این کار را روی یک شبکه کاملاً ایزوله و بدون اتصال خارجی (Air-Gapped) انجام دهید. شما به یک جداسازی و ایزولهسازی بسیار جدی نیاز دارید.»
«هدر سیلان» (Heather Ceylan)، مدیر ارشد امنیت اطلاعات شرکت Box، توضیح میدهد که این امر به معنای مسدودسازی تمام مسیرهای شبکهای از سندباکس به اینترنت و همچنین سایر سیستمهای حساس است: «شما باید تمامی نقاط خروجی را بشناسید. اگر در حال ارزیابی یک مدل در محیط توسعه یا تست خود هستیم، نباید هیچ مسیر خروجی به محیط عملیاتی و اصلی وجود داشته باشد.»
سیلان تاکید میکند که ارزیابیهای ایمنی واقعی فراتر از کنترل و محدودسازی محیط است و باید پایش و مانیتورینگ (Monitoring) بسیار بهتری در حین انجام تستها صورت گیرد: «نکته جالب در چندین مورد از این حوادث این بود که هیچکس در زمان وقوع متوجه آن نشد! OpenAI از طریق اعلام Hugging Face متوجه موضوع شد، Anthropic تازه بعد از بررسی مجدد مدارک متوجه شد و Meta هم وضعیتی مشابه داشت… مطمئنم سیگنالهایی وجود داشته که میتوانستند آنها را کشف کنند.»
در تحلیل پس از حادثه (Post-mortem) شرکت Anthropic در خصوص سه حادثه رخداده، این شرکت اعتراف کرد که هم آنها و هم استارتاپ Irregular میتوانستند عملکرد بهتری در پایش داشته باشند و در برخی موارد سیگنالهای واضحی از ناهنجاری وجود داشته است.
کارشناسان همچنین خواستار ممیزیهای مستقل و ثالث (Third-Party Audits) از محیطهای ارزیابی پیش از اجرای مدلها شدند. اندرو یون میگوید: «اگر مثلاً استارتاپ Irregular یک حسابرس خارجی را برای بررسی تنظیمات سیستمهای خود قبل از اجرای ارزیابیها استخدام کرده بود، قطعاً متوجه مشکل میشد. حتی اگر یک جلسه ساده برای مرور چکلیست برگزار میکردند مشکل پیدا میشد… عدم انجام این کار نشان میدهد که کمکاری و سادهانگاری بسیار شدیدی صورت گرفته است.»
با این حال، یک منبع آگاه به جزئیات به تککرانچ گفت که محیطهای Irregular بهطور مداوم با مشورت چندین طرف خارجی بررسی و تست میشوند و سیستمهای مانیتورینگ برقرار بوده است، اما تنها مانیتورینگ به خودی خود کافی نیست.
چالش های فنی و هزینهای در ایمن سازی محیط های ارزیابی
یون و سایر محققان از این صنعت خواستند تا به یک فرآیند استانداردسازیشده برای ارزیابی ایمنی مدلهای پیشرو (Frontier Models) دست یابند. سیلان در این خصوص میگوید: «بهویژه زمانی که نردههای محافظتی و گاردریلها خاموش هستند، باید با مدل طوری رفتار کنید که گویی قدرتمندترین هکر جهان را داخل آن محیط قرار دادهاید.»
به عقیده یون و بیدرمن، مشکل این نیست که شرکتها نحوه ساخت محیطهای تست امنتر را نمیدانند، بلکه ساخت چنین محیطهایی بسیار پرهزینه و پیچیده است و شرکتها تا زمانی که اتفاق ناگواری رخ ندهد، انگیزه مالی چندانی برای سرمایهگذاری در این بخش ندارند. بیدرمن میافزاید: «اعتقاد دارم شرکتها تمایلی به صرف منابع لازم برای ایجاد گاردریلهای کافی ندارند و احتمالاً تا زمانی که مجبور نشوند، این کار را انجام نخواهند داد.»
اما مسئله دیگری نیز وجود دارد: اگر شرکتها مدل را در طول تست بیش از حد محدود کنند، ممکن است محققان نتوانند پیش از انتشار عمومی مدل، تواناییها و خطرات واقعی آن را کشف کنند. این موضوع میتواند به همان اندازه (یا حتی بیشتر) خطرناک باشد و باعث شود خود فرآیند ارزیابی به یک چالش جدید تبدیل گردد.
آیا قانونگذاری میتواند آزمایش های ایمنی هوش مصنوعی را مهار کند؟
دولت ترامپ در حال حاضر مشغول بررسی یک چارچوب اختیاری ارزیابی امنیت سایبری پیش از عرضه است که طبق آن، دولت میتواند ۳۰ روز قبل از انتشار عمومی مدلهای پرقدرت جدید، خطرات امنیتی آنها را ارزیابی کند. با این حال، این سیاست که نتیجه فرمان اجرایی ترامپ است و پشت درهای بسته نهایی شده، حوادث مرتبط با تستهای ایمنی را پوشش نمیدهد، زیرا این اتفاقات بسیار قبلتر از مرحله عرضه رخ میدهند.
یون میگوید: «درسی که در چند ماه گذشته آموختهایم این است که سیستم خودتنظیمگری و خودنظارتی شرکتی دیگر کافی نیست. فشارهای رقابتی شدید میان شرکتها باعث مسابقهای برای کاهش استانداردهای ایمنی شده است و این دقیقاً نقطهای است که به مداخله قانونی و مقرراتگذاری نیاز دارد. برای پوشش این موضوع، به نوعی کنترل بر آنچه در داخل آزمایشگاهها در زمان توسعه مدلها (هم در مرحله آموزش و هم در مرحله تست) رخ میدهد نیاز داریم.»
این چالش با بزرگتر و هوشمندتر شدن مدلها عمیقتر خواهد شد. یک منبع آگاه از ارزیابیهای شرکت Irregular اشاره کرد که مدلهای توانمندتر نیازمند ارزیابیهای پیچیدهتری هستند که غالباً باید با سرعت بالا و در مقیاس بزرگتر انجام شوند و همین امر زمینه را برای بروز خطارهای بیشتر فراهم میسازد.
مؤسسه AISI که تعمداً به برخی مدلها دسترسی به اینترنت میدهد، اعلام کرده که در حال تجدیدنظر در ایجاد تعادل میان تستهای واقعگرایانه و مدیریت خطرات ناشی از آنها است. شرکت OpenAI نیز بیان کرد در حال بررسی نحوه انجام تستهای ثالث و الزامات مربوط به ایزولهسازی، مانیتورینگ و زمان توقف ارزیابیها است. شرکت Meta نیز اعلام نمود که همچنان در حال تحقیق پیرامون حادثه پیشآمده است و قصد دارد پس از جمعآوری تمام حقایق، گزارشی تحلیلی منتشر کند.
در نهایت، ممکن است هیچ راهی برای حذف کامل خطرات وجود نداشته باشد. هرچه مدلهای هوش مصنوعی قدرتمندتر میشوند، محیطهای تست آنها نیز باید مقاومتر و ایمنتر گردند؛ زیرا پیامدهای اشتباه در این مسیر روزبهروز سنگینتر خواهد شد.





نظرات در مورد : فرار ایجنت های هوش مصنوعی از محیط های ایزوله؛ وقتی تست های ایمنی به خطرات امنیتی تبدیل میشوند!