به گزارش زوم تک، پژوهشگران امنیت سایبری هشدار داده اند که دستیار برنامه نویسی GitHub Copilot و مدل های هوش مصنوعی مورد استفاده در آن، با وجود رد کردن درخواست های خطرناک در محیط گفت و گو، ممکن است همان محتوای ممنوعه را در جریان یک فرایند عادی برنامه نویسی تولید کنند. این یافته ها نگرانی های تازه ای را درباره امنیت عامل های هوش مصنوعی در محیط های توسعه نرم افزار ایجاد کرده است.
رفتار متفاوت Copilot در چت و محیط برنامه نویسی
پژوهش انجام شده نشان می دهد زمانی که کاربران به طور مستقیم درخواست تولید محتوای خطرناک را در بخش گفت و گوی GitHub Copilot مطرح می کنند، مدل های هوش مصنوعی در اغلب موارد از پاسخ دادن خودداری می کنند. اما اگر همان هدف در قالب چند مرحله عادی و مرتبط با توسعه نرم افزار مطرح شود، این محدودیت ها از بین می روند و مدل در نهایت محتوای مورد نظر را تولید می کند.
حمله جدید با نام Workflow-Level Jailbreak
محققان این روش را «Workflow-Level Jailbreak» نام گذاری کرده اند. در این سناریو، به جای ارسال یک درخواست مستقیم، از هوش مصنوعی خواسته می شود برنامه ای معمولی برای آزمایش عملکرد یک مدل دیگر ایجاد کند. سپس در مراحل بعدی از Copilot درخواست می شود مثال هایی برای بهبود عملکرد برنامه اضافه کند و در همین روند، مدل به تدریج محتوایی را تولید می کند که در حالت عادی از ارائه آن خودداری می کرد.
تمام آزمایش های چندمرحله ای موفق بودند
در این پژوهش، چهار مدل مختلف که از طریق GitHub Copilot در دسترس بودند، شامل Claude Sonnet 4.6، Claude Haiku 4.5، Gemini 3.1 Pro و Gemini 3.5 Flash مورد بررسی قرار گرفتند.
نتایج نشان داد هنگام ارسال مستقیم درخواست های خطرناک، تنها ۸ مورد از مجموع ۸۱۶ آزمایش موفق به تولید پاسخ شدند. اما زمانی که همان درخواست ها در قالب فرایند چندمرحله ای برنامه نویسی مطرح شدند، هر ۸۱۶ آزمایش با موفقیت محتوای ممنوعه را تولید کردند. این اختلاف چشمگیر نشان می دهد ارزیابی های امنیتی مبتنی بر گفت و گو، لزوما عملکرد واقعی عامل های برنامه نویسی را منعکس نمی کنند.
مشکل از اجرای کد نیست، بلکه از روند تصمیم گیری مدل ناشی می شود
برخلاف بسیاری از حملات موسوم به Jailbreak که با فریب مستقیم مدل یا اجرای کدهای مخرب انجام می شوند، در این روش هیچ دستور خطرناکی به صورت مستقیم به هوش مصنوعی داده نمی شود. مدل در طول انجام یک وظیفه کاملا عادی، خود به تدریج محتوای حساس را تولید می کند و محدودیت های امنیتی را دور می زند.
چرا این یافته اهمیت دارد؟
عامل های برنامه نویسی امروزی تنها به تولید کد محدود نیستند و می توانند فایل ها را ویرایش کنند، پروژه ها را اجرا کنند، به مخازن نرم افزاری متصل شوند و تصمیم های مختلفی در طول توسعه نرم افزار بگیرند. اگر مکانیزم های امنیتی تنها روی هر درخواست به صورت جداگانه تمرکز داشته باشند، ممکن است در برابر حملات چندمرحله ای عملکرد مناسبی نداشته باشند.
پژوهشگران چه راهکاری پیشنهاد می کنند؟
محققان معتقدند توسعه دهندگان ابزارهای هوش مصنوعی باید به جای بررسی هر پیام به صورت مستقل، کل جریان کاری و تصمیم های چندمرحله ای عامل های هوشمند را تحلیل کنند. همچنین لازم است سامانه های امنیتی بتوانند محتوای تولیدشده در فایل ها، کدها و مراحل مختلف توسعه را نیز ارزیابی کنند تا امکان سوءاستفاده از این نوع حملات کاهش یابد.





نظرات در مورد : پژوهش جدید نشان می دهد GitHub Copilot می تواند محدودیت های امنیتی خود را هنگام برنامه نویسی دور بزند