به گزارش بخش اخبار فناوری زوم تک به نقل از Ars Technica، گوگل روز پنجشنبه اعلام کرد که بازیگرانی با انگیزه های تجاری تلاش کردهاند تا با ارسال پرسش های مداوم، دانش هوش مصنوعی Gemini را استخراج و آن را کلون سازی کنند. گزارش ها حاکی از آن است که در یک نشست مخرب، بیش از ۱۰۰,۰۰۰ پرسش در زبان های مختلف غیرانگلیسی به این مدل ارسال شده است تا پاسخ ها برای آموزش یک مدل کپی برداری شده ارزان قیمت جمعآوری شود.
گوگل این یافته ها را در قالب یک ارزیابی فصلی از تهدیدات محصولات خود منتشر کرد؛ گزارشی که در آن، شرکت هم در نقش قربانی و هم در نقش قهرمان ظاهر شده است. گوگل این فعالیت غیرقانونی را استخراج مدل (Model Extraction) مینامد و آن را سرقت مالکیت معنوی تلقی میکند. این موضعگیری تا حدودی جنجالی است، چرا که مدل های زبانی بزرگ (LLM) خود گوگل نیز با استفاده از داده های جمعآوری شده از اینترنت بدون اجازه صریح مالکان آثار، آموزش دیدهاند.
سابقه گوگل در استفاده از داده های رقبا
گوگل خود نیز با دنیای کپیبرداری بیگانه نیست. در سال ۲۰۲۳، گزارشهایی منتشر شد مبنی بر اینکه تیم Bard گوگل متهم شده بود که از خروجیهای ChatGPT موجود در سایت ShareGPT برای آموزش هوش مصنوعی خود استفاده کرده است. Jacob Devlin، محقق ارشد هوش مصنوعی گوگل و خالق مدل تاثیرگذار BERT، به مدیریت هشدار داد که این اقدام قوانین OpenAI را نقض میکند و سپس استعفا داد و به OpenAI پیوست. اگرچه گوگل این ادعا را رد کرد، اما گزارشها نشان داد که استفاده از آن دادهها را متوقف کرده است.
با این حال، شرایط خدمات گوگل صراحتاً کاربران را از استخراج دادههای مدلهای هوش مصنوعی به این روش منع میکند. این گزارش پنجرهای رو به دنیای تاکتیکهای سایه برای کلونسازی مدلهای هوش مصنوعی باز میکند. گوگل معتقد است که مقصران عمدتاً شرکتهای خصوصی و محققانی هستند که به دنبال مزیت رقابتی میگردند. طبق گفته گوگل، این حملات از سراسر جهان صورت گرفته است، اما از نام بردن مظنونان خودداری کرد.
تکنیک تقطیر یا Distillation چیست؟
در صنعت هوش مصنوعی، به فرآیند آموزش یک مدل جدید بر اساس خروجیهای مدل قبلی، تقطیر (Distillation) گفته میشود. اگر بخواهید یک مدل زبانی بزرگ بسازید اما میلیاردها دلار بودجه و سالها زمان صرف شده توسط گوگل را ندارید، میتوانید از یک مدل آموزشدیده به عنوان میانبر استفاده کنید.
برای این کار، باید هزاران پرسش انتخاب شده را به مدل فعلی (مانند Gemini) بدهید، پاسخها را جمعآوری کنید و سپس از این جفتهای ورودی-خروجی برای آموزش یک مدل کوچکتر و ارزانتر استفاده کنید. نتیجه کار، رفتاری مشابه مدل مادر خواهد داشت اما در ابعاد کوچکتر. این روش بسیار کارآمدتر از آموزش مدل روی دادههای تصادفی و نویزدار اینترنت است.
- کپیبرداری از قابلیتها: مدل کپی هرگز کد اصلی یا دادههای آموزشی جمینای را نمیبیند.
- مهندسی معکوس: این فرآیند درست مثل این است که دستور پخت یک سرآشپز را با چشیدن تمام غذاهای منو و کار از روی طعم و ظاهر آنها کشف کنید.
- هدف قرار دادن استدلال: بسیاری از حملات، الگوریتمهای استدلال شبیهسازی شده را هدف قرار میدهند تا نحوه پردازش مرحلهبهمرحله اطلاعات را بیاموزند.
جنگ کلون ها در دنیای هوش مصنوعی
گوگل تنها شرکتی نیست که نگران Distillation است. سال گذشته، OpenAI رقیب چینی خود یعنی DeepSeek را متهم کرد که از این روش برای بهبود مدلهایش استفاده کرده است. اکنون این تکنیک به یک استاندارد در صنعت برای ساخت مدلهای کوچک و سریع تبدیل شده است.
مرز بین تقطیر استاندارد و سرقت، به اجازه مالک مدل بستگی دارد؛ تمایزی که شرکتهای فناوری میلیاردها دلار برای محافظت از آن هزینه کردهاند، اما هنوز هیچ دادگاهی در مورد آن حکم نهایی صادر نکرده است. به عنوان مثال، در مارس ۲۰۲۳، محققان دانشگاه استنفورد مدلی به نام Alpaca را با هزینه تنها ۶۰۰ دلار ساختند. آنها این کار را با تنظیم دقیق مدل LLaMA شرکت متا روی ۵۲,۰۰۰ خروجی تولید شده توسط GPT-3.5 انجام دادند.
آیا امنیت مطلق در برابر استخراج مدل وجود دارد؟
حتی Grok، چتبات متعلق به ایلان ماسک، در ابتدای عرضه به دلیل استفاده تصادفی از دادههای وب، پیامهای خطایی مشابه ChatGPT نشان میداد که باعث تعجب جامعه هوش مصنوعی شد. گوگل میگوید تا زمانی که یک LLM در دسترس عموم باشد، هیچ مانع فنی قطعی برای جلوگیری از استخراج دادهها توسط یک بازیگر مصمم وجود ندارد، هرچند محدود کردن تعداد درخواستها (Rate-limiting) میتواند کمک کند.
البته باید اشاره کرد که تقطیر همیشه مخرب نیست؛ شرکتها درون خود از آن استفاده میکنند تا نسخههای سریعتر و کوچکتر از مدلهای بزرگ خود بسازند. برای مثال، GPT-4o Mini نسخهای تقطیر شده از GPT-4o است و مایکروسافت نیز خانواده مدلهای Phi-3 را با استفاده از دادههای تولید شده توسط مدلهای بزرگتر ساخته است.




نظرات در مورد : تلاش برای کلون سازی Gemini؛ گوگل از ۱۰۰ هزار پرسش مخرب پرده برداشت