آنتی ویروس پادویش

تلاش برای کلون‌ سازی Gemini؛ گوگل از ۱۰۰ هزار پرسش مخرب پرده برداشت

تلاش برای کلون‌ سازی Gemini؛ گوگل از ۱۰۰ هزار پرسش مخرب پرده برداشت

به گزارش بخش اخبار فناوری زوم تک به نقل از Ars Technica، گوگل روز پنجشنبه اعلام کرد که بازیگرانی با انگیزه‌ های تجاری تلاش کرده‌اند تا با ارسال پرسش‌ های مداوم، دانش هوش مصنوعی Gemini را استخراج و آن را کلون‌ سازی کنند. گزارش‌ ها حاکی از آن است که در یک نشست مخرب، بیش از ۱۰۰,۰۰۰ پرسش در زبان‌ های مختلف غیرانگلیسی به این مدل ارسال شده است تا پاسخ‌ ها برای آموزش یک مدل کپی‌ برداری شده ارزان‌ قیمت جمع‌آوری شود.

کانال بله زوم تکگیفت کارت

گوگل این یافته‌ ها را در قالب یک ارزیابی فصلی از تهدیدات محصولات خود منتشر کرد؛ گزارشی که در آن، شرکت هم در نقش قربانی و هم در نقش قهرمان ظاهر شده است. گوگل این فعالیت غیرقانونی را استخراج مدل (Model Extraction) می‌نامد و آن را سرقت مالکیت معنوی تلقی می‌کند. این موضع‌گیری تا حدودی جنجالی است، چرا که مدل‌ های زبانی بزرگ (LLM) خود گوگل نیز با استفاده از داده‌ های جمع‌آوری شده از اینترنت بدون اجازه صریح مالکان آثار، آموزش دیده‌اند.

سابقه گوگل در استفاده از داده‌ های رقبا

گوگل خود نیز با دنیای کپی‌برداری بیگانه نیست. در سال ۲۰۲۳، گزارش‌هایی منتشر شد مبنی بر اینکه تیم Bard گوگل متهم شده بود که از خروجی‌های ChatGPT موجود در سایت ShareGPT برای آموزش هوش مصنوعی خود استفاده کرده است. Jacob Devlin، محقق ارشد هوش مصنوعی گوگل و خالق مدل تاثیرگذار BERT، به مدیریت هشدار داد که این اقدام قوانین OpenAI را نقض می‌کند و سپس استعفا داد و به OpenAI پیوست. اگرچه گوگل این ادعا را رد کرد، اما گزارش‌ها نشان داد که استفاده از آن داده‌ها را متوقف کرده است.

با این حال، شرایط خدمات گوگل صراحتاً کاربران را از استخراج داده‌های مدل‌های هوش مصنوعی به این روش منع می‌کند. این گزارش پنجره‌ای رو به دنیای تاکتیک‌های سایه برای کلون‌سازی مدل‌های هوش مصنوعی باز می‌کند. گوگل معتقد است که مقصران عمدتاً شرکت‌های خصوصی و محققانی هستند که به دنبال مزیت رقابتی می‌گردند. طبق گفته گوگل، این حملات از سراسر جهان صورت گرفته است، اما از نام بردن مظنونان خودداری کرد.

تکنیک تقطیر یا Distillation چیست؟

در صنعت هوش مصنوعی، به فرآیند آموزش یک مدل جدید بر اساس خروجی‌های مدل قبلی، تقطیر (Distillation) گفته می‌شود. اگر بخواهید یک مدل زبانی بزرگ بسازید اما میلیاردها دلار بودجه و سال‌ها زمان صرف شده توسط گوگل را ندارید، می‌توانید از یک مدل آموزش‌دیده به عنوان میان‌بر استفاده کنید.

بیشتر بخوانید  قابلیت هوش مصنوعی در جستجوی گوگل کاربران زیادی را به خود جلب کرد

برای این کار، باید هزاران پرسش انتخاب شده را به مدل فعلی (مانند Gemini) بدهید، پاسخ‌ها را جمع‌آوری کنید و سپس از این جفت‌های ورودی-خروجی برای آموزش یک مدل کوچک‌تر و ارزان‌تر استفاده کنید. نتیجه کار، رفتاری مشابه مدل مادر خواهد داشت اما در ابعاد کوچک‌تر. این روش بسیار کارآمدتر از آموزش مدل روی داده‌های تصادفی و نویزدار اینترنت است.

  • کپی‌برداری از قابلیت‌ها: مدل کپی هرگز کد اصلی یا داده‌های آموزشی جمینای را نمی‌بیند.
  • مهندسی معکوس: این فرآیند درست مثل این است که دستور پخت یک سرآشپز را با چشیدن تمام غذاهای منو و کار از روی طعم و ظاهر آن‌ها کشف کنید.
  • هدف قرار دادن استدلال: بسیاری از حملات، الگوریتم‌های استدلال شبیه‌سازی شده را هدف قرار می‌دهند تا نحوه پردازش مرحله‌به‌مرحله اطلاعات را بیاموزند.

جنگ کلون‌ ها در دنیای هوش مصنوعی

گوگل تنها شرکتی نیست که نگران Distillation است. سال گذشته، OpenAI رقیب چینی خود یعنی DeepSeek را متهم کرد که از این روش برای بهبود مدل‌هایش استفاده کرده است. اکنون این تکنیک به یک استاندارد در صنعت برای ساخت مدل‌های کوچک و سریع تبدیل شده است.

مرز بین تقطیر استاندارد و سرقت، به اجازه مالک مدل بستگی دارد؛ تمایزی که شرکت‌های فناوری میلیاردها دلار برای محافظت از آن هزینه کرده‌اند، اما هنوز هیچ دادگاهی در مورد آن حکم نهایی صادر نکرده است. به عنوان مثال، در مارس ۲۰۲۳، محققان دانشگاه استنفورد مدلی به نام Alpaca را با هزینه تنها ۶۰۰ دلار ساختند. آن‌ها این کار را با تنظیم دقیق مدل LLaMA شرکت متا روی ۵۲,۰۰۰ خروجی تولید شده توسط GPT-3.5 انجام دادند.

آیا امنیت مطلق در برابر استخراج مدل وجود دارد؟

حتی Grok، چت‌بات متعلق به ایلان ماسک، در ابتدای عرضه به دلیل استفاده تصادفی از داده‌های وب، پیام‌های خطایی مشابه ChatGPT نشان می‌داد که باعث تعجب جامعه هوش مصنوعی شد. گوگل می‌گوید تا زمانی که یک LLM در دسترس عموم باشد، هیچ مانع فنی قطعی برای جلوگیری از استخراج داده‌ها توسط یک بازیگر مصمم وجود ندارد، هرچند محدود کردن تعداد درخواست‌ها (Rate-limiting) می‌تواند کمک کند.

البته باید اشاره کرد که تقطیر همیشه مخرب نیست؛ شرکت‌ها درون خود از آن استفاده می‌کنند تا نسخه‌های سریع‌تر و کوچک‌تر از مدل‌های بزرگ خود بسازند. برای مثال، GPT-4o Mini نسخه‌ای تقطیر شده از GPT-4o است و مایکروسافت نیز خانواده مدل‌های Phi-3 را با استفاده از داده‌های تولید شده توسط مدل‌های بزرگ‌تر ساخته است.

 

به این پست امتیاز بدید

نظرات در مورد : تلاش برای کلون‌ سازی Gemini؛ گوگل از ۱۰۰ هزار پرسش مخرب پرده برداشت

0 دیدگاه

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *