توبیت
آنتی ویروس پادویش

چگونه اپل مدل های هوش مصنوعی جدید خود را آموزش داد: 4 نکته جذاب از گزارش فنی

چگونه اپل مدل های هوش مصنوعی جدید خود را آموزش داد: 4 نکته جذاب از گزارش فنی

اپل در کنفرانس WWDC25 از مدل های بنیادی جدید هوش مصنوعی خود رونمایی کرد و حالا در یک گزارش فنی جامع، جزئیات جذابی از نحوه آموزش، بهینه سازی و ارزیابی این مدل ها را منتشر کرده است. این گزارش نشان می دهد که اپل چگونه توانسته است با نوآوری های معماری، مدل های هوش مصنوعی قدرتمند خود را هم روی دستگاه و هم در فضای ابری، با تمرکز ویژه بر حریم خصوصی و عملکرد چند زبانه، توسعه دهد. در ادامه، چهار نکته برجسته و کنجکاوانه از این گزارش را با هم بررسی خواهیم کرد.

کانال بله زوم تکگیفت کارت

به گزارش بخش اخبار فناوری زوم تک از 9to5Mac، اپل پس از معرفی نسخه های جدید مدل های بنیادی هوش مصنوعی خود (هم روی دستگاه و هم مبتنی بر فضای ابری) در کنفرانس WWDC25، اکنون یک گزارش فنی مفصل با عنوان “مدل های زبانی بنیادی هوش اپل – گزارش فنی 2025” منتشر کرده است. این سند جامع، جزئیات ارزشمندی را در مورد معماری، منابع داده، پیش آموزش، پس آموزش، توسعه استفاده از ابزارها، بهینه سازی ها و معیارهای ارزیابی این مدل ها ارائه می دهد. این گزارش برای علاقه مندان به جزئیات فنی حوزه هوش مصنوعی، بسیار خواندنی و پربار است. در ادامه، به چهار نکته برجسته و قابل توجه از این گزارش می پردازیم.

مدل محلی در دو بلوک جداگانه

قبلا می دانستیم که مدل هوش مصنوعی روی دستگاه اپل (مدلی که توسعه دهندگان می توانند از آن استفاده کنند) حدود 3 میلیارد پارامتر دارد. حالا، اپل جزئیات بیشتری ارائه کرده و توضیح داده که این مدل در واقع به دو بلوک تقسیم شده است:

“بلوک 1 شامل 62.5% از کل لایه های ترنسفورمر است، در حالی که بلوک 2 شامل 37.5% باقیمانده از لایه های ترنسفورمر است، اما طرح بندی های کلید و مقدار از آن حذف شده اند.”

در عمل، این تقسیم بندی به این معنی است که مدل محلی 37.5% حافظه کمتری برای کش (caching) نیاز دارد و زمان لازم برای تولید اولین توکن (که اساسا تکه ای از یک کلمه است) نیز حدود 37.5% کاهش یافته است. با این حال، اپل ساختار این تقسیم بندی را به گونه ای طراحی کرده است که ادعا می کند عملکرد کلی مدل و کیفیت خروجی آن حفظ می شود. این رویکرد، در حالی که در نهایت مسیر متفاوتی را نسبت به ایده اولیه اپل در مورد مبادله بخش هایی از LLM بین رم و حافظه فلش برای جا دادن مدل های بزرگتر در حافظه دستگاه انتخاب کرده است، نشان دهنده تلاش های خلاقانه این شرکت برای ارائه عملکرد بالا حتی در دستگاه هایی با حافظه محدود است.

معماری خلاقانه مدل مبتنی بر فضای ابری

برای مدل سرور خود، اپل یک معماری سفارشی ایجاد کرده است که به طور خاص برای پلتفرم “محاسبات ابری خصوصی” (Private Cloud Compute) آن طراحی شده است. این معماری “ترکیب متخصصان ردیف موازی” (Parallel-Track Mixture-of-Experts – PT-MoE) نام دارد و نحوه عملکرد آن بسیار جالب است.

به طور خلاصه (و با خطر ساده سازی بیش از حد)، “ترکیب متخصصان” (Mixture of Experts) زمانی است که به جای تکیه بر یک مدل هوش مصنوعی عظیم، مدل به زیرشبکه های کوچکتر (یا متخصصان) تقسیم می شود که تنها زمانی فعال می شوند که وظیفه مربوط به حوزه تخصص آنها باشد. بنابراین، اگر درخواست شما در مورد آشپزی باشد، تنها متخصصان مربوط به آشپزی فعال می شوند، در حالی که بقیه غیرفعال می مانند. نتیجه همچنان یک مدل کلی عظیم است، اما طراحی ماژولار آن به آن اجازه می دهد تا سریع تر (و اغلب دقیق تر) پاسخ دهد تا اینکه همه چیز از طریق مدل عظیم و یکپارچه برای هر درخواست اجرا شود.

اپل نوع جدیدی از ترنسفورمر به نام “ترنسفورمر ردیف موازی” (Parallel Track Transformer) را ساخته و سپس آن را با لایه های “ترکیب متخصصان” (MoE) مقیاس بندی کرده است. این موضوع بسیار پیچیده به نظر می رسد، اما نکته اصلی این است: ترنسفورمرهای سنتی توکن ها را از طریق یک پشته لایه ای منفرد و پشت سر هم پردازش می کنند. اما به جای استفاده از این رویکرد تک ردیفی برای محاسبه هر توکن، طراحی اپل مدل را به چندین ردیف موازی تقسیم می کند. هر ردیف توکن ها را به طور مستقل پردازش می کند و تنها در نقاط خاصی همگام سازی می شود.

سپس، در داخل هر یک از این ردیف ها، اپل هر لایه ترنسفورمر معمولی را با یک لایه MoE جایگزین کرده است که تنها چند متخصص را برای هر توکن فعال می کند، در حالی که بقیه غیرفعال می مانند. و از آنجایی که هر ردیف متخصصان محلی خود را دارد، مدل از گلوگاه های پردازشی که هنگام نیاز به هماهنگی همه چیز در کل سیستم رخ می دهد، جلوگیری می کند. با افزودن یک تنظیمات هوشمندانه که تعادل بین درک محلی و درک کلی را برقرار می کند (که “لایه های توجه جهانی و محلی درهم تنیده” نامیده می شود)، نتیجه یک مدل بسیار ماژولار، کارآمد و مقیاس پذیر است که سریع تر و سبک تر است، اما همچنان بسیار هوشمندانه عمل می کند.

بیشتر بخوانید  نوآوری چشمگیر اپل در آیفون تاشو: نمایشگری بدون چین‌خوردگی، انقلابی در راه است

افزایش 275 درصدی نمایش چند زبانه

یکی از بزرگترین انتقادات به عرضه اولیه هوش اپل، پشتیبانی محدود از زبان ها فراتر از انگلیسی بود (و هنوز هم هست). با مدل های جدید خود، اپل پشتیبانی از زبان را گسترش داده است، و این سند گام هایی را که برای انجام این کار برداشته است، تشریح می کند.

طبق این سند، اپل میزان داده های چند زبانه مورد استفاده در طول آموزش را از 8% به 30% افزایش داده است. این شامل هر دو محتوای ارگانیک و مصنوعی می شود. اپل همچنین اندازه توکنایزر خود (که اساسا واژگان توکن مدل است) را 50% افزایش داده است. این به این معنی است که مدل آن اکنون 150 هزار توکن مختلف را می شناسد، در حالی که قبلا 100 هزار توکن بود.

این شرکت می گوید که این تغییرات منجر به “افزایش قابل توجهی” در عملکرد در معیارهای غیرانگلیسی شده است، به خصوص پس از تنظیم دقیق با یادگیری تقویتی. در این سند، اپل توضیح می دهد که ارزیابی ها با استفاده از درخواست های نوشته شده توسط سخنوران بومی (به جای ترجمه ها) انجام شده است و مدل هم از نظر دقت و هم از نظر طبیعی بودن پاسخ های آن در زمینه های محلی آزمایش شده است. در عمل، همه اینها به این معنی است که ویژگی هایی مانند “ابزارهای نوشتاری” باید در زبان های پشتیبانی شده با قابلیت اطمینان بیشتری کار کنند.

اپل داده های خود را از کجا تامین می کند؟

همانند مدل های اولیه خود، بیشتر داده های آموزشی از خزش در وب به دست آمده است. اما اپل می گوید که خزنده Applebot آن به “robots.txt” احترام می گذارد، به این معنی که اگر یک وب سایت نخواهد اپل محتوای آن را خراش دهد، می تواند این را اعلام کند، و Applebot آن را نادیده خواهد گرفت. با این حال، اپل می گوید که داده ها را برای مدل های جدید خود از منابع زیر تامین کرده است:

  • داده های وب در دسترس عموم: اگرچه اپل مقادیر یا نسبت ها را مشخص نمی کند، اما می گوید که بزرگترین بخش داده های آموزشی آن از خزش Applebot در صفحات وب به دست آمده است. اپل چندین لایه فیلتر برای حذف محتوای با کیفیت پایین، ناامن یا نامربوط، از جمله صفحات اسپم، متن های سطحی یا قالب بندی شده، و قالب بندی های خراب، اعمال کرده است.
  • داده های دارای مجوز: اپل در اینجا جزئیات زیادی ارائه نمی دهد، اما تایید می کند که برخی از داده های آموزشی از ناشران مجوز گرفته شده است. گزارش های قبلی نشان داده بودند که اپل با Condé Nast (The New Yorker, Vogue, Wired و غیره)، NBC News و IAC (People Magazine, The Daily Beast و Better Homes and Gardens و غیره) در حال مذاکره بوده است، بنابراین احتمالا حداقل بخشی از این مواد در آن گنجانده شده است.
  • داده های مصنوعی: اپل داده های مصنوعی را با استفاده از مدل های کوچکتر و خطوط لوله سفارشی، به ویژه برای ریاضی، کد، تنظیم دستورالعمل و وظایف دید-زبان تولید کرده است. در حالی که این شرکت مشخص نمی کند که این داده ها چه مقدار از مجموعه داده را تشکیل می دهند، اما اشاره می کند که داده های مصنوعی نقش بزرگی در مراحل کلیدی آموزش مانند تنظیم دقیق، یادگیری تقویتی و بهبود پشتیبانی چند زبانه ایفا کرده اند.
  • داده های بصری: برای پشتیبانی از درک تصویر، اپل بیش از 10 میلیارد جفت تصویر-زیرنویس، از جمله اسکرین شات ها با OCR و یادداشت های دست نویس را جمع آوری کرده است. همچنین از مدل های خود برای تولید زیرنویس های اضافی و غنی تر استفاده کرده است. در گذشته گزارش شده بود که اپل با Shutterstock در مورد مجوز صحبت کرده است، بنابراین ممکن است برخی از آن مواد نیز در آن گنجانده شده باشند.

نگاه 9to5Mac

اخبار زیادی در مورد “درامای داخلی” اپل، چالش های فنی و ناتوانی کلی آن در کسب شتاب لازم برای پر کردن شکاف (که برخی آن را دره می نامند) بین پیشنهادات هوش مصنوعی خود و رقبا وجود داشته است. همه اینها درست است. با این حال، این واقعیت که اپل عمدتا عقب تر از هوش مصنوعی تلقی می شود به این معنی نیست که این شرکت ثابت مانده است. این گزارش بینش جالبی را در مورد بهبودهای زیرساختی (و کاستی ها) مدل های جدید اپل، همراه با جزئیات گسترده در مورد رویکردی که many companies are even attempting. بسیاری از شرکت ها حتی تلاش نمی کنند، ارائه می دهد. اپل با تمرکز بر حفظ حریم خصوصی، رویکردی متفاوت را در پیش گرفته است که در دنیای هوش مصنوعی کنونی کمتر دیده می شود.

 

به این پست امتیاز بدید

نظرات در مورد : چگونه اپل مدل های هوش مصنوعی جدید خود را آموزش داد: 4 نکته جذاب از گزارش فنی

0 دیدگاه

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *