توبیت
آنتی ویروس پادویش

چرا پیشرفت NPU در گوشی‌ ها باعث بهبود چشمگیر هوش مصنوعی نمی‌شود؟ بررسی چالش‌ های کوچک‌ سازی AI

چرا پیشرفت NPU در گوشی‌ ها باعث بهبود چشمگیر هوش مصنوعی نمی‌شود؟ بررسی چالش‌ های کوچک‌ سازی AI

تقریباً هر نوآوری تکنولوژیکی در سال‌های اخیر بر یک چیز متمرکز بوده است: هوش مصنوعی مولد (Generative AI). بسیاری از این سیستم‌ های به ظاهر انقلابی بر روی سرورهای بزرگ و گران‌ قیمت در مراکز داده اجرا می‌شوند، اما هم‌ زمان، سازندگان تراشه مدام از قدرت واحدهای پردازش عصبی (NPU) که به دستگاه‌ های مصرف‌کننده آورده‌اند، دم می‌ زنند. هر چند ماه یک‌ بار، داستان تکرار می‌شود: این NPU جدید ۳۰ یا ۴۰ درصد سریع‌ تر از قبلی است. قرار است این پیشرفت به شما اجازه دهد کار مهمی انجام دهید، اما هیچ‌ کس واقعاً توضیح نمی‌ دهد آن کار چیست.

کانال بله زوم تکگیفت کارت

به گزارش بخش اخبار فناوری زوم تک به نقل از (Ars Technica)، کارشناسان آینده‌ای از ابزارهای هوش مصنوعی امن و شخصی را با هوش روی دستگاه (On-device) پیش‌بینی می‌کنند، اما آیا این با واقعیت رونق فعلی AI مطابقت دارد؟ هوش مصنوعی در «لبه» (Edge) عالی به نظر می‌رسد، اما تقریباً هر ابزار مهم هوش مصنوعی در حال حاضر در فضای ابری (Cloud) اجرا می‌شود. پس آن تراشه داخل گوشی شما دقیقاً چه کاری انجام می‌دهد؟

NPU چیست و چه نقشی دارد؟

شرکت‌هایی که محصول جدیدی را عرضه می‌کنند، اغلب غرق در کلمات اغراق‌آمیز و اصطلاحات مبهم بازاریابی می‌شوند و در توضیح جزئیات فنی ضعیف عمل می‌کنند. برای اکثر افرادی که گوشی می‌خرند روشن نیست که چرا برای اجرای بارهای کاری AI به سخت‌افزار نیاز دارند و مزایای ادعایی تا حد زیادی تئوریک باقی مانده است.

بسیاری از پردازنده‌های پرچمدار امروزی، سیستم روی چیپ (SoC) هستند زیرا چندین عنصر محاسباتی مانند هسته‌های CPU، پردازنده‌های گرافیکی (GPU) و کنترل‌کننده‌های تصویر را روی یک قطعه سیلیکون ادغام می‌کنند. این موضوع در مورد قطعات موبایل مانند Snapdragon کوالکام یا Tensor گوگل و همچنین قطعات کامپیوتر مانند Intel Core Ultra صدق می‌کند.

واحد NPU افزونه جدیدتری به تراشه‌ها است، اما یک‌شبه ظاهر نشده است؛ تبار و پیشینه‌ای وجود دارد که ما را به اینجا رسانده است. NPUها در کار خود خوب هستند زیرا بر محاسبات موازی تأکید دارند، چیزی که در سایر اجزای SoC نیز مهم است.

تکامل از DSP به NPU

کوالکام (Qualcomm) زمان قابل توجهی را در طول معرفی محصولات جدید خود به صحبت در مورد NPUهای Hexagon اختصاص می‌دهد. ناظران تیزبین ممکن است به یاد داشته باشند که این نام تجاری از خط تولید پردازنده‌های سیگنال دیجیتال (DSP) این شرکت مجدداً استفاده شده است و دلیل خوبی هم برای آن وجود دارد.

وینش سوکومار، رئیس محصولات هوش مصنوعی کوالکام، می‌گوید: «سفر ما به پردازش هوش مصنوعی احتمالاً ۱۵ یا ۲۰ سال پیش آغاز شد، جایی که اولین نقطه اتکای ما نگاه به پردازش سیگنال بود.» DSPها معماری مشابهی با NPUها دارند، اما بسیار ساده‌تر هستند و بر پردازش صدا (مانند تشخیص گفتار) و سیگنال‌های مودم تمرکز دارند.

با توسعه مجموعه فناوری‌هایی که ما به عنوان «هوش مصنوعی» می‌شناسیم، مهندسان شروع به استفاده از DSP برای انواع بیشتری از پردازش موازی کردند، مانند حافظه کوتاه-مدت طولانی (LSTM). سوکومار توضیح داد که با شیفتگی صنعت به شبکه‌های عصبی کانولوشنال (CNNs) – فناوری زیربنایی برنامه‌هایی مانند بینایی کامپیوتر – DSPها بر توابع ماتریسی متمرکز شدند که برای پردازش هوش مصنوعی مولد نیز ضروری هستند.

اگرچه یک پیوند معماری در اینجا وجود دارد، اما کاملاً درست نیست که بگوییم NPUها فقط DSPهای پرزرق‌وبرق هستند. مارک اودانی، معاون مدیاتک (MediaTek)، می‌گوید: «اگر در مورد DSP در معنای عام کلمه صحبت کنید، بله، [یک NPU] یک پردازنده سیگنال دیجیتال است. اما همه چیز راه طولانی را طی کرده است و برای موازی‌سازی، نحوه کار ترنسفورمرها و نگه داشتن تعداد زیادی پارامتر برای پردازش، بسیار بهینه‌تر شده است.»

چرا پیشرفت NPU در گوشی‌ ها باعث بهبود چشمگیر هوش مصنوعی نمی‌شود؟ بررسی چالش‌ های کوچک‌ سازی AI

رقابت NPU با CPU و GPU

با وجود برجسته بودن در تراشه‌های جدید، NPUها برای اجرای بارهای کاری هوش مصنوعی در «لبه» (اصطلاحی که پردازش محلی AI را از سیستم‌های مبتنی بر ابر متمایز می‌کند) کاملاً ضروری نیستند. CPUها کندتر از NPUها هستند اما می‌توانند برخی از بارهای کاری سبک را بدون مصرف انرژی زیاد انجام دهند. در همین حال، GPUها اغلب می‌توانند داده‌های بیشتری را نسبت به یک NPU پردازش کنند، اما برای انجام آن انرژی بیشتری مصرف می‌کنند. و به گفته سوکومار از کوالکام، مواقعی وجود دارد که ممکن است بخواهید این کار را انجام دهید. برای مثال، اجرای بارهای کاری AI در حالی که یک بازی در حال اجرا است، می‌تواند به نفع GPU باشد.

سوکومار می‌گوید: «در اینجا، معیار موفقیت شما این است که نرخ فریم (Frame Rate) خود را کاهش ندهید و در عین حال رزولوشن فضایی و دامنه دینامیکی پیکسل را حفظ کنید و همچنین بتوانید توصیه‌های هوش مصنوعی را برای بازیکن در آن فضا ارائه دهید. در این نوع استفاده، واقعاً منطقی است که آن را در موتور گرافیکی اجرا کنید، زیرا در این صورت مجبور نیستید مدام بین گرافیک و یک موتور AI خاص دامنه مانند NPU جابجا شوید.»

زندگی در لبه (Edge) سخت است

متأسفانه، NPUها در بسیاری از دستگاه‌ها بیکار می‌مانند (و نه فقط در هنگام بازی). ترکیب ابزارهای AI محلی در مقابل ابری به نفع دومی است زیرا آنجا زیستگاه طبیعی LLMها (مدل‌های زبانی بزرگ) است. مدل‌های هوش مصنوعی بر روی سرورهای قدرتمند آموزش دیده و تنظیم دقیق می‌شوند و در همان‌جا بهترین عملکرد را دارند.

یک هوش مصنوعی مبتنی بر سرور، مانند نسخه‌های کامل Gemini و ChatGPT، مانند مدلی که روی NPU گوشی شما اجرا می‌شود، محدودیت منابع ندارد. آخرین نسخه مدل جمینای نانو (Gemini Nano) گوگل را در نظر بگیرید که دارای پنجره زمینه ۳۲ هزار توکن است. این یک پیشرفت بیش از ۲ برابری نسبت به نسخه قبلی است. با این حال، مدل‌های مبتنی بر ابر جمینای دارای پنجره‌های زمینه تا ۱ میلیون توکن هستند، به این معنی که می‌توانند حجم بسیار بزرگتری از داده‌ها را پردازش کنند.

هم سخت‌افزار مبتنی بر ابر و هم سخت‌افزار AI لبه به پیشرفت خود ادامه خواهند داد، اما تعادل ممکن است به نفع NPU تغییر نکند. شهناز زک، مدیر ارشد محصول در تیم پیکسل گوگل، می‌گوید: «ابر همیشه منابع محاسباتی بیشتری نسبت به یک دستگاه تلفن همراه خواهد داشت.»

کوچک‌ سازی مدل‌ ها و چالش پارامترها

اودانی می‌گوید: «اگر دقیق‌ترین مدل‌ها یا مدل‌های دارای قدرت خام را می‌خواهید، همه این‌ها باید در فضای ابری انجام شود. اما آنچه ما می‌یابیم این است که در بسیاری از موارد استفاده که فقط خلاصه‌سازی متن است یا شما با دستیار صوتی خود صحبت می‌کنید، بسیاری از این کارها می‌توانند در محدوده ۳ میلیارد پارامتر جای بگیرند.»

فشرده‌سازی مدل‌های هوش مصنوعی روی تلفن یا لپ‌تاپ مستلزم برخی مصالحه‌ها است – برای مثال، با کاهش پارامترهای موجود در مدل. اودانی توضیح داد که مدل‌های مبتنی بر ابر صدها میلیارد پارامتر را اجرا می‌کنند؛ وزن‌دهی که تعیین می‌کند مدل چگونه توکن‌های ورودی را پردازش کرده تا خروجی تولید کند. شما نمی‌توانید در حال حاضر چیزی شبیه به آن را روی یک دستگاه مصرف‌کننده اجرا کنید، بنابراین توسعه‌دهندگان باید اندازه مدل‌ها را برای لبه به شدت کاهش دهند. اودانی می‌گوید جدیدترین NPU نسل نهم MediaTek می‌تواند حدود ۳ میلیارد پارامتر را مدیریت کند – تفاوتی در حد چندین مرتبه بزرگی.

میزان حافظه موجود در تلفن یا لپ‌تاپ نیز یک عامل محدودکننده است، بنابراین مدل‌های AI بهینه‌شده برای موبایل معمولاً کوانتیزه (Quantized) می‌شوند. این بدان معناست که تخمین مدل از توکن بعدی با دقت کمتری اجرا می‌شود. فرض کنید می‌خواهید یکی از مدل‌های باز بزرگ‌تر، مانند Llama یا Gemma 7b را روی دستگاه خود اجرا کنید. استاندارد واقعی FP16 است که به عنوان دقت نیمه شناخته می‌شود. در آن سطح، مدلی با ۷ میلیارد پارامتر، ۱۳ یا ۱۴ گیگابایت حافظه را اشغال می‌کند. پایین آمدن به FP4 (دقت یک‌چهارم) اندازه مدل در حافظه را به چند گیگابایت می‌رساند.

سوکومار گفت: «وقتی فشرده‌سازی می‌کنید، مثلاً بین سه تا چهار گیگابایت، این یک نقطه ایده‌آل برای ادغام در فرم فکتورهای محدود از نظر حافظه مانند گوشی هوشمند است. و سرمایه‌گذاری زیادی در اکوسیستم و در کوالکام انجام شده تا راه‌های مختلف فشرده‌سازی مدل‌ها بدون از دست دادن کیفیت بررسی شود.»

بیشتر بخوانید  گلکسی اس 24 اولترا جادوی هوش مصنوعی سامسونگ معرفی شد

ایجاد یک هوش مصنوعی عمومی با این محدودیت‌ها برای دستگاه‌های تلفن همراه دشوار است، اما رایانه‌ها – و به ویژه تلفن‌های هوشمند – سرچشمه‌ای از داده‌ها هستند که می‌توانند به مدل‌ها تزریق شوند تا خروجی‌های ظاهراً مفیدی تولید کنند. به همین دلیل است که اکثر هوش مصنوعی لبه (Edge AI) به سمت موارد استفاده خاص و محدود هدایت می‌شود، مانند تجزیه و تحلیل اسکرین‌شات‌ها یا پیشنهاد قرارهای تقویم. گوگل می‌گوید جدیدترین تلفن‌های Pixel بیش از ۱۰۰ مدل هوش مصنوعی، اعم از مولد و سنتی را اجرا می‌کنند.

حتی منتقدان هوش مصنوعی هم می‌توانند تشخیص دهند که چشم‌انداز به سرعت در حال تغییر است. در زمانی که طول می‌کشد تا مدل‌های AI برای یک تلفن یا لپ‌تاپ کوچک و بهینه شوند، مدل‌های ابری جدیدی ممکن است ظاهر شوند که آن کار را منسوخ کنند. این همچنین دلیلی است که توسعه‌دهندگان شخص ثالث در استفاده از پردازش NPU در برنامه‌ها کند عمل کرده‌اند. آن‌ها یا باید به یک مدل موجود روی دستگاه متصل شوند که شامل محدودیت‌ها و اهداف توسعه سریع‌الحرکت است، یا مدل‌های سفارشی خود را مستقر کنند. هیچ‌کدام در حال حاضر گزینه عالی نیستند.

مسئله اعتماد و حریم خصوصی

اگر فضای ابری سریع‌تر و آسان‌تر است، چرا باید زحمت بهینه‌سازی برای لبه و سوزاندن انرژی بیشتر با NPU را به خود داد؟ تکیه بر فضای ابری به معنای پذیرش سطحی از وابستگی و اعتماد به افرادی است که مراکز داده AI را اداره می‌کنند و این ممکن است همیشه مناسب نباشد.

سوکومار از کوالکام گفت: «ما همیشه با حریم خصوصی کاربر به عنوان یک عنصر شروع می‌کنیم.» او توضیح داد که بهترین استنتاج ماهیت عمومی ندارد – بلکه بر اساس علایق کاربر و آنچه در زندگی او اتفاق می‌افتد شخصی‌سازی شده است. تنظیم دقیق مدل‌ها برای ارائه آن تجربه نیاز به داده‌های شخصی دارد و ذخیره و پردازش آن داده‌ها به صورت محلی ایمن‌تر است.

حتی وقتی شرکت‌ها حرف‌های درستی در مورد حریم خصوصی در خدمات ابری خود می‌زنند، این‌ها تضمین‌کننده نیستند. حس دوستانه و کمک‌کننده چت‌بات‌های عمومی نیز مردم را تشویق می‌کند تا اطلاعات شخصی زیادی را فاش کنند، و اگر آن دستیار در فضای ابری اجرا شود، داده‌های شما نیز آنجاست. دعوای کپی‌رایت OpenAI با نیویورک تایمز می‌تواند منجر به تحویل میلیون‌ها چت خصوصی به ناشر شود. رشد انفجاری و چارچوب نظارتی نامشخص هوش مصنوعی مولد، دانستن اینکه چه اتفاقی برای داده‌های شما می‌افتد را دشوار می‌کند.

اودانی گفت: «مردم از بسیاری از این دستیارهای هوش مصنوعی مولد مانند یک درمانگر استفاده می‌کنند. و شما نمی‌دانید که آیا روزی همه این چیزها در اینترنت منتشر خواهد شد یا خیر.»

قابلیت اطمینان پردازش محلی

همه نگران نیستند. زک ادعا می‌کند که گوگل «امن‌ترین زیرساخت ابری جهان» را ساخته است که به آن اجازه می‌دهد داده‌ها را در جایی پردازش کند که بهترین نتایج را ارائه می‌دهد. او از Video Boost و Pixel Studio به عنوان نمونه‌هایی از این رویکرد استفاده می‌کند و خاطرنشان می‌کند که ابر گوگل تنها راه برای سریع و باکیفیت کردن این تجربیات است. این شرکت اخیراً سیستم جدید Private AI Compute خود را معرفی کرده که ادعا می‌کند به اندازه هوش مصنوعی محلی ایمن است.

حتی اگر این درست باشد، لبه مزایای دیگری دارد – هوش مصنوعی لبه صرفاً قابل اعتمادتر از یک سرویس ابری است. اودانی گفت: «روی دستگاه سریع است. گاهی اوقات من با ChatGPT صحبت می‌کنم و وای‌فای من قطع می‌شود یا هر چیز دیگری، و وقفه‌ای ایجاد می‌شود.» سرویس‌های میزبان مدل‌های AI ابری فقط یک وب‌سایت واحد نیستند – اینترنت امروز به شدت وابسته به هم است، با شبکه‌های تحویل محتوا، ارائه‌دهندگان DNS، میزبانی و سایر خدماتی که می‌توانند در صورت بروز نقص، هوش مصنوعی مورد علاقه شما را از کار بیندازند یا ضعیف کنند. وقتی Cloudflare اخیراً دچار قطعی شد، کاربران ChatGPT با ناراحتی متوجه شدند که چت‌بات قابل اعتمادشان در دسترس نیست. ویژگی‌های هوش مصنوعی محلی این اشکال را ندارند.

سلطه کلاود در برابر واقعیت گوشی‌ ها

به نظر می‌رسد همه توافق دارند که یک رویکرد ترکیبی برای ارائه ویژگی‌های واقعاً مفید هوش مصنوعی (با فرض وجود آن‌ها) ضروری است؛ ارسال داده‌ها به خدمات ابری قدرتمندتر در صورت لزوم – گوگل، اپل و هر سازنده تلفن دیگری این کار را انجام می‌دهد. اما تلاش برای یک تجربه یکپارچه همچنین می‌تواند آنچه را که با داده‌های شما اتفاق می‌افتد پنهان کند. بیشتر اوقات، ویژگی‌های AI روی تلفن شما به روشی امن و محلی اجرا نمی‌شوند، حتی زمانی که دستگاه سخت‌افزار لازم برای انجام آن را دارد.

برای مثال، گوشی جدید OnePlus 15 را در نظر بگیرید. این تلفن دارای تراشه کاملاً جدید Snapdragon 8 Elite Gen 5 کوالکام است که دارای یک NPU است که ۳۷ درصد سریع‌تر از مدل قبلی است. حتی با تمام آن قدرت AI روی دستگاه، وان‌پلاس به شدت به فضای ابری برای تجزیه و تحلیل داده‌های شخصی شما وابسته است. ویژگی‌هایی مانند AI Writer و AI Recorder برای پردازش به سرورهای شرکت متصل می‌شوند، سیستمی که وان‌پلاس به ما اطمینان می‌دهد کاملاً امن و خصوصی است.

به طور مشابه، موتورولا در تابستان خط جدیدی از تلفن‌های تاشو Razr را عرضه کرد که پر از ویژگی‌های AI از ارائه دهندگان متعدد است. این تلفن‌ها می‌توانند اعلان‌های شما را با استفاده از هوش مصنوعی خلاصه کنند، اما اگر شرایط و ضوابط را نخوانید، ممکن است تعجب کنید که چه مقدار از آن در فضای ابری اتفاق می‌افتد. اگر مدل Razr Ultra را بخرید، آن خلاصه‌سازی روی تلفن شما انجام می‌شود. با این حال، مدل‌های ارزان‌تر با رم و قدرت NPU کمتر از خدمات ابری برای پردازش اعلان‌های شما استفاده می‌کنند.

حتی وقتی یک سازنده تجهیزات اصلی (OEM) بر استفاده از سخت‌افزار NPU تمرکز می‌کند، نتایج ممکن است ناقص باشد. به Daily Hub گوگل و Now Brief سامسونگ نگاه کنید. قرار است این ویژگی‌ها تمام داده‌های تلفن شما را بررسی کنند و توصیه‌ها و اقدامات مفیدی ایجاد کنند، اما به ندرت کاری غیر از نشان دادن رویدادهای تقویم انجام می‌دهند. در واقع، گوگل موقتاً Daily Hub را از پیکسل‌ها حذف کرده است زیرا این ویژگی کارایی کمی داشت، و گوگل پیشگام هوش مصنوعی محلی با جمینای نانو است. گوگل در ماه‌های اخیر عملاً برخی از بخش‌های تجربه هوش مصنوعی موبایل خود را از پردازش محلی به مبتنی بر ابر منتقل کرده است.

چرا پیشرفت NPU در گوشی‌ ها باعث بهبود چشمگیر هوش مصنوعی نمی‌شود؟ بررسی چالش‌ های کوچک‌ سازی AI

آینده: شاید فقط رم بیشتر بخواهیم!

علاقه زیادی به هوش مصنوعی محلی وجود دارد، اما تاکنون، این علاقه به یک انقلاب AI در جیب شما تبدیل نشده است. اکثر پیشرفت‌های هوش مصنوعی که تاکنون دیده‌ایم به مقیاس روزافزون سیستم‌های ابری و مدل‌های عمومی که در آنجا اجرا می‌شوند وابسته هستند. کارشناسان صنعت می‌گویند که کارهای گسترده‌ای در پشت صحنه برای کوچک‌سازی مدل‌های AI جهت کار بر روی تلفن‌ها و لپ‌تاپ‌ها در حال انجام است، اما زمان می‌برد تا این امر تأثیرگذار باشد.

در همین حال، پردازش AI محلی به شکلی محدود وجود دارد. گوگل هنوز از NPU تنسور برای مدیریت داده‌های حساس برای ویژگی‌هایی مانند Magic Cue استفاده می‌کند و سامسونگ واقعاً از چیپ‌ست‌های متمرکز بر AI کوالکام نهایت استفاده را می‌برد. در حالی که ابزار Now Brief کاربرد مشکوکی دارد، سامسونگ آگاه است که تکیه بر ابر چگونه ممکن است بر کاربران تأثیر بگذارد و یک دکمه تغییر وضعیت (Toggle) در تنظیمات سیستم ارائه می‌دهد که پردازش هوش مصنوعی را فقط به اجرا روی دستگاه محدود می‌کند. این کار تعداد ویژگی‌های AI موجود را محدود می‌کند و برخی دیگر به خوبی کار نمی‌کنند، اما خواهید دانست که هیچ‌یک از داده‌های شخصی شما به اشتراک گذاشته نمی‌شود. هیچ‌کس دیگری این گزینه را در یک تلفن هوشمند ارائه نمی‌دهد.

الیز سمباخ، سخنگوی سامسونگ، گفت که تلاش‌های AI این شرکت بر ارتقای تجربیات در عین حفظ کنترل کاربر استوار است. او گفت: «دکمه پردازش روی دستگاه در One UI بازتابی از این رویکرد است. این به کاربران امکان می‌دهد تا وظایف AI را برای عملکرد سریع‌تر، حریم خصوصی بیشتر و قابلیت اطمینان حتی بدون اتصال شبکه، به صورت محلی پردازش کنند.»

علاقه به هوش مصنوعی لبه (Edge AI) ممکن است چیز خوبی باشد حتی اگر از آن استفاده نکنید. برنامه‌ریزی برای این آینده غنی از AI می‌تواند سازندگان دستگاه را تشویق کند تا روی سخت‌افزار بهتر سرمایه‌گذاری کنند – مانند حافظه بیشتر برای اجرای تمام آن مدل‌های نظری هوش مصنوعی. سوکومار گفت: «ما قطعاً به شرکای خود توصیه می‌کنیم ظرفیت RAM خود را افزایش دهند.» در واقع، گوگل، سامسونگ و دیگران ظرفیت حافظه را تا حد زیادی برای پشتیبانی از AI روی دستگاه افزایش داده‌اند. حتی اگر فضای ابری برنده باشد، ما از رم اضافی استقبال می‌کنیم.

به این پست امتیاز بدید

نظرات در مورد : چرا پیشرفت NPU در گوشی‌ ها باعث بهبود چشمگیر هوش مصنوعی نمی‌شود؟ بررسی چالش‌ های کوچک‌ سازی AI

0 دیدگاه

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *