به گزارش بخش اخبار فناوری زوم تک از 9to5Mac، اپل چند ماه پیش مدل زبان بصری (VLM) خود با نام FastVLM را معرفی کرد که توانایی پردازش تصاویر با وضوح بالا را در لحظه فراهم می کند. اکنون، کاربران می توانند این مدل را مستقیما در مرورگر خود امتحان کنند، البته به شرطی که از یک مک مجهز به پردازنده اپل سیلیکون استفاده کنند.
معرفی FastVLM و چارچوب اختصاصی MLX
زمانی که برای اولین بار خبر FastVLM را منتشر کردیم، توضیح دادیم که این مدل از چارچوب MLX اپل استفاده می کند. MLX یک چارچوب یادگیری ماشینی متن باز است که به طور اختصاصی برای پردازنده های اپل سیلیکون طراحی شده است. این چارچوب باعث شده FastVLM تا ۸۵ برابر سریع تر از مدل های مشابه کپشن نویسی ویدیو انجام دهد، در حالی که حجم ان بیش از سه برابر کوچکتر است.
از زمان انتشار اولیه، اپل روی این پروژه بیشتر کار کرده و اکنون علاوه بر GitHub، این مدل در پلتفرم Hugging Face نیز در دسترس قرار گرفته است. در Hugging Face، کاربران می توانند نسخه سبک تر مدل، یعنی FastVLM-0.5B را مستقیما در مرورگر خود بارگذاری کرده و عملکرد ان را شخصا بررسی کنند.
تجربه کار با مدل و قابلیت های آن
بسته به سخت افزار دستگاه، بارگذاری مدل ممکن است کمی زمان ببرد. به عنوان مثال، روی یک مک بوک پرو با پردازنده M2 Pro و ۱۶ گیگابایت رم، این فرایند چند دقیقه طول کشید. اما به محض بارگذاری کامل، مدل شروع به توصیف دقیق ظاهر او، فضای پشت سرش، حالات چهره مختلف و اشیایی کرد که به جلوی دوربین می اورد.
در گوشه پایین و سمت چپ رابط کاربری، می توانید متنی را که مدل باید در نظر بگیرد، تنظیم کنید تا کپشن ها به صورت زنده به روز شوند. همچنین چند پیشنهاد از پیش تعیین شده نیز وجود دارد، مانند:
- آنچه را که می بینید در یک جمله توصیف کنید.
- رنگ پیراهن من چیست؟
- هر گونه متن یا محتوای نوشتاری قابل مشاهده را شناسایی کنید.
- چه احساسات یا اعمالی به تصویر کشیده شده است؟
- نام شیئی که در دست دارم را بگو.
اگر می خواهید تجربه عمیق تری داشته باشید، می توانید از یک برنامه دوربین مجازی برای ورودی ویدیو به این ابزار استفاده کنید. با این کار می بینید که مدل به طور انی صحنه های مختلف را با جزئیات کامل توصیف می کند، تا جایی که درک اطلاعات ممکن است دشوار شود. البته کاربرد واقعی ان متفاوت خواهد بود، اما این نمایش به خوبی نشان دهنده سرعت و دقت بالای مدل است.
عملکرد محلی و کاربردهای بالقوه
نکته ای که به طور خاص در مورد این ازمایش جالب است، اجرای مدل به صورت محلی در مرورگر است. این به این معنی است که هیچ داده ای هرگز دستگاه شما را ترک نمی کند و حتی می تواند به صورت افلاین نیز کار کند. این ویژگی برای دستگاه های پوشیدنی و فناوری های کمکی کاربرد فوق العاده ای دارد، جایی که سبکی و تاخیر کم برای کاربردهای بهتر از اهمیت بالایی برخوردار است.
شایان ذکر است که این نسخه نمایشی از مدل سبک تر با ۰.۵ میلیارد پارامتر استفاده می کند، در حالی که خانواده FastVLM شامل نسخه های بزرگ تر و قدرتمندتر با ۱.۵ میلیارد و ۷ میلیارد پارامتر نیز می شود. با مدل های بزرگ تر، عملکرد و سرعت می تواند حتی بیشتر بهبود یابد، هرچند که اجرای مستقیم انها در مرورگر احتمالا امکان پذیر نخواهد بود.
این مدل پیشگامانه نشان می دهد که اپل چگونه در حال پیشبرد هوش مصنوعی روی دستگاه است و می خواهد قدرت پردازش را مستقیما به دست کاربران برساند، بدون اینکه نیازی به اتصال به سرورهای ابری باشد. این رویکرد نه تنها امنیت و حریم خصوصی را افزایش می دهد، بلکه امکان ایجاد تجربه های کاربری بی سابقه ای را در محصولات اینده اپل فراهم می کند.




نظرات در مورد : اکنون می توانید مدل فوق العاده سریع کپشن نویسی ویدیوی اپل را در مرورگر خود امتحان کنید