تحقیقات جدید اپل نشان می دهد که یک ترفند ساده برای افزایش بهره وری، می تواند مدل های زبانی بزرگ (LLM) را نیز به طرز چشمگیری بهبود ببخند. محققان اپل با استفاده از یک رویکرد جدید به نام “یادگیری تقویتی از بازخورد چک لیست” (RLCF)، به یک مدل هوش مصنوعی یاد دادند تا کارهای خود را بر اساس یک چک لیست مشخص بررسی کند. نتایج این مطالعه نشان می دهد که این روش به طور قابل توجهی دقت و کارایی مدل را در پاسخ به دستورات پیچیده افزایش می دهد. این یافته می تواند گام مهمی در جهت ساخت دستیارهای هوشمند قابل اعتمادتر باشد.
هوش مصنوعی اپل از ترفندهای گذشته برای آینده استفاده میکند
به گزارش بخش اخبار فناوری زوم تک از 9to5Mac، یک تحقیق جدید که توسط محققان اپل انجام شده است، نشان می دهد که یک مدل زبانی بزرگ (LLM) با استفاده از یک ترفند ساده می تواند به طرز چشمگیری بهبود یابد. این ترفند قدیمی، چیزی نیست جز استفاده از یک چک لیست برای بررسی کارها. در این مطالعه، یک مدل هوش مصنوعی متن باز به نام Qwen2.5-7B-Instruct با استفاده از روشی به نام “یادگیری تقویتی از بازخورد چک لیست” (RLCF) آموزش داده شد. نتایج اولیه این تحقیق بسیار امیدوارکننده است و نشان می دهد که این روش، دقت و قابلیت اطمینان مدل را در پاسخ به دستورات پیچیده به شکل قابل توجهی افزایش می دهد.
RLCF چگونه کار می کند؟
در حال حاضر، اکثر مدل های هوش مصنوعی از روشی به نام “یادگیری تقویتی از بازخورد انسانی” (RLHF) برای بهبود عملکرد خود استفاده می کنند. در این روش، افراد با دادن بازخوردهای مثبت (لایک) یا منفی (دیس لایک)، به مدل می آموزند که کدام پاسخ ها بهتر هستند. اما این روش محدودیت هایی دارد؛ زیرا مدل ممکن است یاد بگیرد که پاسخ هایی تولید کند که در ظاهر درست به نظر می رسند، اما در واقع به طور کامل به درخواست کاربر پاسخ نمی دهند.

اما در روش جدید اپل، به جای یک بازخورد کلی، از یک چک لیست دقیق استفاده می شود. هر پاسخ بر اساس یک چک لیست ۰ تا ۱۰۰ امتیازی، برای میزان رضایت بخشی آن نسبت به هر یک از موارد موجود در چک لیست، مورد ارزیابی قرار می گیرد. به عنوان مثال، اگر از مدل خواسته شود تا متنی را به زبان اسپانیایی ترجمه کند و در آن از کلمات کلیدی خاصی استفاده کند، چک لیست می تواند شامل مواردی مانند “آیا متن به اسپانیایی ترجمه شده است؟” یا “آیا از کلمات کلیدی مورد نظر استفاده شده است؟” باشد.
نتایج درخشان و کاربردهای آینده
محققان اپل این روش را با دیگر روش های بهبود مدل های هوش مصنوعی مقایسه کردند و نتایج نشان داد که RLCF تنها روشی است که عملکرد مدل را در تمامی معیارهای مورد آزمایش بهبود بخشید. به عنوان مثال، نرخ موفقیت در معیارهای “FollowBench” و “InFoBench” به ترتیب ۴ و ۶ امتیاز افزایش یافت و نرخ برد در معیار “Arena-Hard” نیز ۳ امتیاز بیشتر شد. این پیشرفت ها به ویژه برای دستیارهای هوش مصنوعی که قرار است به عنوان رابط اصلی بین کاربران و دستگاه هایشان عمل کنند، بسیار حیاتی است. این دستیارها باید بتوانند دستورات پیچیده و چند مرحله ای کاربران را به درستی درک کرده و به آنها عمل کنند.

تولید چک لیست با کمک هوش مصنوعی
نکته جالب این است که خود چک لیست ها نیز توسط یک مدل هوش مصنوعی دیگر ایجاد می شوند. بر اساس تحقیقات قبلی، محققان اپل بیش از ۱۳۰,۰۰۰ دستورالعمل را به مدل هوش مصنوعی دادند تا برای هر کدام یک چک لیست کوچک با الزامات مشخص تولید کند. سپس یک مدل بزرگ تر به عنوان “قاضی” عمل کرده و پاسخ های تولید شده توسط یک مدل کوچک تر را بر اساس این چک لیست ها امتیاز می دهد. این امتیازها سپس به عنوان سیگنال پاداش برای آموزش مدل کوچک تر مورد استفاده قرار می گیرند. این فرآیند تضمین می کند که مدل به طور دقیق یاد بگیرد که چگونه دستورات را به طور کامل و صحیح دنبال کند.
محدودیت های تحقیق و نگاهی به آینده
محققان خاطرنشان می کنند که مطالعه آنها بر روی “دنبال کردن دستورات پیچیده” متمرکز بوده و ممکن است RLCF بهترین روش برای دیگر کاربردها نباشد. همچنین، این روش به یک مدل قدرتمندتر برای آموزش مدل کوچک تر نیاز دارد که می تواند یک محدودیت مهم محسوب شود. اما با این حال، این مطالعه یک روش جالب و ساده برای افزایش قابلیت اطمینان مدل های هوش مصنوعی ارائه می دهد. با توجه به اینکه دستیارهای هوشمند در آینده توانایی انجام کارهای پیچیده تری را پیدا خواهند کرد، پیروی دقیق از دستورالعمل ها و هم راستا شدن با هدف کاربران، اهمیتی حیاتی پیدا می کند.




نظرات در مورد : دستیارهای هوش مصنوعی اپل از این پس از یک ترفند قدیمی استفاده می کنند