به گزارش بخش اخبار فناوری زوم تک، گوگل یکی از کمپانی هایی است که نقش بسزایی در تولید مدل های هوش مصنوعی دارد و در این بین محصول جدیدی ارائه داد.
گوگل یک مدل هوش مصنوعی جدید به نام Gemini 2.5 Computer Use منتشر کرده است. این مدل به عوامل هوش مصنوعی اجازه میدهد تا با وبسایتها و رابطهای کاربری مانند یک انسان تعامل داشته باشند. اکنون پیشنمایش عمومی آن از طریق Gemini API در Google AI Studio و Vertex AI در دسترس است.
این مدل بر اساس قابلیتهای درک و استدلال بصری Gemini 2.5 Pro ساخته شده است. این مدل میتواند طیف گستردهای از اقدامات مبتنی بر مرورگر مانند کلیک کردن، تایپ کردن، اسکرول کردن، معلق نگه داشتن ماوس، باز کردن منوهای کشویی و پیمایش در URLها را انجام دهد. گوگل میگوید که این مدل در چندین معیار، از جمله Online-Mind2Web، WebVoyager و AndroidWorld، عملکرد بهتری نسبت به ابزارهای رقیب دارد، در حالی که تأخیر کمتری را حفظ میکند.
برخلاف مدلهای سنتی هوش مصنوعی که به APIها متکی هستند، Gemini 2.5 Computer Use تصاویر رابطهای وب را پردازش میکند و در پاسخ، اقدامات رابط کاربری خاصی را ایجاد میکند. عامل یک اعلان وظیفه، یک تصویر از محیط دیجیتال و سابقه اقدامات اخیر را دریافت میکند. سپس رابط را تجزیه و تحلیل میکند و یک اقدام رابط کاربری، مانند کلیک کردن روی یک دکمه یا تایپ کردن در یک فیلد را برمیگرداند. این عمل در سمت کلاینت اجرا میشود و یک اسکرینشات جدید برای ادامه کار در یک حلقه به مدل ارسال میشود.

گوگل عملکرد مدل را با مثالهایی نشان داد که نشان میدهد عامل، یادداشتهای چسبان را روی یک تخته سفید دیجیتال مرتب میکند و جزئیات حیوان خانگی را از یک وبسایت به یک سیستم CRM منتقل میکند. ویدیوهای نمایشی برای نمایش فرآیند در زمان واقعی، شتابدهی شدهاند.
این مدل در حال حاضر از ۱۳ عمل پشتیبانی میکند و با مرورگرهای وب بهترین عملکرد را دارد. گوگل اعلام کرد که هنوز برای وظایف سطح سیستم عامل دسکتاپ بهینه نشده است، اگرچه در معیارهای موبایل پتانسیل خود را نشان داده است.
گوگل همچنین اقدامات ایمنی را برای جلوگیری از سوءاستفاده اجرا کرده است. هر عملی که توسط مدل پیشنهاد میشود، قبل از اجرا توسط یک سرویس ایمنی بررسی میشود. توسعهدهندگان میتوانند اقدامات خاصی را محدود کنند یا برای وظایف پرخطر مانند تراکنشهای مالی، تأیید صریح کاربر را درخواست کنند.
چندین تیم داخلی گوگل در حال حاضر از این مدل در مرحله تولید استفاده میکنند. این مدل از آزمایش رابط کاربری و وظایف اتوماسیون در پلتفرمهایی مانند Search و Firebase پشتیبانی میکند. توسعهدهندگان خارجی در برنامه دسترسی اولیه از این مدل برای ساخت اتوماسیون گردش کار و ابزارهای دستیار استفاده کردهاند.
توسعهدهندگان میتوانند از طریق Google AI Studio یا Vertex AI شروع به استفاده از این مدل کنند. گوگل همچنین یک محیط آزمایشی از طریق Browserbase برای آزمایش و تجربه ارائه میدهد.
منبع: gizmochina





نظرات در مورد : گوگل مدل هوش مصنوعی Gemini 2.5 Computer Use را راهاندازی کرد