به گزارش بخش اخبار فناوری زوم تک، OpenAI یکی از کمپانی های بزرگ و مطرح صنعت هوش مصنوعی است که پیشتر اپ ویدیویی Sora AI را منتشر کرد.
سورا، اپلیکیشن OpenAI برای ساخت ویدیوهای تولید شده توسط هوش مصنوعی، بیش از یک میلیون بار دانلود شده است. بیل پیبلز، سرپرست Sora در OpenAI، دیشب این اطلاعات را در شبکه اجتماعی X به اشتراک گذاشت.
پیبلز گفت که Sora حتی سریعتر از ChatGPT به یک میلیون دانلود رسیده است، و با وجود اینکه در حال حاضر فقط با دعوتنامه در ایالات متحده و کانادا در دسترس است، علاقه به این اپلیکیشن رو به افزایش است.
سورا در پایان ماه سپتامبر منتشر شد. این اپلیکیشن برای تولید ویدیوهای هوش مصنوعی با استفاده از ویدیوهای واقعگرایانه از افراد واقعی و دوستانشان طراحی شده است. هر کاربر یک “کامئو” یا ویدیوی کوتاه آپلود میکند که میتواند از آن با درخواستهای هوش مصنوعی استفاده کند.
این اپلیکیشن شامل گزینهای برای کاربران است تا کامئوهای خود را به اشتراک بگذارند و به افراد یا هر کسی در Sora اجازه میدهد تا ویدیوی هوش مصنوعی را با شباهت خود تولید کنند. سورا به دلیل تولید ویدیوهای بیکیفیت هوش مصنوعی مورد انتقاد قرار گرفته است، اما این موضوع تاثیری بر محبوبیت آن نداشته است. این اپلیکیشن همچنان برترین اپلیکیشن رایگان در فروشگاه اپل است.
سورا از مدل تولید ویدیوی Sora 2 شرکت OpenAI استفاده میکند که میتواند حرکات پیچیده را برای ویدیوهای واقعگرایانه، سینمایی و انیمهگونه مدیریت کند. سورا 2 از تولید صدا پشتیبانی میکند، بنابراین تمام ویدیوهای ساخته شده در سورا با صدا همراه هستند.
استقبال بزرگ از اپ ویدیویی Sora AI
اوپنایآی سورا را طوری طراحی کرده است که محتوا را بر اساس افرادی که کاربر دنبال میکند یا با آنها تعامل دارد نمایش دهد و این برنامه مرتباً از کاربران در مورد سلامتشان نظرسنجی میکند. کنترلهایی برای تغییر آنچه در فید نمایش داده میشود وجود دارد و OpenAI میگوید که قرار است با دوستان استفاده شود، به همین دلیل است که فقط برای دعوت در نظر گرفته شده است.
در دیگر خبرها گوگل یک مدل هوش مصنوعی جدید به نام Gemini 2.5 Computer Use منتشر کرده است. این مدل به عوامل هوش مصنوعی اجازه میدهد تا با وبسایتها و رابطهای کاربری مانند یک انسان تعامل داشته باشند. اکنون پیشنمایش عمومی آن از طریق Gemini API در Google AI Studio و Vertex AI در دسترس است.
این مدل بر اساس قابلیتهای درک و استدلال بصری Gemini 2.5 Pro ساخته شده است. این مدل میتواند طیف گستردهای از اقدامات مبتنی بر مرورگر مانند کلیک کردن، تایپ کردن، اسکرول کردن، معلق نگه داشتن ماوس، باز کردن منوهای کشویی و پیمایش در URLها را انجام دهد. گوگل میگوید که این مدل در چندین معیار، از جمله Online-Mind2Web، WebVoyager و AndroidWorld، عملکرد بهتری نسبت به ابزارهای رقیب دارد، در حالی که تأخیر کمتری را حفظ میکند.
برخلاف مدلهای سنتی هوش مصنوعی که به APIها متکی هستند، Gemini 2.5 Computer Use تصاویر رابطهای وب را پردازش میکند و در پاسخ، اقدامات رابط کاربری خاصی را ایجاد میکند. عامل یک اعلان وظیفه، یک تصویر از محیط دیجیتال و سابقه اقدامات اخیر را دریافت میکند. سپس رابط را تجزیه و تحلیل میکند و یک اقدام رابط کاربری، مانند کلیک کردن روی یک دکمه یا تایپ کردن در یک فیلد را برمیگرداند. این عمل در سمت کلاینت اجرا میشود و یک اسکرینشات جدید برای ادامه کار در یک حلقه به مدل ارسال میشود.
منبع: macrumors





نظرات در مورد : اپ ویدیویی Sora AI از شرکت OpenAI به مرز یک میلیون دانلود رسید