به گزارش بخش اخبار فناوری زوم تک ,در عصری که تعاملات صوتی با دستگاه های هوشمند به بخش جدایی ناپذیر زندگی روزمره تبدیل شده، آمازون با معرفی مدل هوش مصنوعی “Nova Sonic”، گامی بلند در جهت ارتقای تجربه کاربری برداشته است. این فناوری نوین، که با هدف پردازش طبیعی تر و دقیق تر صدا توسعه یافته، نه تنها توانایی درک و پاسخگویی به دستورات صوتی را بهبود میبخشد، بلکه با تولید گفتاری روان و شبیه به انسان، تعامل با دستیارهای صوتی را به سطحی جدید ارتقا میدهد. “Nova Sonic” با بهرهگیری از آخرین دستاوردهای هوش مصنوعی، قادر است ظرافت های گفتاری، لحن و حتی مکث های طبیعی را درک کرده و پاسخ هایی متناسب با آن ارائه دهد. این امر، زمینه ساز تعاملاتی طبیعی تر و صمیمانه تر بین انسان و ماشین خواهد شد.
آمازون با هوش مصنوعی Nova Sonic به مصاف غول های پردازش صدا میرود
شرکت آمازون از جدیدترین دستاورد خود در زمینه هوش مصنوعی مولد رونمایی کرد؛ مدلی قدرتمند با نام Nova Sonic که به طور تخصصی برای پردازش صدا طراحی شده و قادر به تولید گفتاری بسیار طبیعی و شبیه به انسان است. آمازون با اطمینان ادعا میکند که Nova Sonic در زمینه های کلیدی مانند سرعت پردازش، دقت تشخیص گفتار و کیفیت کلی مکالمات صوتی، توان رقابت با پیشرفته ترین مدل های صوتی ارائه شده توسط OpenAI و گوگل را دارد.
معرفی Nova Sonic، پاسخی قاطع از سوی آمازون به ظهور مدل های صوتی هوش مصنوعی پیشرفته، از جمله مدلی که قابلیت گفتاری جذاب ChatGPT را ممکن ساخته است، به شمار میرود. کیفیت صدای تولید شده توسط این مدل های جدید، به مراتب طبیعی تر و انسانی تر از نمونه های اولیه دستیار صوتی الکسا به نظر میرسد. پیشرفت های چشمگیر اخیر در حوزه فناوری هوش مصنوعی، باعث شدهاند تا مدل های قدیمی و دستیارهای دیجیتال سنتی، نظیر سیری اپل یا نسخه های ابتدایی الکسا، صدایی خشک و ماشینی داشته باشند و از جذابیت کمتری برخوردار باشند.
هوش مصنوعی Nova Sonic از طریق پلتفرم Bedrock، بستری جامع برای توسعه برنامه های هوش مصنوعی سازمانی، و همچنین از طریق یک رابط برنامه نویسی کاربردی (API) جدید و دوطرفه با قابلیت استریمینگ، در اختیار توسعه دهندگان قرار خواهد گرفت. آمازون در یک بیانیه رسمی مطبوعاتی، Nova Sonic را به عنوان «به صرفه ترین مدل صوتی هوش مصنوعی موجود در بازار» معرفی کرده و اعلام نموده است که هزینه استفاده از آن تقریباً ۸۰ درصد کمتر از مدل پیشرفته GPT-4o است که این امر میتواند جذابیت زیادی برای توسعه دهندگان داشته باشد.
بخش هایی از قابلیت های Nova Sonic هم اکنون در نسخه ارتقا یافته دستیار صوتی محبوب آمازون با نام +Alexa به کار گرفته شدهاند و بهبودهای قابل توجهی را در عملکرد آن به ارمغان آوردهاند. به گفته روهیت پراساد، معاون ارشد آمازون و رئیس واحد AGI (هوش مصنوعی عمومی)، این مدل پیشرفته بر پایه تجربه گسترده و طولانی مدت آمازون در زمینه سیستم های ارکستراسیون بزرگ توسعه یافته است. این زیرساخت های فنی، همان هایی هستند که عملکرد روان و کارآمد الکسا را برای میلیون ها کاربر در سراسر جهان ممکن میسازند.
پراساد همچنین خاطرنشان میکند که Nova Sonic در هدایت درخواست های کاربران به رابط های برنامه نویسی کاربردی (API) مختلف، عملکردی به مراتب بهتر و هوشمندانه تر از خود نشان میدهد. این توانایی کلیدی به مدل اجازه میدهد تا به طور خودکار تشخیص دهد که در چه زمانی نیاز به دریافت اطلاعات از اینترنت، پردازش یک منبع داده اختصاصی یا انجام یک اقدام خاص در یک برنامه خارجی وجود دارد و بر اساس آن، ابزار مناسب برای هر یک از این وظایف را به درستی انتخاب و اجرا کند.
بر اساس اظهارات رسمی آمازون، در جریان یک مکالمه دوطرفه و تعاملی، Nova Sonic با دقت منتظر زمان مناسب برای پاسخگویی میماند و مکث های احتمالی در صحبت های کاربر را به طور هوشمندانه در نظر میگیرد تا تجربهای طبیعی تر و روان تر از مکالمه را ارائه دهد. علاوه بر این، این مدل قادر به تولید متن پیاده سازیشده (Transcript) از گفتار کاربران نیز میباشد که این قابلیت ارزشمند میتواند توسط توسعه دهندگان در کاربردهای متنوعی مورد استفاده قرار گیرد.
پراساد با تأکید بر دقت بالای تشخیص گفتار Nova Sonic میگوید که این مدل در مقایسه با بسیاری از مدل های صوتی هوش مصنوعی دیگر، از دقت بیشتری برخوردار است؛ به طوری که حتی در شرایطی که کاربر در حین صحبت مکث میکند، اشتباهات جزئی در تلفظ دارد یا در یک محیط پر سر و صدا قرار گرفته است، باز هم در تشخیص منظور واقعی کاربر عملکرد بسیار موفقی از خود نشان میدهد و میتواند منظور او را به درستی درک کند.
بر اساس نتایج یک آزمایش استاندارد با نام Multilingual LibriSpeech که برای ارزیابی عملکرد تشخیص گفتار در زبان ها و لهجه های مختلف طراحی شده است، Nova Sonic توانسته به نرخ خطای کلمهای (WER) بسیار پایین و قابل توجه 4.2 درصد در پنج زبان مختلف شامل انگلیسی، فرانسوی، ایتالیایی، آلمانی و اسپانیایی دست یابد. این بدان معناست که تنها حدود 4 کلمه از هر 100 کلمه در خروجی این مدل با نسخه انسانی آن تفاوت داشته است که نشان از دقت بالای آن در تشخیص و پردازش گفتار دارد.




نظرات در مورد : گوش های هوشمندتر: آمازون با هوش مصنوعی جدید، پردازش صدا را متحول میکند