همه ما هنگام صحبت کردن دچار تپق زدن، مکث، بیان کلمات اضافه، تکرار و تصحیح کلام خود میشویم. مدل هوش مصنوعی جدید گوگل با نام Gemini 3.5 Transcribe دقیقاً با در نظر گرفتن همین نقصهای طبیعی گفتار انسان طراحی و ساخته شده است. این فناوری به عنوان دقیقترین مدل تبدیل گفتار به متن (Speech-to-Text) گوگل تا به امروز معرفی شده است که میتواند کلام نامرتب، عامیانه و بدون ساختار شما را دریافت کرده و بدون اینکه نیازی باشد مانند یک گوینده خبر شستهرفته و بدون نقص صحبت کنید، آن را به متنی تمیز، خوانا و ساختاریافته تبدیل نماید.
به گزارش بخش اخبار فناوری زوم تک به نقل از بیانیه رسمی گوگل و رسانههای معتبر حوزه فناوری، این مدل در کنار دو عضو دیگر از این خانواده با نامهای Gemini 3.5 Live و Gemini 3.5 Live Experimental عرضه شده است که هر سه در کنار یکدیگر اکوسیستم صوتی جدید گوگل را تحت عنوان Gemini Audio تشکیل میدهند.
گوگل در معرفی رسمی این مدل در شبکههای اجتماعی اعلام کرد: «ما در حال معرفی Gemini 3.5 Transcribe هستیم؛ دقیقترین مدل تبدیل گفتار به متن ما تا به امروز. این مدل صوت را در بیش از ۸۵ زبان زنده دنیا به متنی کاملاً دقیق تبدیل میکند، کلمات پرکننده زائد نظیر “اِم” و “آه” را حذف مینماید، اصلاحات لحظهای کلام شما را به درستی پردازش میکند و نیت اصلی گفتار شما را متوجه میشود تا بتوانید کارهای خود را سریعتر پیش ببرید.»
نحوه عملکرد Gemini 3.5 Transcribe در اصلاح و پاکسازی هوشمند گفتار
مدل جدید Gemini 3.5 Transcribe به صورت کاملاً خودکار کلمات پرکننده و اصوات اضافه (Filler Words) مانند «اِم» و «آه» را از خروجی حذف میکند تا متن نهایی پیادهسازیشده دچار لکنت و سکتههای کلامی نباشد. علاوه بر این، این ابزار هوشمند قابلیت اصلاح خودکار در لحظه (Self-Correction) دارد؛ به عنوان مثال، اگر در هنگام صحبت بگویید «جلسه ما روز سهشنبه، نه صبر کن، چهارشنبه برگزار میشود»، این سیستم متوجه میشود که منظور نهایی شما روز چهارشنبه بوده و متن را مستقیماً مطابق با آن تصحیح میکند. کاربران همچنین قادر خواهند بود متنهای خود را صرفاً با استفاده از فرمانهای صوتی ویرایش و اصلاح کنند.
این مدل هوش مصنوعی همچنین قادر است از طریق قابلیت فراخوانی تابع (Function Calling)، کارهایی مانند تولید تصویر یا تحلیل و بررسی فایلها را به سایر مدلهای خانواده جمینای واگذار کند؛ قابلیتی که هماکنون در اپلیکیشن رسمی Gemini بر روی سیستمعامل مکاواس (macOS) به صورت زنده فعال است.

کاهش چشمگیر نرخ خطا و پشتیبانی از گویندگان چندگانه
فناوری Gemini 3.5 Transcribe قدرتبخش قابلیت هوشمند Rambler در سیستمعامل اندروید (Android) است؛ قابلیتی که پیشتر در رویداد Android Show برای تبدیل افکار گفتاری به متنی صیقلخورده معرفی شده بود و از این مدل برای پاکسازی صدا و حذف اصوات اضافه بهره میبرد.
بر اساس گزارشهای رسمی گوگل، این مدل از سطح دقت خارقالعادهای برخوردار است؛ بهطوریکه نرخ خطای کلمات (Word Error Rate یا WER) در آن برای استریم و تبدیل زنده و درلحظه صدا تنها ۴ درصد و برای فایلهای صوتی از پیش ضبطشده معادل ۲.۶ درصد ثبت شده است. علاوه بر این، مدل یادشده با پشتیبانی از بیش از ۸۵ زبان، لهجههای مختلف محلی و اصطلاحات تخصصی همراه است و حتی توانایی تفکیک و انتساب گفتار به حداکثر ۳ گوینده مختلف را به همراه برچسبهای زمانی دقیق (Timestamps) در یک فایل صوتی داراست.
کدام اپلیکیشن ها و سرویس های گوگل به مدل Gemini 3.5 Transcribe مجهز شدهاند؟
این مدل قدرتمند در انحصار محیطهای آزمایشگاهی نمانده است؛ در حال حاضر ابزار Rambler در قابلیت تایپ صوتی کیبورد جیبورد (Gboard) اندروید و همچنین اپلیکیشن Gemini در سیستمعامل macOS از این مدل قدرت میگیرند. به زودی پشتیبانی از این قابلیت به مرورگر گوگل کروم (Google Chrome) نیز افزوده خواهد شد که امکان تایپ صوتی مستقیم در تمامی فیلدهای متنی وب را برای کاربران فراهم میسازد.
توسعهدهندگان در حال حاضر میتوانند از طریق پلتفرمهای Google AI Studio و پلتفرم برنامهنویسی عاملمحور Antigravity به این مدل دسترسی پیدا کنند. کاربران سازمانی نیز از طریق پلتفرم Gemini Enterprise Agent به آن متصل میشوند. در آینده نزدیک، این فناوری به سرویسهای Search Live، Gemini Live، گوگل داکس (Google Docs)، گوگل کیپ (Google Keep) و جیمیل (Gmail) نیز اضافه خواهد شد؛ بنابراین در دفعات بعدی که با سرعت و تپق با گوشی خود صحبت میکنید، هوش مصنوعی جمینای احتمالاً منظور شما را حتی بهتر از خودتان درک خواهد کرد!





نظرات در مورد : رونمایی گوگل از مدل هوش مصنوعی Gemini 3.5 Transcribe؛ تبدیل دقیق گفتار به متن با حذف تپق و مکثهای کلامی