گوگل در ادامه توسعه مدلهای هوش مصنوعی سری جمینای، از ابزار جدید و قدرتمند خود با نام Gemini 3.5 Transcribe رونمایی کرد. این مدل که بهطور تخصصی برای تبدیل گفتار به نوشتار طراحی شده، جهشی بزرگ در دقت و سرعت پردازش صوتی محسوب میشود. Gemini 3.5 Transcribe با بهرهگیری از الگوریتمهای پیشرفته یادگیری ماشین، نه تنها کلمات را با کمترین ضریب خطا شناسایی میکند، بلکه با درک هوشمندانه از ساختار جملات، متنی روان و ویرایششده را به کاربر ارائه میدهد.
افزایش چشمگیر سرعت و کاهش خطا نسبت به نسل قبل
در مقایسه با نسل پیشین موتور تبدیل گفتار گوگل یعنی Chirp 3، مدل جدید Gemini 3.5 Transcribe در حدود ۷۰ درصد سریعتر عمل میکند. این مدل موفق شده نرخ خطای تشخیص گفتار زنده را به ۵.۵ درصد کاهش دهد؛ رقمی که در مقایسه با نرخ ۷.۳۲ درصدی نسل قبل، پیشرفتی خیرهکننده در حوزه دقت تشخیص کلمات محسوب میشود. اگرچه این تغییر در نگاه اول جزئی به نظر میرسد، اما در عمل باعث کاهش چشمگیر نیاز به ویرایش دستی متون تایپشده توسط کاربر میشود و تجربه کاربری را به شکلی محسوس ارتقا میدهد.
ویرایش خودکار و درک اصطلاحات تخصصی
ویژگی برجسته Gemini 3.5 Transcribe فراتر از یک تبدیلگر ساده است؛ این هوش مصنوعی قادر است کلمات «پرکننده» و اضافه مانند «اِم» یا «آه» را که معمولاً در صحبتهای روزمره شنیده میشوند، به صورت هوشمند حذف کند. علاوه بر این، سیستم قابلیت تصحیح لحظهای متن را داراست و کاربران میتوانند با ارائه «واژگان سفارشی»، اصطلاحات تخصصی یا فنی مورد نظر خود را به دایره لغات سیستم اضافه کنند تا در حین تبدیل، دچار خطا نشود. این ابزار قدرتمند در حال حاضر از ۸۵ زبان زنده دنیا پشتیبانی میکند و میتواند بهطور همزمان، گفتگوی حداکثر سه سخنران را در فایلهای صوتی از پیش ضبطشده تفکیک و تبدیل کند.
