گوگل مدل تبدیل گفتار به متن Gemini 3.5 Transcribe را عرضه کرد؛ سیستمی که برای حذف «اُم»ها، تصحیحات آنی و تولید متن صیقلی‌تر طراحی شده و هم‌اکنون به‌عنوان موتور Rambler در Gboard روی Pixel 11 فعال است. انتظار می‌رود این قابلیت به زودی در سایر سرویس‌ها و دستگاه‌های اکوسیستم گوگل گسترش یابد.

دقت و سرعت Gemini 3.5 Transcribe

Gemini 3.5 Transcribe نسبت به نسل قبلی، Chirp 3، سرعت و دقت قابل‌توجهی دارد: فرایند تبدیل صدا به متن تا حدود 70 درصد سریع‌تر شده و نرخ خطای گفتار زنده به 5.5 درصد کاهش یافته است (در مقابل 7.32 درصد برای Chirp 3). هرچند کاهش عددی ممکن است کوچک به‌نظر برسد، در محیط‌هایی که اصلاح دستی متن دشوار است یا پردازش بلادرنگ اهمیت دارد، این بهبود تجربه کاربری را به‌طور محسوسی بهتر می‌کند.

پاک‌سازی گفتار و درک مقصود

این فناوری فراتر از تشخیص ساده واژه‌ها عمل می‌کند و تلاش می‌کند مقصود گوینده را بازتاب دهد: حذف «اُم» و «اَّه»، اصلاح لحظه‌ای خودِ گوینده، و پشتیبانی از واژگان سفارشی برای اصطلاحات تخصصی از جمله قابلیت‌های اصلی است. پشتیبانی از 85 زبان و شناسایی تا 3 گوینده در فایل‌های صوتی از پیش ضبط‌شده نیز فراهم شده است.

رابط کاربری Gemini 3.5 Transcribe در Gboard

محدودیت‌ها و ریسک‌های بازنویسی خودکار

اتکا صرف به بازنویسی خودکار می‌تواند منجر به تغییر در انتخاب واژه‌ها یا ساختار جمله شود. برای یادداشت‌های روزمره یا تولید پیش‌نویس این بازنویسی اغلب مفید است، اما در موقعیت‌هایی که نقل‌قول دقیق یا ثبت حقوقی و پزشکی ضرورت دارد، تغییر خودکار ممکن است نامناسب یا پرخطر باشد.

موارد مناسب برای استفاده

  • یادداشت‌برداری سریع، تبدیل پیام‌های صوتی به متن و تدوین پیش‌نویس‌های قابل ویرایش.
  • ضبط‌های مصاحبه‌ای غیررسمی با حداکثر سه گوینده.
  • زمانی که امکان تعریف واژگان سفارشی برای اصطلاحات فنی و اسامی خاص فراهم باشد.

مواردی که باید احتیاط شد

  • متون حقوقی، پزشکی یا هر سندی که نیاز به نقل‌قول دقیق دارد؛ در این حالت بهتر است بازنویسی خودکار خاموش و متنِ خام حفظ شود.
  • وقتی شفافیت و بی‌طرفی در انتخاب واژه‌ها اهمیت بالایی دارد.

پیام به توسعه‌دهندگان و چشم‌انداز کاربردی

کاهش خطا و افزایش سرعت در تبدیل گفتار به متن، فرصت‌های تازه‌ای برای سازندگان اپلیکیشن و سرویس‌های صوتی فراهم می‌کند. توسعه‌دهندگان می‌توانند Gemini 3.5 Transcribe را در ابزارهای بهره‌وری، پیام‌رسان‌ها و پلتفرم‌های تولید محتوا به‌کار بگیرند تا تجربه صوت‌محور را روان‌تر کنند. هم‌زمان باید به مسائل حریم خصوصی، شفافیت در بازنویسی و امکان خاموش‌کردن اصلاحات خودکار برای موارد حساس توجه شود.

برای مطالعه بیشتر درباره فناوری‌های تبدیل گفتار به متن به صفحهٔ Speech recognition مراجعه کنید یا پوشش‌های تحلیلی رسانه‌هایی مانند TechCrunch را دنبال کنید. Gemini 3.5 Transcribe گامی مهم در بهبود رابط‌های صوتی است، اما انتخاب نهایی برای استفاده باید براساس نوع کاربرد و حساسیت محتوای گفتاری صورت گیرد.