دو مدل جدید تبدیل گفتار به متن توسط اوپنایآی منتشر شد
اوپنایآی (OpenAI) اخیراً دو مدل هوش مصنوعی جدید در زمینه تشخیص گفتار و رونویسی صوتی با نامهای GPT Transcribe و GPT Live Transcribe را بهطور رسمی از طریق رابط برنامهنویسی (API) خود در دسترس توسعهدهندگان قرار داده است. مدل اول برای پردازش فایلهای صوتی پیشضبطشده طراحی شده و نسبت به نسخههای پیشین حدود 34 برابر سریعتر از زمان واقعی عمل میکند. مدل دوم اما بهطور تخصصی برای جریانزنده (Streaming) و رونویسی بلادرنگ با تأخیر بسیار پایین بهینهسازی شده است.
بهبود دقت در کنار کاهش هزینهها
بر اساس نتایج معیار بنچمارک AA-WER که توسط موسسه Artificial Analysis پایش میشود، مدل GPT Transcribe به نرخ خطای کلمه (WER) برابر با 3.31 درصد دست یافته است. این عدد نشاندهنده بهبود 0.7 واحد درصدی در مقایسه با مدل یکساله پیشین یعنی GPT-4o Transcribe است. اوپنایآی در همین راستا قیمتگذاری سرویسهای جدید را 25 درصد کاهش داده و نرخ آن اکنون به 0.0045 دلار به ازای هر دقیقه فایل صوتی رسیده است. هر دو مدل جدید از قابلیت پردازش متن بهعنوان زمینه (Context)، درج کلیدواژههای خاص و پشتیبانی از چندین زبان ورودی پشتیبانی میکنند.
رقابت فشرده در بازار رونویسی صوتی
علیرغم پیشرفتهای اوپنایآی، رقابت در حوزه مدلهای تبدیل گفتار به متن همچنان به شدت داغ است. در جدول رتبهبندی AA-WER، مدلهای رقیب همچنان فاصله قابلتوجهی دارند. سرویس ElevenLabs Scribe v2 با نرخ خطای 2.3 درصد در جایگاه نخست قرار دارد. در جایگاه بعدی مدل Google Gemini 3 Pro با نرخ خطای 2.9 درصد و مدل Voxtral Small متعلق به شرکت Mistral با 3 درصد خطا پشت سر آنها دیده میشود. جالب اینجاست که Mistral اخیراً با معرفی نسخه جدید Voxtral Transcribe V2، شرایط را برای کسبوکارهای کوچک و توسعهدهندگان مقرونبهصرفهتر کرده و قیمت شروع سرویس خود را تنها به 0.003 دلار به ازای هر دقیقه کاهش داده است.
یکپارچهسازی با اکوسیستم بلادرنگ اوپنایآی
این مدلهای رونویسی جدید، مکمل جدیدترین قابلیت اعلامشده اوپنایآی یعنی تولید مدلهای بلادرنگ (Realtime Model Generation) محسوب میشوند. این اکوسیستم گستردهتر شامل مدل GPT-Realtime-Whisper نیز میشود که به توسعهدهندگان امکان میدهد سیستمهای صوتی و گفتاری پیچیدهتری را در پروژههای خود پیادهسازی کنند. اطلاعات فنی کامل و نحوه استفاده از این سرویسها در راهنمای رسمی رونویسی اوپنایآی منتشر شده است. با افزایش مداوم سرعت و کاهش هزینهها، رقابت بر سر دقت در پردازش گفتار طبیعی به یکی از محورهای اصلی تمرکز شرکتهای هوش مصنوعی تبدیل شده است که در ماههای آینده قطعاً شاهد تغییرات بیشتری در این حوزه خواهیم بود.





