دو مدل جدید تبدیل گفتار به متن توسط اوپن‌ای‌آی منتشر شد

اوپن‌ای‌آی (OpenAI) اخیراً دو مدل هوش مصنوعی جدید در زمینه تشخیص گفتار و رونویسی صوتی با نام‌های GPT Transcribe و GPT Live Transcribe را به‌طور رسمی از طریق رابط برنامه‌نویسی (API) خود در دسترس توسعه‌دهندگان قرار داده است. مدل اول برای پردازش فایل‌های صوتی پیش‌ضبط‌شده طراحی شده و نسبت به نسخه‌های پیشین حدود 34 برابر سریع‌تر از زمان واقعی عمل می‌کند. مدل دوم اما به‌طور تخصصی برای جریان‌زنده (Streaming) و رونویسی بلادرنگ با تأخیر بسیار پایین بهینه‌سازی شده است.

بهبود دقت در کنار کاهش هزینه‌ها

بر اساس نتایج معیار بنچمارک AA-WER که توسط موسسه Artificial Analysis پایش می‌شود، مدل GPT Transcribe به نرخ خطای کلمه (WER) برابر با 3.31 درصد دست یافته است. این عدد نشان‌دهنده بهبود 0.7 واحد درصدی در مقایسه با مدل یک‌ساله پیشین یعنی GPT-4o Transcribe است. اوپن‌ای‌آی در همین راستا قیمت‌گذاری سرویس‌های جدید را 25 درصد کاهش داده و نرخ آن اکنون به 0.0045 دلار به ازای هر دقیقه فایل صوتی رسیده است. هر دو مدل جدید از قابلیت پردازش متن به‌عنوان زمینه (Context)، درج کلیدواژه‌های خاص و پشتیبانی از چندین زبان ورودی پشتیبانی می‌کنند.

رقابت فشرده در بازار رونویسی صوتی

علی‌رغم پیشرفت‌های اوپن‌ای‌آی، رقابت در حوزه مدل‌های تبدیل گفتار به متن همچنان به شدت داغ است. در جدول رتبه‌بندی AA-WER، مدل‌های رقیب همچنان فاصله قابل‌توجهی دارند. سرویس ElevenLabs Scribe v2 با نرخ خطای 2.3 درصد در جایگاه نخست قرار دارد. در جایگاه بعدی مدل Google Gemini 3 Pro با نرخ خطای 2.9 درصد و مدل Voxtral Small متعلق به شرکت Mistral با 3 درصد خطا پشت سر آن‌ها دیده می‌شود. جالب اینجاست که Mistral اخیراً با معرفی نسخه جدید Voxtral Transcribe V2، شرایط را برای کسب‌وکارهای کوچک و توسعه‌دهندگان مقرون‌به‌صرفه‌تر کرده و قیمت شروع سرویس خود را تنها به 0.003 دلار به ازای هر دقیقه کاهش داده است.

یکپارچه‌سازی با اکوسیستم بلادرنگ اوپن‌ای‌آی

این مدل‌های رونویسی جدید، مکمل جدیدترین قابلیت اعلام‌شده اوپن‌ای‌آی یعنی تولید مدل‌های بلادرنگ (Realtime Model Generation) محسوب می‌شوند. این اکوسیستم گسترده‌تر شامل مدل GPT-Realtime-Whisper نیز می‌شود که به توسعه‌دهندگان امکان می‌دهد سیستم‌های صوتی و گفتاری پیچیده‌تری را در پروژه‌های خود پیاده‌سازی کنند. اطلاعات فنی کامل و نحوه استفاده از این سرویس‌ها در راهنمای رسمی رونویسی اوپن‌ای‌آی منتشر شده است. با افزایش مداوم سرعت و کاهش هزینه‌ها، رقابت بر سر دقت در پردازش گفتار طبیعی به یکی از محورهای اصلی تمرکز شرکت‌های هوش مصنوعی تبدیل شده است که در ماه‌های آینده قطعاً شاهد تغییرات بیشتری در این حوزه خواهیم بود.