OpenAI با معرفیٔ مدل‌های مکالمه‌ای جدیدِ GPT‑Live‑1 و GPT‑Live‑1 mini، فازِ جدیدی از تعاملاتِ صوتی را آغاز کرده‌است. این مدل‌های تمام‌دوطرفهٔ قادرند هم‌زمان گوش دهند و پاسخ دهند؛ قابلیتی که به کاربران اجازه می‌دهد کلامِ هوش‌مصنوعی را به‌صورتِ کاملاً طبیعی قطع کنند و مکالماتی روان‌تر و بی‌وقفه تجربه نمایند.

پایانِ دورانِ تبدیلِ صوت به متن در ChatGPT

معماریِ مدل‌های جدید نشان می‌دهد OpenAI از روش‌های سنتی فاصله گرفته‌است. مدل‌های پیشین برای پردازشِ صدایِ کاربر ابتدا گفته‌ها را به متن تبدیل (Speech‑to‑Text)، سپس توسط مدلِ زبانیِ بزرگ (LLM) پردازش و در نهایت پاسخ را به صوت (Text‑to‑Speech) تبدیل می‌کردند. اما مدل‌های جدید این پیچیدگی را حذف کرده و تجربه‌ای بسیار سریع‌تر و بی‌وقفه ارائه می‌دهند.

بر اساسِ اعلامِ شرکت، حالتِ صدایِ پیشرفته (Advanced Voice Mode) فعلی در ChatGPT به‌طورِ پیش‌فرض جای خود را به GPT‑Live‑1 mini می‌دهد. کاربرانِ نسخهٔ پولی نیز می‌توانند از مدلِ قدرتمندترِ GPT‑Live‑1 استفاده کنند.

رفعِ مشکلاتِ نوبت‌گیری و افزایشِ هوشِ مکالمه

یکی از آزاردهنده‌ترین مشکلاتِ دستیارهای صوتی، قطعِ نابهنگامِ حرفِ کاربر است. OpenAI در نشستِ خبریِ خود اعلام کرد که مدل‌های GPT‑Live‑1 این چالشِ تاریخی را تا حدِ زیادی کاهش داده‌اند.

علاوه بر این، زمانی که مدلِ جدید با پرسش‌های پیچیده‌ای روبه‌رو می‌شود که نیازمندِ جست‌وجو، استدلال یا قابلیت‌های عاملیت (agentic) است، در حینِ ادامهٔ مکالمه و بدونِ وقفه درخواست را به جدیدترین مدل‌هایِ متنیِ خود مانند GPT‑5.5 ارسال می‌کند. این یعنی کاربران در میانهٔ یک گفت‌وگوی طولانی مجبور به انتظارِ طولانی برای دریافتِ پاسخ نیستند.

سکوتِ استراتژیک و خروجی‌های بصری

قابلیتِ قابل‌توجهِ دیگرِ این مدل‌ها، تواناییِ حفظِ سکوت برای مدت‌زمانِ طولانی و درکِ کاملِ بافتِ مکالمه تا زمانی است که کاربر مستقیماً با آن‌ها سخن گوید.

از آنجا که این رابطِ صوتی به نسل‌هایِ جدیدترِ مدل‌های GPT متصل است، می‌تواند بخشی از اطلاعات و پاسخ‌ها را به‌صورتِ بصری و گرافیکی ارائه دهد؛ رویکردی که برخی استارتاپ‌ها مانندِ Monogram (که اخیراً ۴۰ میلیون دلار سرمایهٔ اولیه جذب کرده‌است) نیز برای تعاملی‌تر کردنِ دستیارها دنبال می‌کنند.

صداهای طولانی‌تر؛ رابطِ اصلیِ رایانش در آینده

آتیِ التی (Atty Eleti)، رئیسِ محصولِ ChatGPT Voice، در خصوصِ اهدافِ جدیدِ شرکت گفت: «با گذشتِ زمان، این قابلیت‌ها امکانِ استفاده از صدا را به‌عنوانِ رابطِ اصلیِ رایانش و مدیریتِ کارهای پیچیده و طولانی‌مدت فراهم می‌کنند؛ همان کارهای شگفت‌انگیزی که افراد اکنون با Codex و ChatGPT انجام می‌دهند.»

وی همچنین اشاره کرد که حالتِ صدایِ جدید برای مکالماتِ بسیارِ طولانی طراحی شده است؛ تا جایی که خودِ او در زمانِ پیاده‌روی مکالماتی ۳۰ تا ۴۰ دقیقه‌ای با این دستیار داشته‌است. بیش از ۱۵۰ میلیون نفر در حالِ حاضر از طریقِ ویژگی‌های صوتی و دیکته با ChatGPT ارتباط برقرار می‌کنند. شایعات و گزارش‌ها حاکی از آن است که OpenAI ممکن است در همین سال، برای تکمیلِ این تجربه هدفون‌های مبتنی بر هوش‌مصنوعی نیز عرضه کند.

رقابتِ تنگاتنگ با غول‌ها و استارتاپ‌ها

Apple و Amazon نیز اخیراً دستیارهای خود را برای درکِ بهترِ زمینهٔ مکالمه و لحنِ طبیعی‌تر به‌روزرسانی کرده‌اند. در کنارِ آن‌ها، استارتاپ‌هایی مانندِ Sesame که توسطِ برندان آیریب (هم‌بنیان‌گذارِ Oculus) تأسیس شده‌اند، در حالِ توسعهٔ هوش‌مصنوعی‌هایی هستند که می‌توانند به‌طورِ هم‌زمان مکالمه‌ای طبیعی داشته باشند و وظایف را در پس‌زمینه انجام دهند.

با وجودِ این رقابت، OpenAI تأکید دارد که هدفش ساختِ یک «همدمِ هوش‌مصنوعی» نیست. مدل‌های جدید دارای محافظ‌هایِ امنیتیِ داخلی هستند تا برای نوجوانان پاسخ‌های متناسب با سن ارائه دهند و در مواجهه با موضوعاتِ حساسی مانندِ خودآزاری فوراً منابعِ کمک‌رسانی را پیشنهاد کنند.

نقاطِ ضعف در ترجمهٔ زنده و زبان‌های دیگر

پیش از آنکه این مدل بی‌نقص به نظر برسد، هنوز نقاطِ ضعفی وجود دارد که باید برطرف شوند. در نمایشِ زندهٔ انجام‌شده، زمانی که ویژگیِ ترجمهٔ زنده به زبانِ هندی آزمایش شد، دستیار لهجهٔ سنگینِ آمریکایی داشت و هندی را با لحنی نسبتاً ماشینی و کتابی ادا کرد.

OpenAI اعلام کرده است که این حالتِ جدید برای «بیشترِ زبان‌های رایج» بهینه‌سازی شده است، اما از نام‌بردنِ دقیقِ این زبان‌ها و زمانِ پشتیبانیِ کامل از زبان‌های با تمرکزِ کمتر خودداری کرده‌است.