OpenAI با معرفیٔ مدلهای مکالمهای جدیدِ GPT‑Live‑1 و GPT‑Live‑1 mini، فازِ جدیدی از تعاملاتِ صوتی را آغاز کردهاست. این مدلهای تمامدوطرفهٔ قادرند همزمان گوش دهند و پاسخ دهند؛ قابلیتی که به کاربران اجازه میدهد کلامِ هوشمصنوعی را بهصورتِ کاملاً طبیعی قطع کنند و مکالماتی روانتر و بیوقفه تجربه نمایند.
پایانِ دورانِ تبدیلِ صوت به متن در ChatGPT
معماریِ مدلهای جدید نشان میدهد OpenAI از روشهای سنتی فاصله گرفتهاست. مدلهای پیشین برای پردازشِ صدایِ کاربر ابتدا گفتهها را به متن تبدیل (Speech‑to‑Text)، سپس توسط مدلِ زبانیِ بزرگ (LLM) پردازش و در نهایت پاسخ را به صوت (Text‑to‑Speech) تبدیل میکردند. اما مدلهای جدید این پیچیدگی را حذف کرده و تجربهای بسیار سریعتر و بیوقفه ارائه میدهند.
بر اساسِ اعلامِ شرکت، حالتِ صدایِ پیشرفته (Advanced Voice Mode) فعلی در ChatGPT بهطورِ پیشفرض جای خود را به GPT‑Live‑1 mini میدهد. کاربرانِ نسخهٔ پولی نیز میتوانند از مدلِ قدرتمندترِ GPT‑Live‑1 استفاده کنند.
رفعِ مشکلاتِ نوبتگیری و افزایشِ هوشِ مکالمه
یکی از آزاردهندهترین مشکلاتِ دستیارهای صوتی، قطعِ نابهنگامِ حرفِ کاربر است. OpenAI در نشستِ خبریِ خود اعلام کرد که مدلهای GPT‑Live‑1 این چالشِ تاریخی را تا حدِ زیادی کاهش دادهاند.
علاوه بر این، زمانی که مدلِ جدید با پرسشهای پیچیدهای روبهرو میشود که نیازمندِ جستوجو، استدلال یا قابلیتهای عاملیت (agentic) است، در حینِ ادامهٔ مکالمه و بدونِ وقفه درخواست را به جدیدترین مدلهایِ متنیِ خود مانند GPT‑5.5 ارسال میکند. این یعنی کاربران در میانهٔ یک گفتوگوی طولانی مجبور به انتظارِ طولانی برای دریافتِ پاسخ نیستند.
سکوتِ استراتژیک و خروجیهای بصری
قابلیتِ قابلتوجهِ دیگرِ این مدلها، تواناییِ حفظِ سکوت برای مدتزمانِ طولانی و درکِ کاملِ بافتِ مکالمه تا زمانی است که کاربر مستقیماً با آنها سخن گوید.
از آنجا که این رابطِ صوتی به نسلهایِ جدیدترِ مدلهای GPT متصل است، میتواند بخشی از اطلاعات و پاسخها را بهصورتِ بصری و گرافیکی ارائه دهد؛ رویکردی که برخی استارتاپها مانندِ Monogram (که اخیراً ۴۰ میلیون دلار سرمایهٔ اولیه جذب کردهاست) نیز برای تعاملیتر کردنِ دستیارها دنبال میکنند.
صداهای طولانیتر؛ رابطِ اصلیِ رایانش در آینده
آتیِ التی (Atty Eleti)، رئیسِ محصولِ ChatGPT Voice، در خصوصِ اهدافِ جدیدِ شرکت گفت: «با گذشتِ زمان، این قابلیتها امکانِ استفاده از صدا را بهعنوانِ رابطِ اصلیِ رایانش و مدیریتِ کارهای پیچیده و طولانیمدت فراهم میکنند؛ همان کارهای شگفتانگیزی که افراد اکنون با Codex و ChatGPT انجام میدهند.»
وی همچنین اشاره کرد که حالتِ صدایِ جدید برای مکالماتِ بسیارِ طولانی طراحی شده است؛ تا جایی که خودِ او در زمانِ پیادهروی مکالماتی ۳۰ تا ۴۰ دقیقهای با این دستیار داشتهاست. بیش از ۱۵۰ میلیون نفر در حالِ حاضر از طریقِ ویژگیهای صوتی و دیکته با ChatGPT ارتباط برقرار میکنند. شایعات و گزارشها حاکی از آن است که OpenAI ممکن است در همین سال، برای تکمیلِ این تجربه هدفونهای مبتنی بر هوشمصنوعی نیز عرضه کند.
رقابتِ تنگاتنگ با غولها و استارتاپها
Apple و Amazon نیز اخیراً دستیارهای خود را برای درکِ بهترِ زمینهٔ مکالمه و لحنِ طبیعیتر بهروزرسانی کردهاند. در کنارِ آنها، استارتاپهایی مانندِ Sesame که توسطِ برندان آیریب (همبنیانگذارِ Oculus) تأسیس شدهاند، در حالِ توسعهٔ هوشمصنوعیهایی هستند که میتوانند بهطورِ همزمان مکالمهای طبیعی داشته باشند و وظایف را در پسزمینه انجام دهند.
با وجودِ این رقابت، OpenAI تأکید دارد که هدفش ساختِ یک «همدمِ هوشمصنوعی» نیست. مدلهای جدید دارای محافظهایِ امنیتیِ داخلی هستند تا برای نوجوانان پاسخهای متناسب با سن ارائه دهند و در مواجهه با موضوعاتِ حساسی مانندِ خودآزاری فوراً منابعِ کمکرسانی را پیشنهاد کنند.
نقاطِ ضعف در ترجمهٔ زنده و زبانهای دیگر
پیش از آنکه این مدل بینقص به نظر برسد، هنوز نقاطِ ضعفی وجود دارد که باید برطرف شوند. در نمایشِ زندهٔ انجامشده، زمانی که ویژگیِ ترجمهٔ زنده به زبانِ هندی آزمایش شد، دستیار لهجهٔ سنگینِ آمریکایی داشت و هندی را با لحنی نسبتاً ماشینی و کتابی ادا کرد.
OpenAI اعلام کرده است که این حالتِ جدید برای «بیشترِ زبانهای رایج» بهینهسازی شده است، اما از نامبردنِ دقیقِ این زبانها و زمانِ پشتیبانیِ کامل از زبانهای با تمرکزِ کمتر خودداری کردهاست.





