عصر پنجشنبه، دو غول هوش مصنوعی تقریباً همزمان به‌روزرسانی‌های صوتی عمده‌ای را اعلام کردند؛ اما استراتژی‌های آن‌ها برای آینده تعامل صوتی کاربران با هوش مصنوعی کاملاً متفاوت به نظر می‌رسد. OpenAI به سمت تبدیل ChatGPT Voice به ابزاری برای کنترل بی‌سیم رایانه و مدیریت عامل‌های هوش مصنوعی حرکت می‌کند، در حالی که Anthropic تمرکز خود را بر ارتقای Claude به عنوان شریک تفکر برای حل مسائل پیچیده از طریق گفتگو گذاشته است.

این به‌روزرسانی‌ها نشان‌دهنده تغییر بنیادی در نحوه تعامل انسان با هوش مصنوعی هستند؛ جایی که صدا جایگزین انگشتان و کیبورد در فرمان دادن به سرویس‌های هوش مصنوعی می‌شود و حجم و نوع دستوراتی که به این سرویس‌ها صادر می‌کنیم، در آستانه تحولی چشمگیر است.

کنترل دسکتاپ با دستورات صوتی

به‌روزرسانی OpenAI، ChatGPT Voice را از یک ابزار مکالمه ساده فراتر می‌برد و به آن اجازه می‌دهد وظایف پیچیده‌ای را از طریق ChatGPT Work و Codex هماهنگ کند، بدون آنکه کاربر نیازی به جابه‌جایی بین برنامه‌های مختلف داشته باشد. این اعلامیه از نظر دامنه گسترده‌تر از رقیب خود است و GPT-Live را به اپلیکیشن دسکتاپ ChatGPT در هر دو سیستم‌عامل macOS و ویندوز می‌آورد.

کاربران می‌توانند ChatGPT Voice را با میانبر کیبورد یا دکمه Voice راه‌اندازی کنند و همزمان به استفاده عادی از دسکتاپ خود ادامه دهند. در macOS، OpenAI ویژگی جدیدی به نام Appshots معرفی می‌کند که به ChatGPT امکان دیدن برنامه فعال را می‌دهد تا پیش از هرگونه اقدام، درک کند کاربر روی چه پروژه‌ای کار می‌کند.

این به‌روزرسانی نحوه کار جلسات صوتی را نیز متحول می‌کند: ChatGPT اکنون می‌تواند چندین کار را از یک مکالمه واحد آغاز کند، در حالی که درخواست‌های قبلی همچنان در پس‌زمینه اجرا می‌شوند. این قابلیت به کاربر اجازه می‌دهد بدون انتظار برای تکمیل هر وظیفه، دستور بعدی را صادر کند و روند کار او قطع نشود.

GPT-Live در حال ارائه به کاربران پلاس، پرو، کسب‌وکار، سازمانی و آموزش در macOS و ویندوز است. این ویژگی همان محدودیت‌های استفاده ChatGPT Work و Codex را دارد. ChatGPT Remote از قبل در iOS در دسترس است و انتظار می‌رود پشتیبانی از اندروید به‌زودی اضافه شود.

استدلال و حل مسئله از طریق گفتگو

به‌روزرسانی صوتی ChatGPT و Claude

Anthropic مسیر کاملاً متفاوتی را انتخاب کرده است: به‌جای تبدیل صدا به ابزاری برای کنترل نرم‌افزار، این شرکت از صدا برای پشتیبانی از مکالمات طولانی‌تر و تکرارشونده پیرامون مسائل پیچیده استفاده می‌کند.

حالت صدای به‌روزرسانی‌شده Claude به کاربران اجازه می‌دهد درباره یک ایده بحث کنند، از Claude بخواهند پیش از پاسخ دادن عمیق‌تر فکر کند و راه‌حل را در طی چندین تبادل نظر بهبود بخشد. Anthropic با این رویکرد، صحبت درباره کد یا رفع اشکال (دیباگ) را بدون جابه‌جایی مداوم به سمت کیبورد آسان‌تر می‌کند.

ویژگی‌های جدید Claude Code Voice

Claude Code Voice نیز قابلیت‌های جدیدی دریافت کرده است. توسعه‌دهندگان اکنون می‌توانند درخواست‌ها، فرمان‌های ترمینال و تغییرات کد را به صورت صوتی دیکته کنند. این ویژگی به دو روش قابل استفاده است: روشن نگه‌داشتن مداوم صدا یا استفاده از حالت فشاری (push-to-talk).

صدا فراتر از چت‌بات‌ها

اگرچه هر دو شرکت در یک روز ویژگی‌های صوتی خود را گسترش دادند، اما محصولات آن‌ها اهداف متفاوتی را دنبال می‌کنند. OpenAI از صدا برای کار در میان برنامه‌ها و سرویس‌های مختلف استفاده می‌کند و یک لایه کنترلی سراسری می‌سازد، در حالی که Anthropic صدا را عمیق‌تر در Claude و Claude Code ادغام می‌کند.

این به‌روزرسانی‌ها هر دو، صدا را از مکالمات ساده فراتر می‌برند و راهی جدید در اختیار توسعه‌دهندگان قرار می‌دهند تا بدون دست زدن به کیبورد با هوش مصنوعی کار کنند. رقابت میان این دو غول احتمالاً سرعت پیشرفت فناوری‌های صوتی را در ماه‌های آینده شتاب می‌بخشد و تعامل ما با رایانه‌ها را برای همیشه دگرگون می‌کند.