دو معرفی، یک موضوع: سرعت برای عامل‌های هوش مصنوعی

گوگل و OpenAI مدل‌هایی را معرفی یا نمایش دادند که معیار رقابت را از «چه کسی هوش بیشتری دارد» به «چه کسی برای عامل‌های بلادرنگ کافی سریع است» تغییر داده‌اند. گوگل Gemini 3.7 Flash را عمومی کرده و OpenAI نسخهٔ Ultrafast از GPT-5.6 Sol را روی سخت‌افزار Cerebras در یک پیش‌نمایش محدود نشان داده است.

نکات کلیدی

  • دسترسی: Gemini 3.7 Flash اکنون در بیش از 160 کشور در دسترس است؛ GPT-5.6 Sol Ultrafast فعلاً تنها با دعوت برای سازمان‌ها و مشتریان منتخب عرضه می‌شود.
  • سرعت: حالت Ultrafast OpenAI روی چیپ‌های مقیاس‌ورقه‌ای Cerebras تا 750 توکن خروجی در ثانیه (حدود 560 کلمه) گزارش شده؛ OpenAI اعلام کرده این تا 14 برابر سریع‌تر از حالت استاندارد GPT-5.6 Sol است.
  • دامنه ورودی/خروجی: Gemini 3.7 Flash تا 1,000,000 توکن ورودی (~750,000 کلمه) و حداکثر 64,000 توکن خروجی را پشتیبانی می‌کند و قادر به پردازش متن، تصویر، ویدئو، صوت و PDF است و می‌تواند ابزارها را فراخوانی کند.

چه ویژگی‌هایی Gemini 3.7 Flash را متمایز می‌کند؟

گوگل مدل را برای کدنویسی، توسعه وب و جریان‌های کاری خودران سازمانی بهینه کرده است. براساس معیارهای منتشرشده توسط خود گوگل، Gemini 3.7 Flash در 11 از 18 دسته آزمایشی از رقبایی مثل Claude Sonnet 5 و GPT-5.6 Terra جلوتر بوده است؛ از جمله امتیاز 1,588 Elo در Code Arena و 30.4% در AutomationBench برای وظایف سازمانی. این آمارها بر پایه روش‌شناسی اعلام‌شده توسط گوگل ارائه شده‌اند و باید هنگام ارزیابی دیده شوند.

صفحه معرفی Gemini 3.7 Flash گوگل

قابلیت‌های عملیاتی: Gemini 3.7 Flash می‌تواند ابزارها را فراخوانی کند، سیستم‌ها را کنترل نماید و فرایندهای چندمرحله‌ای را با دخالت کمتر انسان اجرا کند؛ گوگل به آن «مغز کم‌هزینه» برای سیستم‌های خودکار می‌گوید. تعرفه معرفی تا پایان سال رقابتی است: 0.75 دلار به ازای هر میلیون توکن ورودی و 3.75 دلار به ازای هر میلیون توکن خروجی؛ پس از 31 دسامبر نرخ‌ها به 1.50 و 7.50 دلار افزایش می‌یابد.

چه تجربه‌ای GPT-5.6 Sol Ultrafast ارائه می‌دهد؟

حالت Ultrafast مدل جدیدی نیست؛ همان GPT-5.6 Sol است که اکنون روی زیرساختی اجرا می‌شود که تمرکز روی افزایش سرعت دارد. با استفاده از چیپ‌های Cerebras، OpenAI خروجی تا 750 توکن در ثانیه گزارش کرده است. این سطح سرعت به‌ویژه برای عامل‌های صوتی حیاتی است؛ شرکت‌ها خبر داده‌اند مدل می‌تواند در خلال تماس تلفنی پاسخ‌ها را تقریباً «در لحظه» تولید کند و تجربه مکالمه را متحول نماید.

نمونه استفاده از GPT-5.6 Sol Ultrafast در عامل‌های صوتی

تا کنون OpenAI امتیازات مقایسه‌ای گسترده‌ای برای حالت Ultrafast منتشر نکرده و بیشتر به بازخورد مشتریان استناد می‌کند؛ مشتریان می‌گویند سرعت بالاتر فرصت‌های جدیدی برای کاربرد مدل‌ها فراهم می‌کند و کیفیت تعاملات صوتی را بهبود می‌بخشد. فعلاً دسترسی به این حالت از طریق دعوت در API ممکن شده و OpenAI وعده داده با افزایش ظرفیت، دسترسی را توسعه خواهد داد.

اعداد کلیدی

  • حداکثر ورودی Gemini: 1,000,000 توکن
  • حداکثر خروجی Gemini: 64,000 توکن
  • سرعت Ultrafast OpenAI: تا 750 توکن در ثانیه (حدود 560 کلمه)
  • قیمت معرفی Gemini تا پایان سال: 0.75 دلار (ورودی) / 3.75 دلار (خروجی) به ازای هر میلیون توکن

پیامدها برای توسعه‌دهندگان و کسب‌وکارها

تمرکز بازار روی سرعت نشان می‌دهد معیار موفقیت مدل‌ها از «هوشمندی خام» به «قابلیت اجرا در زمان واقعی» تغییر کرده است. برای توسعه‌دهندگانی که روی عامل‌های صوتی، ربات‌های پاسخ‌گو و اتوماسیون فرآیند کار کار می‌کنند، دسترسی عمومی و هزینه پایین Gemini گزینهٔ جذابی است. سازمان‌هایی که به تأخیر بسیار پایین نیاز دارند ممکن است فعلاً به راه‌حل‌های دعوتی و سخت‌افزار اختصاصی مانند Ultrafast تکیه کنند.

راهنمای تصمیم‌گیری

  • دسترسی فوری و هزینه پایین اولویت دارد: Gemini 3.7 Flash گزینهٔ عملی‌تر است.
  • نیاز به تأخیر کمتر از چند ثانیه و تجربه صوتی بی‌وقفه: Ultrafast، هرچند فعلاً محدود و دعوتی، مناسب‌تر است.
  • برای شرکت‌های بزرگ: ترکیب مدل‌های عمومی با ارائه‌دهندگان سخت‌افزار پرسرعت می‌تواند تعادلی بین هزینه و عملکرد ایجاد کند.

چه‌چیزی در ادامه محتمل است

گوگل هنوز Gemini 3.5 Pro را به‌صورت گسترده عرضه نکرده و تغییرات مدیریتی در DeepMind ممکن است زمان‌بندی عرضه‌ها را تحت‌تأثیر قرار دهد. OpenAI نیز برای افزایش سرعت از ظرفیت‌های خارجی استفاده می‌کند تا زیرساخت داخلی خود را توسعه دهد. نتیجهٔ این رقابت برای کاربران نهایی روشن است: مدل‌ها روز‌به‌روز سریع‌تر و کاربردی‌تر می‌شوند، به‌خصوص در کاربردهایی که به پاسخ بلادرنگ وابسته‌اند.

منابع فنی برای مطالعه بیشتر: صفحهٔ Large language model در ویکی‌پدیا و سایت Cerebras.