پایان دوران خط لوله‌های مصنوعی در هوش مصنوعی

رونمایی OpenAI از مدل GPT-4o در ماه مه 2024، فصل تازه‌ای در تعامل انسان و ماشین باز کرد. حرف o در نام این سیستم مخفف omni به معنای همه‌جانبة جامع است که دقیقاً توصیف‌کننده توانایی زیربنایی آن محسوب می‌شود. این شبکه عصبی واحد می‌تواند در لحظه بر روی داده‌های صوتی، تصویری و متنی استدلال کند، هر ترکیبی را به عنوان ورودی بپذیرد و خروجی‌های چندرسانه‌ای تولید کند. این تغییر پارادایم باعث شد کاربران و توسعه‌دهندگان نحوه تعامل با دستیارهای هوشمند را کاملاً متحول ببینند.

تا پیش از معرفی این نسخه، حالت صوتی چت‌جی‌پی‌تی بر پایه یک خط لوله‌ سه‌مرحله‌ای استوار بود. ابتدا یک مدل صوت را به متن تبدیل می‌کرد، سپس GPT-3.5 یا GPT-4 Turbo متن پردازش‌شده را بررسی و پاسخ می‌داد و در نهایت مدل سوم، آن پاسخ متنی را به صدا برمی‌گرداند. این رویکرد تکه‌تکه نه‌تنها تأخیر قابل‌توجهی ایجاد می‌کرد (میانگین 2.8 ثانیه برای نسخه قدیمی‌تر و 5.4 ثانیه برای نسخه پیشرفته‌تر)، بلکه باعث از دست رفتن جزئیات حیاتی می‌شد. مدل قبلی نمی‌توانست لحن کلام، حضور هم‌زمان چند گوینده یا صداهای محیطی را درک کند و توانایی تولید خنده یا تغییرات احساسی در خروجی صوتی نداشت.

مقایسه معماری خط لوله قدیمی و مدل جدید همه‌جانبة GPT-4o

GPT-4o این شکاف را به‌کلی پر کرد. OpenAI با آموزش یک مدل واحد از ابتدا تا انتها بر روی داده‌های چندرسانه‌ای، تمام ورودی‌ها و خروجی‌ها را در یک چرخه عصبی یکپارچه مدیریت می‌کند. نتیجه این معماری جدید چشمگیر است: پاسخ‌دهی صوتی به کسری از ثانیه کاهش یافته و به میانگین 320 میلی‌ثانیه (و گاهی کمتر از 232 میلی‌ثانیه) رسیده است که دقیقاً در حد زمان واکنش طبیعی یک انسان در مکالمات روزمره قرار می‌گیرد. تیم فنی شرکت اعلام کرده که با وجود موفقیت‌های اولیه، هنوز در ابتدای راه کاوش توانایی‌ها و محدودیت‌های واقعی این مدل هستند.

عملکرد در محک‌های استاندارد و بهینه‌سازی هزینه‌های API

در تست‌های استاندارد هوش مصنوعی، این مدل عملکردی در سطح نسخه‌های قبلی در درک متن، استدلال منطقی و کدنویسی از خود نشان می‌دهد، اما رکوردهای جدیدی را در حوزه‌های چندزبانه، صوتی و بینایی ماشین ثبت کرده است. طبق مستندات منتشرشده، نمره 88.7 در محک درک چندوظیفه گسترده (MMLU) کسب کرده که نسبت به نسخه قبل بهبود ملموسی نشان می‌دهد. در زمان عرضه، نسخه پیش‌نمایش این مدل رکوردهای جدیدی در زمینه تشخیص گفتار، ترجمه زنده و تحلیل تصویر به ثبت رساند.

OpenAI همچنین بر کاهش چشمگیر هزینه‌ها و افزایش سرعت API تأکید کرده است. شرکت مدعی است پردازش این مدل تا 50 درصد ارزان‌تر تمام می‌شود و سرعت پاسخ‌دهی به مراتب بالاتر رفته است. در روزهای نخست معرفی، پشتیبانی از بیش از 50 زبان فعال بود که ادعا می‌شود گنجایش بیش از 97 درصد گویندگان روی زمین را پوشش می‌دهد.

ارتقای توکن‌ساز و انقلاب در پردازش زبان‌های غیرانگلیسی

یکی از تغییرات فنی که کمتر به آن توجه شد، نوسازی توکن‌ساز (Tokenizer) داخلی مدل است. این بهینه‌سازی فشرده‌سازی متن را در خانواده‌های زبانی مختلف به شکل قابل‌توجهی بهبود بخشید. داده‌های فنی منتشرشده OpenAI نشان می‌دهد کاهش تعداد توکن‌های مورد نیاز در زبان‌های مختلف به شرح زیر است:

  • گجراتی: 4.4 برابر توکن کمتر (کاهش از 145 به 33)
  • تلوگو: 3.5 برابر توکن کمتر (کاهش از 159 به 45)
  • تامل: 3.3 برابر توکن کمتر (کاهش از 116 به 35)
  • مراتی و هندی: هر کدام 2.9 برابر کاهش
  • اردو: 2.5 برابر کاهش
  • عربی: 2.0 برابر کاهش
  • فارسی: 1.9 برابر کاهش
  • روسی و کره‌ای: هر کدام 1.7 برابر کاهش
  • ویتنامی: 1.5 برابر کاهش
  • چینی و ژاپنی: هر کدام 1.4 برابر کاهش
  • ترکی: 1.3 برابر کاهش
  • زبان‌های اروپایی (ایتالیایی، آلمانی، اسپانیایی، پرتغالی، فرانسوی، انگلیسی): 1.1 تا 1.2 برابر کاهش
نمونه کاهش تعداد توکن‌ها در زبان‌های مختلف با توکن‌ساز جدید

این کاهش حجم توکن مستقیماً به معنای کاهش هزینه‌های محاسباتی و سرعت پردازش بالاتر برای کاربران سراسر جهان است. این نوآوری ادعای توسعه‌دهندگان مبنی بر بهبود ساختاری در پردازش متن‌های غیرانگلیسی را کاملاً تأیید می‌کند.

درک بصری در عمل و ردیابی اقدامات فیزیکی

گزارش‌های راه‌اندازی OpenAI توانایی بینایی ماشین این مدل را با نمایشی خیره‌کننده به اثبات رساندند. در این آزمایش، دوربین دید اول شخص یک ربات را نشان می‌داد که دفتری را روی یک ماشین تایپ کلاسیک پر می‌کند. مدل دقیقاً توانست مراحل نوشتن، حرکت فیزیکی صفحه کاغذ به سمت بالا، و حتی لایه‌لایه کردن برگه کاغذ در پایان کار را به صورت پیوسته ردیابی و درک کند. این سطح از هماهنگی بصری نشان می‌دهد که سیستم صرفاً پردازشگر کلمات نیست، بلکه قادر به درک فضای فیزیکی و توالی رویدادها در محیط واقعی است.

مسیر تکامل هوش مصنوعی همیشه با پرش‌های ناگهانی تعریف می‌شود و این مدل دقیقاً در جهت هموار کردن مرزهای میان پاسخ‌های خشک ماشینی و گفتوگوهای زنده انسانی حرکت می‌کند. اگر توسعه‌دهندگان و تیم‌های محصول بخواهند بهترین بازدهی را از این قابلیت‌های جدید بگیرند، باید معماری‌های کلاینت و سرور خود را برای مدیریت جریان‌های چندرسانه‌ای همزمان به‌روز کنند و زیرساخت‌های پردازش را برای بهره‌برداری از پاسخ‌دهی در حد میلی‌ثانیه بهینه سازند.