گوگل با رونمایی از Gemini Ultra در دسامبر 2023، مستقیماً مدل GPT-4 را به چالش کشید؛ مدلی که از زمان عرضه‌اش در مارس 2023 بر چشم‌انداز هوش مصنوعی مولد مسلط بود. این دو مدل به‌عنوان برترین پلتفرم‌های هوش مصنوعی در جهان شناخته می‌شوند و تحلیل‌های صنعت نشان می‌دهد که در بنچمارک‌های استدلال عملکردی بسیار نزدیک به یکدیگر دارند. با این حال، بررسی دقیق اعداد و ارقام تفاوت‌های پنهانی را برجسته می‌کند که انتخاب بین این دو غول را برای توسعه‌دهندگان و سازمان‌ها دگرگون می‌کند.

مروری بر مدل‌ها و مشخصات کلیدی

OpenAI مدل GPT-4 را در 14 مارس 2023 عرضه کرد، در حالی که گوگل حدود 9 ماه بعد، در 6 دسامبر 2023، Gemini Ultra را به بازار آورد. هر دو مدل اختصاصی و غیرمتن‌باز هستند، اما از نظر معماری فنی و نحوه دسترسی تفاوت‌های چشمگیری دارند.

مشخصات GPT-4 Gemini Ultra
ارائه‌دهنده OpenAI Google
تاریخ عرضه 14 مارس 2023 6 دسامبر 2023
طول زمینه 8,192 توکن 32,800 توکن
حداکثر خروجی 8,192 توکن 8,192 توکن
زمان توقف دانش سپتامبر 2021 نامشخص
متن‌باز خیر خیر
دسترسی از طریق API OpenAI API Vertex AI

چشمگیرترین تفاوت در سطح پردازش، پنجره زمینه است. GPT-4 پنجره زمینه‌ای برابر با 8,192 توکن دارد، در حالی که Gemini Ultra این ظرفیت را چهار برابر کرده و به 32,800 توکن رسانده است. هر دو مدل می‌توانند در یک پاسخ واحد حداکثر 8,192 توکن تولید کنند. تفاوت قابل‌توجه دیگر، زمان توقف داده‌های آموزشی است: دانش GPT-4 در سپتامبر 2021 متوقف می‌شود، در حالی که گوگل زمان دقیق توقف دانش Gemini Ultra را اعلام نکرده است. دسترسی به این مدل‌ها نیز بستگی به اکوسیستم دارد؛ GPT-4 از طریق API شرکت OpenAI و Gemini Ultra از طریق پلتفرم Vertex AI گوگل ارائه می‌شود.

مقایسه هزینه‌ها و شفافیت قیمت‌گذاری

شفافیت هزینه یکی از حوزه‌هایی است که این دو مدل در آن تفاوت زیادی دارند. قیمت‌گذاری GPT-4 به‌روشنی منتشر شده است:

  • هزینه ورودی: 30 دلار به ازای هر 1 میلیون توکن
  • هزینه خروجی: 60 دلار به ازای هر 1 میلیون توکن

در مقابل، قیمت‌گذاری Gemini Ultra در داده‌های اولیه مقایسه به‌صورت عمومی در دسترس نبود. این موضوع تحلیل مستقیم صرفه‌اقتصادی را برای استقرارهای گسترده سازمانی پیچیده می‌کند. سازمان‌هایی که برای پروژه‌های بزرگ بودجه‌بندی می‌کنند، در حال حاضر در سمت OpenAI با ارقام مشخص‌تری روبه‌رو هستند.

عملکرد در بنچمارک‌ها: نتایج رو‌در‌رو

رقابت واقعی این دو مدل در بنچمارک‌ها آشکار می‌شود. پس از عرضه Gemini، گوگل جدولی مقایسه‌ای منتشر کرد که عملکرد هر دو مدل را در آزمون‌های دانش عمومی، استدلال، ریاضیات و تولید کد نشان می‌داد. امتیاز دو مدل در بنچمارک‌های کلیدی صنعت به این شرح است:

بنچمارک GPT-4 Gemini Ultra
MMLU (دانش عمومی) 86.4% 83.7%
MMMU (چندرسانه‌ای) 34.9% 59.4%
HellaSwag (استدلال عرفی) 95.3% در دسترس نیست
GSM8K (ریاضیات مقطع ابتدایی) 92% 88.9%
HumanEval (تولید کد پایتون) 67% 74.4%
MATH (ریاضیات پیشرفته) 52.9% (گزارش‌شده) 53.2%

دانش عمومی (MMLU)

MMLU میزان کسب دانش یک مدل زبانی بزرگ را در شرایط بدون نمونه و کم‌نمونه ارزیابی می‌کند. این بنچمارک توانایی هوش مصنوعی را در درک و پاسخ‌گویی به پرسش‌ها در 57 حوزه بررسی می‌کند؛ از علوم، فناوری، مهندسی و ریاضیات گرفته تا علوم انسانی. به بیان ساده، این آزمون مدل را درباره همه‌چیز، از ادبیات شکسپیر گرفته تا قوانین ترمودینامیک، به چالش می‌کشد. در این بخش، GPT-4 با امتیاز 86.4% در برابر 83.7% Gemini Ultra برتری دارد؛ اختلافی برابر با 2.7 واحد درصد.

درک چندوجهی (MMMU)

MMMU یک بنچمارک گسترده، چندرشته‌ای و چندوجهی است و Gemini Ultra در همین بخش قاطع‌ترین پیروزی خود را به دست می‌آورد. مدل گوگل امتیاز 59.4% را کسب کرد و با اختلاف چشمگیر 24.5 واحد درصدی، GPT-4 را با امتیاز 34.9% پشت سر گذاشت. این نتیجه نشان می‌دهد که Gemini Ultra هنگام انجام وظایفی که به استدلال چندوجهی در حوزه‌های مختلف نیاز دارند، برتری قابل‌توجهی دارد.

استدلال عرفی و ریاضیات (HellaSwag و GSM8K)

HellaSwag بنچمارکی برای تکمیل جمله است که استدلال عرفی در موقعیت‌های روزمره را می‌سنجد؛ برای مثال، پیش‌بینی اتفاق بعدی در یک سناریوی ساده. GPT-4 در این بخش با امتیاز 95.3% عملکرد درخشانی دارد و داده‌های مربوط به Gemini Ultra در دسترس نبود. در زمینه ریاضیات مقطع ابتدایی (GSM8K)، GPT-4 با 92% در برابر 88.9% مدل گوگل قرار گرفت. با این حال، در آزمون ریاضیات پیشرفته (MATH)، رقابت به‌شدت نزدیک بود و Gemini Ultra با 53.2% به‌طور محسوسی از GPT-4 (52.9%) پیشی گرفت.

تولید کد پایتون (HumanEval)

HumanEval توانایی مدل را در تولید کدهای پایتون کاربردی و از نظر منطق صحیح ارزیابی می‌کند. در این بخش نیز Gemini Ultra برتری خود را نشان داد و با کسب 74.4% امتیاز، مدل GPT-4 را که 67% امتیاز کسب کرده بود، شکست داد. این یعنی توسعه‌دهندگان به احتمال زیاد در تولید اسکریپت‌ها و تکه‌کدهای پایه از مدل گوگل نتایج بهتری خواهند گرفت.

انتخاب بین این دو مدل نهایی نیست، بلکه کاملاً به نیاز پروژه وابسته است. در حالی که GPT-4 همچنان در درک دانش عمومی و استدلال‌های روزمره قدرتمندتر به نظر می‌رسد، Gemini Ultra با پنجره زمینه چهار برابری و عملکرد چشمگیر در پردازش چندوجهی و تولید کد، مسیر جدیدی را برای پروژه‌های پیچیده باز کرده است. آینده رقابت هوش مصنوعی به اینجا ختم نمی‌شود و توسعه‌دهندگان باید منتظر نسخه‌های جدیدتر و غلبه بر محدودیت‌های فعلی باشند.