گوگل با رونمایی از Gemini Ultra در دسامبر 2023، مستقیماً مدل GPT-4 را به چالش کشید؛ مدلی که از زمان عرضهاش در مارس 2023 بر چشمانداز هوش مصنوعی مولد مسلط بود. این دو مدل بهعنوان برترین پلتفرمهای هوش مصنوعی در جهان شناخته میشوند و تحلیلهای صنعت نشان میدهد که در بنچمارکهای استدلال عملکردی بسیار نزدیک به یکدیگر دارند. با این حال، بررسی دقیق اعداد و ارقام تفاوتهای پنهانی را برجسته میکند که انتخاب بین این دو غول را برای توسعهدهندگان و سازمانها دگرگون میکند.
مروری بر مدلها و مشخصات کلیدی
OpenAI مدل GPT-4 را در 14 مارس 2023 عرضه کرد، در حالی که گوگل حدود 9 ماه بعد، در 6 دسامبر 2023، Gemini Ultra را به بازار آورد. هر دو مدل اختصاصی و غیرمتنباز هستند، اما از نظر معماری فنی و نحوه دسترسی تفاوتهای چشمگیری دارند.
| مشخصات | GPT-4 | Gemini Ultra |
|---|---|---|
| ارائهدهنده | OpenAI | |
| تاریخ عرضه | 14 مارس 2023 | 6 دسامبر 2023 |
| طول زمینه | 8,192 توکن | 32,800 توکن |
| حداکثر خروجی | 8,192 توکن | 8,192 توکن |
| زمان توقف دانش | سپتامبر 2021 | نامشخص |
| متنباز | خیر | خیر |
| دسترسی از طریق API | OpenAI API | Vertex AI |
چشمگیرترین تفاوت در سطح پردازش، پنجره زمینه است. GPT-4 پنجره زمینهای برابر با 8,192 توکن دارد، در حالی که Gemini Ultra این ظرفیت را چهار برابر کرده و به 32,800 توکن رسانده است. هر دو مدل میتوانند در یک پاسخ واحد حداکثر 8,192 توکن تولید کنند. تفاوت قابلتوجه دیگر، زمان توقف دادههای آموزشی است: دانش GPT-4 در سپتامبر 2021 متوقف میشود، در حالی که گوگل زمان دقیق توقف دانش Gemini Ultra را اعلام نکرده است. دسترسی به این مدلها نیز بستگی به اکوسیستم دارد؛ GPT-4 از طریق API شرکت OpenAI و Gemini Ultra از طریق پلتفرم Vertex AI گوگل ارائه میشود.
مقایسه هزینهها و شفافیت قیمتگذاری
شفافیت هزینه یکی از حوزههایی است که این دو مدل در آن تفاوت زیادی دارند. قیمتگذاری GPT-4 بهروشنی منتشر شده است:
- هزینه ورودی: 30 دلار به ازای هر 1 میلیون توکن
- هزینه خروجی: 60 دلار به ازای هر 1 میلیون توکن
در مقابل، قیمتگذاری Gemini Ultra در دادههای اولیه مقایسه بهصورت عمومی در دسترس نبود. این موضوع تحلیل مستقیم صرفهاقتصادی را برای استقرارهای گسترده سازمانی پیچیده میکند. سازمانهایی که برای پروژههای بزرگ بودجهبندی میکنند، در حال حاضر در سمت OpenAI با ارقام مشخصتری روبهرو هستند.
عملکرد در بنچمارکها: نتایج رودررو
رقابت واقعی این دو مدل در بنچمارکها آشکار میشود. پس از عرضه Gemini، گوگل جدولی مقایسهای منتشر کرد که عملکرد هر دو مدل را در آزمونهای دانش عمومی، استدلال، ریاضیات و تولید کد نشان میداد. امتیاز دو مدل در بنچمارکهای کلیدی صنعت به این شرح است:
| بنچمارک | GPT-4 | Gemini Ultra |
|---|---|---|
| MMLU (دانش عمومی) | 86.4% | 83.7% |
| MMMU (چندرسانهای) | 34.9% | 59.4% |
| HellaSwag (استدلال عرفی) | 95.3% | در دسترس نیست |
| GSM8K (ریاضیات مقطع ابتدایی) | 92% | 88.9% |
| HumanEval (تولید کد پایتون) | 67% | 74.4% |
| MATH (ریاضیات پیشرفته) | 52.9% (گزارششده) | 53.2% |
دانش عمومی (MMLU)
MMLU میزان کسب دانش یک مدل زبانی بزرگ را در شرایط بدون نمونه و کمنمونه ارزیابی میکند. این بنچمارک توانایی هوش مصنوعی را در درک و پاسخگویی به پرسشها در 57 حوزه بررسی میکند؛ از علوم، فناوری، مهندسی و ریاضیات گرفته تا علوم انسانی. به بیان ساده، این آزمون مدل را درباره همهچیز، از ادبیات شکسپیر گرفته تا قوانین ترمودینامیک، به چالش میکشد. در این بخش، GPT-4 با امتیاز 86.4% در برابر 83.7% Gemini Ultra برتری دارد؛ اختلافی برابر با 2.7 واحد درصد.
درک چندوجهی (MMMU)
MMMU یک بنچمارک گسترده، چندرشتهای و چندوجهی است و Gemini Ultra در همین بخش قاطعترین پیروزی خود را به دست میآورد. مدل گوگل امتیاز 59.4% را کسب کرد و با اختلاف چشمگیر 24.5 واحد درصدی، GPT-4 را با امتیاز 34.9% پشت سر گذاشت. این نتیجه نشان میدهد که Gemini Ultra هنگام انجام وظایفی که به استدلال چندوجهی در حوزههای مختلف نیاز دارند، برتری قابلتوجهی دارد.
استدلال عرفی و ریاضیات (HellaSwag و GSM8K)
HellaSwag بنچمارکی برای تکمیل جمله است که استدلال عرفی در موقعیتهای روزمره را میسنجد؛ برای مثال، پیشبینی اتفاق بعدی در یک سناریوی ساده. GPT-4 در این بخش با امتیاز 95.3% عملکرد درخشانی دارد و دادههای مربوط به Gemini Ultra در دسترس نبود. در زمینه ریاضیات مقطع ابتدایی (GSM8K)، GPT-4 با 92% در برابر 88.9% مدل گوگل قرار گرفت. با این حال، در آزمون ریاضیات پیشرفته (MATH)، رقابت بهشدت نزدیک بود و Gemini Ultra با 53.2% بهطور محسوسی از GPT-4 (52.9%) پیشی گرفت.
تولید کد پایتون (HumanEval)
HumanEval توانایی مدل را در تولید کدهای پایتون کاربردی و از نظر منطق صحیح ارزیابی میکند. در این بخش نیز Gemini Ultra برتری خود را نشان داد و با کسب 74.4% امتیاز، مدل GPT-4 را که 67% امتیاز کسب کرده بود، شکست داد. این یعنی توسعهدهندگان به احتمال زیاد در تولید اسکریپتها و تکهکدهای پایه از مدل گوگل نتایج بهتری خواهند گرفت.
انتخاب بین این دو مدل نهایی نیست، بلکه کاملاً به نیاز پروژه وابسته است. در حالی که GPT-4 همچنان در درک دانش عمومی و استدلالهای روزمره قدرتمندتر به نظر میرسد، Gemini Ultra با پنجره زمینه چهار برابری و عملکرد چشمگیر در پردازش چندوجهی و تولید کد، مسیر جدیدی را برای پروژههای پیچیده باز کرده است. آینده رقابت هوش مصنوعی به اینجا ختم نمیشود و توسعهدهندگان باید منتظر نسخههای جدیدتر و غلبه بر محدودیتهای فعلی باشند.





