علی‌بابا مدل Qwen3.8-Max را با 2.4 تریلیون پارامتر رونمایی کرد

Qwen3.8-Max برای اجرای پروژه‌های خودگردان و چندمرحله‌ای طراحی شده است؛ از بازتولید و بهبود نتایج پژوهشی و توسعه نرم‌افزار تا طراحی تراشه و مدیریت شبیه‌سازی مالی در تجارت الکترونیک. وزن‌های این مدل هفته آینده منتشر می‌شوند و نسخه‌های قابل دسترس آن هم‌اکنون از طریق طرح Token، Qoder و QoderWork در دسترس است.

نکات کلیدی

  • پارامترها: مجموع 2.4 تریلیون پارامتر؛ حدود 95 میلیارد پارامتر فعال در هر اجرای پرسش.
  • هدف طراحی: انجام خودگردان وظایف طولانی که روزها یا صدها دور تعامل نیاز دارند.
  • دسترس‌پذیری: اولین مدل از کلاس Qwen‑Max که وزن‌های آن عمومی خواهد شد.
  • موارد آزمایشی: توسعه نرم‌افزار، بازتولید مقاله پژوهشی، بهینه‌سازی طراحی تراشه و مدیریت کسب‌وکار شبیه‌سازی‌شده.

معماری و هدف طراحی

Qwen3.8-Max مبتنی بر معماری Qwen3.5 توسعه یافته و به‌جای پاسخ‌های تک‌مرحله‌ای، بر انجام سلسله‌مراتبی و مستقل از کارها تمرکز دارد. مدل طوری تیون شده که در هر بار اجرا حدود 95 میلیارد پارامتر فعال شوند تا مصرف حافظه و محاسبات برای عملیات بلندمدت و چندمرحله‌ای بهتر مدیریت شود. انتشار عمومی وزن‌ها می‌تواند روند پژوهش مستقل و توسعه کاربردهای تخصصی را تسریع کند. (معرفی علی‌بابا: Wikipedia.)

نمونه‌های کدنویسی خودگردان

سه مطالعه موردی نشان‌دهنده توانمندی مدل در پروژه‌های خودگردان کدنویسی است:

  • توسعه ابزار خط فرمان: طی 16 روز، مدل ابزار oh-my-cli را از تبدیل درخواست‌ها به issue در GitHub تا تخصیص وظایف، نوشتن کد، اجرای تست و تکرار توسعه داد. خروجی شامل 265 commit، 127 pull request و 151 issue بود؛ همه بدون دخالت انسانی.
  • بازتولید و بهبود مقاله پژوهشی: مدل مقاله «Unified Data Selection for LLM Reasoning» را بدون کد آغازین دریافت و در حدود 5 روز و 125 ساعت محاسبات، 7,600 خط کد نوشت و 33 job آموزشی اجرا کرد؛ ابتدا شش نتیجه اصلی مقاله را بازتولید و سپس با آزمایش 18 ایده در چهار دور، در بنچ‌مارک ریاضی AIME24 روش مقاله را با اختلاف 2.7 امتیاز پشت سر گذاشت.
  • چالش چندرسانه‌ای Tianchi: در چالش تشخیص نیت گفتگوی چندرسانه‌ای WWW2025، مدل در 24 ساعت چندین مدل چینی و Qwen2.5‑VL‑7B را فاین‌تیون و آن‌ها را با یک سامانه رأی‌گیری ترکیب کرد؛ طی 45 ارسال دقت از 0.60 به 0.853 رسید و از 458 تیم انسانی پیشی گرفت.
عملکرد کدنویسی خودگردان Qwen3.8-Max در توسعه oh-my-cli

طراحی تراشه: کاهش گیت‌ها و بهینه‌سازی فیزیکی

در آزمایشی مبتنی بر معیار تعداد گیت‌های منطقی، مدل از طراحی اولیه 8,298 گیت شروع کرد و پس از تقریباً 500 تکرار آن را به 678 گیت کاهش داد. پس از اجرای چیدمان خودکار با ابزار متن‌باز OpenROAD، مساحت تراشه از 106×106 میکرومتر به 46×46 میکرومتر کاهش یافت (حدود 81 درصد کاهش). تیم توسعه گزارش کرده که تغییرات ساختاری عمیق و نه صرفاً اصلاحات سطحی، عامل اصلی بهبود بود.

نمونه بهینه‌سازی طراحی تراشه توسط Qwen3.8-Max

شبیه‌سازی سال مالی: مدیریت تجارت الکترونیک در مقیاس

در بنچ‌مارک E-Commerce-Bench، مدل یک سال مالی کامل را در محیط فروش آنلاین (با داده‌های ناشناس‌شده از Taobao و Tmall) از مدیریت خرید و قیمت‌گذاری تا مقابله با بازگشت‌ها و بحران‌ها اجرا کرد. با سرمایه اولیه 100,000 یوان و میان 152 تأمین‌کننده که 152 مورد کلاهبردار پنهان داشتند، شبیه‌سازی با تراز نهایی 416,252 یوان پایان یافت؛ حدود چهار برابر سرمایه اولیه، 38 درصد بهتر از رکورد نفر دوم (GLM 5.2) و بیش از 2.5 برابر بهتر از Qwen3.7-Max.

مهارت‌های چندرسانه‌ای و بازسازی اپلیکیشن‌ها بدون دسترسی به کد منبع

مدل می‌تواند اسناد تا بیش از 200 صفحه و ویدئوهای طولانی‌تر از 100 ساعت را پردازش کند. بنچ‌مارک جدید RecreationBench معرفی شد که در آن مدل باید برنامه‌های در حال اجرا را بدون دسترسی به کد منبع و تنها از طریق تعامل با رابط کاربری (کلیک‌ها و ورودی‌های صفحه‌کلید) بازسازی کند. آزمایش‌ها روی Ubuntu، macOS، Windows، Android و وب انجام شده و نشان می‌دهد مدل قابلیت اجرای وظایف تعاملی در محیط‌های گرافیکی را دارد.

قابلیت‌های چندرسانه‌ای و بازسازی اپلیکیشن در Qwen3.8-Max

عملکرد نسبت به رقبا و دسترسی پژوهشی

بنچ‌مارک‌های داخلی علی‌بابا نشان می‌دهند Qwen3.8-Max در معیارهای منتخب با مدل‌های پیشرو غربی قابل رقابت است؛ هرچند بررسی‌های مستقل برای تائید نهایی ضروری است. دسترسی به وزن‌ها فرصت‌هایی برای توسعه ابزارهای تخصصی، پژوهش‌های کاربردی و ارزیابی عملکرد در وظایف بلندمدت فراهم می‌آورد. برای مروری بر مدل‌های زبانی بزرگ: Wikipedia؛ و برای گزارش‌های خبری و تخصصی می‌توان منابعی مانند TechCrunch را دنبال کرد.

چالش‌ها و الزامات نظارتی

پیشرفت در اجرای وظایف خودگردان بلندمدت کاربردهای نوآورانه‌ای می‌آفریند، اما همراه آن مسئولیت‌های نظارتی، هزینه‌های محاسباتی و نیاز به ارزیابی مستقل برای امنیت و شفافیت باقی می‌ماند. انتشار وزن‌ها امکان بررسی دقیق‌تر را فراهم می‌کند، اما ریسک‌های احتمالی سوءاستفاده و ضرورت تدوین چارچوب‌های اخلاقی و قانونی را نیز افزایش می‌دهد.

جمع‌بندی

Qwen3.8-Max نشان‌دهنده جهشی در جهت‌گیری مدل‌های زبانی به انجام وظایف بلندمدت و خودگردان است. انتشار عمومی وزن‌ها فضای بررسی و توسعه را برای پژوهشگران و توسعه‌دهندگان باز می‌کند؛ مرحله‌ای که تعیین خواهد کرد این‌گونه مدل‌ها تا چه اندازه می‌توانند کارهای پیچیده و طولانی‌مدت را به‌صورت قابل اعتماد خودکار کنند.