علیبابا مدل Qwen3.8-Max را با 2.4 تریلیون پارامتر رونمایی کرد
Qwen3.8-Max برای اجرای پروژههای خودگردان و چندمرحلهای طراحی شده است؛ از بازتولید و بهبود نتایج پژوهشی و توسعه نرمافزار تا طراحی تراشه و مدیریت شبیهسازی مالی در تجارت الکترونیک. وزنهای این مدل هفته آینده منتشر میشوند و نسخههای قابل دسترس آن هماکنون از طریق طرح Token، Qoder و QoderWork در دسترس است.
نکات کلیدی
- پارامترها: مجموع 2.4 تریلیون پارامتر؛ حدود 95 میلیارد پارامتر فعال در هر اجرای پرسش.
- هدف طراحی: انجام خودگردان وظایف طولانی که روزها یا صدها دور تعامل نیاز دارند.
- دسترسپذیری: اولین مدل از کلاس Qwen‑Max که وزنهای آن عمومی خواهد شد.
- موارد آزمایشی: توسعه نرمافزار، بازتولید مقاله پژوهشی، بهینهسازی طراحی تراشه و مدیریت کسبوکار شبیهسازیشده.
معماری و هدف طراحی
Qwen3.8-Max مبتنی بر معماری Qwen3.5 توسعه یافته و بهجای پاسخهای تکمرحلهای، بر انجام سلسلهمراتبی و مستقل از کارها تمرکز دارد. مدل طوری تیون شده که در هر بار اجرا حدود 95 میلیارد پارامتر فعال شوند تا مصرف حافظه و محاسبات برای عملیات بلندمدت و چندمرحلهای بهتر مدیریت شود. انتشار عمومی وزنها میتواند روند پژوهش مستقل و توسعه کاربردهای تخصصی را تسریع کند. (معرفی علیبابا: Wikipedia.)
نمونههای کدنویسی خودگردان
سه مطالعه موردی نشاندهنده توانمندی مدل در پروژههای خودگردان کدنویسی است:
- توسعه ابزار خط فرمان: طی 16 روز، مدل ابزار oh-my-cli را از تبدیل درخواستها به issue در GitHub تا تخصیص وظایف، نوشتن کد، اجرای تست و تکرار توسعه داد. خروجی شامل 265 commit، 127 pull request و 151 issue بود؛ همه بدون دخالت انسانی.
- بازتولید و بهبود مقاله پژوهشی: مدل مقاله «Unified Data Selection for LLM Reasoning» را بدون کد آغازین دریافت و در حدود 5 روز و 125 ساعت محاسبات، 7,600 خط کد نوشت و 33 job آموزشی اجرا کرد؛ ابتدا شش نتیجه اصلی مقاله را بازتولید و سپس با آزمایش 18 ایده در چهار دور، در بنچمارک ریاضی AIME24 روش مقاله را با اختلاف 2.7 امتیاز پشت سر گذاشت.
- چالش چندرسانهای Tianchi: در چالش تشخیص نیت گفتگوی چندرسانهای WWW2025، مدل در 24 ساعت چندین مدل چینی و Qwen2.5‑VL‑7B را فاینتیون و آنها را با یک سامانه رأیگیری ترکیب کرد؛ طی 45 ارسال دقت از 0.60 به 0.853 رسید و از 458 تیم انسانی پیشی گرفت.
طراحی تراشه: کاهش گیتها و بهینهسازی فیزیکی
در آزمایشی مبتنی بر معیار تعداد گیتهای منطقی، مدل از طراحی اولیه 8,298 گیت شروع کرد و پس از تقریباً 500 تکرار آن را به 678 گیت کاهش داد. پس از اجرای چیدمان خودکار با ابزار متنباز OpenROAD، مساحت تراشه از 106×106 میکرومتر به 46×46 میکرومتر کاهش یافت (حدود 81 درصد کاهش). تیم توسعه گزارش کرده که تغییرات ساختاری عمیق و نه صرفاً اصلاحات سطحی، عامل اصلی بهبود بود.
شبیهسازی سال مالی: مدیریت تجارت الکترونیک در مقیاس
در بنچمارک E-Commerce-Bench، مدل یک سال مالی کامل را در محیط فروش آنلاین (با دادههای ناشناسشده از Taobao و Tmall) از مدیریت خرید و قیمتگذاری تا مقابله با بازگشتها و بحرانها اجرا کرد. با سرمایه اولیه 100,000 یوان و میان 152 تأمینکننده که 152 مورد کلاهبردار پنهان داشتند، شبیهسازی با تراز نهایی 416,252 یوان پایان یافت؛ حدود چهار برابر سرمایه اولیه، 38 درصد بهتر از رکورد نفر دوم (GLM 5.2) و بیش از 2.5 برابر بهتر از Qwen3.7-Max.
مهارتهای چندرسانهای و بازسازی اپلیکیشنها بدون دسترسی به کد منبع
مدل میتواند اسناد تا بیش از 200 صفحه و ویدئوهای طولانیتر از 100 ساعت را پردازش کند. بنچمارک جدید RecreationBench معرفی شد که در آن مدل باید برنامههای در حال اجرا را بدون دسترسی به کد منبع و تنها از طریق تعامل با رابط کاربری (کلیکها و ورودیهای صفحهکلید) بازسازی کند. آزمایشها روی Ubuntu، macOS، Windows، Android و وب انجام شده و نشان میدهد مدل قابلیت اجرای وظایف تعاملی در محیطهای گرافیکی را دارد.
عملکرد نسبت به رقبا و دسترسی پژوهشی
بنچمارکهای داخلی علیبابا نشان میدهند Qwen3.8-Max در معیارهای منتخب با مدلهای پیشرو غربی قابل رقابت است؛ هرچند بررسیهای مستقل برای تائید نهایی ضروری است. دسترسی به وزنها فرصتهایی برای توسعه ابزارهای تخصصی، پژوهشهای کاربردی و ارزیابی عملکرد در وظایف بلندمدت فراهم میآورد. برای مروری بر مدلهای زبانی بزرگ: Wikipedia؛ و برای گزارشهای خبری و تخصصی میتوان منابعی مانند TechCrunch را دنبال کرد.
چالشها و الزامات نظارتی
پیشرفت در اجرای وظایف خودگردان بلندمدت کاربردهای نوآورانهای میآفریند، اما همراه آن مسئولیتهای نظارتی، هزینههای محاسباتی و نیاز به ارزیابی مستقل برای امنیت و شفافیت باقی میماند. انتشار وزنها امکان بررسی دقیقتر را فراهم میکند، اما ریسکهای احتمالی سوءاستفاده و ضرورت تدوین چارچوبهای اخلاقی و قانونی را نیز افزایش میدهد.
جمعبندی
Qwen3.8-Max نشاندهنده جهشی در جهتگیری مدلهای زبانی به انجام وظایف بلندمدت و خودگردان است. انتشار عمومی وزنها فضای بررسی و توسعه را برای پژوهشگران و توسعهدهندگان باز میکند؛ مرحلهای که تعیین خواهد کرد اینگونه مدلها تا چه اندازه میتوانند کارهای پیچیده و طولانیمدت را بهصورت قابل اعتماد خودکار کنند.





