DeepMind نسخهای از Gemma 4 را بازمهندسی و بدون آموزش از صفر به یک مدل انتشار متن تبدیل کرده است. نتیجه مدلی است که بلوکهای 256 توکنی را بهصورت موازی پالایش میکند و روی شتابدهنده Nvidia H100 حدود 1500 توکن بر ثانیه پردازش مینماید.
فرایند تبدیل Gemma 4 به DiffusionGemma
تیم توسعه بهجای آموزش مجدد از ابتدا از مدل موجود Gemma-4-26B-A4B استفاده و با صرف کمتر از 10٪ از بودجهٔ توکنی آموزش اولیه آن را بازمهندسی کرد تا رفتار انتشار (diffusion) پیدا کند. سازوکار DiffusionGemma شبیه مدلهای انتشار تصویر است: خروجی از طریق پالایش موازی بلوکهای نویزی تولید میشود، نه تولید توکنبهتوکنِ متوالی.
دو مرحلهٔ آموزشی: بازسازی نویزی و SD·RL
آموزش DiffusionGemma در دو فاز انجام شد:
- بازسازی نویزی: یادگیری بازتولید بلوکهای متنیِ آلوده به نویز.
- SD·RL (ترکیب تقطیرِ نمونهساز و یادگیری تقویتی): بهبود کیفیت پاسخها و کاهش تعداد گامهای محاسباتی لازم.
گزارش تیم نشان میدهد ترکیب این دو فاز بهطور میانگین حدود 10 امتیاز در بنچمارکهای استدلال بهبود ایجاد کرده، توان پردازش توکن به ازای هر گام را تا چهار برابر افزایش داده و خروجیها را تقریباً 50٪ کوتاهتر کرده است که خود به افزایش سرعت کمک میکند.
استدلال دوجهته و مزایای عملی
برخلاف مدلهای خودبازگشتی متداول که خروجی را توکنبهتوکن تولید میکنند، DiffusionGemma از پالایش همزمان بلوکها استفاده میکند؛ بنابراین اشتباهات اولیه پیش از نهاییشدن قابل اصلاحاند. این رویکرد در مسائل ساختیافته مانند حل جدول سودوکو و مسائل ریاضی قابلمشاهده است: پس از فاینتیونینگ محدود، مدل در حل جدولها حدود 85٪ دقت دارد در حالی که مدل پایه در همان وظایف عملکرد ضعیفتری نشان میدهد.
خروجیهای ساختیافته مثل JSON یا تعمیر کد معمولاً ظرف 2 تا 3 مرحله پالایش تکمیل میشوند، زیرا ورودی از پیش بخش بزرگی از توکنها را تعیین میکند. علاوه بر این، مدل امکان بازگشت به حالت خودبازگشتی را حفظ کرده است تا در صورت نیاز بین دو شیوهٔ تولید جابهجا شود.
محدودیتها و نقاط ضعف
با وجود افزایش سرعت و قابلیت اصلاح همزمان، DiffusionGemma در برخی معیارهای مطلق از مدل خودبازگشتی پایه عقب میماند. عوامل مطرحشده عبارتاند از:
- بازمهندسی بر پایهٔ مدلی تولیدشده بهجای آموزش از ابتدا؛
- فاز آموزشی نسبتاً کوتاه و تمرکز SD·RL بر کاهش گامها به جای رسیدن به حداکثر کیفیت؛
- معماری و مجموعه دادههای منتقلشده از Gemma 4 که لزوماً برای انتشار متن بهینه نیستند.
عوارض جانبی کاهش تهاجمی گامها شامل تکرار حلقهای کلمات و در برخی وظایف چندرسانهای «فراموشی» بستن بخشهای استدلال است که امتیازهای بنچمارک را کاهش میدهد. همچنین هنگام بارگذاری همزمان بالا—مثلاً حدود 32 درخواست موازی—مزیت سرعت مدل تا حدی کاهش یافته و مدلهای سنتی به بازدهی نزدیک میشوند.
کاربردها، مجوز و وضعیت انتشار
DeepMind DiffusionGemma را بهعنوان یک مدل تجربی معرفی کرده و هدف از انتشار را تسریع پژوهش در حوزهٔ انتشار متن اعلام کرده است. نسخههایی از این مدل در پلتفرم Hugging Face در دسترس پژوهشگران و توسعهدهندگان قرار گرفتهاند. بهگفتهٔ تیم توسعه، DiffusionGemma هماکنون در پروژههایی مانند تشخیص گفتار چندزبانه توسط Interfaze و تولید گزارشهای رادیولوژی تعاملی کاربرد دارد. پیشینهٔ این رویکرد را میتوان در معرفی Gemini Diffusion در مهٔ 2025 دنبال کرد.
منابع برای مطالعهٔ بیشتر
چشمانداز و راههای پیش رو
DiffusionGemma نشان میدهد میتوان با صرف هزینهٔ کمتر و بازمهندسی روی مدلهای موجود، مدلهای انتشار متن تولید کرد، اما رسیدن به کیفیتِ پیشرو نیازمند طراحی معماری و مجموعه دادههایی است که از ابتدا برای انتشار بهینه شده باشند. مسیرهای عملی برای بهبود شامل آموزش از صفر با دادههای مناسب، طولانیتر کردن فاز SD·RL، اعمال روشهای جدید تقطیر و بهینهسازی برای جلوگیری از تکرار و تقویت عملکرد در سناریوهای چندکاربره است. انتشار DiffusionGemma میتواند زیرساختی برای پژوهشهای تخصصی و توسعهٔ نسخههای کممصرفتر مدلهای متن فراهم سازد.





