مدل جدید تبدیل متن به گفتار شرکت علی‌بابا با نام Qwen-Audio-3.0-TTS-Plus با کسب امتیاز Elo 1236، صدرنشین جدول برترین‌های Speech Arena متعلق به سازمان Artificial Analysis شد. این مدل با اختلافی اندک پیش از Simba 3.2 با امتیاز 1234 قرار گرفته و رقبای قدرتمندتری نظیر Gemini 3.1 Flash TTS با امتیاز 1214 و Sonic 3.5 با امتیاز 1207 را نیز پشت سر گذاشته است.

جدول رتبه‌بندی Speech Arena برای مدل‌های تبدیل متن به گفتار

دو نسخه برای دو کاربرد متفاوت

علی‌بابا این مدل را در دو نسخه مجزا به بازار عرضه کرده است. نسخه Flash به‌طور ویژه برای تعامل بلادرنگ طراحی شده و تأخیری حدود 300 میلی‌ثانیه دارد که آن را برای اپلیکیشن‌های نیازمند پاسخ‌گویی فوری مناسب می‌کند. نسخه Plus اما بر کیفیت خروجی صوتی تمرکز دارد و کاربردی‌تر برای سناریوهایی است که طبیعی بودن و غنای صدا اهمیت بالایی دارد.

پشتیبانی از 16 زبان و کنترل لحن گفتار

این مدل از 16 زبان پشتیبانی می‌کند؛ از جمله زبان‌های کمتر پوشش‌داده‌شده‌ای چون تاگالوگ، مالایی، تایلندی و ویتنامی. چند گویش چینی نیز در فهرست زبان‌های پشتیبانی‌شده دیده می‌شود که نشان‌دهنده توجه علی‌بابا به تنوع زبانی در بازارهای آسیای شرقی و جنوب‌شرقی است.

کاربران می‌توانند سبک صحبت‌کردن را با زبان طبیعی هدایت کنند و حتی نشانه‌های غیرکلامی را با برچسب‌هایی مانند [angry] یا [giggles] به خروجی اضافه کنند. این قابلیت به صداهای تولیدشده حالتی پویاتر و انسانی‌تر می‌بخشد.

مدیریت بهتر شبیه‌سازی صدا در شرایط دشوار

یکی از نقاط قوت برجسته این نسخه، عملکرد آن در شبیه‌سازی صدا (Voice Cloning) از منابع صوتی نامناسب است. علی‌بابا اعلام کرده که مدل جدید، ضبط‌های مرجعِ پر سر و صدا یا دارای اکوی زیاد را به‌مراتب بهتر از نسخه‌های قبلی مدیریت می‌کند و می‌تواند حتی از چنین منابعی صدایی باکیفیت و وفادار تولید کند.

سرعت پردازش؛ نقطه ضعف اصلی

با وجود تمام نقاط قوت، سرعت پردازش همچنان چالش جدی این مدل است. Qwen-Audio-3.0-TTS-Plus با سرعت 16 کاراکتر در ثانیه، فاصله چشمگیری با رقبای خود دارد. Sonic 3.5 با سرعت 120 کاراکتر در ثانیه و Simba 3.2 با سرعت 30.2 کاراکتر در ثانیه، هر دو عملکرد بسیار سریع‌تری را ارائه می‌دهند و این اختلاف می‌تواند برای کاربردهای نیازمند تولید حجم زیادی از صدا در زمان کوتاه، عامل تعیین‌کننده‌ای باشد.

قیمت‌گذاری و دسترسی

قیمت استفاده از این مدل در Alibaba Cloud Model Studio برابر با 27.60 دلار به ازای هر یک میلیون کاراکتر تعیین شده است. این قیمت‌گذاری نشان می‌دهد علی‌بابا قصد دارد مدل خود را به‌عنوان گزینه‌ای باکیفیت اما نه ارزان‌ترین، در بازار تبدیل متن به گفتار معرفی کند.

رقابت در حوزه مدل‌های صوتی به‌سرعت در حال تشدید است و حضور علی‌بابا با Qwen Audio 3.0 نشان می‌دهد شرکت‌های چینی دیگر تنها در عرصه مدل‌های زبانی متنی پیشتاز نیستند؛ بلکه در تولید صدا نیز در حال ساخت سکوی رهبری برای خود هستند. پرسش مهم این است که آیا رقبای غربی در پاسخ به این حرکت، کیفیت را فدای سرعت خواهند کرد یا راه‌حلی برای ترکیب هر دو پیدا می‌کنند؟