متا از Muse Voice Transcribe رونمایی کرد؛ سامانه‌ای برای رونوشت صوتی بلادرنگ که در برخی بنچمارک‌ها عملکرد بهتری نسبت به نمونه‌های مشابه از جمله محصولات گوگل و OpenAI نشان داده است.

ویژگی‌های کلیدی Muse Voice Transcribe

  • پشتیبانی زبانی گسترده: آموزش روی بیش از 70 زبان و اعتبارسنجی گسترده برای 25 زبان.
  • تشخیص چندگوینده: قابلیت شناسایی بیش از 20 گوینده در یک گفتگو.
  • پشتیبانی از مکالمات طولانی: کار با گفتگوهایی به طول بیش از یک ساعت.
  • دسترسی تجاری: ارائه از طریق Meta Model API، Meta AI for Mac و Muse Code. قیمت API حدود 3.00 دلار برای هر 1,000 دقیقهٔ صوتی (حدود 0.18 دلار در ساعت) اعلام شده است.
نمایشی از Muse Voice Transcribe و قابلیت‌های گفتار به متن متا

عملکرد در بنچمارک‌ها

در بنچمارک AA-WER Streaming که روی گفتار انگلیسی تمرکز دارد، نرخ خطای کلمه (WER) برای Muse Voice Transcribe برابر با 3.1% ثبت شده است؛ رقمی بهتر نسبت به Cartesia Ink-2 با 3.4%، Scribe v2 Real-time از ElevenLabs با 3.6%، GPT Live Transcribe با 3.9% و Gemini 3.5 Transcribe Live با 4%.

در زمینهٔ تفکیک گوینده نیز Muse میانگین خطای تشخیص را تا 17.5% کاهش داده که نسبت به بسیاری رقبا وضعیت بهتری نشان می‌دهد، هرچند چالش‌های مرتبط با تشخیص دقیق گوینده در سناریوهای پیچیده همچنان باقی است.

معماری و مکانیسم عملکرد

Muse Voice Transcribe بر پایهٔ معماری خودبازگشتی چندوجهی از خانوادهٔ Muse Spark طراحی شده است؛ این رویکرد امکان پردازش هم‌زمان صوت و متن را فراهم می‌کند. ورودی صوت به قطعات 80 میلی‌ثانیه‌ای تقسیم می‌شود (معادل 12.5 قطعه در ثانیه) و هر قطعه به یک «توکن نرم» فشرده می‌گردد.

در هر قطعه، مدل تصمیم می‌گیرد که توکن متنی صادر کند یا یک نگه‌دارندهٔ ویژه برای «صدای بعدی» بازگرداند تا قطعهٔ بعدی پردازش شود. وقتی جریان صوتی متوقف شود، توکن «صدای خالی» اعلام می‌کند که صوتی نخواهد آمد و متن باقیمانده چاپ می‌شود.

تاخیر تطبیقی و یادگیری تقویتی

مدل از مکانیزم تاخیر تطبیقی استفاده می‌کند: برای واژگان دشوار زمینهٔ بیشتری جمع‌آوری می‌شود و برای واژگان ساده تقریباً بلافاصله رونوشت تولید می‌شود. توازن میان دقت (WER) و تأخیر از طریق یادگیری تقویتی آموخته می‌شود و در این پیاده‌سازی پاداش‌ها به صورت ضربی اعمال می‌شوند، نه جمعی.

مکانیزم مشابهی برای تفکیک گویندگان به کار گرفته شده تا همزمان با تولید متن، تشخیص دهد هر بخش از صدا متعلق به کدام گوینده است.

جایگاه در بازاری رقابتی

رونوشت‌برداری بلادرنگ تبدیل به یکی از بخش‌های رقابتی در حوزهٔ هوش مصنوعی شده است؛ در هفته‌های اخیر محصولات استریمینگ متعددی از سوی OpenAI، گوگل، xAI و علی‌بابا معرفی شده‌اند. اختلاف‌های کوچک در بنچمارک‌ها ممکن است ناپایدار باشند، اما متا انگیزهٔ قوی‌ای برای بهبود مستمر دارد، چون این فناوری مستقیماً تجربهٔ کاربری محصولات مصرفی مانند عینک‌های هوشمند و اپلیکیشن‌های صوتی را تحت تاثیر قرار می‌دهد.

چشم‌انداز و پیامدها

  • افزایش سرعت توسعهٔ کیفیت رونوشت‌ها و کاهش تأخیر در تعامل‌های صوتی.
  • گسترش پشتیبانی چندزبانه و بهبود تفکیک گوینده در محیط‌های چندنفره.
  • نبود انتشار وزن‌های مدل می‌تواند دسترسی جامعهٔ پژوهشی مستقل به تحلیل‌های داخلی را محدود کند.

برای بررسی مفاهیم پایه‌ای تشخیص گفتار می‌توان به صفحهٔ تشخیص گفتار در ویکی‌پدیا مراجعه کرد.

Muse Voice Transcribe ابزار جدیدی در مجموعهٔ صوتی متا است که می‌تواند تجربهٔ تعامل گفتاری در محصولات آینده را روان‌تر کند؛ انتظار می‌رود رقبا نیز در واکنش، به‌سرعت بهبودهایی را ارائه دهند و بازار رونوشت بلادرنگ را جلو ببرند.