متا از Muse Voice Transcribe رونمایی کرد؛ سامانهای برای رونوشت صوتی بلادرنگ که در برخی بنچمارکها عملکرد بهتری نسبت به نمونههای مشابه از جمله محصولات گوگل و OpenAI نشان داده است.
ویژگیهای کلیدی Muse Voice Transcribe
- پشتیبانی زبانی گسترده: آموزش روی بیش از 70 زبان و اعتبارسنجی گسترده برای 25 زبان.
- تشخیص چندگوینده: قابلیت شناسایی بیش از 20 گوینده در یک گفتگو.
- پشتیبانی از مکالمات طولانی: کار با گفتگوهایی به طول بیش از یک ساعت.
- دسترسی تجاری: ارائه از طریق Meta Model API، Meta AI for Mac و Muse Code. قیمت API حدود 3.00 دلار برای هر 1,000 دقیقهٔ صوتی (حدود 0.18 دلار در ساعت) اعلام شده است.
عملکرد در بنچمارکها
در بنچمارک AA-WER Streaming که روی گفتار انگلیسی تمرکز دارد، نرخ خطای کلمه (WER) برای Muse Voice Transcribe برابر با 3.1% ثبت شده است؛ رقمی بهتر نسبت به Cartesia Ink-2 با 3.4%، Scribe v2 Real-time از ElevenLabs با 3.6%، GPT Live Transcribe با 3.9% و Gemini 3.5 Transcribe Live با 4%.
در زمینهٔ تفکیک گوینده نیز Muse میانگین خطای تشخیص را تا 17.5% کاهش داده که نسبت به بسیاری رقبا وضعیت بهتری نشان میدهد، هرچند چالشهای مرتبط با تشخیص دقیق گوینده در سناریوهای پیچیده همچنان باقی است.
معماری و مکانیسم عملکرد
Muse Voice Transcribe بر پایهٔ معماری خودبازگشتی چندوجهی از خانوادهٔ Muse Spark طراحی شده است؛ این رویکرد امکان پردازش همزمان صوت و متن را فراهم میکند. ورودی صوت به قطعات 80 میلیثانیهای تقسیم میشود (معادل 12.5 قطعه در ثانیه) و هر قطعه به یک «توکن نرم» فشرده میگردد.
در هر قطعه، مدل تصمیم میگیرد که توکن متنی صادر کند یا یک نگهدارندهٔ ویژه برای «صدای بعدی» بازگرداند تا قطعهٔ بعدی پردازش شود. وقتی جریان صوتی متوقف شود، توکن «صدای خالی» اعلام میکند که صوتی نخواهد آمد و متن باقیمانده چاپ میشود.
تاخیر تطبیقی و یادگیری تقویتی
مدل از مکانیزم تاخیر تطبیقی استفاده میکند: برای واژگان دشوار زمینهٔ بیشتری جمعآوری میشود و برای واژگان ساده تقریباً بلافاصله رونوشت تولید میشود. توازن میان دقت (WER) و تأخیر از طریق یادگیری تقویتی آموخته میشود و در این پیادهسازی پاداشها به صورت ضربی اعمال میشوند، نه جمعی.
مکانیزم مشابهی برای تفکیک گویندگان به کار گرفته شده تا همزمان با تولید متن، تشخیص دهد هر بخش از صدا متعلق به کدام گوینده است.
جایگاه در بازاری رقابتی
رونوشتبرداری بلادرنگ تبدیل به یکی از بخشهای رقابتی در حوزهٔ هوش مصنوعی شده است؛ در هفتههای اخیر محصولات استریمینگ متعددی از سوی OpenAI، گوگل، xAI و علیبابا معرفی شدهاند. اختلافهای کوچک در بنچمارکها ممکن است ناپایدار باشند، اما متا انگیزهٔ قویای برای بهبود مستمر دارد، چون این فناوری مستقیماً تجربهٔ کاربری محصولات مصرفی مانند عینکهای هوشمند و اپلیکیشنهای صوتی را تحت تاثیر قرار میدهد.
چشمانداز و پیامدها
- افزایش سرعت توسعهٔ کیفیت رونوشتها و کاهش تأخیر در تعاملهای صوتی.
- گسترش پشتیبانی چندزبانه و بهبود تفکیک گوینده در محیطهای چندنفره.
- نبود انتشار وزنهای مدل میتواند دسترسی جامعهٔ پژوهشی مستقل به تحلیلهای داخلی را محدود کند.
برای بررسی مفاهیم پایهای تشخیص گفتار میتوان به صفحهٔ تشخیص گفتار در ویکیپدیا مراجعه کرد.
Muse Voice Transcribe ابزار جدیدی در مجموعهٔ صوتی متا است که میتواند تجربهٔ تعامل گفتاری در محصولات آینده را روانتر کند؛ انتظار میرود رقبا نیز در واکنش، بهسرعت بهبودهایی را ارائه دهند و بازار رونوشت بلادرنگ را جلو ببرند.





