استارتاپ هوش مصنوعی صوتی «رایم» (Rime) با موفقیت ۲۴ میلیون دلار در دور سرمایهگذاری سری A را به liderی M13 Ventures جذب کرد. این سرمایهگذاری که با مشارکت Twilio Ventures، Corazon Capital و Unusual Ventures انجام شده، نشاندهنده اعتماد سرمایهگذاران به رویکرد منحصربهفرد این شرکت در حل چالشهای اصلی فناوری صوتی برای سازمانهای بزرگ است.
چرا رایم در بازار شلوغ صوتی متمایز است؟
بازار هوش مصنوعی صوتی برای مدیریت تماسهای شرکتی در حال حاضر پر از بازیگران قدرتمند است: از توسعهدهندگان مدلهای پایه مانند ElevenLabs و Deepgram، تا شرکتهای زیرساختی مثل Vapi، Retell و LiveKit، و پلتفرمهای تخصصی پشتیبانی همچون Decagon و Sierra. اما رایم استراتژی متفاوتی را پیش گرفته است.
دادههای تعليمی اختصاصی: استودیو ضبط در سانفرانسیسکو
برخلاف بسیاری از رقبا که روی دادههای استخراجشده از وب (Web Scraping) تکیه دارند، رایم یک استودیو ضبط حرفهای در سانفرانسیسکو ساخته تا دادههای مکالمهای طبیعی و باکیفیت بالا تولید کند. این رویکرد به شرکت اجازه میدهد تا مدلهای خود را روی الگوهای گفتاری واقعی، نویزهای طبیعی و تنوع لهجهها آموزش دهد.
معماری مبتنی بر واج (Phoneme-based) برای تلفظ دقیق
یکی از چالشهای اصلی شرکتها در استقرار صوتی هوش مصنوعی، تلفظ نامهای برند، اصطلاحات تخصصی و نامهای اختصاصی است. رایم با استفاده از معماری مبتنی بر واحدهای آوایی (Phonemes)، قابلیت تطبیق با تلفظهای متفاوت را بدون نیاز به بازآموزی مدل (Retraining) برای هر صنعت فراهم کرده است. این یعنی یک بانک میتواند نامهای سرمایهگذاری، یک بیمارستان نام داروها و یک ایرلاین کدهای پرواز را به درستی تلفظ کند، همه با یک مدل پایه.
از خط لوله کلاسیک به مدلهای گفتاربهگفتار (Speech-to-Speech)
رایم ابتدا از معماری سنتی سه مرحلهای استفاده میکرد:
- تبدیل گفتار به متن (STT)
- پردازش با مدل زبانی بزرگ (LLM)
- تبدیل متن به گفتار (TTS)
اما اکنون تمرکز کامل بر روی توسعه مدلهای مستقیم گفتاربهگفتار (Speech-to-Speech) است. این تغییر پارادایم مزایای کلیدی دارد:
- کاهش تأخیر (Latency): حذف مراحل میانی برای پاسخدهی لحظهای
- بهبود نوبتگیری (Turn-taking): درک طبیعی جهت مکالمه و جلوگیری از تداخل گفتاری
- مقاومت در برابر نویز: پردازش مستقیم سیگنال صوتی برای عملکرد بهتر در محیطهای شلوغ
- سادهسازی ارکستراسیون: مدیریت یک مدل یکپارچه به جای هماهنگی چندین مدل جداگانه
"فناوری صوتی هنوز برای خودکارسازی اکثر تماسهای شرکتی کافی نیست. مدلهای زبانی بزرگ ساخت برنامههای صوتی را آسانتر کردهاند، اما حس تعامل را تغییر ندادهاند. صحبت با عامل صوتی هوش مصنوعی همچنان شبیه IVR است، فقط با صدای بهتر."
مشتریان سازمانی و نتایج قابلتأیید
رایم ادعا میکند که به دلیل کیفیت دادههای تعليمی و معماری مدل، مقصران (Callers) مدت زمان بیشتری در تماس میمانند — معیاری حیاتی برای رضایت مشتری و تبدیل فروش. این مزیت به جذب قراردادهای سازمانی با نامهای Schwergewichte منجر شده:
- Mayo Clinic (بهداشت و درمان)
- Dialpad (ارتباطات ابری)
- Upstart (فینتک و اعتبارسنجی)
- Asurion (پشتیبانی فناوری و بیمه)
شرکت در صنایع خدمات غذایی، هوشپیمایی، بهداشت و درمان و فناوری مالی فعال است.
توسعه تیم و جذب استعدادهای تراز اول
با سرمایهگذاری جدید، رایم قصد دارد تیم ۳۵ نفره خود را به طور قابلملاحظهای گسترش دهد.ימוש در زمینههای:
- توسعه مدلهای هوش مصنوعی پیشرفته
- مهندسی پلتفرم و زیرساخت
- مشارکتهای استراتژیک و توسعه کسبوکار
استخدام اخیر رافائل واله (Rafael Valle) به عنوان دانشمند ارشد (Chief Scientist)، سیگنال قوی روی جدیت فنی شرکت است. واله سابقه تحقیق در Meta Superintelligence Labs و تیم NVIDIA Applied Deep Learning Audio Research را دارد.
دیدگاه سرمایهگذار: فراتر از لایه اپلیکیشن
مورگان بلومبرگ (Morgan Blumberg) از M13 Ventures که به هیئت مدیره رایم میپیوندد، به TechCrunch گفت:
"شرکتهایی مثل ElevenLabs به سمت لایه ارکستراسیون و اپلیکیشن رفتهاند و با سیرا و دکاگون رقابت میکنند. من فکر میکنم کار فنی بسیار بیشتری باید انجام شود و رویکرد رایم در پیشبرد بهترین مدل با تأخیر کم، قابلیت اطمینان بالا در محیطهای تنظیمشده، متمایزکننده است."
تاریخچه سرمایهگذاری
- مه ۲۰۲۳: ۵.۵ میلیون دلار دور Seed
- جولای ۲۰۲۴: ۲۴ میلیون دلار سری A (موضوع این خبر)
نکته کلیدی: در حالی که مدلهای زبانی بزرگ (LLM) منطق گفتار را حل کردهاند، لایه صوتی (Voice Layer) همچتنه گلوگاه اصلی برای تجربه کاربری طبیعی باقی مانده. رایم با تمرکز بر مدلهای گفتاربهگفتار اختصاصی، دادههای تعليمی کنترلشده و معماری آوایی، در حال ساختن زیرساختی است که میتواندendlich IVRهای سنتی را در سطح Enterprise جایگزین کند.





