استارتاپ هوش مصنوعی صوتی «رایم» (Rime) با موفقیت ۲۴ میلیون دلار در دور سرمایه‌گذاری سری A را به liderی M13 Ventures جذب کرد. این سرمایه‌گذاری که با مشارکت Twilio Ventures، Corazon Capital و Unusual Ventures انجام شده، نشان‌دهنده اعتماد سرمایه‌گذاران به رویکرد منحصر‌به‌فرد این شرکت در حل چالش‌های اصلی فناوری صوتی برای سازمان‌های بزرگ است.

چرا رایم در بازار شلوغ صوتی متمایز است؟

بازار هوش مصنوعی صوتی برای مدیریت تماس‌های شرکتی در حال حاضر پر از بازیگران قدرتمند است: از توسعه‌دهندگان مدل‌های پایه مانند ElevenLabs و Deepgram، تا شرکت‌های زیرساختی مثل Vapi، Retell و LiveKit، و پلتفرم‌های تخصصی پشتیبانی همچون Decagon و Sierra. اما رایم استراتژی متفاوتی را پیش گرفته است.

داده‌های تعليمی اختصاصی: استودیو ضبط در سانفرانسیسکو

برخلاف بسیاری از رقبا که روی داده‌های استخراج‌شده از وب (Web Scraping) تکیه دارند، رایم یک استودیو ضبط حرفه‌ای در سانفرانسیسکو ساخته تا داده‌های مکالمه‌ای طبیعی و باکیفیت بالا تولید کند. این رویکرد به شرکت اجازه می‌دهد تا مدل‌های خود را روی الگوهای گفتاری واقعی، نویزهای طبیعی و تنوع لهجه‌ها آموزش دهد.

معماری مبتنی بر واج (Phoneme-based) برای تلفظ دقیق

یکی از چالش‌های اصلی شرکت‌ها در استقرار صوتی هوش مصنوعی، تلفظ نام‌های برند، اصطلاحات تخصصی و نام‌های اختصاصی است. رایم با استفاده از معماری مبتنی بر واحدهای آوایی (Phonemes)، قابلیت تطبیق با تلفظ‌های متفاوت را بدون نیاز به بازآموزی مدل (Retraining) برای هر صنعت فراهم کرده است. این یعنی یک بانک می‌تواند نام‌های سرمایه‌گذاری، یک بیمارستان نام داروها و یک ایرلاین کدهای پرواز را به درستی تلفظ کند، همه با یک مدل پایه.

از خط لوله کلاسیک به مدل‌های گفتار‌به‌گفتار (Speech-to-Speech)

رایم ابتدا از معماری سنتی سه مرحله‌ای استفاده می‌کرد:

  • تبدیل گفتار به متن (STT)
  • پردازش با مدل زبانی بزرگ (LLM)
  • تبدیل متن به گفتار (TTS)

اما اکنون تمرکز کامل بر روی توسعه مدل‌های مستقیم گفتار‌به‌گفتار (Speech-to-Speech) است. این تغییر پارادایم مزایای کلیدی دارد:

  • کاهش تأخیر (Latency): حذف مراحل میانی برای پاسخ‌دهی لحظه‌ای
  • بهبود نوبت‌گیری (Turn-taking): درک طبیعی جهت مکالمه و جلوگیری از تداخل گفتاری
  • مقاومت در برابر نویز: پردازش مستقیم سیگنال صوتی برای عملکرد بهتر در محیط‌های شلوغ
  • ساده‌سازی ارکستراسیون: مدیریت یک مدل یکپارچه به جای هماهنگی چندین مدل جداگانه

"فناوری صوتی هنوز برای خودکارسازی اکثر تماس‌های شرکتی کافی نیست. مدل‌های زبانی بزرگ ساخت برنامه‌های صوتی را آسان‌تر کرده‌اند، اما حس تعامل را تغییر نداده‌اند. صحبت با عامل صوتی هوش مصنوعی همچنان شبیه IVR است، فقط با صدای بهتر."

لیلی کلیفورد، بنیان‌گذار و مدیرعامل رایم

مشتریان سازمانی و نتایج قابل‌تأیید

رایم ادعا می‌کند که به دلیل کیفیت داده‌های تعليمی و معماری مدل، مقصران (Callers) مدت زمان بیشتری در تماس می‌مانند — معیاری حیاتی برای رضایت مشتری و تبدیل فروش. این مزیت به جذب قراردادهای سازمانی با نام‌های Schwergewichte منجر شده:

  • Mayo Clinic (بهداشت و درمان)
  • Dialpad (ارتباطات ابری)
  • Upstart (فین‌تک و اعتبارسنجی)
  • Asurion (پشتیبانی فناوری و بیمه)

شرکت در صنایع خدمات غذایی، هوشپیمایی، بهداشت و درمان و فناوری مالی فعال است.

توسعه تیم و جذب استعدادهای تراز اول

با سرمایه‌گذاری جدید، رایم قصد دارد تیم ۳۵ نفره خود را به طور قابل‌ملاحظه‌ای گسترش دهد.ימוש در زمینه‌های:

  • توسعه مدل‌های هوش مصنوعی پیشرفته
  • مهندسی پلتفرم و زیرساخت
  • مشارکت‌های استراتژیک و توسعه کسب‌وکار

استخدام اخیر رافائل واله (Rafael Valle) به عنوان دانشمند ارشد (Chief Scientist)، سیگنال قوی روی جدیت فنی شرکت است. واله سابقه تحقیق در Meta Superintelligence Labs و تیم NVIDIA Applied Deep Learning Audio Research را دارد.

دیدگاه سرمایه‌گذار: فراتر از لایه اپلیکیشن

مورگان بلومبرگ (Morgan Blumberg) از M13 Ventures که به هیئت مدیره رایم می‌پیوندد، به TechCrunch گفت:

"شرکت‌هایی مثل ElevenLabs به سمت لایه ارکستراسیون و اپلیکیشن رفته‌اند و با سیرا و دکاگون رقابت می‌کنند. من فکر می‌کنم کار فنی بسیار بیشتری باید انجام شود و رویکرد رایم در پیشبرد بهترین مدل با تأخیر کم، قابلیت اطمینان بالا در محیط‌های تنظیم‌شده، متمایزکننده است."

تاریخچه سرمایه‌گذاری

  • مه ۲۰۲۳: ۵.۵ میلیون دلار دور Seed
  • جولای ۲۰۲۴: ۲۴ میلیون دلار سری A (موضوع این خبر)

نکته کلیدی: در حالی که مدل‌های زبانی بزرگ (LLM) منطق گفتار را حل کرده‌اند، لایه صوتی (Voice Layer) همچتنه گلوگاه اصلی برای تجربه کاربری طبیعی باقی مانده. رایم با تمرکز بر مدل‌های گفتار‌به‌گفتار اختصاصی، داده‌های تعليمی کنترل‌شده و معماری آوایی، در حال ساختن زیرساختی است که می‌تواندendlich IVRهای سنتی را در سطح Enterprise جایگزین کند.