Smallest.ai در دور سری A مبلغ ۱۳ میلیون دلار جذب کرد تا مدل صوتی کم‌حجمی توسعه دهد که برای مکالمه بلادرنگ و طبیعی طراحی شده است؛ مکالمه‌ای که شنونده نتواند تشخیص دهد طرف مقابل انسان است یا ماشین.

رویکرد متفاوت: مدل‌های کوچک، تخصصی و هم‌زمان پردازش‌کننده

این استارتاپ که اواخر ۲۰۲۴ تأسیس شد، معتقد است جهش بعدی در کاربردهای صوتی نه با بزرگ‌تر کردن مدل‌های زبان، بلکه با به‌کارگیری مدل‌های کوچک‌تر و تخصصی برای تعامل انسانی حاصل می‌شود. مدل Smallest.ai به‌گونه‌ای طراحی شده که هنگام مکالمه هم‌زمان گوش دهد، پردازش کند و پاسخ دهد؛ یعنی رفتار گفت‌وگویی انسان را تقلید می‌کند — قطع کردن حرف، پاسخ‌های لحظه‌ای و واکنش به وقفه‌ها را در نظر می‌گیرد.

کاهش تأخیر در مکالمه

سودارشان کاماث، بنیان‌گذار و مدیرعامل Smallest.ai، توضیح می‌دهد مدل‌های زبان بزرگ معمولاً منتظر دریافت یک پرامپت کامل می‌مانند و سپس پردازش را آغاز می‌کنند؛ رویکردی که در مکالمه صوتی منجر به مکث‌های غیرطبیعی می‌شود. مدل این شرکت به عنوان یک لایهٔ هوش بلادرنگ عمل کرده و پاسخ‌ها را با تأخیر بسیار کم ارائه می‌دهد. در مواردی که پرسش خارج از دامنهٔ دانش مدل کوچک باشد، سیستم به‌صورت موقت پرسش را به یک مدل پایهٔ بزرگ‌تر ارجاع می‌دهد و در همان زمان با پاسخ‌های کوتاه و طبیعی به مشتری اطلاع می‌دهد که موضوع در حال بررسی است.

معماری دوگانه: مدل صوتی کوچک و مدل زبان بزرگ (LLM) آفلاین

کاماث پیش‌بینی می‌کند آیندهٔ نمایندگان هوش مصنوعی بر ترکیب دو مدل استوار خواهد بود: یک مدل صوتی کوچک برای تعامل بلادرنگ و یک مدل زبان بزرگ (LLM) آفلاین که تنها برای حل مسائل پیچیده فعال می‌شود. این جداسازی مزایای زیر را فراهم می‌کند:

  • پاسخ‌دهی بلادرنگ و با تأخیر پایین
  • بهینه‌سازی برای لهجه‌ها و چندزبانگی بدون نیاز به اجرای همیشگی یک LLM بزرگ
  • بهبود عملکرد در محیط‌های پرصدا با تفکیک گفتار از نویز
  • ارجاع هوشمند و کنترل‌شده به مدل‌های بزرگ برای امور تخصصی

سرمایه‌گذاران و مشتریان

دور سرمایه‌گذاری سری A به رهبری Seligman Ventures و با مشارکت Sierra Ventures و 3one4 Capital انجام شد. این مبلغ ۱۳ میلیون دلاری، مجموع سرمایهٔ جذب‌شدهٔ Smallest.ai را به بیش از ۲۱ میلیون دلار رسانده است. از مشتریان فعلی می‌توان به شرکت‌هایی فعال در حوزهٔ صوت مانند RingCentral و Truecaller اشاره کرد که نمونه‌هایی از کاربرد مدل در سناریوهای پشتیبانی سازمانی و تماس مشتریان هستند.

محصول و موارد استفاده

  • نمایندگان پشتیبانی مشتری بلادرنگ با پاسخ‌های طبیعی و کم‌ترین تأخیر
  • مکالمه‌های چندزبانه و تطبیق با لهجه‌های محلی
  • عملکرد در محیط‌های پرسر و صدا با تفکیک گفتار و نویز
  • ارجاع هوشمند به مدل‌های بزرگ برای مسائل تخصصی یا خارج از حوزهٔ دانش مدل کوچک

رقابت و بازار

Smallest.ai با بازیگران شناخته‌شده‌ای مانند ElevenLabs و رقبای منطقه‌ای که روی زبان‌ها و لهجه‌های محلی تمرکز دارند رقابت می‌کند. در حالی که برخی رقبا هوش صوتی را برای دوبله، پادکست یا تولید محتوا به‌کار می‌برند، تمرکز Smallest.ai روی نمایندگان گفت‌وگویی بلادرنگ برای مشتریان سازمانی است.

مسائل فنی و چالش‌های اخلاقی

بردن تجربهٔ صوتی به سطحی که از پس معیارهای آزمون تورینگ برآید، امکانات جدیدی ایجاد می‌کند اما چالش‌هایی نیز به‌همراه دارد. نکات کلیدی که باید رصد شوند:

  • شفافیت دربارهٔ استفاده از هوش مصنوعی: اطلاع‌رسانی به مخاطب در مورد اینکه طرف مقابل یک هوش مصنوعی است یا انسان
  • حریم خصوصی صوتی و نگهداری داده‌ها
  • ریزتر شدن خطر جعل هویت صوتی و سوءاستفاده‌های احتمالی
  • نیاز به چارچوب‌های نظارتی و استانداردهای حفاظتی همزمان با توسعهٔ فناوری

چشم‌انداز

در صورت موفقیت رویکرد مدل‌های کوچک و بلادرنگ، تجربهٔ تماس‌های پشتیبانی مشتری می‌تواند به‌طرز قابل توجهی تغییر کند: کاهش هزینه‌ها، بهبود رضایت مشتری و گسترش خدمات در زبان‌ها و لهجه‌های متنوع. گام بعدی برای Smallest.ai، پیاده‌سازی در مقیاس گسترده و اثبات پایداری عملکرد در محیط‌های واقعی است؛ مرحله‌ای که نشان خواهد داد آیا ترکیب «مدل صوتی کوچک + LLM آفلاین» می‌تواند استاندارد جدیدی برای تعامل صوتی هوش مصنوعی ایجاد کند یا خیر.

منابع مرتبط: گزارش اولیه و پوشش خبری در TechCrunch.