Sai، عامل تعاملی شرکت Simular، در به‌روزرسانی اخیر بنچمارک OSWorld 2.0 به نرخ موفقیت 73٪ رسید. این عملکرد Sai را بالاتر از GPT-5.6 Sol با 62.57٪ و Opus 5 با 70.57٪ قرار می‌دهد و به‌گفتهٔ Simular، این سطح از عملکرد با هزینه‌ای حدود دو سوم هزینهٔ رقبا حاصل شده است.

چیستی بنچمارک OSWorld 2.0 و اهمیت 73٪

OSWorld 2.0، ساختهٔ آزمایشگاه HKU NLP / XLANG، مجموعه‌ای متشکل از 108 وظیفهٔ بلندپایۀ واقع‌گرایانه در محیط‌های دسکتاپ و وب را ارزیابی می‌کند؛ وظایفی که برای نیل به موفقیت معمولاً بیش از یک ساعت زمان انسانی می‌طلبند. نسخهٔ دوم تمرکز خود را بر چالش‌هایی قرار داده که نسخهٔ اول کمتر به آن‌ها پرداخته بود: جمع‌آوری اطلاعات از منابع متعدد، واکنش به تغییرات پویا در حین اجرا، پیروی دقیق از دستورالعمل‌ها و حل ناسازگاری‌های داده‌ها. رسیدن Sai به 73٪ نشان‌دهندۀ توانایی عامل در مدیریت این نوع کارهای پیچیده و زمان‌بر است.

چرایی تمرکز Simular بر کارهای روزمره اما حیاتی

جیاچن یانگ، هم‌بنیان‌گذار و CTO Simular، هدف اصلی را انجام وظایف واقعی محل کار—مانند پیگیری فرآیندهای استخدام، اعتبارسنجی فاکتورها و پژوهش خبری—با هزینه‌ای معقول برای افراد و کسب‌وکارها معرفی می‌کند. Simular با ترکیب مدل‌های مرزبَر و اجزای تخصصی و اجرای مستقیم روی اپلیکیشن‌های دسکتاپ و صفحات وب، می‌کوشد اتوماسیونی ارائه دهد که در عمل قابل‌استفاده و مقرون‌به‌صرفه باشد.

چه چیزی Sai را از مدل‌های صرفاً بزرگ متمایز می‌کند؟

  • اجرای مستقیم در رابط‌های کاربری: Sai مستقیماً با اپلیکیشن‌های دسکتاپ و صفحات وب تعامل می‌کند، APIها را می‌خواند و در صورت نیاز کد تولید می‌کند.
  • رویکرد نوروسیمبولیک: ترکیب توانمندی‌های جستجویی شبکه‌های عصبی با ساختارهای نمادین که اجازه می‌دهد وظایف به‌صورت کد قابل‌تکرار ذخیره شوند. برای توضیح بیشتر به مطلب مرتبط مراجعه کنید.
  • بهینه‌سازی نسبت هزینه به نتیجه: Simular اعلام کرده Sai به‌طور میانگین حدود 1.5 برابر کمتر از مدل‌های خالص فراخوانی مدل انجام می‌دهد و از این رو هزینهٔ اجرایی کمتری تحمیل می‌کند.
تصویر نشان‌دهنده رابط کاربری و عملکرد عامل Sai در محیط دسکتاپ

فناوری‌های کلیدی پشت Sai

Sai برای دستیابی به کارایی و مقیاس‌پذیری از چند تکنیک عملیاتی بهره می‌برد:

  • خلاصه‌سازی تطبیقی برای مدیریت پنجرۀ زمینه: ورودهای ورودی را دینامیک محدود می‌کند و پیشوندهای ضروری را حفظ می‌نماید تا اطلاعات حیاتی از دست نرود.
  • برنامه‌ریزی به‌صورت کد: با کدگذاری طرح‌های حل وظیفه (مثلاً Simulang و ساختارهای نمادین مشابه)، بخش‌های تکرارشونده می‌توانند بدون فراخوانی مکرر مدل اجرا شوند.
  • ارکستراسیون مدل‌های تخصصی: برای تشخیص عناصر رابط کاربری، استدلال‌های دقیق و تعامل با APIها از مدل‌ها و رابط‌های تخصصی جداگانه استفاده می‌شود.

شفافیت و وضعیت انتشار نتایج

Simular اعلام کرده نتایج را ابتدا روی وب‌سایت شرکت منتشر کرده و در مرحلهٔ بعد، مسیرهای اجرایی (trajectories) و نتایج را به جدول امتیازات OSWorld 2.0 ارسال می‌کند و آن‌ها را روی Hugging Face نیز بارگذاری خواهد کرد. پیش از این، Agent S متن‌باز همین شرکت اولین عاملی بود که در نسخهٔ قبلی OSWorld از آستانۀ انسانی عبور کرد.

پیامدها و چشم‌انداز

اگر عواملی مانند Sai بتوانند کارهای تکراری و طولانیِ دفتری را با دقت قابل‌قبول و هزینهٔ پایین انجام دهند، انتظار می‌رود پذیرش اتوماسیون در کسب‌وکارهای کوچک و تیم‌های محصول شتاب گیرد. هم‌زمان ضرورت بنچمارک‌های باز، معیارهای شفاف عملکرد و ارزیابی اثرات جانبی—مانند امنیت داده و حریم خصوصی—برجسته‌تر خواهد شد. با ارسال رسمی نتایج به جداول بنچمارک و انتشار مسیرهای اجرایی در هفته‌ها و ماه‌های آتی، امکان قضاوت دقیق‌تر دربارهٔ جایگاه Sai در میان رقبا فراهم می‌شود.

Simular مسیر خود را از پژوهش آغاز کرده و با تاکید بر ترکیب مدل‌های مرزی و ساختارهای نمادین می‌کوشد نیازهای روزمرهٔ شرکت‌ها و افراد را با سقف هزینه‌ای منطقی پاسخ دهد.