Sai، عامل تعاملی شرکت Simular، در بهروزرسانی اخیر بنچمارک OSWorld 2.0 به نرخ موفقیت 73٪ رسید. این عملکرد Sai را بالاتر از GPT-5.6 Sol با 62.57٪ و Opus 5 با 70.57٪ قرار میدهد و بهگفتهٔ Simular، این سطح از عملکرد با هزینهای حدود دو سوم هزینهٔ رقبا حاصل شده است.
چیستی بنچمارک OSWorld 2.0 و اهمیت 73٪
OSWorld 2.0، ساختهٔ آزمایشگاه HKU NLP / XLANG، مجموعهای متشکل از 108 وظیفهٔ بلندپایۀ واقعگرایانه در محیطهای دسکتاپ و وب را ارزیابی میکند؛ وظایفی که برای نیل به موفقیت معمولاً بیش از یک ساعت زمان انسانی میطلبند. نسخهٔ دوم تمرکز خود را بر چالشهایی قرار داده که نسخهٔ اول کمتر به آنها پرداخته بود: جمعآوری اطلاعات از منابع متعدد، واکنش به تغییرات پویا در حین اجرا، پیروی دقیق از دستورالعملها و حل ناسازگاریهای دادهها. رسیدن Sai به 73٪ نشاندهندۀ توانایی عامل در مدیریت این نوع کارهای پیچیده و زمانبر است.
چرایی تمرکز Simular بر کارهای روزمره اما حیاتی
جیاچن یانگ، همبنیانگذار و CTO Simular، هدف اصلی را انجام وظایف واقعی محل کار—مانند پیگیری فرآیندهای استخدام، اعتبارسنجی فاکتورها و پژوهش خبری—با هزینهای معقول برای افراد و کسبوکارها معرفی میکند. Simular با ترکیب مدلهای مرزبَر و اجزای تخصصی و اجرای مستقیم روی اپلیکیشنهای دسکتاپ و صفحات وب، میکوشد اتوماسیونی ارائه دهد که در عمل قابلاستفاده و مقرونبهصرفه باشد.
چه چیزی Sai را از مدلهای صرفاً بزرگ متمایز میکند؟
- اجرای مستقیم در رابطهای کاربری: Sai مستقیماً با اپلیکیشنهای دسکتاپ و صفحات وب تعامل میکند، APIها را میخواند و در صورت نیاز کد تولید میکند.
- رویکرد نوروسیمبولیک: ترکیب توانمندیهای جستجویی شبکههای عصبی با ساختارهای نمادین که اجازه میدهد وظایف بهصورت کد قابلتکرار ذخیره شوند. برای توضیح بیشتر به مطلب مرتبط مراجعه کنید.
- بهینهسازی نسبت هزینه به نتیجه: Simular اعلام کرده Sai بهطور میانگین حدود 1.5 برابر کمتر از مدلهای خالص فراخوانی مدل انجام میدهد و از این رو هزینهٔ اجرایی کمتری تحمیل میکند.
فناوریهای کلیدی پشت Sai
Sai برای دستیابی به کارایی و مقیاسپذیری از چند تکنیک عملیاتی بهره میبرد:
- خلاصهسازی تطبیقی برای مدیریت پنجرۀ زمینه: ورودهای ورودی را دینامیک محدود میکند و پیشوندهای ضروری را حفظ مینماید تا اطلاعات حیاتی از دست نرود.
- برنامهریزی بهصورت کد: با کدگذاری طرحهای حل وظیفه (مثلاً Simulang و ساختارهای نمادین مشابه)، بخشهای تکرارشونده میتوانند بدون فراخوانی مکرر مدل اجرا شوند.
- ارکستراسیون مدلهای تخصصی: برای تشخیص عناصر رابط کاربری، استدلالهای دقیق و تعامل با APIها از مدلها و رابطهای تخصصی جداگانه استفاده میشود.
شفافیت و وضعیت انتشار نتایج
Simular اعلام کرده نتایج را ابتدا روی وبسایت شرکت منتشر کرده و در مرحلهٔ بعد، مسیرهای اجرایی (trajectories) و نتایج را به جدول امتیازات OSWorld 2.0 ارسال میکند و آنها را روی Hugging Face نیز بارگذاری خواهد کرد. پیش از این، Agent S متنباز همین شرکت اولین عاملی بود که در نسخهٔ قبلی OSWorld از آستانۀ انسانی عبور کرد.
پیامدها و چشمانداز
اگر عواملی مانند Sai بتوانند کارهای تکراری و طولانیِ دفتری را با دقت قابلقبول و هزینهٔ پایین انجام دهند، انتظار میرود پذیرش اتوماسیون در کسبوکارهای کوچک و تیمهای محصول شتاب گیرد. همزمان ضرورت بنچمارکهای باز، معیارهای شفاف عملکرد و ارزیابی اثرات جانبی—مانند امنیت داده و حریم خصوصی—برجستهتر خواهد شد. با ارسال رسمی نتایج به جداول بنچمارک و انتشار مسیرهای اجرایی در هفتهها و ماههای آتی، امکان قضاوت دقیقتر دربارهٔ جایگاه Sai در میان رقبا فراهم میشود.
Simular مسیر خود را از پژوهش آغاز کرده و با تاکید بر ترکیب مدلهای مرزی و ساختارهای نمادین میکوشد نیازهای روزمرهٔ شرکتها و افراد را با سقف هزینهای منطقی پاسخ دهد.





