PhiloLabs با صرف حدود 33 دلار و مصرف تقریباً 8,000,000 توکن، با استفاده از مدلهای Claude Fable 5.1 یک بازسازی سهبعدی از میدان Union Square سانفرانسیسکو را داخل مرورگر پیادهسازی کرد. پروژه فراتر از تولید «کد اجرایی» رفت و تلاش شد خطاهای بصری با بازبینی تصویری شناسایی و گزارش شوند؛ تجربهای آموزنده در ساخت Union Square مجازی با تکیه بر عاملهای هوش مصنوعی.
آنچه عاملها ساختند
- 453 محدودهٔ پایهٔ ساختمان
- 75 نمای سفارشی
- 129 فروشگاه نامدار
- 220 عابر پیاده و 109 خودرو، شامل ترامواهای خیابان Powell
فرآیند تولید حدود دو ساعت طول کشید و نتیجه یک نسخهٔ Three.js از Union Square بود که در مرورگر اجرا شد. برای آشنایی بیشتر با Three.js میتوانید به صفحه ویکیپدیا مراجعه کنید.
Playwright بهعنوان «بینایی» عاملها
روش کار
برای تشخیص خطاهای ظاهری و اختلاف با نمونهٔ واقعی، PhiloLabs از Playwright استفاده کرد و از 34 موقعیت دوربین از پیشتعریفشده اسکرینشات گرفت. این اسکرینشاتها با عکسهای مرجع میدان مقایسه شدند و در مجموع 147 برگهٔ مقایسه تولید شد تا ناهماهنگیهایی مانند تناسب نادرست نما یا قرارگیری ویترین روی سمت اشتباه خیابان سریعتر دیده شوند.
چرخهٔ بازبینی و گزارشدهی
پس از تولید اولیه، زیرعاملهایی با تخصصهای معماری، جغرافیا، هنر فنی و تعاملات صحنه را بررسی کردند. فرایند بازبینی منجر به 9 گزارش تخصصی شد که فهرستی از اصلاحات لازم را برای نوبت بعدی تولید فراهم کرد؛ توسعهدهندگان پس از اعمال تغییرات، صحنه را مجدداً اجرا کردند تا بهبودها سنجش شود.
پر کردن شکافهای دادهای و حدسهای عاملها
عاملها از منابع آزاد مانند OpenStreetMap و دادههای ارتفاع USGS بهره بردند، اما این منابع معمولاً موقعیت کلی سازهها را نشان میدهند نه جزئیات نمای ساختمان. عکسهای مرجع اغلب محدود به زوایای خاص هستند، بنابراین عاملها در برخی نقاط مجبور به تصمیمگیری و حدس زدن شدند. وقتی دادهٔ اولیه ناقص است، حتی بازبینی ماشینی هم ممکن است همان خطای اولیه را تأیید کند.
شاخصهای کلیدی مصرف و هزینه
- مصرف تقریبی: 8,000,000 توکن
- هزینهٔ گزارششدهٔ API: حدود $33
- کاهش هزینهها از طریق توزیع کار میان زیرعاملها، اجرای موازی و استفاده از متن کششده
محدودیتها
- دید بصری محدود: اسکرینشاتها برای کشف خطاهای آشکار مناسباند، اما در برنامههای تعاملی پیچیده یا هنگام بررسی باگهای پنهان در لایههای عمیق کد ناکافی خواهند بود.
- وابستگی به کیفیت دادهٔ منبع: کمبود دادهٔ نمای ساختمان یا زاویههای پوششدهی محدود عکسها باعث میشود عاملها به حدس متکی شوند و خطاهای همراستا از بازبینی عبور کنند.
- محدودیت در گسترش: روش برای یک میدان نسبتاً محصور جواب میدهد، اما برای محیطهای باز یا پیچیدهتر به ابزارهای بینایی قویتر، تستهای کاربری و مجموعهدادههای دقیقتر نیاز است.
چشمانداز فنی و پیشنهادات
- ترکیب عاملهای زبانی با ابزارهای بینایی پیشرفتهتر و شبکههای تشخیص صحنه میتواند دقت بررسیهای بصری را بالا ببرد.
- دسترسی به دادههای معماری ساختاری و مجموعهتصاویر با پوشش زاویهای بهتر، بار حدسزدن عاملها را کاهش میدهد.
- قرار دادن انسان در حلقهٔ بازبینی برای نهاییسازی ظرافتهای بصری و کنشپذیری تجربه ضروری است.
جمعبندی
نمونهٔ PhiloLabs نشان میدهد ساخت Union Square مجازی با هزینه و زمان محدود امکانپذیر است، اما خروجی برای رسیدن به تجربهای واقعنما و قابلاعتماد نیازمند دادههای دقیقتر و نظارت انسانی است. عاملها در تولید اولیه و بازبینی سریع کارآمد هستند، اما برای پروژههایی که به وفاداری بصری و تعامل پیچیده نیاز دارند، ترکیب ابزارهای قویتر و بررسی انسانی لازم است.





