چتباتهای هوش مصنوعی که قادر به خواندن عکسهای اشعه ایکس و امآرآی هستند، با وجود پیشرفتهای چشمگیر، گاهی با اطمینان کامل پاسخهای اشتباه میدهند. این پدیده که در یک مطالعه جدید با عنوان «آخرین آزمون رادیولوژی» (RadLE 2.0) به دقت بررسی شده، میتواند برای بیماران بسیار خطرناک باشد. در این مطلب به جزئیات این تحقیق و پیامدهای آن برای استفاده از هوش مصنوعی در پزشکی میپردازیم.
آزمون جدید RadLE 2.0: سنجش صداقت هوش مصنوعی
نسخه دوم معیار RadLE (مخفف Radiology's Last Exam) توسط آزمایشگاه CRASH در دانشگاه آشوکا هند توسعه یافته است. این آزمون که در سپتامبر 2025 منتشر شد، توانایی مدلهای هوش مصنوعی را در تشخیص صحیح و همچنین میزان اطمینان آنها به پاسخهایشان میسنجد. نکته کلیدی این است که مدلها مجاز هستند بگویند «نمیدانم» و این کار امتیاز منفی ندارد.
در این معیار، 200 مورد بالینی روی 16 مدل مختلف آزمایش شد و نتایج با عملکرد یک گروه از رادیولوژیستهای متخصص مقایسه گردید. کارشناسان انسانی 988.7 امتیاز از 2000 کسب کردند، در حالی که بهترین مدل هوش مصنوعی (Claude Fable 5 از Anthropic) به 758 امتیاز رسید. رادیولوژی به عنوان یک تخصص پزشکی نیازمند دقت بالا و تشخیص صحیح است، و این آزمون نشان میدهد هوش مصنوعی هنوز فاصله زیادی با انسان دارد.
سکوت صادقانه بهتر از حدسهای مطمئن
سیستم امتیازدهی RadLE 2.0 به گونهای طراحی شده که صداقت را پاداش میدهد و اطمینان بیجا را جریمه میکند. اگر مدل با اطمینان بالا پاسخ صحیح دهد، امتیاز کامل میگیرد. اما اگر با همان اطمینان پاسخ اشتباه بدهد، امتیاز از دست میدهد. پاسخ «نمیدانم» نه امتیاز مثبت دارد و نه منفی. این رویکرد بر اساس مقالهای پراستناد شکل گرفته که هشدار میدهد تا زمانی که معیارها فقط دقت را تشویق کنند، مدلها برای حدس زدن آموزش میبینند.
به گفته تیم تحقیق، بسیاری از مدلها اگر سکوت میکردند و حدس نمیزدند، امتیاز بهتری کسب میکردند. این مشکل در مدلهای متنباز و مدلهای آموزشدیده برای پزشکی بیشتر دیده شد. این مدلها تقریباً به همه موارد پاسخ میدهند و اغلب با اطمینان بالا اشتباه میکنند. توهم (Hallucination) در هوش مصنوعی یکی از بزرگترین چالشهای استفاده از آن در پزشکی است.
نتایج: هیچ مدلی برنده همهجانبه نیست
آزمایش RadLE 2.0 نشان داد هیچ مدل واحدی در همه زمینهها برتر نیست. Anthropic Claude Fable 5 در پاسخهای قابل اعتماد و ایمن بهترین بود، در حالی که Google Gemini 3 Pro بالاترین دقت خام را داشت. Meta Muse Spark 1.1 نیز در تشخیص زمان واگذاری پرونده به انسان بهترین عملکرد را نشان داد. نکته جالب این است که Meta نرخ توهم Muse Spark 1.1 را با کاهش پاسخدهی به نصف رسانده است. در مقابل، Grok 4.5 از xAI به دلیل اطمینان بیش از حد به پاسخهای اشتباه، توهم بیشتری دارد.
نسخه اول RadLE تصویر تیرهتری ارائه داد: رادیولوژیستها 83 درصد دقت داشتند، در حالی که بهترین مدل تنها 30 درصد امتیاز گرفت. اما ظرف سه ماه، Gemini 3 Pro از سطح رادیولوژیستهای دستیار فراتر رفت. دقت به سرعت در حال رشد است، اما مدلها هنوز هیچ درکی از محدودیتهای خود ندارند.
بیماران و خطر استفاده از چتباتها
تعداد فزایندهای از مردم تصاویر پزشکی خود را برای چتباتها آپلود میکنند و به پاسخها اعتماد میکنند. مطالعهای در نشریه npj Digital Medicine نشان داد که چتباتهای پرکاربرد اغلب پاسخهای غیرقابل اعتمادی به سوالات پزشکی میدهند. تیم تحقیق RadLE مدیران اجرایی و سرمایهگذاران را متهم میکند که تواناییهای هوش مصنوعی را بیش از حد بزرگ جلوه میدهند. ادعاهایی مانند «تشخیص بهتر از 99 درصد پزشکان» عمدتاً بر اساس داستانهای تکی یا شبیهسازیها است.
مطالعهای در آوریل روی 21 مدل پیشرفته نشان داد که آنها برای استفاده بالینی بدون نظارت آماده نیستند. این در حالی است که سیستمهایی مانند MIRA و AMIE در مشاورههای شبیهسازیشده با پزشکان عمومی همگام شدهاند. اما نویسندگان RadLE 2.0 هشدار میدهند که قبل از اطمینان از توانایی هوش مصنوعی در تشخیص «محدودیتهای خود»، نباید آن را به تنهایی به کار گرفت.
آینده RadLE و نظارت بر هوش مصنوعی پزشکی
RadLE 2.0 به صورت چرخشی بهروز میشود و مدلهای جدید را شامل میگردد. تیم تحقیق قصد دارد یک مقاله علمی کامل با تحلیل هزینهها و طبقهبندی خطاها منتشر کند. این معیار میتواند نقش مهمی در نظارت بر کیفیت هوش مصنوعیهای پزشکی ایفا کند. تا زمانی که مدلها یاد نگیرند به جای حدس زدن، سکوت کنند، استفاده از آنها در تشخیصهای پزشکی همچنان یک خطر بالقوه خواهد بود.





