مطالعهی مشاهدهایاخلاق، ایمنی و ریسکمدلهای زبانی بزرگ (LLM)شواهد متوسط
Hallucination Rates and Reference Accuracy of ChatGPT and Bard for Systematic Reviews: Comparative Analysis
Chelli M, Descamps J, Lavoué V. و همکاران · Journal of Medical Internet Research (JMIR) · 2024 · حجم نمونه: ۱۰۴ تا ۱۳۹ ارجاعِ تولیدشده بهازای هر مدل
🗓 تاریخ انتشار در روانای: ۳ مرداد ۱۴۰۵
🔗 مطالعهی مقالهی اصلی · DOI: 10.2196/53164
این مطالعه، «توهمِ» مدلهای زبانیِ بزرگ — یعنی اختراعِ منابعِ علمیِ غیرواقعی یا نادرست — را در وظیفهی تولیدِ مرورِ سیستماتیک، بهطور مستقیم اندازهگیری کرد.
یافتههای کلیدی
- نرخِ توهم: GPT-3.5 ۳۹٫۶٪ (۵۵ از ۱۳۹ ارجاع)، GPT-4 ۲۸٫۶٪ (۳۴ از ۱۱۹)، و Bard ۹۱٫۴٪ (۹۵ از ۱۰۴) — تفاوتی کاملاً معنادار (p<۰٫۰۰۱).
- دقتِ ارجاعدهی (precision) هر سه مدل بسیار پایین بود: GPT-3.5 تنها ۹٫۴٪، GPT-4 تنها ۱۳٫۴٪، و Bard صفر درصد.
محدودیتها و نکات احتیاطی
- این مطالعه مدلهای نسخهی خاصی را در یک بازهی زمانیِ مشخص آزموده؛ مدلهای جدیدتر ممکن است عملکردِ متفاوتی داشته باشند.
- وظیفهی خاصِ «تولیدِ ارجاعِ علمی» یکی از سختترین آزمونها برای مدلهای زبانی است؛ نتایج لزوماً به همهی کاربردهای پزشکی تعمیم نمییابد.
چرا مهم است
نویسندگان صراحتاً نتیجه گرفتند این مدلها «نباید بهعنوان تنها یا ابزارِ اصلیِ» تولیدِ مرورهای علمی به کار روند. این یافته برای کاربردِ این ابزارها در سلامت روان هم هشداردهنده است: هر ادعایی که یک چتبات با «ارجاعِ علمی» پشتیبانی میکند، باید مستقلاً راستیآزمایی شود.
