مطالعهی کیفیاخلاق، ایمنی و ریسکتشخیص و غربالگریشواهد متوسط
Racial bias in AI-mediated psychiatric diagnosis and treatment: a qualitative comparison of four large language models
Bouguettaya A, Stuart EM, Aboujaoude E. · npj Digital Medicine · 2025 · حجم نمونه: ۴ مدل زبانی × ۱۰ پرونده × ۳ حالت (۱۲۰ خروجی)
🗓 تاریخ انتشار در روانای: ۳ مرداد ۱۴۰۵
🔗 مطالعهی مقالهی اصلی · DOI: 10.1038/s41746-025-01746-4
این مطالعه، عملکرد چهار مدل زبانیِ بزرگ (Claude، ChatGPT، Gemini و یک مدل تخصصیِ روانپزشکی) را روی ده پروندهی بالینیِ روانپزشکی، در سه حالتِ متفاوت (نژاد نامشخص، نژادِ ضمنی، نژادِ صریح) مقایسه کرد.
یافتههای کلیدی
- در ۱۲۰ خروجیِ بررسیشده (۴ مدل × ۱۰ پرونده × ۳ حالت)، تصمیمهای تشخیصی سوگیریِ اندکی نشان دادند، اما توصیههای درمانی هنگامِ ذکرِ صریح یا ضمنیِ نژاد، اغلب ضعیفتر میشدند.
- مثالها: Gemini فقط وقتی بیمار «آفریقایی-آمریکایی» معرفی شده بود، روی کاهش مصرف الکل در موارد اضطراب تمرکز بیشتری نشان داد؛ Claude فقط در حالتِ نژادِ صریح، برای موارد افسردگی توصیه به «قیمومیت» (guardianship) کرد.
- یکی از مدلها (تخصصیِ روانپزشکی) بیشترین سوگیری را نشان داد؛ Gemini کمترین سوگیری را داشت. نمرهی سوگیری در حالت صریح (۱٫۹۳) بهطور محسوسی بیشتر از حالت ضمنی (۱٫۳۷) بود.
محدودیتها و نکات احتیاطی
- مطالعهای کیفی با ۱۰ پروندهی شبیهسازیشده است، نه کارآزماییِ کمّیِ بزرگمقیاس؛ تعمیم به همهی موقعیتهای بالینی نیازمند احتیاط است.
- فقط نژاد آفریقایی-آمریکایی بهطور مشخص بررسی شد؛ سایر گروههای نژادی/قومی در این طرح نبودند.
چرا مهم است
این پژوهش نشان میدهد سوگیریِ نژادیِ موجود در دادههای آموزشیِ مدلهای زبانی میتواند مستقیماً به نابرابری در توصیههای درمانیِ واقعی ترجمه شود — نکتهای حیاتی پیش از هرگونه بهکارگیریِ این مدلها در تصمیمگیریِ بالینی.
