ارزیابی کور سه مدل زبانی عمومی نشان داد این مدلها به بسیاری از پرسشهای مربوط به افسردگی سالمندی پاسخ قابلقبول میدهند، اما در سناریوهای پرخطر همچنان خطاهای مهمی دارند. این مطالعه ۱۱ سپتامبر در Frontiers in Psychiatry منتشر شد و پاسخهای ChatGPT، Gemini و Doubao را در موقعیتهایی سنجید که تشخیص فوریت و توجه به شرایط خاص سالمندان اهمیت داشت.
پژوهشگران ۹۰ پرسش بیمارمحور و مراقبمحور را در شش حوزهٔ روانپزشکی سالمندی طراحی کردند. پرسشها بهطور مساوی در سه سطح خطر پایین، متوسط و بالا قرار گرفتند. GPT-5.5 Instant در ChatGPT، Gemini 3.5 Flash و Seed2.0 Pro در Doubao به هر پرسش پاسخ دادند. سپس دو روانپزشک، بدون اطلاع از نام مدل، پاسخها را با معیارهای ازپیشتعیینشده بررسی کردند و اختلافهای مهم را روانپزشک سوم داوری کرد.
پاسخ از نظر بالینی قابلقبول برای ۷۸٫۹ درصد پرسشها در ChatGPT، ۷۲٫۲ درصد در Gemini و ۶۰ درصد در Doubao ثبت شد. تفاوت ChatGPT و Gemini از نظر آماری معنادار نبود، اما هر دو از Doubao بهتر بودند. کاملبودن ملاحظات ویژهٔ سالمندی پایینتر بود: ۶۴٫۴ درصد برای ChatGPT، ۵۵٫۶ درصد برای Gemini و ۴۳٫۳ درصد برای Doubao.
شکاف در پرسشهای پرخطر برجستهتر شد. در این گروه، نرخ پاسخ قابلقبول بهترتیب ۶۳٫۳، ۵۰ و ۳۶٫۷ درصد بود. کمبرآوردکردن فوریت در ۱۶٫۷ درصد پاسخهای ChatGPT، ۲۶٫۷ درصد پاسخهای Gemini و ۳۶٫۷ درصد پاسخهای Doubao رخ داد. خطای عمدهٔ ایمنی نیز در ۵٫۶، ۱۰ و ۱۶٫۷ درصد کل پاسخها دیده شد. مدلها در تشخیص آشفتگی حاد، خودمراقبتی ناکافی، شکنندگی، مصرف همزمان چند دارو و نیازهای عملی مراقب همیشه قابلاتکا نبودند.
پژوهشگران ۳۰ پرسش را بار دیگر به مدلها دادند. ثبات بالینی پاسخها برای ChatGPT برابر ۹۰ درصد، برای Gemini ۸۳٫۳ درصد و برای Doubao ۷۳٫۳ درصد بود. بنابراین حتی مدل دارای عملکرد بهتر نیز همیشه در دو نوبت پاسخ همسانی تولید نکرد.
این پژوهش کارآزمایی درمانی نبود و هیچ بیمار واقعی بر پایهٔ خروجی مدل مراقبت دریافت نکرد. مجموعهٔ پرسشها نیز آزمون فشار مقایسهای بود و لزوماً فراوانی پرسشهای دنیای واقعی را بازنمایی نمیکرد. نویسندگان نتیجه گرفتند مدلهای عمومی ممکن است برای بعضی آموزشهای کمخطر مفید باشند، اما نباید بهتنهایی دربارهٔ تریاژ اورژانسی، تغییر دارو یا مدیریت خطر خودکشی در سالمندان راهنمایی کنند.
منبع: Xiao W, Zhang H, Chen X, et al. Large language models for late-life depression: a blinded benchmark of clinical safety, geriatric appropriateness, and triage. Frontiers in Psychiatry. 2026. DOI: 10.3389/fpsyt.2026.1956736.







