مطالعهی مشاهدهایتشخیص و غربالگریمدلهای زبانی بزرگ (LLM)شواهد مقدماتی
Zero-Shot Large Language Models for Preliminary Prediction of PTSD Symptoms From Clinical Interview Transcripts
Teferra و همکاران — Unity Health Toronto / University of Alberta · Canadian Journal of Psychiatry · 2026 · حجم نمونه: ۱۰۰ رونوشت مصاحبه بالینی (DAIC-WoZ)
🗓 تاریخ انتشار در روانای: ۲ مرداد ۱۴۰۵
🔗 مطالعهی مقالهی اصلی · DOI: 10.1177/07067437261468897
اختلال استرس پس از سانحه (PTSD) شایع اما اغلب کمتشخیصدادهشده است، چون غربالگری نظاممند آن معمولاً به پرسشنامههای خودگزارشی وابسته است. پژوهشگرانی از دانشگاه تورنتو و دانشگاه آلبرتا در کانادا بررسی کردند که آیا مدلهای زبانی بزرگ (LLM) میتوانند علائم PTSD را مستقیماً از دل گفتوگوی مصاحبه بالینی، بدون آموزش اختصاصی (zero-shot)، استخراج کنند.
یافتههای کلیدی
- شش مدل زبانی (DeepSeek 3.1، Claude Sonnet 4، LLaMA 4 Scout، GPT-4o، GPT-5 و Gemini 2.5 Flash) روی ۱۰۰ رونوشت مصاحبه نیمهساختاریافته از مجموعهداده DAIC-WoZ آزموده شدند تا هر ۱۷ آیتم چکلیست PTSD نسخه غیرنظامی (PCL-C) را پیشبینی کنند.
- در تشخیص دوتایی وجود/عدموجود علامت، Claude 4 با میانگین دقت ۰٫۷۰۵ (فاصله اطمینان ۹۵٪: ۰٫۶۸۱ تا ۰٫۷۲۸) بهترین عملکرد را داشت؛ پس از آن DeepSeek 3.1 با ۰٫۶۹۹ و Gemini 2.5 با ۰٫۶۹۸ قرار گرفتند.
- در پیشبینی شدت علامت روی مقیاس ۵ درجهای لیکرت، بهترین مدل (DeepSeek 3.1) تنها دقت ۰٫۴۳۸ داشت که اندکی بالاتر از خط پایه حدس اکثریت (۰٫۳۹۹) بود.
- علائم بازتجربه (فلاشبک) و برانگیختگی بیشازحد بهتر از علائم اجتناب و بیحسی عاطفی پیشبینی شدند.
- تفاوت عملکرد میان مدلهای مختلف کوچک بود و هیچ مدلی برتری قاطع نداشت.
محدودیتها و نکات احتیاطی
- حجم نمونه محدود (۱۰۰ رونوشت) و مصاحبهها بهطور اختصاصی برای غربالگری تروما طراحی نشده بودند، که تعمیمپذیری یافتهها را محدود میکند.
- نویسندگان صریحاً نتیجه گرفتهاند که دقت مدلها برای کاربرد بالینی کافی نیست، بهویژه در برآورد دقیق شدت علائم.
- یافتهها مقدماتی (preliminary) تلقی میشوند و نیازمند بررسی در دادههای بالینی واقعی و اختصاصیتر برای تروما هستند.
چرا مهم است
این مطالعه نشان میدهد که هرچند مدلهای زبانی بزرگ میتوانند الگوهای کلی علائم PTSD را تا حدی از گفتوگوی طبیعی تشخیص دهند، این فناوری هنوز در مرحله ابتدایی است و نمیتواند جایگزین ابزارهای غربالگری موجود شود؛ نتایج باید بهعنوان زمینهای برای پژوهش بیشتر، نه توصیهای برای استفاده بالینی، در نظر گرفته شود.
