پژوهشگران در یک مطالعهٔ تازه، سه مدل زبانی هوش مصنوعی را با مصاحبههای واقعی روانسرطانشناسی به زبان کرهای آزمودند. مدلها در مجموع با امتیازهای روانپزشکان توافق بالایی داشتند، اما الگوی خطاهایشان یکسان نبود و دو مدل بار کلی نشانهها را بیشتر از ارزیابی بالینی برآورد کردند.
این مقاله ۹ سپتامبر ۲۰۲۶ در Journal of Medical Internet Research منتشر شد. ۱۰۱ بزرگسالِ تحت مراقبت سرطان در سه بیمارستان کرهٔ جنوبی در مصاحبههای نیمهساختاریافته شرکت کردند. سه روانپزشکِ روانسرطانشناسی، ۳۹ مورد مربوط به نشانههای روانپزشکی و جسمانی و اختلال در کارکرد را همان هنگام امتیاز دادند.
سپس GPT-4o، Claude 3.5 Sonnet و Gemini 2.5 Flash متن کامل کرهای هر مصاحبه و بخش مرتبط با هر مورد را دریافت کردند. هر سه مدل باید بدون نمونهٔ آموزشی و با دستور یکسان، برای هر مورد امتیازی از صفر تا سه و توضیحی کوتاه ارائه میکردند. در مجموع، ۳٬۹۳۱ امتیاز مدل با داوری متخصصان مقایسه شد.
توافق کلی مدلها با روانپزشکان خوب بود: ضریب همبستگی درونطبقهای بین ۰٫۸۱۶ تا ۰٫۸۷۲ قرار داشت و GPT-4o بالاترین توافق را نشان داد. بااینحال، Claude و Gemini بار کلی نشانهها را بهطور معناداری بیشتر از متخصصان برآورد کردند؛ این تفاوت برای GPT-4o معنادار نبود.
بازبینی اختلافها نشان داد بخشی از آنها به ابهام واقعی در گفتههای بیماران مربوط بود. این سهم برای GPT-4o برابر ۳۹٫۱ درصد، برای Claude برابر ۲۹٫۲ درصد و برای Gemini برابر ۳۳٫۲ درصد بود. در خطاهای روشنتر، رایجترین مشکل کاربرد نادرست آستانهٔ شدت بود؛ برای مثال، مدل گاهی اشاره به یک نشانه را بدون شواهد کافی دربارهٔ مدت یا اثر آن، شدیدتر امتیاز میداد.
این یافتهها به معنای آمادهبودن مدلهای زبانی برای غربالگری مستقل نیست. بیشتر شرکتکنندگان زن و مبتلا به سرطان پستان بودند، ارزیابی فقط در یک زبان و با نسخههای مشخص مدلها انجام شد و اعتبارسنجی بیرونی وجود نداشت. مصاحبهٔ روانپزشکی نیز فقط به متن محدود نمیشود و نشانههای غیرکلامی در این آزمون به مدل داده نشدند.
پیام عملی مطالعه محتاطانه است: توافق میانگینِ بالا میتواند تفاوتهای مهم در جهت و علت خطاها را پنهان کند. اگر چنین سامانهای روزی وارد مراقبت شود، باید نقش کمکیار داشته باشد، خروجی آن را متخصص بازبینی کند و عملکردش در جمعیتها و زبانهای دیگر جداگانه سنجیده شود.
منبع: Kim J و همکاران. Large Language Models for Distress Rating in Korean Psycho-Oncology Interviews: Exploratory Clinician-Benchmarked Evaluation Study. Journal of Medical Internet Research، ۲۰۲۶. متن کامل مقاله؛ DOI: 10.2196/91405.







