پاسخی که روان، منظم و مطمئن به نظر میرسد، لزوماً پاسخ درستی نیست. پیش از آنکه پاسخ هوش مصنوعی را بپذیریم یا براساس آن تصمیم بگیریم، باید میزان اعتمادمان را با شواهد، بافت و پیامد احتمالی خطا تنظیم کنیم.
هوش مصنوعی میتواند در چند ثانیه توضیحی روشن، فهرستی مرتب یا پیشنهادی قانعکننده بسازد. همین کیفیت زبانی گاهی باعث میشود فراموش کنیم که مدل ممکن است منبعی ساختگی ارائه کند، اطلاعاتی قدیمی ارائه کند، یک استثنای مهم را نادیده بگیرد یا با پیشفرض نادرست ما همراه شود. پژوهش دربارهٔ توهم مدلها، استنادهای ساختگی و اعتماد به اتوماسیون نشان میدهد ظاهر حرفهای پاسخ، جای راستیآزمایی را نمیگیرد [۱][۲][۳].
این چکلیست قرار نیست هوش مصنوعی را کنار بگذارد. هدف آن این است که هوش مصنوعی را در جایگاه درست نگه داریم: یک دستیار برای فکرکردن، جستوجو و تهیهٔ پیشنویس؛ نه مرجعی که صرفاً بهدلیل لحن مطمئنش مبنای تصمیمگیری قرار میگیرد.
نکتهٔ مهم: این چکلیست یک مقیاس اعتبارسنجیشده یا ابزار امتیازدهی علمی نیست. در پژوهشهای موجود، نمرهٔ واحدی پیدا نشده که اعتبار هر پاسخ هوش مصنوعی را در همهٔ مدلها و حوزهها تعیین کند. قرار نیست تیکهای بیشتر به پاسخ «نمرهٔ قبولی» بدهند؛ قرار است نقاطی را نشان دهند که پیش از اتکا باید بررسی شوند.
اول سطح خطر را مشخص کنید
پیش از هر بررسی دیگری، از خودتان بپرسید: اگر این پاسخ اشتباه باشد، چه اتفاقی میافتد؟ شدت بررسی باید متناسب با پیامد خطا باشد [۲][۴].
- کمخطر: ایدهپردازی، انتخاب عنوان، توضیح اولیهٔ یک مفهوم یا کاری که بهراحتی قابل بازگشت و اصلاح است.
- متوسط: تکلیف دانشگاهی، گزارش کاری، توصیهای که بر دیگران اثر میگذارد یا اطلاعاتی که قرار است منتشر شود.
- پرخطر: سلامت و سلامت روان، دارو، حقوق، امور مالی، ایمنی، تصمیم دربارهٔ فرد دیگر یا اقدامی که بهسختی قابل بازگشت است.
قاعدهٔ توقف: اگر پاسخ میتواند به بدن، روان، حق قانونی، پول قابلتوجه، ایمنی، اعتبار علمی یا شخص دیگری آسیب بزند، خروجی AI فقط نقطهٔ شروع بررسی است؛ نه مبنای اقدام. در این موقعیتها منبع رسمیِ بهروز و، در صورت لزوم، انسان واجدصلاحیت باید وارد تصمیم شود.
چکلیست ۱۱ پرسشی پیش از اعتماد
در پاسخهای کمخطر ممکن است چند کنترل سریع کافی باشد. هرچه تصمیم مهمتر میشود، باید پرسشهای مربوط به منبع، تاریخ، استدلال، حریم خصوصی و نظر متخصص را کاملتر بررسی کنید.
۱. پیامد خطا را بسنجید
بپرسید: اگر این پاسخ غلط باشد، چه کسی یا چه چیزی آسیب میبیند؟
در ده ثانیه پاسخ را «کمخطر، متوسط یا پرخطر» بنامید و یک پیامد واقعیِ بدترین حالت را بنویسید. فوریت، آسیب جسمی یا روانی، مهلت قانونی، پول قابلتوجه و تصمیم دربارهٔ دیگری، سطح بررسی لازم را بالاتر میبرند [۲][۴].
۲. ادعای اصلی را از متن جدا کنید
بپرسید: این پاسخ دقیقاً چه واقعیت، توصیه، پیشبینی یا تصمیمی را مطرح میکند؟
پاسخهای طولانی میتوانند ادعای تعیینکننده را میان توضیحات درست یا کماهمیت پنهان کنند. جملهٔ کلیدی را با این قالب بازنویسی کنید: «AI میگوید X، برای Y، در زمان یا مکان Z». سپس همان X را بررسی کنید. واژههایی مثل «همیشه»، «قطعاً»، «بهترین» و «ثابت شده» بدون تعریف و شرط، علامت هشدارند.
۳. منبع را واقعاً باز کنید
بپرسید: آیا منبع اصلی وجود دارد و واقعاً از همین ادعا پشتیبانی میکند؟
مدل میتواند عنوان، نویسنده، DOI، نقلقول یا آمار بسازد؛ یا منبعی واقعی اما نامرتبط ارائه کند [۱][۳]. عنوان یا DOI را در وبسایت ناشر، PubMed، ACL یا پایگاه معتبر دیگری جستوجو کنید. نویسنده، سال، عنوان و سپس چکیده یا بخش مرتبط را بخوانید. اگر لینک باز نشد یا منبع فقط موضوعی شبیه داشت، ادعا هنوز تأیید نشده است.
۴. تاریخ و بافت را تطبیق دهید
بپرسید: آیا این اطلاعات برای امروز، این نسخه، این کشور و این موقعیت مناسب است؟
قانون، قیمت، سیاست دانشگاه، امکانات یک محصول و حتی عملکرد مدلها تغییر میکنند. یک منبع رسمیِ تاریخدار باز کنید و تاریخ انتشار یا اجرا، نسخه، کشور و گروه هدف را کنار ادعا بنویسید. عبارتهایی مانند «آخرین» و «اکنون» بدون منبع زنده قابل اتکا نیستند [۵].
۵. فرضها و عدمقطعیت را آشکار کنید
بپرسید: مدل چه چیزی را نمیداند و چه فرضی کرده است؟
لحن مطمئن میتواند کمبود داده یا اختلاف شواهد را پنهان کند؛ حتی اعتراف خود مدل به «میزان اطمینان» نیز اعتبارسنجی مستقل نیست [۶]. از مدل بخواهید «سه فرض، دو محدودیت و یک داده که با تغییر آن نتیجه عوض میشود» را نام ببرد؛ بعد خودتان این موارد را کنترل کنید.
۶. عدد و استدلال را بازسازی کنید
بپرسید: آیا میتوانم ورودی، واحد، مرحلهٔ میانی و نتیجه را مستقل محاسبه کنم؟
توضیح مرحلهبهمرحله میتواند همچنان اشتباه باشد و درخواست «دوباره بررسی کن» از همان مدل، داوری مستقل به شمار نمیآید [۷]. دادهها را در ماشینحساب یا صفحهگسترده وارد کنید، واحدها را بسنجید و دستکم یک مرحلهٔ حساس را جداگانه حساب کنید. برای استدلال نیز فرضها و شاهد مخالف را فهرست کنید.
۷. پاسخ را با بازپرسش بیازمایید
بپرسید: اگر سؤال را کوتاهتر، خنثیتر یا با زاویهای دیگر مطرح کنم، نتیجهٔ مهم ثابت میماند؟
قالب و زبان پرامپت میتواند خروجی را تغییر دهد [۸]. یک بار سؤال را بدون لحن القایی بازنویسی کنید و یک بار شاهد مخالف بخواهید. اختلاف معنادار علامت خطر است، اما توافق دو پاسخ نیز بهتنهایی حقیقت را ثابت نمیکند؛ ممکن است هر دو یک خطای مشترک داشته باشند.
۸. باور خودتان را وارونه کنید
بپرسید: آیا مدل فقط با فرض یا خواستهٔ من موافقت کرده است؟
مدلهای زبانی ممکن است با دیدگاه کاربر همراهی بیدلیل نشان دهند و این رفتار میتواند سوگیری تأییدی ما را تقویت کند [۹]. بپرسید: «قویترین دلیل مخالف چیست؟ چه شواهدی نتیجه را رد میکند؟ اگر فرض من غلط باشد چه؟» سپس یکی از منابع یا افراد مستقل را عمداً از زاویهٔ مخالف بررسی کنید.
۹. زبان، فرهنگ و تناسب شخصی را کنترل کنید
بپرسید: آیا این پاسخ برای زبان، فرهنگ، قوانین و موقعیت من مناسب است؟
مدلها میتوانند هنجارهای یک فرهنگ را عمومی فرض کنند و عملکردشان در وظایف فارسی نیز یکنواخت نیست [۱۰][۱۱]. اصطلاح کلیدی را در یک منبع فارسی یا محلی معتبر بررسی کنید و ببینید قانون، دسترسی، ساختار خانواده، آموزش یا خدمات موجود در محل شما چه تفاوتی ایجاد میکند.
۱۰. ورودی و خروجی حساس را ایمن کنید
بپرسید: آیا اطلاعات شخصی، محرمانه یا قابلشناسایی را وارد یا بازنشر میکنم؟
نام و مشخصات بیمار، مراجع یا دانشجو، پرونده، قرارداد، گذرواژه، API key، راز تجاری و پژوهش منتشرنشده را وارد نکنید. داده را کمینه و ناشناس کنید و سیاست سازمان و محصول را بخوانید. «پاسخ بهتر» توجیهی برای افشای دادهٔ حساس نیست [۱][۱۲][۱۳].
۱۱. دروازهٔ انسان یا منبع رسمی را فعال کنید
بپرسید: آیا پیش از اقدام به منبع رسمیِ بهروز یا انسان واجدصلاحیت نیاز دارم؟
مدل عمومی جای معاینه، سابقهٔ کامل، مسئولیت حرفهای، قانون محل یا مشاورهٔ متناسب با وضعیت شخصی را نمیگیرد. اگر موضوع سلامت یا سلامت روان، حقوق، امور مالی یا ایمنی است؛ تصمیم سختبرگشت است؛ یا فرد دیگری از آن تأثیر میگیرد، پاسخ AI را به فهرستی از سؤالها تبدیل کنید و بررسی را به منبع رسمی یا متخصص همان حوزه بسپارید [۱۲][۱۴][۱۵].
سه نمونهٔ کاربردی
۱. پاسخ دربارهٔ سلامت روان
فرض کنید AI با لحنی همدلانه میگوید نشانههای شما «حتماً اضطراب» است و یک برنامهٔ مواجهه پیشنهاد میکند. لحن همدلانه و اصطلاح تخصصی میتوانند پاسخ را معتبر جلوه دهند، اما تشخیص و توصیهٔ شخصی با اطلاعات محدود شکل گرفته است. پژوهشها نشان دادهاند پاسخ چتبات ممکن است از نظر کیفیت و همدلیِ ادراکشده مطلوب ارزیابی شود؛ این یافته بهتنهایی ایمنی بالینی یا تناسب درمان با فرد را ثابت نمیکند [۱۶].
تصمیم مناسب: از پاسخ برای ساختن سؤال استفاده کنید، نه خودتشخیصی یا تغییر درمان. اگر خطر خودآسیبی، علائم شدید یا وضعیت بحرانی وجود دارد، استفاده از چکلیست جای اقدام فوری و کمک انسانی یا خدمات اضطراری محلی را نمیگیرد [۱۲][۱۴].
۲. پاسخ برای پژوهش یا تکلیف دانشگاهی
مدل پنج مقاله با DOI، سال جدید و یک عدد دقیق معرفی میکند. این ظاهر رسمی هنوز ثابت نمیکند مقالهها وجود دارند یا عدد از همان پژوهش آمده است. هر DOI را باز کنید، نوع مطالعه و جامعه را بخوانید و عدد را در متن یا جدول اصلی پیدا کنید [۳].
تصمیم مناسب: فقط منبعی را وارد تکلیف کنید که شخصاً دیدهاید و ادعایش را با متن اصلی تطبیق دادهاید. نقش AI را نیز مطابق سیاست درس، دانشگاه یا مجله افشا کنید؛ مسئولیت منبع و استدلال همچنان با نویسندهٔ انسانی است [۱۳][۱۷].
۳. پاسخ برای یک تصمیم روزمره
AI یک دستگاه را «بهترین انتخاب» معرفی میکند و قیمت، گارانتی و مشخصات فنی میدهد. این اطلاعات به زمان و منطقه وابستهاند. نام دقیق مدل، تاریخ قیمت، مشخصات سازنده، هزینهٔ قطعات مصرفی و شرایط گارانتی را در دو منبع معتبر مقایسه کنید [۵].
تصمیم مناسب: برای خرید کمهزینه و قابل بازگشت، همین کنترل کوتاه ممکن است کافی باشد. هرچه هزینه و تعهد بیشتر میشود، بررسی مستقل نیز باید عمیقتر شود.
علائم هشدار که باید شما را متوقف کنند
- منبع، DOI یا نقلقول پیدا نمیشود یا ارتباطش با ادعا روشن نیست.
- تاریخ، نسخه، کشور، واحد یا گروه هدف مشخص نشده است.
- AI دربارهٔ درمان، حقوق، پول یا ایمنی با قطعیت و بدون شناخت موقعیت خاص فرمان میدهد.
- محاسبه، ورودیها یا مسیر استدلال را نمیتوان مستقل بازسازی کرد.
- یک بازنویسی خنثی، نتیجه یا میزان قطعیت را بهطور جدی تغییر میدهد.
- پاسخ فقط با باور یا منفعت شما همراه است و دلیل مخالف را جدی نمیگیرد.
- برای گرفتن پاسخ باید دادهٔ شخصی، محرمانه یا قابلشناسایی وارد شود.
پس از توقف چه کنید؟ پاسخ را نه «درست» و نه «غلط»، بلکه «نیازمند راستیآزمایی» برچسب بزنید. ادعای اصلی را جدا کنید، منبع را باز کنید، آن را با یک منبع مستقل مقایسه کنید و فقط پس از رفع ابهام اقدام کنید.
محدودیت این چکلیست
مدلها و ابزارهای جستوجو سریع تغییر میکنند. نتیجهٔ یک بنچمارک دربارهٔ یک مدل یا نسخه، تضمین عملکرد امروز نیست. شواهد دربارهٔ اثر چکلیستهای ساده بر رفتار واقعی کاربران هنوز محدود است و بخشی از دانش اعتماد و سوگیری، از پژوهشهای قدیمیتر اتوماسیون میآید. در سلامت روان نیز شواهد دربارهٔ استفادهٔ مستقل از مدلهای زبانی ناهمگون است و برای نتیجهگیری قطعی دربارهٔ اثربخشی و ایمنی کافی نیست [۱۴].
دربارهٔ فارسی و کاربران ایرانی نیز دادههای مستقیم محدود است. به همین دلیل، بررسی منبع محلی، زبان، فرهنگ، قانون و دسترسیهای واقعی بخشی از خودِ اعتمادسنجی است؛ نه یک مرحلهٔ فرعی.
یک تمرین دو دقیقهای
در پاسخ بعدی AI فقط یک ادعای مهم را انتخاب کنید و کنار آن سه چیز بنویسید: منبع اصلی، تاریخ یا بافت، و وضعیت «تأیید شد / نیازمند بررسی». اگر یکی از این سه مورد را ندارید، هنوز براساس آن ادعا تصمیم نگیرید.
آخرین بازبینی: ۶ سپتامبر ۲۰۲۶. با هر تغییر مهم در مدلهای عمومی، سیاستهای حریم خصوصی، راهنماهای حرفهای یا ظهور شواهد فارسی و بالینی تازه، این مطلب باید زودتر از بازهٔ ششماهه بازبینی شود.
منابع
- Autio C, et al. Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile. NIST; 2024. DOI
- National Institute of Standards and Technology. Artificial Intelligence Risk Management Framework (AI RMF 1.0). 2023. DOI
- Ji Z, et al. Survey of Hallucination in Natural Language Generation. ACM Computing Surveys. 2023. DOI
- Lyell D, Coiera E. Automation bias and verification complexity: a systematic review. JAMIA. 2017. DOI
- Zhu C, et al. Is Your LLM Outdated? A Deep Look at Temporal Generalization. NAACL. 2025. لینک مقاله
- Xiong M, et al. Can LLMs Express Their Uncertainty? ICLR. 2024. لینک مقاله
- Kamoi R, et al. When Can LLMs Actually Correct Their Own Mistakes? Transactions of the ACL. 2024. DOI
- Mizrahi M, et al. State of What Art? A Call for Multi-Prompt LLM Evaluation. Transactions of the ACL. 2024. DOI
- Sharma M, et al. Towards Understanding Sycophancy in Language Models. ICLR. 2024. لینک مقاله
- Tao Y, Viberg O, Baker RS, Kizilcec RF. Cultural bias and cultural alignment of large language models. PNAS Nexus. 2024. DOI
- Abaskohi A, et al. Benchmarking Large Language Models for Persian. LREC-COLING. 2024. لینک مقاله
- World Health Organization. Ethics and governance of artificial intelligence for health: Guidance on large multi-modal models. 2024. لینک راهنما
- UNESCO. Guidance for generative AI in education and research. 2023. لینک راهنما
- Hua Y, et al. A scoping review of large language models for generative tasks in mental health care. npj Digital Medicine. 2025. DOI
- Haltaufderheide J, Ranisch R. The ethics of ChatGPT in medicine and healthcare. npj Digital Medicine. 2024. DOI
- Ayers JW, et al. Comparing Physician and Artificial Intelligence Chatbot Responses to Patient Questions. JAMA Internal Medicine. 2023. DOI
- Committee on Publication Ethics. Authorship and AI tools. 2023. لینک راهنما
این مطلب بخشی از پروژهٔ «هوشزیست» روانای است و برای استفادهٔ آگاهانه و مسئولانه از هوش مصنوعی نوشته شده است. توصیهها عمومیاند و جایگزین ارزیابی تخصصی، راهنمای رسمی یا سیاستهای محل کار و تحصیل شما نیستند.




