اولین بار که متوجه شدم ChatGPT با اطمینان کامل، اطلاعاتی را ارائه داده که در واقعیت نادرست بود، در یک پروژه‌ی مشاوره‌ای بود. مدل، یک مطالعه‌ی تحقیقاتی را با جزئیات دقیق توصیف کرد که هرگز وجود نداشت — نویسندگان، مجله، سال انتشار، حتی شماره صفحات. آن تجربه، نقطه‌ی شروع مطالعه‌ای شد که امروز به یکی از جدی‌ترین پرسش‌های حوزه‌ی هوش مصنوعی تبدیل شده است. قابلیت اعتماد اطلاعات ChatGPT، یک مسئله‌ی صرفاً فنی نیست؛ یک مسئله‌ی معرفت‌شناختی است که نیازمند درک عمیق از ماهیت مدل‌های زبانی و چارچوب‌های اعتبارسنجی است. این متن تلاش می‌کند این حوزه را در سطح مهندسی ارشد باز کند.

اگر با مفاهیم پایه آشنا نیستید، ابتدا ChatGPT چیست و چگونه از آن استفاده کنیم را مرور کنید. اگر با این مفاهیم راحتی دارید، این متن را می‌توانید بدون وقفه دنبال کنید.

اعتبار اطلاعات یعنی چه؟ تعریف عملیاتی

اعتبار اطلاعات، یک صفت مطلق نیست؛ یک مفهوم چندبعدی است. در حوزه‌ی مدل‌های زبانی، اعتبار را می‌توان در سه سطح تعریف کرد.

سطح اول، صحت واقعی است: آیا اطلاعات ارائه‌شده با واقعیت بیرونی هم‌خوانی دارد؟ این سطح، آنچه معمولاً به‌عنوان درست یا نادرست در ذهن داریم.

سطح دوم، انسجام منطقی است: آیا اطلاعات ارائه‌شده از نظر منطقی سازگار است؟ حتی اگر اطلاعات با واقعیت هم‌خوانی داشته باشد، ممکن است از نظر منطقی ناسازگار باشد.

سطح سوم، اعتبار منبع است: آیا می‌توان اطلاعات ارائه‌شده را به یک منبع معتبر ارجاع داد؟ این سطح، در حوزه‌های آکادمیک و حقوقی، حیاتی است.

ChatGPT در هر سه سطح، محدودیت‌های ساختاری دارد. در سطح اول، احتمال hallucination وجود دارد. در سطح دوم، ممکن است اطلاعات ناسازگار ارائه دهد. در سطح سوم، ارجاع دقیق به منابع، یکی از ضعف‌های شناخته‌شده‌ی مدل‌های زبانی است.

اعتبار اطلاعات در ChatGPT، نه یک ویژگی باینری بلکه یک پیوستار است که باید در بستر کاربرد تعریف شود.

مکانیزم hallucination در مدل‌های زبانی

Hallucination، پدیده‌ای است که در آن، مدل اطلاعاتی تولید می‌کند که در واقعیت نادرست است اما با confidence بالا ارائه می‌شود. درک مکانیزم این پدیده، برای استفاده‌ی مسئولانه از ChatGPT حیاتی است.

در ساده‌ترین توصیف، مدل‌های زبانی بر اساس توزیع احتمال داده‌های آموزشی آموزش دیده‌اند. مدل یاد می‌گیرد که در هر گام، توکن بعدی را بر اساس context پیش‌بینی کند. اما این پیش‌بینی، بر اساس هم‌راستایی واقعی با حقیقت نیست؛ بر اساس هم‌راستایی آماری با داده‌های آموزشی است.

به‌زبان دیگر، مدل یاد می‌گیرد که «چه چیزی می‌تواند بعد از این متن بیاید» بر اساس داده‌های آموزشی، نه «چه چیزی واقعاً درست است». در بسیاری از موارد، این دو هم‌راستا هستند، چون داده‌های آموزشی معمولاً اطلاعات درست را در خود دارند. اما در مواردی که داده‌های آموزشی مبهم، متناقض یا ناقص هستند، مدل ممکن است اطلاعات نادرست را با همان confidence ارائه دهد.

پژوهش‌های اخیر نشان داده‌اند که hallucination در مدل‌های زبانی، نه یک باگ بلکه یک ویژگی ساختاری است. یعنی، حتی با بهبود قابل توجه در معماری و داده‌های آموزشی، احتمال hallucination به‌طور کامل حذف نمی‌شود. این نکته، برای استفاده‌ی مسئولانه از ChatGPT، بسیار مهم است.

مکانیزم دقیق hallucination به چند عامل بستگی دارد. اول، داده‌های آموزشی ناقص یا متناقض. دوم، عدم توانایی مدل در تشخیص حدود دانش خود. سوم، تمایل مدل به ارائه پاسخ‌های مفصل حتی وقتی مطمئن نیست. چهارم، ماهیت probabilistic مدل که در برخی موارد، نمونه‌های احتمالاتی کمتر را نیز تولید می‌کند. برای درک مبانی، هوش مصنوعی مولد چیست و چگونه کار می‌کند را ببینید.

الگوهای رایج اطلاعات نادرست

اطلاعات نادرست ChatGPT، الگوهای قابل پیش‌بینی دارند. شناخت این الگوها، به کاربر اجازه می‌دهد که به‌موقع به آن‌ها مشکوک شود.

الگوی اول، ارجاع جعلی است. ChatGPT می‌تواند مقاله‌ای با نویسندگان، مجله، سال و شماره صفحه‌های دقیق توصیف کند که هرگز وجود نداشته. این الگو، به‌ویژه در حوزه‌های آکادمیک شایع است. مدل، الگوی ارجاع آکادمیک را یاد گرفته اما محتوای دقیق را از داده‌های آموزشی به‌خاطر نمی‌سپارد.

الگوی دوم، جزئیات تخیلی است. ChatGPT می‌تواند برای یک شخصیت واقعی، ویژگی‌هایی نسبت دهد که هرگز نداشته. مثلاً جای تولد اشتباه، سابقه‌ی تحصیلی جعلی یا نقل‌قول‌های ساختگی.

الگوی سوم، آمار ساختگی است. ChatGPT می‌تواند آمار دقیقی با اعداد مشخص ارائه دهد که از هیچ منبعی نمی‌آید. این الگو، به‌ویژه در حوزه‌های اقتصادی و اجتماعی خطرناک است.

الگوی چهارم، ترکیب درست و نادرست است. ChatGPT می‌تواند در یک پاسخ، ترکیبی از اطلاعات درست و نادرست ارائه دهد که تشخیص آن‌ها دشوار است. این الگو، خطرناک‌ترین حالت است چون باعث می‌شود کاربر به کل پاسخ اعتماد کند.

الگوی پنجم، اطمینان کاذب است. ChatGPT در ارائه اطلاعات نادرست، معمولاً همان لحن اطمینان را دارد که در ارائه اطلاعات درست. این مسئله، باعث می‌شود که کاربر نتواند بر اساس لحن، به درستی اطلاعات شک کند.

ChatGPT در چه حوزه‌هایی قابل اعتماد است؟

پاسخ به این پرسش، به حوزه و نوع کاربرد بستگی دارد. سه دسته‌ی کلی وجود دارد.

دسته‌ی اول، حوزه‌های با اعتبار بالا. ChatGPT در حوزه‌هایی که داده‌ی آموزشی غنی، ساختاریافته و متناقض‌نباشد، عملکرد خوبی دارد. مثلاً توضیح مفاهیم فنی ساده، کمک به نوشتن کد boilerplate، یا خلاصه‌سازی متن‌های طولانی.

دسته‌ی دوم، حوزه‌های با اعتبار متوسط. ChatGPT در حوزه‌هایی که داده‌ی آموزشی غنی است اما ممکن است متناقض یا ناقص باشد، عملکرد متوسطی دارد. مثلاً توضیح تاریخ، تحلیل‌های اقتصادی یا خلاصه‌ی اخبار.

دسته‌ی سوم، حوزه‌های با اعتبار پایین. ChatGPT در حوزه‌هایی که نیازمند ارجاع دقیق به منبع، اطلاعات به‌روز یا تحلیل تخصصی است، عملکرد ضعیفی دارد. مثلاً اطلاعات پزشکی، مشاوره‌ی حقوقی یا تحلیل‌های مالی.

نکته‌ی مهم: حتی در حوزه‌های با اعتبار بالا، احتمال hallucination صفر نیست. بهترین رویکرد، استفاده‌ی مشروط از ChatGPT با لایه‌ی اعتبارسنجی است. برای درک دقیق‌تر، مدل‌های زبانی بزرگ و انقلاب آن‌ها را ببینید.

استراتژی‌های اعتبارسنجی

اعتبارسنجی اطلاعات ChatGPT، نیازمند رویکردی چندلایه است. چهار استراتژی اصلی وجود دارد.

استراتژی اول، تأیید متقابل است. هر ادعای مهم ChatGPT باید با منابع مستقل تأیید شود. برای اطلاعات آکادمیک، از Google Scholar یا PubMed. برای اطلاعات خبری، از خبرگزاری‌های معتبر. برای اطلاعات فنی، از مستندات رسمی.

استراتژی دوم، درخواست منابع است. از ChatGPT می‌توان خواست که منابع ادعاهای خود را ارائه دهد. اگرچه این منابع ممکن است جعلی باشند، اما درخواست آن‌ها باعث می‌شود که کاربر به‌طور جدی‌تر به ادعاها نگاه کند.

استراتژی سوم، پرسش‌های تشخیصی است. از ChatGPT می‌توان پرسید که «چقدر مطمئن هستید؟» یا «اگر این اطلاعات نادرست باشد، چه چیزی می‌تواند علتش باشد؟». پاسخ‌های این پرسش‌ها، می‌توانند سیگنال‌هایی درباره اعتبار اطلاعات بدهند.

استراتژی چهارم، تست حقیقت است. برای ادعاهای قابل تست، باید واقعاً تست انجام شود. مثلاً اگر ChatGPT می‌گوید یک API با پارامتر خاص کار می‌کند، باید در محیط واقعی تست شود. این استراتژی، به‌ویژه در حوزه‌های فنی، حیاتی است.

نقش RAG در افزایش اعتبار

RAG (Retrieval-Augmented Generation) یکی از مؤثرترین رویکردها برای افزایش اعتبار ChatGPT است. در RAG، به‌جای اینکه مدل بر اساس دانش داخلی خود پاسخ دهد، ابتدا اطلاعات از یک پایگاه داده‌ی معتبر بازیابی می‌شود و سپس بر اساس آن اطلاعات، پاسخ تولید می‌شود.

در عمل، RAG به‌طور چشمگیری دقت پاسخ‌ها را افزایش می‌دهد. مطالعات نشان می‌دهد که استفاده از RAG می‌تواند نرخ hallucination را ۵۰ تا ۸۰ درصد کاهش دهد. این کاهش، به‌ویژه در حوزه‌های تخصصی که نیازمند اطلاعات دقیق و به‌روز هستند، اهمیت بالایی دارد.

پیاده‌سازی RAG نیازمند سه گام است. گام اول، ساخت یک پایگاه داده از اسناد معتبر. گام دوم، تبدیل اسناد به embedding و ذخیره در vector database. گام سوم، ادغام بازیابی در فرآیند تولید پاسخ.

در پروژه‌های سازمانی، RAG به یک استاندارد تبدیل شده است. سازمان‌هایی که می‌خواهند ChatGPT را در حوزه‌های حساس استفاده کنند، معمولاً با ساخت پایگاه داده‌ی داخلی و ادغام RAG، دقت و قابلیت اعتماد پاسخ‌ها را به‌طور محسوسی افزایش می‌دهند. برای درک دقیق‌تر این حوزه، RAG چیست و چرا دقت مدل‌ها را بالا می‌برد را ببینید.

RAG، پل بین دانش عمومی مدل و دانش اختصاصی سازمان است. نتیجه، ترکیبی از انعطاف مدل با دقت داده‌های داخلی.

تکنیک‌های prompt برای کاهش خطا

کیفیت prompt، تأثیر مستقیم بر دقت ChatGPT دارد. چند تکنیک مؤثر وجود دارد.

تکنیک اول، درخواست صریح برای عدم حدس است. اضافه کردن عبارتی مثل «اگر اطلاعات دقیق ندارید، صراحتاً بگویید» می‌تواند نرخ hallucination را کاهش دهد. مدل‌های مدرن، این نوع درخواست‌ها را جدی می‌گیرند.

تکنیک دوم، درخواست تفکیک است. اضافه کردن عبارتی مثل «اطلاعاتی که مطمئن هستید را از اطلاعاتی که تخمین می‌زنید جدا کنید» می‌تواند به کاربر کمک کند که بین اطلاعات درست و نادرست تفکیک کند.

تکنیک سوم، ارائه context غنی است. هرچه context دقیق‌تر ارائه شود، مدل با احتمال بالاتری در محدوده‌ی اطلاعاتی که در اختیار دارد پاسخ می‌دهد و کمتر به hallucination می‌افتد.

تکنیک چهارم، درخواست منابع است. اضافه کردن عبارتی مثل «برای هر ادعا، منبع معتبر ارائه دهید» اگرچه منابع دقیق ممکن است نباشند، اما مدل را به سمت دقت بیشتر هدایت می‌کند.

تکنیک پنجم، زنجیره‌ی استدلال است. درخواست از مدل که مرحله‌به‌مرحله استدلال کند، معمولاً دقت پاسخ را افزایش می‌دهد. این تکنیک، به‌ویژه در مسائل پیچیده مؤثر است.

استفاده حرفه‌ای در حوزه‌های حساس

در حوزه‌های حساس مثل پزشکی، حقوق، مالی و امنیت، استفاده از ChatGPT نیازمند رویکردی سختگیرانه است. سه اصل کلی وجود دارد.

اصل اول، ChatGPT به‌عنوان ابزار کمکی است، نه مرجع. تصمیم‌گیری در حوزه‌های حساس، نیازمند متخصص انسانی است. ChatGPT می‌تواند در گردآوری اطلاعات، پیشنهاد فرضیه و ارائه‌ی دیدگاه‌های متعدد کمک کند، اما جایگزین متخصص نیست.

اصل دوم، اعتبارسنجی دوسطحی است. هر خروجی ChatGPT در حوزه‌های حساس باید هم با منابع معتبر تأیید شود و هم توسط متخصص انسانی بازبینی شود.

اصل سوم، مستندسازی کامل است. در حوزه‌های حساس، استفاده از ChatGPT باید مستندسازی شود. یعنی مشخص باشد که چه پرسشی پرسیده شده، چه پاسخی دریافت شده و چگونه تأیید شده است.

در حوزه‌ی پزشکی، ChatGPT می‌تواند در آگاهی از علائم، پیشنهاد سوالات برای پزشک و توضیح مفاهیم پزشکی کمک کند. اما تشخیص و درمان، همچنان با پزشک است. در حوزه‌ی حقوقی، ChatGPT می‌تواند در درک مفاهیم حقوقی و پیشنهاد سوالات برای وکیل کمک کند، اما نمی‌تواند جایگزین مشاوره‌ی حقوقی شود.

حوزهسطح اعتبار ChatGPTنیاز به اعتبارسنجیمناسب برای
توضیح مفاهیم سادهبالاکمیادگیری عمومی
کد برنامه‌نویسیمتوسطبالاتولید اولیه
تحلیل کسب‌وکارمتوسطبالادیدگاه‌های اضافی
اطلاعات پزشکیپایینبالاآگاهی اولیه
مشاوره حقوقیپایینبالاآگاهی اولیه
تحلیل مالیپایینبالادیدگاه‌های کلی

پرسش‌های پرتکرار درباره اعتبار ChatGPT

چرا ChatGPT اطلاعات نادرست ارائه می‌دهد؟ ChatGPT بر اساس توزیع احتمال داده‌های آموزشی آموزش دیده، نه بر اساس دانش واقعی. وقتی داده‌های آموزشی ناقص، متناقض یا مبهم باشند، مدل ممکن است اطلاعات نادرست را با confidence بالا ارائه دهد. این پدیده، hallucination نام دارد و به‌عنوان یک ویژگی ساختاری، نه باگ، در مدل‌ها وجود دارد.

آیا ChatGPT همیشه اطلاعات نادرست می‌دهد؟ نه. ChatGPT در حوزه‌های با داده‌ی آموزشی غنی و ساختاریافته، عملکرد خوبی دارد. اما در حوزه‌های با داده‌ی ناقص یا متناقض، احتمال خطا بیشتر است. بنابراین، اعتبار ChatGPT به حوزه و نوع پرسش بستگی دارد.

چگونه می‌توان از اطلاعات نادرست ChatGPT جلوگیری کرد؟ سه راهکار اصلی: اول، تأیید متقابل با منابع معتبر. دوم، استفاده از RAG برای دریافت پاسخ‌ها بر اساس اسناد معتبر. سوم، درخواست از ChatGPT که عدم اطمینان خود را صراحتاً بیان کند.

آیا RAG می‌تواند مشکل hallucination را کاملاً حل کند؟ نه به‌طور کامل، اما به‌طور چشمگیری کاهش می‌دهد. RAG دقت را در حوزه‌های تخصصی بهبود می‌بخشد اما همچنان نیازمند بازبینی انسانی است. در برخی موارد، RAG می‌تواند به بازیابی اطلاعات نادرست نیز منجر شود.

آیا ChatGPT برای استفاده در حوزه‌های پزشکی مناسب است؟ برای آگاهی اولیه، بله. برای تشخیص و درمان، نه. ChatGPT می‌تواند در درک علائم، پیشنهاد سوالات برای پزشک و توضیح مفاهیم پزشکی کمک کند، اما جایگزین پزشک نیست. تصمیم‌گیری در حوزه‌ی پزشکی نیازمند متخصص انسانی است.

آیا اطلاعات ChatGPT در موضوعات به‌روز قابل اعتماد است؟ نه به‌طور کامل. ChatGPT بر اساس داده‌های آموزشی تاریخی آموزش دیده و ممکن است اطلاعات قبل از تاریخ قطع آموزش را در خود داشته باشد. برای اطلاعات به‌روز، نیازمند RAG یا دسترسی به وب است.

چه عواملی بر اعتبار ChatGPT تأثیر می‌گذارد؟ سه عامل اصلی: کیفیت داده‌های آموزشی، کیفیت prompt، و حوزه‌ی کاربرد. در حوزه‌های با داده‌ی غنی و ساختاریافته و با prompt دقیق، اعتبار بالاتر است.

آیا می‌توان به ChatGPT برای یادگیری اعتماد کرد؟ بله، با شرط. ChatGPT می‌تواند یک ابزار یادگیری مؤثر باشد اگر کاربر بداند که باید اطلاعات را با منابع معتبر تأیید کند. بهترین رویکرد، استفاده‌ی ChatGPT به‌عنوان نقطه‌ی شروع یادگیری و سپس تأیید با منابع معتبر است. برای درک دقیق‌تر، ChatGPT در آموزش و یادگیری چه نقشی دارد را ببینید.

سنتز نهایی: اعتماد مشروط

پس از چند سال کار با ChatGPT در پروژه‌های مختلف، سه نتیجه‌گیری برای من روشن است. اول، اعتماد به ChatGPT باید مشروط باشد، نه مطلق. ChatGPT در حوزه‌های با داده‌ی غنی، عملکرد خوبی دارد اما در حوزه‌های حساس، نیازمند بازبینی انسانی است. برای مطالعه‌ی مفاهیم پایه، می‌توانید ChatGPT را در ویکی‌پدیا دنبال کنید.

دوم، hallucination یک ویژگی ساختاری است، نه یک باگ موقت. این نکته، به کاربر اجازه می‌دهد که به‌جای انتظار برای حل کامل مشکل، استراتژی‌های اعتبارسنجی را در فرآیند کار خود ادغام کند.

سوم، ترکیب ChatGPT با RAG و اعتبارسنجی انسانی، بهترین رویکرد برای استفاده‌ی مسئولانه است. تیم‌هایی که این ترکیب را پیاده می‌کنند، از قابلیت‌های ChatGPT بهره می‌برند بدون اینکه در دام اطلاعات نادرست بیفتند. اگر تجربه‌ای از استفاده از ChatGPT در حوزه‌های حساس دارید — چه موفق، چه چالشی — تجربه‌تان را بنویسید. جزئیات آن سناریو، برای متخصصان دیگری که همین مسیر را طی می‌کنند، ارزشمند است.