ارزیابی کیفیت پرامپت یکی از آن حلقه‌های گمشده در بسیاری از پروژه‌های مبتنی بر مدل‌های زبانی است. تیم‌ها معمولاً پرامپت‌ها را می‌نویسند، تست‌های دستی انجام می‌دهند، و بعد از یک یا دو بار مشاهده‌ی نتیجه‌ی قابل قبول، آن را نهایی می‌کنند. اما وقتی پروژه بزرگ‌تر می‌شود و تعداد پرامپت‌ها افزایش می‌یابد، نداشتن چارچوب ارزیابی سیستماتیک به یک بحران تبدیل می‌شود. در تجربه‌های پروژه‌ای متعددی که روی سیستم‌های مبتنی بر LLM کار کرده‌ام، تفاوت بین تیم‌هایی که ارزیابی جدی می‌گیرند و تیم‌هایی که آن را جدی نمی‌گیرند، در بلندمدت چشمگیر بوده است.

نگاهی کلی به آنچه در این نوشتار بررسی می‌شود

در ادامه ابتدا تعریف ارزیابی کیفیت پرامپت و ضرورت آن بررسی می‌شود. سپس ابعاد مختلف ارزیابی و ساختار Rubric ارائه می‌گردد. در ادامه، ساخت مجموعه آزمون، ارزیابی انسانی، ارزیابی خودکار و رویکرد ترکیبی مرور می‌شود. در انتها، فرآیند گام‌به‌گام، اشتباهات رایج و نگاه معمارانه به این حوزه بررسی خواهد شد.

ارزیابی کیفیت پرامپت چیست؟

ارزیابی کیفیت پرامپت به فرآیند سنجش عملکرد یک پرامپت در برابر معیارهای مشخص گفته می‌شود. این فرآیند، شامل تعریف معیارها، ساخت مجموعه آزمون، اجرای پرامپت روی نمونه‌های مختلف، و تحلیل نتایج است. برای مطالعه پایه‌های این حوزه، نوشتار راهنمای پایه پرامپت نویسی را ببینید.

تفاوت ارزیابی کیفیت پرامپت با ارزیابی مدل در سطح کلان، در دامنه است. در ارزیابی مدل، عملکرد مدل در برابر بنچمارک‌های استاندارد سنجیده می‌شود. در ارزیابی پرامپت، عملکرد پرامپت خاص در برابر نیاز مشخص کاربرد سنجیده می‌شود. این ارزیابی، معمولاً بر داده‌های محدود و مرتبط با کاربرد انجام می‌گیرد.

در ادبیات فنی، این حوزه با عنوان Prompt Evaluation شناخته می‌شود و یکی از ستون‌های مدیریت کیفیت در سیستم‌های مبتنی بر LLM است. برای مطالعه دقیق‌تر در مورد معیارها، نوشتار معیارهای ارزیابی پرامپت را ببینید.

چرا ارزیابی سیستماتیک ضرورت دارد؟

سه دلیل اصلی برای ضرورت ارزیابی سیستماتیک وجود دارد:

۱. جبران غیرقطعیت مدل

مدل‌های زبانی غیرقطعی (Stochastic) هستند. یعنی یک پرامپت مشخص، در دو اجرا ممکن است دو خروجی متفاوت بدهد. این ویژگی، ارزیابی بر اساس یک اجرا را بی‌معنا می‌کند. باید چند اجرا انجام شود تا تصویر واقعی‌تری از کیفیت به دست آید.

۲. کشف رگرسیون در تغییرات

هر بار که پرامپت را تغییر می‌دهید، احتمال رگرسیون وجود دارد. ممکن است کیفیت در برخی موارد بهبود یابد اما در موارد دیگر افت کند. بدون ارزیابی سیستماتیک، این رگرسیون‌ها آشکار نمی‌شوند.

۳. تصمیم‌گیری بر داده به‌جای حدس

در پروژه‌های مبتنی بر LLM، تصمیم‌های زیادی گرفته می‌شود: کدام نسخه پرامپت بهتر است، کدام مدل مناسب‌تر است، کدام قالب خروجی مؤثرتر است. بدون داده، این تصمیم‌ها بر پایه‌ی حدس و سلیقه گرفته می‌شوند. برای مطالعه دقیق‌تر در مورد طراحی آزمایش، نوشتار آزمون A/B پرامپت‌ها را ببینید.

ارزیابی پرامپت، سرمایه‌گذاری روی کیفیت بلندمدت است. تیمی که چند ساعت در هفته روی ارزیابی سرمایه‌گذاری می‌کند، در ماه‌های بعد بسیار سریع‌تر از تیمی است که بر پایه‌ی حدس تصمیم می‌گیرد.

ابعاد ارزیابی کیفیت پرامپت

ارزیابی کیفیت پرامپت، یک بُعد واحد نیست. چند بُعد مختلف را باید جداگانه سنجید:

بُعدتوضیحنوع سنجش
انطباق با قالبرعایت ساختار خروجی موردنظرخودکار
دقت اطلاعاتدرستی محتوای تولیدشدهانسانی + خودکار
مرتبط بودنارتباط پاسخ با پرسشخودکار
کامل بودنپوشش همه ابعاد درخواستانسانی
انسجاممنطقی بودن ساختار پاسخخودکار + انسانی
رعایت لحن و سبکانطباق با سبک تعریف‌شدهخودکار + انسانی
کارایی توکننسبت کیفیت به مصرف توکنخودکار
زمان پاسختأخیر در تولید خروجیخودکار
مقاومت در برابر تزریقعدم انحراف در برابر ورودی مخربخودکار + انسانی

هر یک از این ابعاد، وزن متفاوتی در کاربردهای مختلف دارد. در یک سیستم پشتیبانی، دقت اطلاعات حیاتی‌تر است. در یک سیستم تولید محتوا، لحن و سبک اهمیت بیشتری دارد. برای مطالعه دقیق‌تر، نوشتار افزایش وضوح و مشخص بودن در پرامپت را ببینید.

ساخت Rubric برای ارزیابی

Rubric یک جدول امتیازدهی است که معیارهای ارزیابی و سطوح کیفیت را تعریف می‌کند. بدون Rubric، ارزیابی انسانی به سلیقه وابسته می‌شود و نتایج قابل مقایسه نخواهند بود.

ساختار پیشنهادی

معیارسطح ۱سطح ۳سطح ۵
دقت اطلاعاتخطاهای اساسیاکثراً درستکاملاً درست با استناد
کامل بودننیمی از ابعاد پوشش داده نشدهاکثر ابعاد پوشش داده شدههمه ابعاد با جزئیات
انسجامساختار نامنظمساختار قابل قبولساختار منسجم و منطقی
رعایت لحنلحن نامناسبلحن قابل قبوللحن دقیقاً مطابق تعریف

نکات کلیدی در ساخت Rubric

  • معیارها باید قابل اندازه‌گیری باشند.
  • سطوح باید توصیفی و صریح باشند.
  • تعداد سطوح معمولاً بین ۳ تا ۵ است.
  • Rubric باید برای همه‌ی ارزیاب‌ها یکسان باشد.
  • Rubric باید با نمونه‌های مرجع همراه باشد.

در سیستم‌های حساس، معمولاً از Rubricهای اختصاصی برای هر کاربرد استفاده می‌شود. برای مطالعه دقیق‌تر، نوشتار ارزیابی کیفیت پرامپت را ببینید.

ساخت مجموعه آزمون یا Golden Set

مجموعه آزمون (Test Set) یا Golden Set، مجموعه‌ای از ورودی‌های مشخص با خروجی‌های مرجع است که برای ارزیابی پرامپت استفاده می‌شود. ساخت این مجموعه، یکی از مهم‌ترین گام‌های ارزیابی است.

معیارهای ساخت مجموعه آزمون

  1. پوشش تنوع: ورودی‌ها باید طیف متنوعی از موارد را پوشش دهند.
  2. شامل موارد مرزی: موارد نادر و چالشی باید در مجموعه باشند.
  3. مرجع معتبر: خروجی مرجع باید توسط متخصص تأیید شود.
  4. اندازه مناسب: بین ۳۰ تا ۱۰۰ نمونه معمولاً کافی است.
  5. پایدار بودن: مجموعه آزمون باید در طول زمان ثابت بماند تا مقایسه ممکن باشد.

منابع ساخت مجموعه آزمون

  • داده‌های واقعی از سیستم تولیدی
  • داده‌های برچسب‌گذاری‌شده توسط متخصص
  • داده‌های تولیدشده برای موارد نادر
  • داده‌های مصنوعی برای شرایط خاص

در تجربه‌های واقعی، بهترین مجموعه‌های آزمون آن‌هایی هستند که ترکیبی از داده‌های واقعی و موارد مرزی طراحی‌شده باشند.

ارزیابی انسانی و چالش‌های آن

ارزیابی انسانی همچنان معیار طلایی در کیفیت پرامپت است. اما این رویکرد چالش‌های خاص خود را دارد:

مزایا

  • درک زمینه و ظرافت‌های معنایی
  • قابلیت قضاوت در موارد مبهم
  • درک ارزش واقعی برای کاربر نهایی

چالش‌ها

  • هزینه بالا و کندی فرآیند
  • سوگیری‌های شخصی ارزیاب
  • ناسازگاری بین ارزیاب‌های مختلف
  • مشکل در مقیاس‌پذیری

راهبردهای کاهش چالش

  1. استفاده از Rubric دقیق برای کاهش سوگیری
  2. آموزش ارزیاب‌ها با نمونه‌های مرجع
  3. استفاده از چند ارزیاب برای هر مورد
  4. محاسبه‌ی Inter-Rater Reliability برای بررسی ناسازگاری
  5. دوره‌های بازبینی منظم برای هماهنگی

ارزیابی خودکار با مدل‌های داور

ارزیابی خودکار با مدل‌های زبانی، یکی از ابزارهای کارآمد در سنجش کیفیت است. این رویکرد که با عنوان LLM-as-a-Judge شناخته می‌شود، امکان ارزیابی سریع و مقیاس‌پذیر را فراهم می‌کند.

مزایا

  • سرعت و مقیاس‌پذیری بالا
  • هزینه کمتر از ارزیابی انسانی
  • سازگاری بین اجراها
  • قابلیت اجرای مداوم

محدودیت‌ها

  • سوگیری‌های مشابه با مدل اصلی
  • ضعف در قضاوت موارد بسیار ظریف
  • حساسیت به طراحی پرامپت داور
  • مشکل در موارد خاص دامنه

راهبردهای بهبود ارزیابی خودکار

  1. استفاده از چند مدل داور برای کاهش سوگیری
  2. ترکیب با ارزیابی انسانی در نقاط کلیدی
  3. کالیبره کردن مدل داور با نمونه‌های برچسب‌دار
  4. پایش دوره‌ای همبستگی مدل داور با ارزیابی انسانی

در سیستم‌های پیشرفته، مدل داور معمولاً با پرامپت دقیق و Rubric مشخص طراحی می‌شود. برای مطالعه دقیق‌تر، نوشتار استفاده از LLM به‌عنوان داور را ببینید.

ترکیب ارزیابی انسانی و خودکار

در پروژه‌های واقعی، بهترین رویکرد ترکیبی از ارزیابی انسانی و خودکار است:

مرحلهنوع ارزیابیهدف
۱. غربال اولیهخودکارحذف خروجی‌های نامعتبر
۲. ارزیابی ساختاریخودکاربررسی قالب و انطباق
۳. ارزیابی محتواییخودکار + انسانیدقت و کامل بودن
۴. بازبینی نهاییانسانیموارد حساس و مرزی

این ساختار، هزینه را کنترل می‌کند و در عین حال کیفیت را تضمین می‌کند. ارزیابی خودکار، حجم بزرگی از کار را انجام می‌دهد و ارزیابی انسانی، دقت نهایی را تضمین می‌کند.

فرآیند ارزیابی گام‌به‌گام

یک فرآیند ارزیابی سیستماتیک، شامل گام‌های زیر است:

  1. تعریف اهداف: مشخص کنید که چه چیزی را می‌خواهید بسنجید.
  2. تعریف معیارها: ابعاد ارزیابی و وزن هر یک را تعیین کنید.
  3. ساخت Rubric: سطوح کیفیت را برای هر معیار تعریف کنید.
  4. ساخت مجموعه آزمون: ورودی‌ها و خروجی‌های مرجع را آماده کنید.
  5. اجرای پرامپت: پرامپت را روی کل مجموعه اجرا کنید.
  6. ارزیابی: بر اساس Rubric، خروجی‌ها را امتیازدهی کنید.
  7. تحلیل: نقاط ضعف و الگوها را شناسایی کنید.
  8. اصلاح: بر اساس تحلیل، پرامپت را بهبود دهید.
  9. تکرار: چرخه را تا رسیدن به کیفیت مطلوب ادامه دهید.

این فرآیند، بخشی از چرخه‌ی گسترده‌تر اصلاح پرامپت است. برای مطالعه دقیق‌تر، نوشتار اصلاح تدریجی پرامپت را ببینید.

اشتباهات رایج در ارزیابی پرامپت

  • نبود معیار مشخص برای ارزیابی
  • ارزیابی بر اساس یک اجرای واحد
  • نادیده گرفتن غیرقطعیت مدل
  • نبود Rubric و وابستگی به سلیقه
  • استفاده از مجموعه آزمون محدود و غیرمتنوع
  • اعتماد صرف به ارزیابی خودکار بدون بازبینی انسانی
  • نبود مستندسازی نتایج
  • عدم پایش دوره‌ای کیفیت
  • نادیده گرفتن جنبه‌های امنیتی در ارزیابی
  • عدم توجه به هزینه و تأخیر در ارزیابی

پرسش‌های متداول درباره ارزیابی پرامپت

چطور کیفیت پرامپت را ارزیابی کنیم؟

با تعریف معیارهای مشخص، ساخت Rubric، آماده‌سازی مجموعه آزمون، اجرای پرامپت روی نمونه‌ها و تحلیل نتایج. ترکیب ارزیابی انسانی و خودکار بهترین نتیجه را می‌دهد.

چه تعداد نمونه برای ارزیابی کافی است؟

معمولاً بین ۳۰ تا ۱۰۰ نمونه کافی است، به شرطی که مجموعه متنوع و شامل موارد مرزی باشد. اگر کاربرد بسیار خاص است، ممکن است تعداد بیشتری لازم شود.

آیا ارزیابی خودکار جایگزین ارزیابی انسانی است؟

نه، این دو مکمل یکدیگرند. ارزیابی خودکار سرعت و مقیاس‌پذیری می‌دهد، ارزیابی انسانی دقت نهایی. برای مطالعه دقیق‌تر، نوشتار استفاده از LLM به‌عنوان داور را ببینید.

چطور از سوگیری ارزیاب انسانی جلوگیری کنیم؟

با استفاده از Rubric دقیق، آموزش ارزیاب‌ها، استفاده از چند ارزیاب برای هر مورد، و محاسبه‌ی Inter-Rater Reliability.

آیا ارزیابی در زبان فارسی با انگلیسی متفاوت است؟

اصول کلی یکسان است، اما در زبان فارسی چالش‌هایی مثل توکن‌سازی متفاوت، نیم‌فاصله و ارزیابی لحن وجود دارد که باید لحاظ شوند.

نگاه معمارانه به ارزیابی پرامپت

از منظر معماری، ارزیابی پرامپت یک فرآیند مستمر است که با چرخه‌ی توسعه یکپارچه می‌شود. در سیستم‌های بالغ، ارزیابی نه یک مرحله‌ی جداگانه، بلکه بخشی از pipeline است که در هر تغییر اجرا می‌شود.

در سیستم‌های پیشرفته، معمولاً یک لایه‌ی اختصاصی برای ارزیابی وجود دارد که وظایف زیر را انجام می‌دهد:

  • اجرای پرامپت روی مجموعه آزمون
  • ارزیابی خودکار خروجی‌ها
  • ارسال موارد حساس به بازبینی انسانی
  • محاسبه و پایش شاخص‌های کیفیت
  • هشدار در صورت افت کیفیت

این لایه، پایه‌ی سیستم‌های CI/CD برای پرامپت است. هر بار که پرامپت تغییر می‌کند، این لایه به‌طور خودکار ارزیابی را اجرا می‌کند و در صورت افت کیفیت، هشدار می‌دهد. برای مطالعه دقیق‌تر در مورد معماری تولید، نوشتار CI/CD برای پروژه‌های وردپرسی را ببینید که اصول مشابهی دارد.

نکته مهم دیگر این است که ارزیابی باید با پایش تولید ادغام شود. کیفیت پرامپت در محیط آزمایشگاهی ممکن است با کیفیت در محیط تولید متفاوت باشد. برای پایش کیفیت واقعی، باید داده‌های محیط تولید را نیز جمع‌آوری و تحلیل کرد. برای مطالعه دقیق‌تر، نوشتار پایش کیفیت در تولید را ببینید.

در سیستم‌های مقیاس بزرگ، ارزیابی پرامپت معمولاً با ارزیابی مدل ترکیب می‌شود. هدف این است که مشخص شود افت کیفیت ناشی از تغییر پرامپت است، تغییر مدل، یا تغییر داده ورودی. این تفکیک، تصمیم‌گیری درباره رفع مشکل را ساده‌تر می‌کند.

آخرین نکته‌ای که در طراحی سیستم‌های ارزیابی بارها تجربه کرده‌ام: همیشه یک نسخه از خروجی‌های ارزیابی‌شده را نگه دارید. اگر بعداً Rubric یا معیارها تغییر کنند، می‌توانید ارزیابی را روی داده‌های قدیمی دوباره اجرا کنید و نتایج را مقایسه کنید. این قابلیت، بازگشت به گذشته و بهبود تدریجی را ممکن می‌کند.

تجربه شما

اگر در پروژه‌ای واقعی چارچوب ارزیابی پرامپت را طراحی کرده‌اید، برای ما جالب است بدانید کدام رویکرد — ارزیابی انسانی، خودکار، یا ترکیبی — بهترین نتیجه را در پروژه‌ی شما داشته است. اگر چالش متفاوتی در این حوزه تجربه کرده‌اید، تجربه‌تان را در دیدگاه‌ها بنویسید تا خواننده بعدی از آن استفاده کند.