هوش مصنوعی · حدود 12 دقیقه

می‌خواهی بفهمی یک prompt واقعاً بهتر شده؟ یک Test Set ده‌تایی بساز

prompt را چند بار تغییر می‌دهی و هر بار یک جواب خوب می‌بینی، اما نمی‌دانی در استفاده واقعی عملکرد پایدارتر شده یا نه.

اگر عجله داری

به‌جای قضاوت با یک نمونه خوش‌شانس، 10 ورودی واقعی با چند edge case نگه دار و هر نسخه prompt را روی همان‌ها مقایسه کن.

چطور دقیق‌تر به موضوع نگاه کنیم؟

  1. از کار واقعی 6 نمونه معمولی، 2 نمونه سخت و 2 ورودی نامعتبر یا مبهم انتخاب کن.
  2. معیار موفقیت را قبل از تست بنویس؛ صحت، فرمت، کامل‌بودن یا نیاز به اصلاح دستی.
  3. نسخه‌های prompt را روی همان ورودی‌ها اجرا و خطاها را دسته‌بندی کن.
  4. به‌جای اصلاح برای یک مورد، الگویی را تغییر بده که چند خطا را حل می‌کند و regression جدید نسازد.

چرا این موضوع مهم است؟

خروجی مدل می‌تواند بین نمونه‌ها و اجراها تغییر کند. مجموعه تست کوچک باعث می‌شود بهبود را روی موارد نماینده بسنجی.

سؤال‌هایی که معمولاً بعدش پیش می‌آید

ده نمونه کافی است؟

برای شروع و workflow کوچک مفید است؛ سیستم مهم‌تر یا متنوع‌تر به مجموعه بزرگ‌تر نیاز دارد.

هر بار جواب یکسان نمی‌آید؛ چه کنم؟

معیار را روی ویژگی‌های خروجی بسنج، نه تطابق کلمه‌به‌کلمه؛ در صورت نیاز چند اجرا نمونه بگیر.