AI Evals چیست؟ چگونه کیفیت مدل و AI Agent را ارزیابی کنیم؟

در سامانه‌های مبتنی بر هوش مصنوعی نمی‌توان کیفیت را فقط با چند آزمایش دستی سنجید. AI Evals مجموعه‌ای از آزمون‌ها و معیارهاست که کمک می‌کند پاسخ مدل، عملکرد Agent و کیفیت یک فرایند AI به‌صورت تکرارپذیر و قابل مقایسه ارزیابی شود.

نویسنده
تحریریه آیوان
تاریخ انتشار
۳۱ مرداد ۱۴۰۵
زمان مطالعه
۹ دقیقه
فهرست بخش‌ها
  1. AI Evals چیست؟
  2. چرا ارزیابی AI ضروری است؟
  3. چه چیزی را باید ارزیابی کنیم؟
  4. ارزیابی پاسخ و Agent
  5. Dataset و Ground Truth
  6. LLM-as-a-Judge چیست؟
  7. ارزیابی قبل و بعد از انتشار
  8. Evals در سازمان
  9. پرسش‌های متداول
  10. منابع

AI Evals چیست؟

AI Evals مجموعه‌ای از Datasetها، معیارها و روش‌های داوری است که رفتار یک سیستم مولد را در سناریوهای تعریف‌شده اندازه می‌گیرد.

Eval خوب یک مشاهده اتفاقی نیست؛ ورودی، نتیجه مورد انتظار، روش امتیازدهی و نسخه سیستم را ثبت می‌کند تا تغییر مدل یا Prompt قابل مقایسه باشد.

چرا ارزیابی AI ضروری است؟

پاسخ روان لزوماً پاسخ درست یا ایمن نیست. تغییر کوچک در مدل، Context یا ابزار نیز می‌تواند کیفیت بخشی از سناریوها را بهتر و بخشی دیگر را ضعیف‌تر کند.

ارزیابی مستمر، Regression را پیش از انتشار آشکار می‌کند و پس از انتشار نیز فاصله رفتار واقعی از انتظار را نشان می‌دهد.

چه چیزی را باید ارزیابی کنیم؟

معیار باید از هدف کسب‌وکار و ریسک سناریو بیاید. یک پاسخ دانش‌محور با Agent اجرایی معیارهای یکسانی ندارد.

  • Correctness و Relevance
  • Faithfulness و استناد به منبع
  • Task Success و Tool Selection
  • Safety و رعایت Policy
  • Latency و Cost

ارزیابی پاسخ و Agent

Final Response Evaluation بررسی می‌کند خروجی نهایی تا چه حد درست، مرتبط و مطابق هدف است. Trajectory Evaluation مسیر رسیدن به پاسخ، ترتیب Tool Callها و انتخاب ابزار را می‌سنجد.

مستندات Google Cloud نیز ارزیابی Agent را به خروجی نهایی و مسیر یا توالی فراخوانی ابزار تقسیم می‌کند. پاسخ درست می‌تواند از مسیر پرهزینه، ناامن یا تصادفی به دست آمده باشد.

Dataset و Ground Truth

Dataset باید نمونه‌های معمول، مرزی، دشوار و نامعتبر را پوشش دهد. Ground Truth می‌تواند پاسخ مرجع، ابزار مورد انتظار، Policy یا نتیجه موفق وظیفه باشد.

داده ارزیابی باید نسخه‌دار و از داده آموزش یا نمونه‌های نمایشی جدا باشد تا امتیاز خوش‌بینانه ایجاد نشود.

LLM-as-a-Judge چیست؟

در LLM-as-a-Judge یک مدل بر اساس Rubric مشخص خروجی را امتیاز می‌دهد. این روش برای مقیاس مناسب است، اما باید با نمونه انسانی کالیبره و از نظر Bias و ناپایداری بررسی شود.

برای معیارهای قطعی مانند وجود Citation، قالب JSON یا موفقیت API بهتر است از بررسی محاسباتی استفاده شود.

ارزیابی قبل و بعد از انتشار

پیش از انتشار، Evalهای ثابت برای مقایسه نسخه‌ها و تعیین حد پذیرش اجرا می‌شوند. پس از انتشار، نمونه‌های واقعی، خطاها، feedback و شاخص‌های عملیاتی به Dataset برمی‌گردند.

اطلاعات واقعی باید با حذف یا پوشاندن داده حساس و با قواعد نگه‌داری روشن استفاده شود.

Evals در سازمان

برای هر سناریو یک مالک، معیار موفقیت، آستانه توقف و چرخه بازبینی تعریف کنید. Cost per successful task و نرخ ارجاع به انسان معمولاً از امتیاز کلی مدل معنادارترند.

پاسخ‌های مستند نیز باید از نظر ارتباط Citation با ادعا ارزیابی شوند.

پرسش‌های متداول

آیا چند تست دستی کافی است؟

خیر؛ تست دستی برای کشف اولیه مفید است، اما مقایسه نسخه‌ها به Dataset و معیار تکرارپذیر نیاز دارد.

آیا LLM-as-a-Judge جای انسان را می‌گیرد؟

خیر؛ داوری مدل باید با نمونه انسانی کالیبره و برای تصمیم‌های پرریسک بازبینی شود.

برای Agent فقط پاسخ نهایی مهم است؟

خیر؛ مسیر ابزارها، تعداد گام‌ها، خطا و رعایت Policy نیز باید سنجیده شود.

منابع

ارزیابی را بخشی از چرخه عمر AI کنید

آیوان به طراحی Dataset، معیارهای موفقیت و پایش کیفیت سناریوهای سازمانی کمک می‌کند.