AI Evals چیست؟
AI Evals مجموعهای از Datasetها، معیارها و روشهای داوری است که رفتار یک سیستم مولد را در سناریوهای تعریفشده اندازه میگیرد.
Eval خوب یک مشاهده اتفاقی نیست؛ ورودی، نتیجه مورد انتظار، روش امتیازدهی و نسخه سیستم را ثبت میکند تا تغییر مدل یا Prompt قابل مقایسه باشد.
چرا ارزیابی AI ضروری است؟
پاسخ روان لزوماً پاسخ درست یا ایمن نیست. تغییر کوچک در مدل، Context یا ابزار نیز میتواند کیفیت بخشی از سناریوها را بهتر و بخشی دیگر را ضعیفتر کند.
ارزیابی مستمر، Regression را پیش از انتشار آشکار میکند و پس از انتشار نیز فاصله رفتار واقعی از انتظار را نشان میدهد.
چه چیزی را باید ارزیابی کنیم؟
معیار باید از هدف کسبوکار و ریسک سناریو بیاید. یک پاسخ دانشمحور با Agent اجرایی معیارهای یکسانی ندارد.
- Correctness و Relevance
- Faithfulness و استناد به منبع
- Task Success و Tool Selection
- Safety و رعایت Policy
- Latency و Cost
ارزیابی پاسخ و Agent
Final Response Evaluation بررسی میکند خروجی نهایی تا چه حد درست، مرتبط و مطابق هدف است. Trajectory Evaluation مسیر رسیدن به پاسخ، ترتیب Tool Callها و انتخاب ابزار را میسنجد.
مستندات Google Cloud نیز ارزیابی Agent را به خروجی نهایی و مسیر یا توالی فراخوانی ابزار تقسیم میکند. پاسخ درست میتواند از مسیر پرهزینه، ناامن یا تصادفی به دست آمده باشد.
Dataset و Ground Truth
Dataset باید نمونههای معمول، مرزی، دشوار و نامعتبر را پوشش دهد. Ground Truth میتواند پاسخ مرجع، ابزار مورد انتظار، Policy یا نتیجه موفق وظیفه باشد.
داده ارزیابی باید نسخهدار و از داده آموزش یا نمونههای نمایشی جدا باشد تا امتیاز خوشبینانه ایجاد نشود.
LLM-as-a-Judge چیست؟
در LLM-as-a-Judge یک مدل بر اساس Rubric مشخص خروجی را امتیاز میدهد. این روش برای مقیاس مناسب است، اما باید با نمونه انسانی کالیبره و از نظر Bias و ناپایداری بررسی شود.
برای معیارهای قطعی مانند وجود Citation، قالب JSON یا موفقیت API بهتر است از بررسی محاسباتی استفاده شود.
ارزیابی قبل و بعد از انتشار
پیش از انتشار، Evalهای ثابت برای مقایسه نسخهها و تعیین حد پذیرش اجرا میشوند. پس از انتشار، نمونههای واقعی، خطاها، feedback و شاخصهای عملیاتی به Dataset برمیگردند.
اطلاعات واقعی باید با حذف یا پوشاندن داده حساس و با قواعد نگهداری روشن استفاده شود.
Evals در سازمان
برای هر سناریو یک مالک، معیار موفقیت، آستانه توقف و چرخه بازبینی تعریف کنید. Cost per successful task و نرخ ارجاع به انسان معمولاً از امتیاز کلی مدل معنادارترند.
پاسخهای مستند نیز باید از نظر ارتباط Citation با ادعا ارزیابی شوند.
پرسشهای متداول
آیا چند تست دستی کافی است؟
خیر؛ تست دستی برای کشف اولیه مفید است، اما مقایسه نسخهها به Dataset و معیار تکرارپذیر نیاز دارد.
آیا LLM-as-a-Judge جای انسان را میگیرد؟
خیر؛ داوری مدل باید با نمونه انسانی کالیبره و برای تصمیمهای پرریسک بازبینی شود.
برای Agent فقط پاسخ نهایی مهم است؟
خیر؛ مسیر ابزارها، تعداد گامها، خطا و رعایت Policy نیز باید سنجیده شود.
منابع
- Google CloudAgent evaluation30 July 2026 · Official Documentation
- Google CloudGen AI evaluation service overview19 August 2026 · Official Documentation
- Google CloudEvaluate Gen AI agents21 August 2026 · Official Documentation