AI Evaluation (Evals) چیست ؟
اگر یک مدل در سه سؤال خوب جواب داد، آیا میتوانیم بگوییم برای محصول آماده است؟ نه لزوماً. AI Evaluation یا Evals یعنی مدل یا سیستم هوش مصنوعی را با مجموعهای از مثالها و معیارهای مشخص آزمایش کنیم تا بفهمیم واقعاً چقدر خوب عمل میکند.
مثلاً اگر یک AI برای دستهبندی پیامهای پشتیبانی ساختهاید، میتوانید صدها پیام با جواب درست آماده کنید و ببینید مدل چند مورد را صحیح تشخیص میدهد. برای یک دستیار نوشتاری هم ممکن است معیارهایی مثل دقت، رعایت لحن یا پیروی از قالب بررسی شوند.
Evals کمک میکنند تغییرات را قابلاندازهگیری کنیم. اگر مدل، Prompt یا ابزار سیستم عوض شد، میتوان همان تستها را دوباره اجرا کرد و دید عملکرد بهتر شده یا بدتر.
یک Eval خوب باید شبیه استفاده واقعی باشد. اگر تستها خیلی ساده یا غیرواقعی باشند، نمره خوب ممکن است تصویری اشتباه از کیفیت محصول بدهد. همچنین بعضی معیارها عددیاند و بعضی نیاز به بررسی انسان یا داور مدل دارند.
بنابراین Evals را میتوان شبیه امتحان منظم برای سیستم AI دانست. هدف فقط گرفتن یک نمره نیست؛ هدف این است که بدانیم مدل در چه موقعیتهایی قابل اعتماد است و کجا هنوز مشکل دارد.
