AI Guardrails چیست ؟
تصور کنید یک AI Agent اجازه دارد ایمیل بفرستد یا اطلاعاتی را تغییر دهد. منطقی نیست هر تصمیم مدل بدون کنترل اجرا شود. AI Guardrails مجموعهای از بررسیها و محدودیتها هستند که کمک میکنند ورودی، خروجی یا اقدامهای سیستم هوش مصنوعی از مرزهای مشخص عبور نکنند.
برای مثال یک Guardrail میتواند جلوی درخواست ممنوع را قبل از رسیدن به مدل بگیرد، خروجی را پیش از نمایش بررسی کند یا اجازه ندهد یک ابزار با مقدار غیرمجاز اجرا شود.
در سیستمهای حساس، Guardrail ممکن است با تأیید انسان ترکیب شود. مثلاً Agent میتواند پیشنویس بازپرداخت را آماده کند، اما برای اجرای نهایی مبلغ بالا منتظر تأیید یک نفر بماند.
Guardrail را نباید با تضمین امنیت کامل اشتباه گرفت. هر کنترل ممکن است خطا کند یا سناریویی را پوشش ندهد. به همین دلیل طراحی خوب معمولاً چند لایه دارد: محدودیت دسترسی، بررسی ورودی و خروجی، ثبت رویداد و در بعضی کارها Human-in-the-Loop.
در یک جمله، Guardrail شبیه حفاظ کنار جاده است: قرار نیست خودش رانندگی کند، اما کمک میکند سیستم در موقعیتهای مشخص از مسیر خطرناک خارج نشود.
