护栏guardrail
防止人工智能系统产生有害或非预期输出和行为的限制机制。
11篇文章
最近提及 护栏指为防止人工智能系统产生有害、违反政策或非预期的输出和行为而设置的规则、过滤器、检查等限制机制。其实现方式包括过滤输入与输出、在训练阶段调整模型行为,以及限制工具使用权限等。
本条目依据AIPOST的文章与广为人知的事实整理。如有错误,请通过更正请求告诉我们。
涉及该条目的文章
企业担心权限设置错误的智能体会删除生产数据库,这种顾虑合情合理,因此必须先建立护栏、细粒度的访问控制和严格的评估机制。
安全团队可以在这里设置护栏,让智能体在工作时检查公司规则。
权限设定安全护栏和停止条件。
该团队强调,智能体获得的自主权越大,越需要这类不依赖模型判断的护栏。
由此得出的教训是:面对危险或超出范围的请求,与其试图有用地回答,不如用护栏直接拒绝。
Stripe内部:先设护栏,再开放访问
模型固然重要,但方法更为关键:团队先确定究竟要测量什么,再让AI智能体(能够自行规划并执行多步骤任务的AI系统)把这些数字压低,而护栏始终由人来掌握。
专职dot在严格的护栏和专门的监控下,运行于Mac Mini等独立硬件上。
在他看来,给一个没人理解其内部的系统加装护栏,防护效果很弱。
当团队测试没有常规行为护栏的模型时,这一区别尤为重要。