导语:AI Agent一旦拥有发布文章、删除数据、发送消息或修改配置的权限,就不能只靠一句系统提示词来保证安全。真正可靠的做法,是把高风险动作拆成预览、审批、执行和回滚几个明确节点。

哪些动作应该增加人工确认
判断标准不是工具名字,而是动作的副作用和影响范围。发送外部通知、发布公开内容、删除数据、修改权限、执行付费操作和批量变更,都应该至少提供预览或确认机制。
只读查询、格式转换和低风险草稿生成,通常可以自动执行,但仍然需要参数校验和超时保护。
先生成预览再执行
预览阶段应该展示将要执行的动作、目标资源、关键参数、预计影响和可能的费用。用户确认的不是一句“是否继续”,而是一个具体、可理解的操作摘要。
- 目标对象是谁;
- 将要修改什么;
- 影响多少条数据或多少用户;
- 失败后能否恢复。
审批状态要独立保存
不要把“模型说可以执行”当作审批记录。系统应该保存任务ID、预览内容摘要、审批人、审批时间、过期时间和最终执行结果。审批状态和执行状态分开,才能避免重复点击或过期审批被再次使用。
审批要有过期时间
预览和真实执行之间可能相隔很久,期间目标资源、价格或权限可能已经变化。因此审批记录应设置有效期,执行前重新校验关键参数。超过有效期就重新生成预览,而不是沿用旧确认。
服务端必须再次校验
前端按钮、模型输出和审批页面都不能代替服务端权限校验。执行接口需要重新确认调用者身份、目标资源归属、允许字段和当前状态,避免有人绕过审批页面直接调用执行接口。
失败时怎么回滚
能回滚的操作应设计反向动作或保留版本。不能回滚的操作要在执行前明确提示风险,并设置更严格的审批级别。批量动作可以拆成小批次,先执行一小部分确认结果,再继续剩余任务。
审批日志不要泄露敏感内容
审批页面需要足够的信息帮助判断,但不应展示完整密钥、隐私字段或全部内部文档。可以展示脱敏后的摘要、字段变化和资源数量,详细内容按权限查看。
总结
AI Agent的人工确认应该围绕副作用和影响范围设计。先预览、再审批、执行前二次校验,最后保留回滚或补救路径,才能让自动化效率和操作安全同时成立。
评论 0