Agent Safety — 三道安全防线
2026-05-15·AI, Agent, Safety, nanoAgent
核心概念
Agent Safety 解决 Agent 执行危险操作时的安全边界问题。
三道防线
-
防线 1:黑名单拦截
- 已知高危命令正则匹配(
rm -rf、mkfs、curl | bash、fork bomb 等) - 匹配后直接拒绝执行,返回拦截信息
- 已知高危命令正则匹配(
-
防线 2:人工确认
- 未被黑名单拦截的命令,执行前展示给用户确认
- 支持 Y(执行)/ N(跳过)/ Q(终止 Agent)
--auto模式仅适合完全信任的隔离环境
-
防线 3:输出截断
- 超长输出截断,防止上下文撑爆
- 既是安全问题,也是稳定性问题
串联执行
execute_bash(command)
→ 防线 1: is_dangerous(command) → 拦截或放行
→ 防线 2: ask_user_confirmation() → 确认或跳过
→ 执行: subprocess.run()
→ 防线 3: truncate_output() → 截断后返回
设计原则
- 不宜将"是否安全"的判断完全交给模型
- 分级策略:高危直接拦截,其余人工确认
- 所有动作都需确认会降低体验,需要平衡
#AI#Agent#Safety#nanoAgent