Reborn's Blog

Agent Safety — 三道安全防线

2026-05-15·AI, Agent, Safety, nanoAgent

核心概念

Agent Safety 解决 Agent 执行危险操作时的安全边界问题。

三道防线

  1. 防线 1:黑名单拦截

    • 已知高危命令正则匹配(rm -rfmkfscurl | bash、fork bomb 等)
    • 匹配后直接拒绝执行,返回拦截信息
  2. 防线 2:人工确认

    • 未被黑名单拦截的命令,执行前展示给用户确认
    • 支持 Y(执行)/ N(跳过)/ Q(终止 Agent)
    • --auto 模式仅适合完全信任的隔离环境
  3. 防线 3:输出截断

    • 超长输出截断,防止上下文撑爆
    • 既是安全问题,也是稳定性问题

串联执行

execute_bash(command)
  → 防线 1: is_dangerous(command) → 拦截或放行
  → 防线 2: ask_user_confirmation() → 确认或跳过
  → 执行: subprocess.run()
  → 防线 3: truncate_output() → 截断后返回

设计原则

  • 不宜将"是否安全"的判断完全交给模型
  • 分级策略:高危直接拦截,其余人工确认
  • 所有动作都需确认会降低体验,需要平衡
#AI#Agent#Safety#nanoAgent