AI Agent 的人机协同:当你的自主系统需要检查点
浏览网页、执行代码和链式工具调用的 AI Agent 创造了新的 HITL 挑战。以下是如何在它们采取不可逆行动之前设计人工监督。
传统 AI 做的是预测,Agentic AI 做的是行动。
这个转变是实质性的。一个判断“这封邮件是垃圾邮件”的模型对现实世界没有任何作用。而一个会浏览网页、把文件写入磁盘、执行代码、发送邮件、调用外部 API、修改数据库的 模型,正在持续改变自己所处的运行环境。它出错时,代价是一次错误的行动,而这次行动带出的下游影响可能很难挽回,甚至无法挽回。
为静态模型设计的人机协同(HITL,human-in-the-loop)做法,无法原样迁移到 Agentic 系统上。理解其中的原因,以及应该改用什么做法,是本文要讲的核心。
为什么静态模型的 HITL 无法照搬
静态模型的输入输出结构很简单:一个提示词进去,一个补全出来。人工审核者可以检查输出、评估它,然后决定要不要据此行动。模型本身什么都没改变,所有下游行动仍然由人掌控。
Agent 的情况不同。Agent 产生的是一串输出,其中每一步都在改变世界,并塑造后续的步骤。等到人工审核者看到 Agent 执行任务的第 6 步时,第 1 步到第 5 步早已发生:那些页面已经浏览过了,那段代码已经写好了,那些记录已经追加进去了。审核第 6 步,并不能给你阻止第 1 到第 5 步的机会。
所以 Agentic 系统的 HITL 只放在任务末尾是不够的。它必须从一开始就设计进执行架构,在 Agent 采取行动之前生效,而非事后补救。
Agentic 系统的三种 HITL 架构
1. 起飞前审批
Agent 在执行任何一步之前,先构建一份计划:一份结构化的说明,写清楚它打算做什么、按什么顺序做、用哪些工具。人工审核并批准这份计划之后,执行才开始。
这套做法适合后果重大、频次不高的任务。一个被交办“起草这份提案并发给客户”的 Agent,应该在发出任何东西之前,把草稿交给人审批。人在这里批准的是行动意图本身,时点在这个行动变得不可逆之前。
起飞前审批是摩擦最高的 HITL 模式,它给每一个任务都增加了延迟。当任务的后果足以支撑这份成本时,这样做是合适的。
2. 检查点门控
Agent 在任务中已定义的各个阶段内自主推进,但在跨越设定好的关键节点之前必须暂停,等待人工审核。信息收集由 Agent 自主完成,而基于这些信息采取行动,需要人的批准。
举个例子,一个法律研究 Agent 可以自主检索、总结并整理判例法。但在它产出任何将被写进诉状引用的内容之前,要由人类律师审核。阅读的活儿归 Agent,这些材料对案件意味着什么的判断归人。
检查点门控适合这样的多阶段工作流:其中一些阶段后果轻微(检索、摘要、排版),另一些阶段后果重大(据此行动、对外发布或正式提交)。
3. 置信度门控的自主性
Agent 在高置信度、低风险的步骤上自主推进。当它的置信度低于阈值,或者即将采取一个被归类为高风险的行动时,就暂停并请求人工批准。
这是扩展性最好的一种模式,大多数任务无需人工介入即可完成,但它有一个关键依赖:Agent 必须具备可靠的机制,来评估自身的不确定性并对行动风险做分级。如果这套自我评估不可靠,Agent 要么打断得太频繁(审核疲劳会让 HITL 形同虚设),要么打断得太少(给出一种监督到位的假象)。
不可逆性分类
在任何生产环境中部署 Agent 之前,先把它能采取的每一类行动按可逆性分级:
- 只读(查询数据库、读取文件、浏览页面):完全可逆,没有任何状态被改变
- 写入草稿(创建邮件草稿、写本地文件、往暂存系统里加一条记录):可逆,草稿丢弃即可
- 写入已发布(更新线上记录、修改配置、推送到共享系统):需要付出工作量才能部分回退,必须再建一条记录来抵消原来那条
- 删除、发送或执行(发出邮件、删除记录、执行有外部副作用的代码):不可逆,或者只能通过大量补救工作来挽回
HITL 门控应当放在不可逆行动之前。对任何具备不可逆行动能力的 Agent 来说,这是可行监督架构的下限,是必须满足的一条。
计算爆炸半径
每个上线的 Agent 都有一个最大爆炸半径:它在一次未经审核的行动序列中可能造成的破坏总范围。这是一个很有用的设计约束。
要把它明确算出来。如果 Agent 能发邮件,它在一次任务执行中最多可能触达多少收件人?如果它能删记录,最多可能删掉多少条?如果它能执行代码,那段代码对它够得着的系统最大影响是什么?
把 HITL 门控的频率和位置设定成这样:任意 两个连续人工检查点之间的爆炸半径,都落在可接受范围内。“可接受”是一个业务判断,不是技术判断。要在部署之前把这个判断写成文档。
企业场景中的例子
财务分析 Agent。 一个读取市场数据、财务报表和内部模型来产出分析报告的 Agent。读取类操作自主进行。任何将要对外发出的产出,无论收件方是客户、监管机构还是交易对手,都需要人工审核并明确批准之后才能发送。
法律研究 Agent。 一个浏览判例法数据库、归纳裁判要旨并起草研究备忘录的 Agent。在研究阶段内部,Agent 自主运行。任何产出要并入客户文件或正式呈递材料之前,都需要经过起飞前审批。
HR 简历筛选 Agent。 一个处理求职申请并产出排序候选名单的 Agent。Agent 可以过滤和排序,但每一次拒绝都需要人来决定。Agent 负责推荐,人负责决定。
国防 AI 这一维度
当前围绕 AI 用于国防场景的争 论,由 2025 年 7 月五角大楼授予四家前沿实验室的合同、以及一年之后围绕 Anthropic 的自主武器限制能否被谈判掉而爆发的那场争斗所引发,它是 Agentic HITL 问题的极端版本。
在致命性自主武器系统中,HITL 问题变成了一个国际人道法问题。国际人道法要求,每一次使用武力都必须出自一个可被问责的人的决定:这个人理解当时的情况,有时间评估它,并且真的有能力做出另一种选择。一套在没有有效人类控制的情况下选择并打击目标的 AI 系统,无法满足这项要求,技术精度再高也一样。
同样的原则在国防之外、在低得多的风险等级上同样成立。有意义的人类监督需要三个条件同时成立:人必须掌握足够的信息,明白 Agent 即将做什么;有足够的时间去评估;并且真的有能力叫停。这三个条件中只要有一个不成立,监督就成了表演,有问责之形而无问责之实。
微调后的 Agent 组件带来什么变化
置信度门控失灵的一个常见来源是:模型在某类输入上给出高不确定性的预测,而这类输入在你的具体部署中很常见,在基座模型的训练数据里却很罕见。通用模型对你的领域没有特别的专长,它不认识你的术语、你的文档格式、你的判断标准。
在你的任务分布上微调过的模型,训练时见到的正是它上线后会遇到的 那类输入。这会降低模型在常规输入上给出低置信度预测的频率,也就降低了本该由 Agent 自主处理的任务被 HITL 打断的频率。结果是 HITL 门控在该触发的时候触发:面对真正新颖或含糊的情况,而不是面对那些只是在通用基座模型眼里显得陌生的常规任务。
关于 HITL 的基础概念,见什么是人在回路 AI和人在环中 vs 人在环上。关于高风险场景中辅助与自主之间的边界,见高风险决策中 AI 辅助与 AI 自主的区别。
如果你正在把微调模型作为 Agent 的组件部署,想在进入生产之前减少置信度失灵,查看定价 →
如果你正在搭建企业级 Agent 工作流,需要带完整审计轨迹的本地部署数据基础设施,预约 Ertas 发现通话 →
Ship AI that runs on your users' devices.
Free plan with 30 credits/mo, no card required. Paid plans from $10/mo USD.