FunTester Agentic Coding 的监督机制

FunTester · July 27, 2026 · 36 hits

在讨论 AI 编程时,很多人会把问题简化成一句话:AI 会不会替代程序员?这个问题看起来直接,但其实过于粗糙。软件开发不是单一动作,而是一组复杂活动的组合,包括理解需求、拆解任务、设计方案、编写代码、验证结果、处理风险、维护系统、权衡业务目标。AI 可以参与其中很多环节,但这并不等于人类可以从流程中完全退出。

Anthropic 在《2026 Agentic Coding Trends Report》中提出的第四个趋势是:人类监督将通过智能协作扩大规模。报告认为,2026 年最有价值的能力之一,不是让 Agent 盲目尝试完成所有任务,而是让 Agent 学会什么时候应该请求帮助;同时,人类也不再审查所有细节,而是把注意力集中在真正需要判断的地方。

这个趋势非常关键。它纠正了一个常见误解:Agentic Coding 的目标不是取消人类监督,而是让监督变得更高效、更精准、更可扩展。AI 写得越多、跑得越久、参与的流程越复杂,越需要清晰的监督机制。否则,AI 提升的不只是效率,也可能放大错误。

协作悖论

报告中有一个非常重要的观察:开发者大约在 60% 的工作中使用 AI,但真正能够完全委托给 AI 的任务只占很小一部分,大约在 0% 到 20% 之间。

这个数据很值得展开。它说明 AI 已经深度进入软件开发流程,但它更多是持续协作者,而不是完全替代者。开发者会频繁使用 AI,但通常不会把关键任务直接丢给 AI 后不再检查。原因很简单:软件开发的结果需要对业务、用户、系统稳定性和长期维护负责,而这些责任仍然需要人类承担。

这就是报告中所谓的协作悖论:一方面,AI 使用频率很高,工程师离不开它;另一方面,工程师真正敢完全放手的任务仍然有限。表面看这两点矛盾,实际上并不矛盾。高效使用 AI 本身就需要人类参与,包括任务设置、提示、监督、验证和判断。

例如,开发者可能会让 AI 生成一组单元测试,但仍然要判断这些测试是否覆盖了关键边界;会让 AI 修复一个 Bug,但仍然要确认修复是否破坏其他路径;会让 AI 重构一段代码,但仍然要检查重构是否符合整体架构。

所以,Agentic Coding 的现实形态不是 AI 独立完成一切,而是 AI 承担大量执行工作,人类负责方向、边界和最终判断。

全自动开发

如果 AI 已经能写代码、跑测试、修 Bug,为什么还不能直接全自动开发?报告给出的答案很明确:软件开发中有大量任务不仅需要执行能力,还需要上下文判断。

开发者通常更愿意把那些容易验证、边界清楚、风险较低的任务交给 AI。报告中提到,工程师会逐渐形成关于 AI 委托的直觉:他们倾向于把可以比较容易 sniff-check 正确性的任务交给 AI,比如低风险脚本、明确的 Bug 定位、重复性实现等;而对于概念复杂、设计依赖强、需要组织上下文或 taste 的任务,则更倾向于自己主导,或者与 AI 协作完成。

可以把软件开发任务分成三类:

任务类型 适合程度 原因
明确、低风险、可验证任务 适合较高程度委托 结果容易检查,错误影响有限
中等复杂度工程任务 适合人机协作 AI 可执行,人类需判断方向
高风险、强上下文、战略性任务 不适合完全委托 需要业务理解、架构判断和责任承担

例如,生成测试数据、整理日志、补充样板代码、编写简单脚本,这类任务可以较多交给 AI。修复复杂 Bug、重构模块、补充测试体系,则可以让 AI 执行大量工作,但需要人类持续检查。至于架构选型、核心业务规则、权限边界、数据一致性策略、重大性能权衡,就不能简单让 AI 独立决定。

原因不在于 AI 没有能力给出建议,而在于这些决策没有唯一正确答案。它们往往依赖业务目标、组织经验、历史包袱和风险偏好。AI 可以参与分析,但最终判断必须由人类承担。

监督重点

传统代码 Review 的模式,往往是人类直接检查开发者提交的变更。代码量可控时,这种方式有效。但当 Agentic Coding 普及后,AI 生成代码的速度和规模会明显提高。如果仍然要求人类逐行审查所有 AI 生成内容,监督很快会成为瓶颈。

报告对此提出了一个重要判断:未来人类监督会从 review everything 转向 review what matters。也就是说,团队不可能也不应该让人类审查每一个细节,而是要建立智能协作机制,让系统自动处理常规检查,把真正重要、复杂、异常或高风险的问题升级给人类。

这会改变 Review 的形态。过去的 Review 更像是人工过滤器。开发者提交代码,Reviewer 逐行看实现、风格、逻辑和潜在问题。未来的 Review 更可能变成分层机制:

层级 主要职责
自动化测试 验证功能行为和回归风险
静态分析 检查语法、类型、规范和常见缺陷
Agent Review 检查 AI 生成代码的架构一致性、安全风险和质量问题
人类 Review 判断关键设计、业务边界、风险取舍和最终是否接受

这并不是降低人类 Review 的重要性,而是提高人类 Review 的密度。人类不再把大量时间花在格式、样板、简单遗漏上,而是集中处理真正影响系统质量的问题。

在这种模式下,监督的目标也会改变。人类不是要重新做一遍 AI 的工作,而是判断 AI 的工作是否满足目标、是否存在隐藏风险、是否符合系统长期方向。

Agentic Quality Control

报告提出,Agentic Quality Control 会成为标准。组织会使用 AI Agent 来审查大规模 AI 生成内容,分析代码中的安全漏洞、架构一致性和质量问题。

这一点非常重要,因为它说明 Agentic Coding 的质量保障不能只依赖人类。随着 AI 生成内容增加,必须引入自动化和智能化的质量控制机制。否则,AI 产出越多,人类 Review 压力越大,最终要么流程变慢,要么质量失控。

可以把 Agentic Quality Control 理解成 AI 参与生产,也参与初级质量筛查。例如:

检查对象 Agent 可以做什么
代码质量 检查重复逻辑、复杂度、异常处理和规范一致性
架构一致性 判断修改是否符合现有模块边界和设计模式
安全风险 检查输入校验、权限控制、敏感数据处理
测试完整性 判断测试是否覆盖关键路径和边界条件
文档同步 检查接口、配置和行为变更是否更新文档
回归风险 分析变更可能影响哪些调用链和模块

这类 Agent Review 并不能替代最终人类判断,但它可以把大量明显问题提前暴露出来。人类看到的就不再是一大堆未经筛选的代码,而是经过初步分析的风险清单、修改摘要、测试结果和需要决策的问题。

这对软件团队尤其重要。Agentic Coding 的规模化落地,本质上取决于一个问题:团队能不能在代码生成速度提升的同时,保持质量控制能力同步提升。如果生成速度提升了十倍,但 Review 能力没有提升,最终结果不是效率革命,而是风险堆积。

请求帮助

报告还强调,未来有价值的 Agent 能力之一,是 Agent 学会什么时候请求帮助。一个成熟 Agent 不应该对所有任务都盲目尝试,也不应该在不确定情况下装作确定。它需要能识别自己遇到了什么类型的问题,并在合适时机升级给人类。

这其实是 Agentic Coding 中非常关键的能力。很多 AI 系统的问题不是不够会做,而是不知道什么时候不该继续做。如果一个 Agent 在需求不清楚、权限边界不明确、数据迁移风险很高、测试结果互相矛盾的情况下仍然继续执行,就可能造成严重问题。

一个好的 Agent 应该具备类似的行为:

  • 当需求存在多种解释时,主动列出歧义并请求确认
  • 当修改会影响核心业务路径时,提示风险并等待批准
  • 当测试失败原因不确定时,给出假设而不是直接乱改
  • 当安全边界不清晰时,停止执行并升级给人类
  • 当发现现有代码和文档冲突时,标记不一致并请求判断
  • 当有多个实现方案且取舍不同,要求人类做决策

这类能力会让 Agent 更像可靠协作者,而不是无限自信的代码生成器。

从工程角度看,会请求帮助其实是质量控制的一部分。它避免 Agent 把不确定性隐藏在输出里,也避免人类在最终阶段才发现方向错误。越早暴露不确定性,越容易控制风险。

扩大规模

扩大规模并不是让人类做更多 Review,而是让有限的人类注意力覆盖更大的 AI 产出。

在传统模式下,一个高级工程师可能只能 Review 几个开发者的代码。如果未来 Agent 能同时生成多个功能、修复多个 Bug、补充大量测试,那么人类监督必须从逐项检查转向系统化管理。

这种扩展主要依赖三件事。

第一,自动筛查。常规问题交给测试、静态分析和 Review Agent 先处理。比如构建失败、格式问题、明显类型错误、简单安全漏洞,都不应该直接消耗人类注意力。

第二,风险分级。系统需要区分低风险变更和高风险变更。修改文档、补充测试、调整样式,与修改权限模型、计费逻辑、数据一致性策略,不能采用同样的审批强度。

第三,关键升级。Agent 要能把真正需要人类判断的事项提炼出来,而不是让人类阅读所有中间过程。比如:这里有两个实现方案,方案 A 兼容旧接口但代码复杂,方案 B 更简洁但需要迁移调用方。这种信息比直接提交一堆代码更有价值。

在这种模式下,人类监督的对象从每一行代码变成每一个关键决策。这就是报告所说的,让人类注意力集中在真正重要的地方。

CRED 案例

报告中提到 CRED 的案例。CRED 是印度一家服务超过 1500 万用户的金融科技平台。它在整个开发生命周期中使用 Claude Code,以加快交付速度,同时保持金融服务所需的质量标准。报告指出,Claude 驱动的开发系统让他们的执行速度提升了一倍,但关键并不是消除人类参与,而是把开发者转向更高价值的工作。

这个案例很适合说明 Trend 4 的核心。金融科技场景对质量、安全和稳定性要求很高,不可能简单把开发工作完全交给 AI 后不做监督。CRED 的例子说明,Agentic Coding 的价值并不是让人退出,而是让人从低价值重复工作中释放出来,把注意力放到更重要的判断上。

换句话说,效率提升来自协作结构的变化:

过去 未来
人写大量实现代码 Agent 承担更多实现
人手动处理大量细节 Agent 处理常规验证和修复
人审查所有问题 人关注关键风险和决策
人被流程细节消耗 人转向更高价值工作

这也说明,Agentic Coding 在高要求场景中的落地,不是靠弱化质量流程,而是靠增强质量流程。

监督机制

Trend 4 对工程团队最重要的启示是:人类监督不能临时靠个人经验,而需要被设计进工作流。

如果团队只是让开发者随意使用 AI,然后在最后 Review 一下结果,很难真正控制风险。成熟的 Agentic Coding 流程应该提前定义好哪些任务可以委托,哪些任务必须协作,哪些任务必须人工批准。

例如,团队可以建立这样的规则:

场景 处理方式
文档生成、注释补充 Agent 可自动完成,人类抽查
单元测试补齐 Agent 生成,测试通过后人类 Review 核心覆盖
小 Bug 修复 Agent 实现并附带测试,人类 Review
核心业务逻辑修改 Agent 辅助分析和实现,人类必须批准
权限、安全、数据迁移 Agent 只能给方案和草稿,人类主导决策
大规模重构 分阶段执行,每阶段设置检查点

这类规则的价值在于,让监督不依赖个人临场判断,而成为可执行流程。

未来团队需要的不只是会用 AI 的工程师,还需要能设计 AI 协作边界的工程流程。监督机制会成为 Agentic Coding 是否可靠的核心基础设施。

精准监督

Trend 4 的核心可以总结为一句话:AI 参与越深,人类监督越需要升级。

开发者已经在大量工作中使用 AI,但完全委托给 AI 的比例仍然很低。这说明 AI 的正确定位不是替代全部工程判断,而是作为持续协作者,承担大量实现、检查和反馈工作。人类则负责目标、边界、风险、架构和最终判断。

未来高效的软件团队,不会要求人类逐行审查所有 AI 生成内容,也不会盲目相信 AI 自动完成一切。它们会建立智能协作机制:用 Agent 做初级质量控制,用自动化测试和分析做持续验证,用风险分级决定审批强度,用人类判断处理真正重要的问题。

因此,第四个趋势可以用一句话概括:Agentic Coding 的关键不是把人从流程中拿掉,而是让人类判断出现在最需要它的位置。


相关阅读

##### FunTester 名片|万粉千文,百无一用

如果觉得我的文章对您有用,请随意打赏。您的支持将鼓励我继续创作!
No Reply at the moment.
需要 Sign In 后方可回复, 如果你还没有账号请点击这里 Sign Up