AI 写代码越快,返工越快

AI 写代码越快,返工越快

这几个场景,你肯定不陌生。

需求写得清清楚楚,AI 自信满满交出一大段代码,你仔细一看——它解决的是另一个问题。AI 改代码的路径天马行空,换了同事接手,完全复现不了它当时的操作。代码能跑就算完工,没有测试、没有 lint,上线全靠人肉兜底。赶进度跳过审查,线上 bug 此起彼伏。同一个坑,上个月踩过,这个月 AI 换着花样再踩一遍。

Claude Code、Cursor、Qoder、Codex 把写代码的速度拉高了不止一倍,但一个残酷的事实正在浮现:代码写得越快,错得也越快。AI 工作流失控带来的返工成本,正在悄悄吃掉效率红利。

上周,阿里云 Qoder 团队开源了一个叫 Better Harness 的项目,专门治这个问题。上线没几天,GitHub 已经 1.5k star。

失控的根源,不在模型,在工作流

先把话说清楚:Better Harness 不是又一个写代码的 Agent,它是给 AI 编码智能体做工作流审计的工具。

它背后有一个模型,叫「智能体工作闭环」(Agent Work Loop):AI 从接收需求到交付上线,应该走完五个环节——任务理解、受控执行、变更验证、可靠交付、经验沉淀。大多数团队失控,是因为这五环里缺了好几环:目标没说清楚,AI 当然答非所问;没有沙箱和约束,AI 当然乱改;没有验证证据,代码当然"能跑就算完"。

Better Harness 干的事,就是把这个闭环拆开,一五一十检查每一环到底有没有真正被 AI 用起来。

一条指令,拿到一份带证据的体检报告

在任意支持的编辑器里输入:

/better-harness 审查此项目的 AI 编码工作流并生成报告

它就会启动一轮分析。报告有两个值得说的点。

第一,所有问题分级,且每条都附证据。 没有模糊的评分,每条发现都会说明:问题为什么重要、期望标准是什么、最小修复范围在哪、修完怎么验收。团队可以按优先级逐条处理,而不是面对一堆建议无从下手。

第二,它会告诉你哪些证据缺失。 分析时三个相互独立的只读子 Agent 分头取证:Agent 自定义资产(Rules、Skills、Hooks 是否完整可用)、真实任务会话记录(Agent 实际干了什么)、项目工程基础(仓库能不能支撑 Agent 工作流)。三路证据独立收集再统一汇总,避免结论互相污染。证据覆盖不完整的地方,会被明确标注出来——这既是诚实,也是提醒:看不到的地方,别当它没问题。

还有一个很克制的设计:它不自动改代码。所有修复方案都以可审阅、可回滚的任务形式呈现,只负责指出问题、准备好提示词,决定权在人手里。这点我觉得比"全自动治理"靠谱。

阿里不是第一个,但走的是另一条路

2026 年是 Harness Engineering 的大年。Addy Osmani 写了「Agent = Model + Harness」的长文,Lilian Weng 也在讲 Harness 工程化。行业共识越来越明确:模型能力在涨,工作流跟不上,模型再强也白搭。

这条赛道上已经有人了。小米 Darwin 团队 7 月开源了 HarnessX——9 维行为管线加自适应进化引擎,SWE-bench 等 5 个基准平均提升 14.5%。但两者的定位完全不同:

  • HarnessX 是"进化"路线:自动生成和调整 Harness 配置,让 Agent 自己变强;
  • Better Harness 是"审计"路线:不碰你的配置,只告诉你哪里断了、该补什么,修不修由人决定。

一个像自动驾驶,一个像驾校教练。对大多数还在"AI 编码裸奔"状态的团队来说,先请个教练,比直接上自动驾驶现实得多。

代价清醒:别指望它把你治好

说几个它做不到的事。

它不是主治医生,只是体检中心。 报告指出了问题,修复还得靠人。想要"全自动治理"的团队,期望要先调整。跑一轮分析本身也有成本,证据越全、项目越大,分析越慢。

它还很年轻。 1.5k star,MIT 协议,插件生态刚起步。Qoder 里是内置的,Claude Code 和 Codex 走插件市场装,Cursor 暂时只能本地源码加载——而且 Cursor 的会话证据覆盖范围有限,结论可能被明确标注为不完整。

学术上也有保留意见。 有研究指出(arXiv 2607.08938),小模型在子 Agent 管理上很吃力,而这类基于对特定模型行为观察总结出来的方法,未必能泛化到新模型上。换句话说,这套审计标准将来可能要跟着模型版本走,不是写死一次就一劳永逸。

别过度工程化。 Hugo Bowne 写过一篇很有名的批评:不是所有系统都需要九维管线式的重装备。小项目、单人开发,跑一遍五维体检当然有收获,但没必要为此搭一整套治理体系。

谁适合现在就用

  • 团队技术负责人:统一 AI 编码规范,量化 AI 研发质量,降低线上故障;
  • 被 AI 翻车折磨的开发者:搞清楚自己的工具到底哪里没配置对;
  • AI 平台/工程团队:搭建企业级智能编码平台时,Agent 治理是刚需;
  • 开源项目维护者:统一不同贡献者的 AI 行为,避免代码风格大杂烩。

说到底,AI 编码的核心瓶颈从来不是模型本身,而是配套的工作流治理。Better Harness 跳出了"优化 Prompt、加大上下文"的老思路,用可观测、可验证、可沉淀的工程化方式,把 AI 编码重新拉回纪律的轨道上。

先体检,再治病。这句话放在 AI 编码上,一样成立。


相关链接:

评论

暂无评论。

登录后可发表评论。