推荐 Addy Osmani 最新分享「Own the Outer Loop」 Agent 可以写代码,但工程师必须守住边界上的决定与后果!
过去一年,大家谈 harness、loop、fleet、software factory,话语越来越“工厂化”。Osmani 的判断是:真正该守住的,不是内环执行,是外环问责——谁能说清改了什么、为什么安全、错了怎么办。说不清,组织就不会真正把关键系统交给你。
模型越强(Claude Fable 5、GPT-5.6),这点越关键:杠杆越大,义务越大。
三个关键词
· Quality(质量)
放行前装上的检查:测试、类型、沙箱、审计、监控。它们产出证据,不是感觉。
· Verdict(裁决)
进入依赖系统前的最终决定:放行、拦住、改道、收窄、加护栏,还是直接拒绝。
模型可以写台词,裁决必须是人的——“挂我名字的内容,我来拍板”。
· Answerability(可交代性)
有人追问时,你能讲清为什么。长时程 agent 会做大量中间决策,很多追不到原始 token;若不把可交代性写进系统设计,事后重建决策链会贵到做不起。
一句话:质量产证据 → 证据支撑裁决 → 裁决必须可交代。
系统分层:他怎么画这张图
· Model:引擎
· Harness:车——工具、记忆、权限、沙箱、测试、可观测、恢复
· Loop:调查 → 实现 → 验证 → 再来;且“做完”由独立检查判定,不是模型自说自话
· Factory:很多 loop 并行;agent 在里面干活,人在边界上做决定
边界内外各干一件事:
· 里面是 capability:调查、实现、验证、回报——模型已经能做
· 外面是 agency:决定、核实、批准、承担——仍属人
所以不是“人退出工程”,是人从内环执行,挪到外环治理。
为什么现在特别急
数据指向同一缺口:
· 生成变便宜(Sonar:约 42% 提交已是 AI 生成或显著辅助)
· 稀缺的是审查、验证、理解、维护
· 生成速度跑赢了控制速度 → trust–verification gap
· GitLab:治理常发生在代码已写出、风险已吃下之后——控制权已经丢了半截
他的提醒很实在:很多人嘴上不信 AI 代码,却没把这种不信写进验证流程。这比盲目信任更危险。
人该站在哪
人不需要卡在内环每一拍。人该在:
· 约束环:输入、架构、指令、不变量
· 抽样环:抽多少、看什么
· 审计环:留什么证据、审计是否有效
· 所有权环:生产边界上哪一段归你
Agent 可以产出超过你能逐行看完的量。稀缺资源是带质量信号的人类判断。Quality 在这里被说成 back pressure(背压):不是给 agent 最大自主,是给到你还能拦住、调节、核查、保住人的判断力。
三个隐性成本
- Cognitive surrender(认知投降)
- Cognitive debt(认知债)
- Orchestration tax(编排税)
Brownfield 尤其险:要审计的行为往往不在代码里,而在伤疤里——历史事故、潜规则、数据怪癖、runbook。
品味、Alpha、Decay
当谁都能做时,选做什么更值钱。
· Alpha:高价值一手
· Decay:人人会的套路,会平台化
· Taste:证据还没齐时,先感到风向在变
工程上的下一步:把品味操作化——命名、用 critique 练、把理由写清楚。职业优势从“会做任务”,上移到:教会、系统化、决定何时做、并对结果负责。
他分得很干脆:人人都能是 developer;engineer 是更严的纪律——推理、约束、权衡、风险、问责。
工厂的十二根柱子
Brownfield 才是规模化的真战场。要把隐性知识变成显式约束,跨团队、跨代际保持一致,落成测试与规格,并绑到客观证据上;失败要能反哺学习。
自动化会制造新瓶颈——而这恰恰是值得人去拥有的瓶颈:从“能不能做”变成“该不该存在、能不能交代”。
操作模型可以概括为一句:
建工厂;保持运转;让工作可读、可验、有主。