虎嗅

Loop Engineering:被高估的循环,被低估的拓扑

该文章尚未提供 Deutsch 解读,以下为中文版内容。

核心内容总结

这篇文章围绕硅谷最新火起来的Loop Engineering(循环工程)展开:它是一种让AI编程agent自动完成任务的系统——不再需要人手动写提示词指挥AI,而是搭建一套“自动循环流水线”,让AI自己找活干、派活、检查结果、记录进度,循环往复。文章前半部分解释了循环工程的定义、核心动作和零件;后半部分通过闭门研讨,揭示了行业内对循环工程的冷静思考:循环被高估,任务的拓扑结构(整体复杂关联)被低估,同时还讨论了多Agent协作、反馈的重要性、环境构建的趋势以及落地的现实差距。

一、什么是Loop Engineering?——从“手动指挥AI”到“搭自动流水线”

以前用AI编程,你得像教小孩一样,一句句写提示词(比如“帮我修复这个bug”),AI做完一步你再指挥下一步。循环工程把这个过程反过来:你搭一个系统,让AI自己完成整个流程,具体分五个动作:

1. 找活干:AI自动扫描代码库,发现没通过的测试、待处理的issue、突然变差的指标等。

2. 派活:给每个任务开独立的“工作副本”,避免多个AI同时改一个文件打架。

3. 验证:找另一个AI当“裁判”,专门挑第一个AI的错(自己打分永远偏高)。

4. 记进度:把做了什么、结果如何存到文件或数据库里,避免AI“失忆”。

5. 调度:设定时间(比如每天早上)让系统自动启动,不用手动点。

这套系统靠六个现成零件搭成:自动找活的工具、独立工作副本、项目规矩手册(让AI不用每次猜)、连接日常工具的接口(比如Slack)、分工的子AI(写代码的+挑错的)、外部记忆(比如markdown文件)。比如Addy的晨间循环:每天早上系统自动扫代码库,派AI修bug,另一个AI审核,开好PR,搞不定的才留给人处理——全程没人写提示词。

二、为什么Loop Engineering突然火了?——模型能力够了,零件齐了

以前这么干效果差:AI笨,得把所有边角情况写进提示词,还得自己维护一堆脚本。现在火起来有两个原因:

1. 模型能力跨过门槛:AI能无人值守完成复杂任务,不用人写所有细节,定时调度也成了主流功能。

2. 零件现成化:Claude Code、Codex等工具已经把自动找活、独立工作副本这些功能做好了,直接用就行。

举个例子:Stripe的Minions系统每周自动合并1300多个PR,全是AI干的——如果靠手动提示,根本不可能做到这个量。还有Anthropic的演示:用极简提示词做游戏跑不起来,用循环做的游戏能换配色、调试,虽然花的时间和钱更多,但结果能用。

三、循环工程的“坑”——六个躲不开的代价

循环工程不是万能的,它放大了之前AI编程的问题:

1. 意图债:AI不知道项目规矩,会乱猜(比如随便改核心代码),得把规矩写成手册让它每次读。

2. 验证债:AI自动跑也会自动错,就算有裁判AI,最后上线还是得人审。

3. 理解债:AI写代码越快,你没亲手写、没读懂的代码越多,以后维护难。

4. 认知投降:人变懒,AI给什么就用什么,慢慢失去判断能力。

5. 编排税:AI并行跑很多任务,但你能审的数量有限,注意力是瓶颈。

6. 成本失控:AI运行的费用(token成本)可能突然飙升,得算着花。

比如Peter Steinberger同时开五六个循环,但承认这只是权宜之计——等模型再快一点才行。

四、闭门研讨的尖锐洞见:循环被高估,拓扑被低估

行业内私下讨论时,大家没那么乐观,最核心的判断是:循环(重复迭代)被过度重视,拓扑(任务的复杂结构)被低估

  • 循环型任务:反馈密集、目标单一(比如修测试),用循环能解决80%问题,但真实任务往往是拓扑型:多个子任务深度关联(比如做一个完整的产品),AI容易在第三、四层就跑偏。
  • 真实任务是两者结合:既要反复优化某个模块(循环),也要推进整体结构(拓扑)。比如做一个APP,既要循环优化登录功能,也要拓扑推进支付、社交等模块的关联。
  • 拓扑难在哪?:它不好标注(比如怎么定义“产品结构合理”),容易被AI“钻空子”,所以大家更愿意做容易的循环任务。

还有一个点:长程≠难。厂商爱晒AI跑几十小时的曲线,但真实用户大多只用AI跑10分钟左右。人的工作是并行、会被打断的(比如上午改bug下午做PPT),很难被AI的单循环镜像。

五、落地的现实差距:离“替代人”还差得远

循环工程听起来厉害,但实际落地有很多gap:

1. 复杂任务做不了:比如咨询级PPT(一张值几万),模型没法拆解成高信息密度的单页,更别说审美和逻辑了。

2. 中间“垃圾时间”的机会:比如AI花8分钟干5分钟的活,用户等得无聊——可以预测耗时,推送信息给用户(比如“再等3分钟,给你看相关教程”),但这个预测很难做准。

3. 自我改进是信仰:没有理论证明AI能自我改进,现在的“改进”只是试错和沉淀经验。比如聪明的模型错一次就会改,普通模型得错5-10次。

结论是:不用焦虑(FOMO),亲自上手就知道模型还差得远,真实用户的需求比想象中复杂。

最后:管AI像带员工

文章结尾用了一个贴切的比喻:管AI和带员工一样,你让它干三天活不给反馈,结果肯定不是你想要的。现在离AI接管完整工作流,还差环境、数据、反馈信号,以及自我改进的证明——但至少路已经多了起来。

(全文完)