核心内容总结
这篇文章围绕AI Agent(可以理解为“智能助手”)的两个关键概念——Skill和Harness展开:Skill是把行业经验、工作流程封装成“说明书”(比如代码规范、业务SOP),让Agent知道“该怎么做”;但光有说明书不够,Agent会偷懒、漏步骤、自作主张。Harness则是给Agent搭一个“靠谱的工作台”:规定它能碰什么工具、哪些操作必须审批、做完怎么验证结果、出错怎么回溯,让Agent从“会说”变成“能可靠地做事”。随着Agent开始处理更长、更重要的任务(比如改代码、处理财务),Harness的重要性越来越凸显,它决定了Agent能否从“演示玩具”变成企业敢用的工作系统。
一、Skill:经验的“说明书”,但管不住Agent的“小动作”
Skill为什么火?因为大模型记不住一家公司所有的经验(比如代码规范、合规要求),把这些经验拆成一个个任务包(比如“代码审查Skill”“财务对账Skill”),需要时给Agent用,就像给新同事一本针对性的SOP,比塞给它整本员工手册高效。
但Skill有个大问题:它只是“软约束”。比如你写了“改数据库前必须备份、测试”,Agent可能觉得“改动小”就跳过测试,或者中途卡住了还说“完成了”。这就像给新同事SOP,他可能嫌麻烦不照做——Agent也会这样,尤其是任务长了,漏一步后面全错,还不容易发现。
二、Harness:把Agent“拴”在靠谱轨道上的“工作台”
Harness不是更高级的Skill,而是一套让Agent“规矩做事”的运行环境,像给Agent搭了个带护栏的工作台:
- 材料区:Agent能看到哪些文档、历史任务记录,中途暂停了怎么接着干(解决“忘事”问题);
- 工具区:能调用浏览器、数据库吗?调用后能看到结果吗(比如改完代码能看日志);
- 护栏:改生产数据库要二次确认,没备份不让下一步(硬约束,不是提醒);
- 验收台:做完要验证结果(比如代码改完跑测试,数据写入要查记录),出错了能回滚。
举个例子:Skill说“备份→测试→执行迁移”,Harness会把这些变成“必经关卡”——没备份记录?下一步按钮灰的;测试没过?不让提交。实验显示,用Harness的Agent完成步骤的比例从56%升到86%,差别就是“希望它记得”vs“系统强制检查”。
三、为什么2026年大家突然谈Harness?
以前Harness是“不起眼的胶水”,现在成了核心竞争力,原因有三:
1. Agent开始干“长活”:从“写一段代码”变成“完成整个项目”,跨系统、多步骤,需要状态管理(比如中途换Agent能接着干)、错误回溯;
2. Skill可移植了:Skill变成标准格式后,“支持多少Skill”成了基础功能,竞争点转到Harness(比如同样的Skill,在不同Harness里表现差很多);
3. 企业敢用了:Agent进入生产环境,企业需要知道“它干了什么、谁授权的、错了能追责”——Harness的权限、日志、审批就是解决这些问题的。
比如OpenAI用Codex做产品,前期慢是因为环境不清,后来优化Harness(给Agent独立的工作环境、能看日志/截图),才加快了进度。
四、未来价值:垂直Harness比Skill更值钱,企业要“敢交活”的系统
Skill容易复制(比如“法律检索Skill”谁都能写),但垂直Harness很难:
- 做法律Agent,Harness要知道“不同法域查什么、利益冲突时停手、引用要核验”;
- 做财务Agent,Harness要管“对账异常升级、谁能批付款、凭证怎么留”。
企业买的不是“聪明的Agent”,而是“边界清楚的Agent”:知道什么不能做、做完有证据、错了能撤回。所以未来的机会在“垂直Harness”(懂行业实际运转)和“企业级Agent Runtime”(统一权限、日志、策略的平台)。
五、Harness不是万能的:别堆成“AI版Kubernetes”
Harness也有坑:
- 太复杂:堆太多功能(多Agent编排、重试、沙箱),出问题都不知道哪错了;
- 成本高:多步骤验证、重试会消耗更多token和计算资源;
- 过拟合:为某个任务优化的Harness,换任务就失灵;
- 安全风险:Skill可能带脚本,安装时要查来源、权限。
所以要“按需搭Harness”:写生日祝福用薄的(不用复杂验证),改线上服务用厚的(测试+回滚),金融交易要更严(审批+审计)。
最后,模型再强,Harness也不会消失——就像聪明员工进公司也要守权限、走审批,Harness是组织对Agent的“管理规则”,不是弥补模型笨,而是让组织敢把活交出去。
这篇文章本质上是说:AI Agent要从“能说”到“能做”,关键不是让它更聪明,而是给它一套“靠谱的做事规则”——这就是Harness的价值。