虎嗅

黄仁勋押注,DeepSeek内测,详解Harness到底是什么?

该文章尚未提供 Français 解读,以下为中文版内容。

核心内容总结

AI行业的竞争焦点正在从“比大模型本身”转向“比谁能更好地驾驭大模型”——这个驾驭系统就是Harness。它不是简单的模型包装,而是一套让AI从“会聊天”变成“能可靠完成实际工作”的智能体工程系统。黄仁勋等行业大佬认为,未来企业的核心能力会建在Harness上,因为它能把大模型(千里马)变成真正的生产力工具(能拉车的马)。现在国内外大厂、开源社区都在抢Harness的主导权,普通人也能动手做简单的Harness。

一、Harness到底是什么?——不是“包装”,是驾驭AI的“操作系统”

你可以把大模型比作一匹千里马,Harness就是全套驾驭装备:缰绳(控制方向)、马鞍(稳定运行)、刹车(防止出错)、仪表盘(监控状态)。它和常见的Agent Framework(开发AI的工具包)不一样:

  • Framework像“招聘手册”:教你怎么造一个AI员工;
  • Harness像“企业管理系统”:安排任务、给工具、记经验、监督执行,让AI员工能长期稳定干活。

从技术角度看,Harness就像电脑的Windows系统:没有它,芯片再强也只是一堆硬件;有了它,才能让AI能力被真正调用。比如Anthropic泄露的51万行代码里,Harness包含6大核心组件:

  • 多层提示词:给AI定规矩(比如“你是市场分析师,不能胡说八道”);
  • 工具说明书:告诉AI怎么用外部工具(比如查数据、写代码);
  • 工具调用循环:先想清楚任务步骤,再一步步执行(避免瞎忙活);
  • 记忆管理:让AI记得之前的工作内容(不会转头就忘);
  • 子Agent分工:主AI派小AI做细分任务(比如写代码的AI和测试的AI配合);
  • 验证钩子:防止AI“虚报成果”(比如检查代码是否真的能运行)。

二、黄仁勋为什么重视Harness?——它能让AI真正“赚钱”

老黄(英伟达CEO)不聊GPU,反而盯着Harness,核心原因是:Harness能把大模型变成企业愿意花钱的生产力工具。数据能说明一切:

  • LangChain实验:用同样的GPT模型,加Harness后任务得分从52.8%涨到66.5%(从“不及格”到“优秀”);
  • Nemotron模型:配合Harness后,评测成本降了10倍(从43美元到4.5美元);
  • Claude模型:加Harness后,能生成可交付的软件(之前只能写半成品)。

对英伟达来说,Harness越普及,企业就越需要更多GPU来跑AI员工——毕竟每个AI员工都得靠GPU“吃饭”。老黄的算盘是:Harness让AI进入企业流程,GPU的销量自然就上去了。

三、Harness争夺战已经打响——大厂和开源社区都在抢

现在国内外玩家都在布局Harness,就像当年抢操作系统主导权:

  • OpenAI:2026年初用5个月让Codex写了100万行代码,靠的就是Harness(一个叫AGENTS.md的文件,定了项目规则);
  • Anthropic:泄露的代码里藏着44个未发布的Harness功能,可见投入之大;
  • 国内大厂:DeepSeek专门组建Harness团队,腾讯WorkBuddy的Harness先在内部2000员工中打磨,再推向市场;
  • 开源社区:OpenClaw(龙虾)能防止AI泄露内部思考,Hermes(爱马仕)能让AI“越用越聪明”——这些都是开源Harness的成果。

谁能掌握Harness,谁就能主导未来AI应用的生态。

四、普通人也能写Harness——200行代码就够了

你不用写几十万行代码,最小可用的Harness只要200行左右。比如想让AI分析英伟达一周新闻并写公众号提纲:

  • 没有Harness:直接问模型,它可能瞎编或漏信息;
  • 有Harness:把任务拆成3步:①找最近一周的英伟达新闻;②筛选重要内容;③整理成提纲。Harness负责安排这3步,模型只做每一步的思考。

入门方法很简单:

  • 先写个AGENTS.md文件(200行Markdown):定好AI的身份、任务规则、禁止操作;
  • 再用开源工具(比如LangChain)搭基础模块(记忆、工具调用);
  • 核心逻辑:让AI从“自由发挥”变成“按流程做事”。

结尾:未来的竞争,拼的是Harness

以后大家用AI,可能不再问“你用什么模型?”,而是问“你的Harness搭得怎么样?”。大模型是人人都能买到的基础设施,而企业自己的Harness,才是真正的“护城河”——它决定了你的AI员工能不能靠谱干活,能不能帮你赚钱。