虎嗅

B端AI落地真正需要的,不是更聪明的Agent

该文章尚未提供 Español 解读,以下为中文版内容。

核心内容总结

这篇文章围绕企业AI(Agent)落地的实际问题展开,核心观点是:企业用AI不是看模型多聪明,而是看系统是否稳定可控、不同环节容错率是否匹配;Agent和传统工作流(Workflow)不是对立关系,而是可以结合(比如Claude的动态工作流);企业需要把AI的“不确定智能”放进“确定的责任边界”里,重点关注出问题后的处理能力。

一、Agent和Workflow:从“对手”变“搭档”,动态工作流模糊了界限

以前大家觉得Agent和Workflow是二选一:Agent像聪明但爱“即兴发挥”的助手,能自己规划任务,但容易失控;Workflow像按固定路线走的老司机,虽然不灵活,但每一步都可控。

现在Claude推出的“动态工作流”打破了这个对立——Agent可以先理解大任务,临时生成工作流,再把活儿分给几十个甚至几百个子Agent(有的干活、有的复核、冲突了还能迭代)。比如Bun创始人用它11天迁移75万行代码,测试通过率99.8%,就是因为动态工作流把Agent的灵活和Workflow的有序结合起来了。

所以现在的问题不是“用Agent还是Workflow”,而是“哪些不确定的事交给Agent,哪些要锁在责任边界里”。

二、B端AI落地:“不犯错”比“更聪明”重要,容错率是核心

很多人以为AI落地只要模型够强就行,但实际企业更怕“出错”。比如帮外贸公司做获客Agent:

  • 搜索客户、筛选信息:犯错了顶多效率低,能重来(容错率高);
  • 发开发信写错称呼、把对手当客户:尴尬但能补救(容错率中等);
  • 处理报价填错价格、承诺不该有的交货期:没撤回机会,直接损失钱(容错率极低)。

企业关心的三个问题:这步允许多大错误概率?出错损失可逆吗?谁来兜底? 模型聪明没用,权限背后的责任才是关键——AI省了人,但如果错一次要三个人救火,那不是自动化,是换种加班方式。

三、业务流程分三层:把风险锁在不同“笼子”里

真正能进企业核心业务的AI流程,不能全靠模型决定,得拆成三层:

1. 确定性的事交给代码/工作流:查数据库、算金额、校验权限这些能写死规则的,别让模型猜(比如客户等级够不够优惠,直接用代码判断,不会错);

2. 模糊的事交给Agent:理解客户邮件意图、读非结构化文档、搜索信息这些路径不定的,让Agent发挥(比如客户说“想降价”,Agent能分析上下文给出方案);

3. 高风险动作交给人工/回滚:付款、删数据、改配置这些不能错的,必须先审批、留日志、能恢复(比如AI生成的报价,得人工确认才能发,发错了能撤回)。

这三层不是必须用不同工具,关键是“可靠的部分用确定结构约束,危险的动作有人兜底”。

四、选工具别跟风:业务需求说了算

不同工具适合不同场景,别看到“动态工作流”火就盲目用:

  • 小任务(定时拉数据、分类表格):用Python/TypeScript脚本就行,没必要搭Agent平台;
  • 流程清晰、要连多个SaaS(比如CRM+邮件工具):用n8n、Zapier这类可视化工具,运营人员也能调;
  • 长流程(跑几小时/几天,有复杂分支):用LangGraph或自己写状态机,重点是能断点恢复、测试、版本管理;
  • 目标清但路径不定(比如大规模代码迁移、安全审计):用Claude动态工作流才显优势。

选工具前问四个问题:这事能写清楚步骤吗?犯错损失大吗?结果能用规则验证吗?错了能改回去吗? 答不上来,选啥工具都是白搭。

五、B端AI拼的是“收场能力”:出问题能搞定才是真本事

模型再强,能处理开放任务,也不如“出问题能查、能停、能改”重要。比如Claude动态工作流虽然能调度几百个Agent,但Anthropic还是保留了“执行前确认”和“管理员禁用”功能——能力越强,越要讲权限和责任。

企业愿意持续付钱的,不是“省了几个人”,而是“少救几次火”:错误少、流程可复制、出问题能找到原因。Agent可以处理不确定,但企业必须把它放进确定的责任边界里,这才是落地的关键。

总结:B端AI落地,不是比谁的模型更聪明,而是比谁能把“智能的不确定”和“流程的确定”结合好,让风险可控、错误可补救——毕竟,企业要的是“放心用”,不是“炫技”。