虎嗅

AI时代,PM最重要的能力,不再是“懂业务”

核心内容总结

AI时代,产品经理的核心能力不再只是“懂业务”,而是能把业务人员脑子里模糊的规则,转化为AI可执行的标准——测试集是这种能力的直接体现。测试集不是简单的“考试卷”,而是定义AI输出“对/错/不够好”的明确规则,能帮我们稳定AI的输出质量。文章以“内容创作Agent”为例,讲了测试集的价值、构建方法,以及它如何成为传统产品经理转型AI的关键门槛。

详细拆解解读

1. 为啥AI产品经理水平看测试集?因为AI输出“不稳定”

传统软件像按固定菜谱炒菜,输入相同,结果永远一样;AI却像新手学做饭,同样的食材,今天咸明天淡,换个锅(模型)味道又变。这时候,你得明确:什么算好吃?什么算难吃?什么算“还行但不够香”?

测试集就是这套“味道判断标准”。如果PM只能说“这菜不好吃”,却讲不出具体哪里不好(比如盐多了、火候不够),AI下次还会犯同样的错。所以,测试集的深度,直接反映PM对业务的理解深度——能不能把模糊的感觉变成可验证的规则。

2. 测试集到底是啥?用人话讲就是“AI的作业评分标准”

测试集不是一堆问题,而是每个问题都带“评分细则”。每条测试用例要回答4件事:

  • 用户给了啥输入?(比如让AI写“传统PM转AI要提升业务能力”)
  • AI该咋处理?(比如判断这个题目太泛,建议拆成具体场景)
  • 输出必须有啥?(比如至少一个目标人群、一个具体场景、一个能力方向)
  • 出现啥算失败?(比如直接写“理解用户需求”这种废话)

举个例子:如果AI写的文章只有“正确的废话”,测试集就能明确判定它“不及格”——因为没满足“具体场景+能力方向”的要求。

3. 好测试集要做三件事:把“模糊感觉”变成“硬标准”

PM要把业务人员的“直觉”转化为AI能懂的规则,得完成三个动作:

  • 把“好”拆成可验证的点:比如“文章质量高”,不能说“看起来不错”,要拆成“有数据支撑、有矛盾拆解、结构清晰”。
  • 把“直觉判断”量化:业务人员说“这个选题太平”,PM要拆成“没有争议点、没有读者冲突、结论能提前猜到”。
  • 提前找“翻车场景”:业务专家知道哪些情况容易出错(比如写敏感客户资料),PM要把这些模棱两可的场景放进测试集,让AI提前避开坑。

4. 测试集要守四类问题:保住基本盘+防翻车

一套合格的测试集,必须覆盖四种场景:

  • 典型案例:正常情况能不能做好?比如AI面对普通选题,能不能判断是否值得写?
  • 边界案例:模糊场景能不能靠谱判断?比如“AI毁掉传统PM”这种容易情绪化的选题,AI能不能提示风险,建议收窄到具体岗位?
  • 红线案例:绝对不能碰的底线?比如客户未公开资料,AI必须先脱敏,保护不了就不写。
  • 历史Badcase:之前犯过的错不能再犯?比如过去写过“标题党但内容空”的文章,测试集要把这个错误加入,每次改模型都要重测。

5. 传统PM转AI的真正门槛:不是技术,是“提炼标准”的能力

很多人以为转AI PM要懂技术,但其实技术门槛在降低(比如用AI工具就能解决部分技术问题)。真正难的是把业务人员说不清的“感觉”变成AI能执行的规则

比如业务人员说“这篇文章不行”,PM要能把这句话拆成“开头没有真实场景、标题承诺的内容没在前半部分兑现”——这就是测试集的核心,也是传统PM转型的关键。

最后一句话总结

AI时代,产品经理的核心不是“懂业务”,而是“能把业务规则写进AI的说明书里”——测试集就是这份说明书,它决定了AI能不能真正帮企业解决问题。

(全文完)