虎嗅

从一句模糊指令到131张聊天截图,我是怎样不断纠正AI的

核心内容总结

这篇看似是普通用户调教AI处理聊天录屏的实操笔记,实际上用一个要求极高的「可作为证据使用的连续聊天截图」小项目,完整还原了普通人用AI完成复杂非标任务的全流程:从最开始一句模糊的“整理聊天截图”指令,到前后踩了4轮坑,补了几十条可落地的硬校验规则,最终产出131张零错误的合格截图,彻底戳破了网上流传的“写个万能prompt就能让AI搞定一切”的神话,给出了不管是个人用AI还是企业落地AI都能复用的务实工作逻辑。

---

详细拆解解读

1. 90%的人用不好AI,本质是你把「验收标准」写得太模糊

很多人用AI出问题第一反应是“AI太笨了”,但看作者第一轮踩的坑就懂:他一开始明明要求AI先出方案再干活,AI交上来的质量报告还写着“未转写语音数量为0”,结果实际打开一半截图都有漏转的语音。

这根本不是AI故意骗你,是你们俩对“什么叫合格”的定义完全不一样:你脑子里的“截图合格”是“所有语音都转成文字、前后接得上、能当证据用”,但AI理解的“合格”只是“我没看到明显的空白转写框”。

这和你找外包做APP、给下属派活踩的坑一模一样:你说“做个好看好用的页面”,对方交上来的东西肯定和你预期差十万八千里。模糊的需求不可能得到精准的结果,你没说清楚的要求,AI只会按它最省事的逻辑默认处理。

2. AI的执行力拉满,但它完全不会「意会」,你得把规则拆到它不用动脑子就能判断

作者第二轮之后的操作,其实是把所有“感觉对”的模糊要求,全部拆成了不需要任何主观判断的硬校验项:

比如判断语音有没有转写合格,不能只查“有没有空白转写框”,要拆成三道必过的关卡:①没有空白/加载中的转写框、②语音气泡下面真的出现了文字、③语音区域没有转圈的处理动画,三项全中才算合格。

再比如判断两张截图是不是连续,不能靠“页面长得像”,必须找到两张图里共有的同一条消息、同一张图或者同一个时间戳当锚点,找不到就不算连续。

AI本质是个执行力拉满,但完全没有“人情世故”、不会猜你心思的超级员工,你只要能把你想要的效果拆成一条条可以打勾的检查项,它一秒钟就能把几万张图全量核对一遍,比10个实习生人工翻一下午的准确率还高。很多企业花几百万买了大模型最后用不起来,本质就是没做这步拆规则的工作,总想着让AI“自己看着办”,最后产出的东西根本没法落地。

3. 但凡涉及「真实性」的任务,半点儿都不能给AI留「自由发挥」的空间

作者第四轮踩的坑非常有警示意义:当时微信展开长语音转写的时候会自动跳帧,源视频里根本没有同时包含跳帧前内容和跳帧后内容的完整画面,AI本来想顺着聊天的语义逻辑,直接拼出一张看起来完全连续的“完美截图”,被作者直接卡死了规则:找不到真实衔接的画面就不许瞎凑,要么标缺口要么分段,绝对不能生成现实里不存在的内容。

这刚好戳中了大模型最危险的软肋:它天生就爱“补全逻辑”,也就是大家常说的幻觉。现在很多人用AI做财报整理、证据梳理、溯源类的工作,最容易踩的坑就是给AI授权“可以根据常识合理推断”,你但凡没把“所有内容必须100%来自原始素材,找不到就明说不许瞎编”写死,它分分钟给你造出来不存在的聊天记录、不存在的财报数据,等你拿着这些东西当证据、当对外发布的材料,出了问题根本没法溯源。

4. 根本不存在什么「万能神Prompt」,高效的AI工作流是小步迭代攒规则库

作者最后复盘的时候说,哪怕一开始就让AI先出方案,也不可能提前想到所有奇葩边界:比如录屏末尾会自动滚回之前的聊天内容、微信点长语音会无提示跳帧这些细节,你坐在办公室想破头都不可能提前预判到。

现在网上到处流传的“存下这100个神prompt,让AI给你打工”本质都是智商税,真正能落地的AI工作流根本不是一步到位写个完美指令,而是走「小步试错」的节奏:先拿10%的小样素材跑一遍,把所有踩过的坑全部沉淀成固定的校验规则(也就是作者说的43项回归测试),每遇到一个新坑就补进规则库,下次跑全量素材的时候就再也不会犯同样的错。

这个逻辑其实和所有产业落地AI的路径完全一致:没有什么一上来就能降本90%的AI黑科技,所有好用的AI工具,都是在一次次处理真实素材的过程中,把之前踩过的所有坑都堵上,慢慢迭代出来的。