虎嗅

GPT-5.6正式发布:AI开始上班,办公室却没有“测试用例”

核心内容总结

OpenAI发布GPT-5.6和ChatGPT Work,把AI从“回答问题”推向“直接交付工作成果”(比如生成文档、PPT、原型),但这背后藏着大问题:AI在代码世界有成熟的纠错机制(报错、测试、回滚),但办公室工作缺乏这种验证体系——AI会“积极补全”未确认的信息,让成果看起来完美却藏着隐性错误,反而增加人的审核返工成本。要让AI真正提效,企业和个人得先建立清晰的工作标准(类似代码的“测试用例”),而不是只依赖“一键生成”的工具。

1. AI从“聊天答题”到“直接干活”——惊喜背后是返工的坑

这次OpenAI的更新不是简单升级模型,而是把AI变成了“全能打工人”:Chat负责聊天搜索,Work能做文档/PPT/网页,Codex管代码和本地文件,三者整合在一个应用里。听起来很美好,但作者的亲身经历打了脸:她让AI生成项目原型,10分钟就出了“完整版本”,结果评审时研发问的细节(按钮给谁用?规则从哪来?),很多是AI自己补的未确认内容,最后花了更多时间核对、删改、解释。AI把“自己做”的时间转移成了“审核AI”的时间,看似快,实则没省事儿。

2. 代码世界有“纠错神器”,办公室却没有——AI在办公室容易“瞎补”

为什么AI在写代码时很少出大问题?因为代码有硬标准:写错了编译不过,功能不对测试失败,改了啥有记录(Diff),出问题能回滚到之前版本。但办公室文档不一样:PRD里AI猜的规则不会标红,PPT错了照样播放,报告引用假数据也能排版得很专业。更麻烦的是,很多工作好坏没有明确标准(比如方案好不好要看领导偏好、历史经验),AI只能“猜”出最像答案的结果,错误难发现。

3. AI把模糊“精装修”了——看起来完美,实则藏雷

AI的一个“坏习惯”是:明明没弄明白,也不会说“我不知道”,而是根据现有信息补全缺失部分。比如一份模糊的需求,过去大家都知道没定,但AI能几分钟内做出完整的页面、流程,让你误以为需求已经落地。模糊没有消失,只是被包装成了“成品”——过去AI胡说八道你能看出来,现在它把胡说八道做成PPT,你可能直到评审才发现全是坑。

4. 办公室需要“测试用例”——不是学编程,是明确“什么算做好”

这里的“测试用例”不是写代码,而是给AI定清楚:这项工作到底怎样才算完成?比如做经营分析,要说明数据来源、统计时间、结论能不能追溯;做产品需求,要明确哪些内容已确认、哪些不能脑补、本期不做什么;做营销内容,要列清楚必须核对的事实、不能用的表达、谁来审批。这些标准能让错误早暴露,避免最后才发现方向错了。OpenAI在ChatGPT Work里强调“参考文件、进度跟踪、审批”,也是这个道理——AI会执行,但不知道“做对”的标准。

5. 企业缺的不是AI工具,是能让AI照着干的清晰规则

国内厂商肯定会很快跟进ChatGPT Work的功能,但光有工具没用。很多企业文档一大堆,却存在“十份制度三份失效、同一个指标不同部门口径不一、文件名都叫‘最终版’却没人知道哪份真的最终”的问题。把这些混乱的资料给AI,只会变成“混乱复制机”。企业真正要补的是:权威数据源、知识版本、业务规则、异常流程、责任人——这些才是AI能真正干活的基础,比发布新模型更重要。

最后想说

AI变强了,能做更多事,但不代表你能少干活。如果工作标准模糊、规则混乱,AI生成的东西越多,你审核的负担越重。办公室要先补上“测试用例”(清晰标准),AI才能真正帮你提效,而不是帮倒忙。对个人来说,未来最值钱的不是AI提示词,而是你对工作的判断标准——知道什么是好、什么不能碰、怎么验证,这才是AI时代的核心竞争力。