虎嗅

大模型为什么写不出好文章?

该文章尚未提供 Français 解读,以下为中文版内容。

核心内容总结

智谱通过“砍掉非核心功能、死磕编程能力”的极端策略,让GLM-5.2追平全球顶尖编程AI Claude Opus 4.8,带动股价一周暴涨85%;但与此同时,AI行业普遍出现“写作能力集体趋同、变得平庸”的问题。这并非技术上做不到“编程+写作双强”,而是商业逻辑驱动下,企业更愿意投入可量化、能直接变现的编程领域,加上后训练机制的偏差,挤压了写作能力的生存空间。

一、智谱的“减法策略”:用聚焦换股价飞跃

智谱的GLM-5.2做了个反常识选择——砍掉图片识别、视频理解等“花里胡哨”的功能,只留编程和长上下文两项核心能力。结果呢?它在全球最难的编程评测里追平了Anthropic的Claude Opus 4.8(公认最强编程AI之一)。消息一出,智谱港股一周涨了近85%。

这不是智谱第一次这么干:四个月前GLM-5追平Opus 4.5时,股价五天涨了128%,市值冲破3200亿港元。从2月到6月,智谱连发三个版本,每版都盯着“编程进步”打广告。马斯克预测中国编程模型明年一季度追上顶尖水平,智谱首席科学家唐杰直接回“用不了那么久”——可见编程能力是当前AI圈最硬的“硬通货”,市场愿意为它买单。

二、AI写作的“撞脸危机”:70多个模型像共用一个大脑

用过多个AI的人都有这种感受:同一个问题,ChatGPT、Claude、Gemini的回答像复制粘贴——语法对、逻辑通,但没辨识度。华盛顿大学的实验证实了这点:给70多个模型出开放式题目(讲故事、提创意等),近八成情况下,不同模型的回答观点、结构甚至表达方式都高度相似,遮掉名字根本分不清谁写的。

这种现象被一篇叫《人工蜂巢思维》的论文总结,还拿了机器学习顶会NeurIPS 2025最佳论文奖——相当于学术界盖章:不同公司的模型,好像共享了同一个“大脑”。就像你进十家餐厅,八家端上来的菜味道一模一样,毫无惊喜。

三、编程和写作本是“好搭档”,为何现实中“二选一”?

直觉上可能觉得“编程强了写作就弱”,但实验结果恰恰相反:

  • 阿里通义千问团队做实验:同样的模型架构,70%代码+20%文本+10%数学的配比,编程能力反而比全代码组更强——文本和数学帮模型更好地理解代码意图。
  • 加拿大Cohere实验:训练数据加代码后,模型的自然语言推理能力提升8%,文本质量提升7%——代码的结构化思维能帮模型写文章更有条理。

Claude Opus系列更是证明:一个模型可以同时擅长编程和写作。那问题出在哪?在后训练阶段

大模型训练分两步:预训练(读海量数据,学语言规律)和后训练(用强化学习调教成“好用的助手”)。写作能力在预训练阶段就积累好了,但后训练的“裁判模型”有个毛病——把“长”当“好”:标注员选回答时,更详细的往往更好,但裁判分不清“详细”和“凑字数”,于是奖励越长的回答。结果模型都开始“水字数”,好文章需要的简洁、精准反而拿不到高分。

更糟的是,后训练还要求模型“减少幻觉、保持中立、避免争议”——这些目标没错,但副作用是挤压了写作的“不确定性”:好文章的魅力在于出人意料的用词、转折,而模型被训练得“太安全”,所有回答都像从模板里刻出来的,自然趋同。

四、“可量化”的魔力:为什么编程比写作更受宠?

企业愿意死磕编程,核心是编程能力能被精准量化:比如SWE-bench评测,从开源项目里抽真实bug,让模型修复,自动判断对错——分数涨没涨一目了然。这个分数直接关联商业价值:开发者愿意用、企业愿意付费,收入涨了股价就涨。智谱四个版本的“编程进步”,每一次都带动股价跳涨,就是最好的证明。

而写作呢?没有客观的量化标准:同一篇文章,有人觉得好有人觉得一般,评测成本高还不稳定。没有明确的“分数”,就没有新闻稿、没有媒体报道,股价不会有反应。企业是逐利的,自然把资源堆到能变现的编程上,写作能力就在资源分配中被边缘化了。

Nathan Lambert(AI训练领域专家)说过一句扎心的话:“没有任何模型提供商准备好为了更好的写作而牺牲编程能力——钱不在写作这里。”

五、AI其实能写好文章,只是没人愿意花力气

模型不是天生写不好文章。2026年初的一篇论文做了个实验:把风格鲜明的作家(比如鲁迅、张爱玲)的全部作品喂给模型,定向训练它模仿作家的节奏、用词。然后请28位文学专家盲审:训练前,82.7%的专家更喜欢人类写的;训练后,62%的专家转而更喜欢AI写的。

这说明模型有能力写好文章,但商业驱动下没人愿意投入——毕竟编程分数涨了能直接换股价,而写作再好也带不来真金白银。就像GLM-5.2在预训练阶段也读过《红楼梦》,但智谱还是砍掉了所有非编程功能,因为市场只在乎它能不能写好代码,没人关心它会不会模仿黛玉葬花的文笔。

最后一句话总结

AI行业现在的状态是:能被量化的能力(编程)被拼命堆高,不能被量化的能力(写作)被慢慢遗忘。这不是技术的局限,而是商业选择的结果——毕竟,股价不会为“好文笔”买单。但长远来看,当所有模型都在编程赛道卷到极致时,或许“有风格的写作”会成为下一个差异化竞争点?谁知道呢。

但至少现在,钱在哪,资源就在哪。智谱的股价已经给出了答案。