第一财经

不卷万亿参数,智谱GLM-5.3侧重编程能力与网络安全

核心内容总结

智谱AI发布的GLM-5.3大模型,没有跟风“堆参数”(仍保持7530亿参数),而是通过“后训练Scaling”(更长训练时间、更多任务场景、更大规模强化学习)挖掘现有基座潜力,能力大幅提升;在终端任务、软件工程、职业知识、编程、网络安全等评测中表现突出(尤其安全能力超过部分国际前沿模型);恰逢大模型行业定价“冰火两重天”——海外巨头降价应对国产冲击,国产模型则从“性价比换市场”转向涨价变现;GLM-5.3的未来取决于后训练红利是否持续、开源后的安全管控能否落地、以及能否靠编程和安全能力建立开发者生态优势。

一、升级逻辑:不追“万亿参数竞赛”,而是“给现有发动机精细调校”

之前大模型行业流行“比参数大小”,比如Kimi K3搞出2.8万亿参数引爆行业。但GLM-5.3反其道而行:基座参数和上一代一样,能力提升全靠“后训练”——相当于给同一台汽车发动机,通过更长时间的磨合测试、在更复杂的路况(任务场景)下练习、用更智能的方式优化驾驶习惯(强化学习),让它跑得更快更稳。智谱称这种方法为“后训练Scaling”,还说现有基座的潜力远没挖完,不用急着重做新基座。

二、能力亮点:安全和编程成“撒手锏”

GLM-5.3在多个关键评测中表现亮眼:

  • 真实任务完成能力:Terminal-Bench得分从4.6跳至28.3(数值越高越好)——意味着处理日常工作任务(比如写报告、做表格)的能力大幅提升;
  • 编程能力:在高难度编程测试中,准确率超过了Anthropic的Claude Opus 4.8,而且输出的代码更简洁(每任务平均5万token,不到Opus的一半);
  • 职业知识覆盖:GDPval-AA得分1769,超过Kimi K3的1682——能应对44种职业的知识工作(比如医生写病历、工程师查技术文档);
  • 安全能力(最大亮点):在国际漏洞推理测试中,超过GPT和Anthropic的模型;深度漏洞利用测试得分翻倍,接近国际最前沿。更实在的是,智谱联合十多家安全团队,在真实代码库中找出2436个漏洞(其中1097个中高危),覆盖安卓、Windows等系统,还提交给国家漏洞库修复——这意味着模型不容易被黑客利用,更可靠。

三、定价反差:海外降价抢市场,国产涨价求变现

最近大模型定价出现“两极分化”:

  • 海外巨头集体降价:OpenAI把GPT-5.6 Luna的API价格砍了80%(每百万token从1美元变0.2美元),谷歌、Anthropic也跟着降——核心是怕国产模型(比如Kimi K3、DeepSeek V4)抢用户;
  • 国产模型纷纷涨价:DeepSeek V4-Pro高峰时段价格涨了4.5倍(从6元到27元/百万token),Kimi K3涨了2-3倍(到100元),智谱之前也提过价。原因是国产模型不再靠“白菜价”换市场,开始要赚钱(价值变现);

GLM-5.3暂时没说涨价,如果沿用之前的价格(输入8元、输出28元/百万token),和DeepSeek V4-Pro差不多,卡在“海外降、国产涨”的关键节点。

四、未来挑战:三个“坎”决定能否走通这条路

GLM-5.3的“不堆参数、挖后训练”路径能不能持续,要看三个问题:

1. 后训练红利还能吃多久? 现在靠后训练提升很快,但总有挖完的时候,之后还能怎么提升?

2. 开源后的安全管控能不能扛住? 智谱可能会开源模型,但开源后更多人用,安全漏洞风险更大,能不能管好?

3. 能不能建立开发者生态优势? 海外降价、国产涨价的情况下,GLM-5.3要靠编程和安全能力吸引开发者——如果开发者觉得它不可替代(比如做安全相关应用只能用它),才能站稳脚跟。

总的来说,GLM-5.3给大模型行业提供了一条“不拼参数拼内功”的新路径,但能不能走通,还要看后续的技术、安全和商业落地。对普通用户来说,未来可能用到更可靠、更智能的国产模型,但价格可能不会像以前那么便宜了。