虎嗅

腾讯终于上桌了?

该文章尚未提供 日本語 解读,以下为中文版内容。

核心内容总结

腾讯混元Hy3正式版是姚顺雨主导腾讯AI架构重建后推出的首款正式大模型,定位“高性价比生产力工具”,以21B激活参数实现对标2-5倍参数模型的效果,同时接入腾讯数十款产品。但深入分析发现:它并非底层架构创新,而是工程调优的结果;能力上“偏科”明显(长板在办公场景的信息检索/单工具执行,短板在复杂推理/硬核代码/多工具协作);腾讯的场景生态优势(如微信)尚未与混元形成合力;姚顺雨的实用主义路线虽快速补短板,但面临市场竞争和内部协同的双重挑战,腾讯AI要真正领跑下半场仍需突破。

一、“小身板对标大模型”:是创新突破还是工程调优?

Hy3最吸引人的点是“用小参数干大事”——总参数295B(激活仅21B),却能对标更大参数的模型。但这不是底层技术的革命,而是稀疏模型路线下的工程优化

  • 它用的是MoE(混合专家)架构,就像公司里有295个“专家”,每次处理问题只叫8个最相关的(激活21B),既省资源又高效。但总参数规模(295B)比行业第一梯队的万亿级模型小很多,能力上限被锁死。
  • 正式版和之前的预览版架构没变化,提升全靠“喂更好的数据、加更多算力调优”,属于“补短板”而非“跨代升级”。
  • 上下文窗口选256K(不是行业流行的1M+),虽适合日常办公,但放弃了超长文档/源码库等企业刚需场景,是实用主义的选择,但也缩小了应用范围。

二、偏科明显:长板在办公,短板卡核心竞争点

Hy3的能力像“偏科生”——某些细分领域很强,但关键赛道落后:

  • 长板突出:在信息检索(比如网页搜索、长文档整理)和单工具执行(比如简单办公任务、单一工具调用)上接近国际顶流。比如搜索智能体得分和GPT-5.5几乎持平,单工具调用能力排行业第二,刚好匹配白领高频需求(内部盲测办公场景评分超过GLM 5.1)。
  • 短板致命:在决定大模型上限的核心领域差距大:
  • 硬核代码:复杂任务(如仓库重构、Debug)得分远低于Claude和GLM,只能应付前端生成、简单脚本;
  • 数学推理:数学竞赛题得分不到GPT-5.5的一半;
  • 多工具协作:跨系统调度能力在主流模型中排最后,无法处理复杂工作流(比如同时调用多个工具完成项目)。

三、生态串联难:微信不用、场景优势没转化

腾讯的最大底牌是微信(14亿月活)、小程序等场景生态,但Hy3还没把这些变成优势:

  • 内部协同有壁垒:微信的AI助手“小微”主要用自研的WeLM,而非混元。原因是微信数据涉及隐私(腾讯不敢随便用来训练混元),且微信有独立的AI团队和技术路线,混元不是内部统一底座。
  • 垂直场景落地浅:金融(腾讯自选股)、游戏(WeGame)等赛道只是点状升级(比如行情解读、游戏问答),没触及核心环节(如金融建模、游戏玩法生成),没形成场景壁垒。

四、实用主义的双刃剑:性价比能撑得起腾讯AI野心吗?

姚顺雨的策略是“不追大参数、不卷超长上下文,主打性价比”(比如API定价1元/百万Token,开源权重),这带来了短期优势,但长期风险不小:

  • 性价比市场越来越卷:DeepSeek、智谱等都推出了高性价比模型,Hy3的价格优势可能很快被稀释;
  • 顶级模型挤压空间:GPT、Claude持续降价,企业用户会更倾向“一步到位”选能力更强的顶级模型,性价比路线只能占细分市场,难成主流;
  • 内部协同成本高:为推动跨部门合作,姚顺雨甚至派骨干支援业务团队,说明大厂内部对齐目标、流通数据的阻力大,这会拖慢混元迭代速度。

结语

Hy3让腾讯终于有了一款“拿得出手”的大模型,补上了过去的短板,但要托起腾讯AI下半场,还需解决三个核心问题:如何把微信等场景生态真正转化为模型优势?如何补上复杂推理、多工具协作的短板?如何在性价比路线之外,找到支撑战略野心的长期竞争力?AI是长跑,腾讯刚上桌,还没到亮底牌的时候。