核心内容总结
8月6日,两件AI圈大事撞车:谷歌DeepMind创始人因模型(Gemini)掉队卸任CEO;字节张一鸣拍板“大模型绝不蒸馏”。这个决定在行业引发分裂——有人说“沽名钓誉”,有人赞“正本清源”。文章围绕“蒸馏”的本质、字节决策的深层原因、行业争议、中国AI公司的多元路径展开,指出字节选择了一条“昂贵且难走”的路,但这种路径多样性恰恰是中国AI生态需要的。
详细拆解
1. 先搞懂:“蒸馏”到底是啥?为啥大家都爱用?
“蒸馏”不是化学实验,而是AI训练的一种方法,分两种:
- 自家蒸:用自己的大模型训小模型(比如用GPT-4训GPT-3.5),这是行业常规操作,没争议;
- 蒸别人:用别家模型的输出(比如ChatGPT的回答)训练自己的模型,这是争议焦点。
打个比方:蒸别人就像学生抄学霸的作业——快速提高“考试成绩”(模型榜单排名),但可能没真正学会“解题思路”(底层推理能力)。为啥大家爱用?因为见效快、省算力:比如DeepSeek用80万条R1模型的输出数据,就把小模型的数学成绩(AIME24基准)提到超过OpenAI的o1-preview,算力成本极低。
但现在麻烦来了:美国开始把“蒸别人”当制裁理由——白宫点名月之暗面“偷技术”,Anthropic指控多家中国公司用虚假账户爬取数据,甚至能通过IP和访问模式检测蒸馏行为。
2. 张一鸣“绝不蒸馏”:不是怕罚,是有自己的坚持?
很多人猜字节是怕TikTok被美国找茬,但文章给出了反证:连国内开源模型(如Kimi K3)也不让蒸——这些模型授权宽松、无风险,完全不会影响TikTok。那真实原因是什么?
- 技术洁癖:字节去年开源过不含“合成数据”(模型生成的数据)的模型,怕污染基座影响后续研究。就像做实验要干净的试管,才能准确找到问题;
- TikTok底色:虽然不是主因,但字节有全球最大的海外业务,不想被抓任何把柄(毕竟之前Project Seed疑似蒸GPT被OpenAI暂停账户);
- 个人技术判断:张一鸣卸任后深耕AI——旁听Seed团队评审、熬夜读论文、请新加坡教授“补课”。这是他补完课的第一个重大决策:宁愿短期落后,也要练“真功夫”。
3. 蒸馏是“捷径”还是“死路”?行业吵翻了天
正反方各有道理:
- 正方(支持蒸馏):有效!省资源!清华研究显示,蒸馏模型的性能显著高于基础模型;Anthropic自己也承认“蒸馏是合法的训练方法”;
- 反方(反对蒸馏):会封死上限!牛津大学研究发现,模型反复学自己/别人的输出,会出现“信息丢失”(比如传话游戏传多了变味),这叫“模型坍缩”;
- 中立观点:AI研究员Lambert说,蒸馏是“模仿”(学学霸的答案形状),强化学习是“探索”(自己试错找路径)。真正的强大能力来自探索——那条路径不会出现在别人的API里。但他也承认,用好合成数据(多元教师、混合真实数据)不会坍缩。
4. 中国AI公司:不止靠蒸馏,还有真功夫
文章用三个例子证明:蒸馏只是工具,不是中国AI的全部:
- 智谱GLM-5.3:没蒸馏、没加参数,靠“后训练”(强化学习、长上下文架构)提升能力,官方说“基座的智能上界远没开发完”;
- DeepSeek:用“自我对弈”练推理,没依赖外部输出,OpenAI首席研究官都承认他们独立发现了o1的核心理念;
- 阿里千问:被指控蒸馏,但同时是半个开源圈的“老师”——全世界很多小模型都用千问当底座,说明它的基础能力强。
结论:围绕蒸馏的争论,更多是对中国AI的污名化——蒸馏最多影响节奏,从未定义天花板。
5. 字节的赌注:走最难的路,赢了改写历史?
字节内部正在讨论训练超5万亿甚至10万亿参数的模型。这条路有多难?
- 短期代价:梁汝波公开承认“和海外领先模型差距拉大”;
- 长期价值:如果成功,字节会成为全球AI领域的重要玩家,甚至改写中国AI发展史;如果失败,会成为行业“昂贵的教训”。
但文章强调:这种路径多样性是好事——中国AI需要不同禀赋的公司走不同的路,张一鸣的选择值得尊重,不必推广成行业准则。
最后一句话
蒸馏不是立场测试题,是技术工具。字节选了最难的路,但这种“不随大流”的勇气,恰恰是AI创新需要的。无论结果如何,它都为中国AI生态添了一种可能性。