核心内容总结
这篇文章反驳了“LLM是高端制造业”“AI终点是电力”等简化认知,指出LLM竞赛的本质是数学/应用数学与工程化直觉的比拼。中国的DeepSeek和Kimi团队通过原创技术(如MLA压缩、KDA长程推理)打破了“中国只能工程化不能原创”的旧叙事,改写了全球资产定价逻辑;同时强调LLM目前缺乏严格数学基础,存在诸多未解决的理论问题,未来竞赛后半程需更重视数学人才和直觉的价值,否则可能陷入“蒙眼狂奔”的风险。
一、为什么LLM不是“高端制造业”?
制造业的核心是“堆资源+流程化”——比如马斯克有足够的人、芯片、供应链,但他的Grok模型表现平平,还得把十万张芯片租给Anthropic。LLM却不一样:它不是靠买更多卡、调整组织架构就能做好的,关键在于对底层数学本质的洞察。
举个例子:DeepSeek团队发现KV Cache(模型处理上下文时存储的关键信息)看似是高维复杂数据,但其实藏着低维的潜在结构——就像一堆看似杂乱的点,其实都落在同一个平面上。这种洞察不是优化工程师“想办法压缩”的思维,而是物理数学里“识别复杂系统简化模式”的直觉,这是制造业流水线式工作无法替代的。
二、中国团队的原创突破,到底改写了什么?
之前市场普遍认为“中国AI只能做工程化,不能原创”,但DeepSeek和Kimi的技术打破了这个偏见:
- DeepSeek的MLA技术:用数学方法把KV Cache做低秩分解,直接把模型成本骤降,还开源了框架——没有它,智谱等国内模型可能还困在公版开源框架里,墙内自娱自乐。
- Kimi的KDA技术:重新设计注意力核函数,解决了长文本推理时的误差积累问题(比如读几十页文档不“忘事”)。
这些突破不仅让国内LLM追上前沿,还打破了OpenAI和Anthropic的垄断——以前他们能随意涨价,现在LLM百花齐放,连“高端制造业”这种错误叙事都冒出来了。更重要的是,这改写了资产定价:之前市场觉得中国AI被锁死在旧时代,现在因为这些原创技术,中国资产的叙事变了(比如中科院官网都报道了DeepSeek的成果)。
三、“直觉”对LLM有多重要?
这里的“直觉”不是瞎猜,而是在复杂系统中看到本质的能力——比如:
- 标准注意力机制里的KV Cache是高维矩阵,懂线性代数的研究生都知道低秩分解,但只有梁文锋团队意识到“KV Cache在序列维度上本来就有低维结构”(不是“可以压缩”,而是“天生就简单”)。
- 长程推理不是加功能组件(比如让模型多记几页),而是数学骨架的重构:要让注意力机制抑制误差积累,残差连接保持梯度语义——这得靠对“自回归误差指数衰减”的数学直觉。
这种直觉不是训练出来的,是“天赋怪”才有的。比如信息几何学之父甘利俊一,独立提出自然梯度下降;福岛邦彦发明CNN前身——他们的种子在日本发芽,却在美国、中国结果。DeepSeek和Kimi里的这些人,能安静推公式、敢大胆试错,这种“偶然”甚至被作者称为“国运”。
四、LLM的数学短板,藏着哪些“雷”?
现在的LLM就像香农之前的通信行业:工程师能造出电话,但没人知道信息的本质。LLM的很多关键问题都没有严格数学证明:
- Scaling Law(参数越大模型越好)为什么是双幂律?万亿参数后还成立吗?不知道,先训了再说。
- GRPO算法(DeepSeek用的训练方法)为什么能收敛?团队只说“试了没崩”,但后来有人发现它有无法消除的偏差项。
- 幻觉问题:模型胡编乱造,本质是概率分布在高维空间“乱逛”,跑出了正确范围——这是因为没有数学框架让模型在“答对”和“说不知道”之间做最优决策。
这些问题不是小毛病:如果Scaling Law到顶(参数再大模型也不进步),或者压缩-预测token只是“拟合游戏”,那么所有基于“AGI终将到来”的估值都会崩塌,市场可能股债双杀——这正是最近市场波动的核心原因。
五、未来LLM竞赛的关键:补“数学课”
文章说,LLM竞赛后半程,数学会更重要。现在的LLM连“风洞实验”都没有:飞机设计师知道马赫数多少会抖振,但LLM不知道多少参数会触发幻觉,多长上下文会让语义漂移。要解决这些问题,得:
1. 招数学怪才:精通非凸优化、矩阵计算、微分方程的人,让他们推公式,找LLM的“无量纲数”(比如飞机的雷诺数)。
2. 等“香农时刻”:就像香农用一页公式定义信息,未来需要有人用简洁公式告诉我们:LLM的压缩极限是多少?推理一致性的下界在哪里?自回归误差能不能被对冲?
只有这样,LLM才能从“概率生成器”变成真正可信的工具——否则,MaaS(模型即服务)的高毛利叙事都是空中楼阁,谁会为“胡编乱造”付长期钱?
最后:给年轻人的建议
作者呼吁有天赋、有直觉的年轻人去学数学和物理——也许未来有人能写出LLM的“香农定理”,用公式定义等效智能的边界,那才是真正的“创世纪”时刻,是钱买不到的突破。
这篇文章的核心逻辑是:LLM不是“堆资源”的游戏,而是“找本质”的竞赛——数学和直觉才是决定胜负的关键,中国团队已经在这方面迈出了关键一步,但还有很长的路要走。