虎嗅

为什么今天造大模型的人,一半在学物理

该文章尚未提供 Deutsch 解读,以下为中文版内容。

核心内容总结

这篇文章探讨了AI领域从奠基者(如诺奖得主Hopfield、Hinton)到前沿团队成员(如Anthropic的Dario Amodei、xAI的庄君堂),很多关键人物都是物理出身的现象。文章指出:这不是巧合,也不是物理人更聪明,而是物理训练培养的“做事品味”(偏好第一性原理、最小模型、理论与实验校准),刚好适配AI当前的发展阶段——AI介于纯理论(数学)和纯工程之间,像物理一样需要“用有效理论指导实验、再用实验修正理论”。同时,物理出身的人往往没有AI领域的师承成见,这种“局外人自由”让他们更敢提根本问题,助力基础突破。

详细拆解解读

1. 不是智力碾压,是“做事品味”踩对了时代

文章明确说:“物理出身更强”是误区——深度学习半壁江山(如LeCun、Transformer作者)都不是物理背景。真正的原因是物理训练给了一套特定的“品味”:

  • 第一性原理:从最根本的规律出发,不依赖现成经验(比如不用“别人都这么做”来决定方向);
  • 最小模型:用最简单的模型抓住核心本质(比如用一个公式概括复杂现象);
  • 相信涌现:认为大量简单单元(如神经元)相互作用,会突然出现单个单元没有的复杂行为(比如大模型的语言理解能力)。

这套品味正好和现在AI的玩法对上:AI既不是纯证明定理的数学,也不是纯拼技术的工程,需要“抓本质+实验验证”的思路。

2. AI现在的“位置”,就是物理人的“主场”

文章把学科比作一条光谱:

  • 纯数学端:靠证明定理(比如“这个公式一定对”);
  • 纯工程端:靠造东西跑赢测试(比如“这个模型能比别人快10%”);
  • 物理在中间:用理论预测实验,再用实验修正理论(比如先猜“苹果落地是引力”,再用望远镜看行星轨道验证)。

现在的AI正好在中间:比如大模型有“Scaling Laws”(规模规律)这样的理论直觉,但最终要靠跑数据、测loss(误差)来验证。物理人干了几百年这种“理论+实验”的事,自然轻车熟路。

3. 物理思维在AI里的“具体操作”

文章举了多个例子,把抽象的“品味”变成看得见的做法:

  • 统计力学→神经网络:两者都研究“大量简单单元涌现复杂行为”——磁体里的自旋、神经网络里的神经元,Hopfield网络、玻尔兹曼机的名字和数学都直接从物理搬来;生成图像的扩散模型,也是从热力学里借的“先打乱再逆转”思路。
  • 对称性→等变网络:物理相信“底层有守恒规律”(比如能量守恒),AI里有人把这个做成“等变网络”——不管图片怎么旋转平移,模型都能认出它(比如旋转后的猫还是猫)。
  • 把模型当“自然对象”:就像科学家研究新星球一样,AI里有人测量模型的行为(比如“模型为什么会犯这个错?”),给它建理论——这就是“神经网络的实验物理学”。
  • 何恺明的细节:他想做物理逻辑的世界模型,找不到合适的人,直到遇到物理背景的合作者——因为共享一套“语言”(比如懂物理仿真),才快速合流,说明这种跨学科思维很稀缺。

4. Scaling Laws:AI里最像物理的“经验规律”

Scaling Laws是AI里的关键发现:模型的误差(loss)会随参数、数据、算力按“幂律”下降(比如参数翻倍,误差降多少)。这个规律不是数学证明出来的,而是通过大量实验拟合出来的——就像开普勒从第谷的天文数据里找出行星轨道规律一样,典型的物理玩法。

文章还打了个比方:这就像18世纪的热力学——能用能预测(比如知道烧多少煤能让火车跑多远),但微观机制(分子运动)还没完全搞懂。AI行业底层就靠这些“知其然不知其所以然”的经验规律,很物理。

5. 物理出身的“自由”:没有门派束缚,敢问根本问题

物理跨到AI的人,往往没有AI领域的师承和门派成见:不用维护“我是某某大佬的学生”的身份,不用遵守“大家都这么做”的潜规则。这种“局外人自由”让他们敢:

  • 提“幼稚但根本”的问题(比如“大模型为什么能理解语言?”);
  • 对流行做法开炮(比如姚顺宇说“我想喷谁喷谁”);
  • 捡起被冷落的方向(比如Hopfield当年在符号主义当道时,从物理角度重新研究神经网络)。

真正的基础突破,往往来自这种打破常规的自由。

最后一句话总结

物理不是AI的“万能钥匙”,但它培养的“抓本质+实验校准”的品味,以及“局外人自由”,刚好适配AI当前的发展阶段——这就是物理人在AI里发光的核心原因。而未来的突破,会属于能在数学、物理、工程之间自由切换的人。