第一财经

重磅|对话强化学习之父萨顿:关于AI下一步突破方向,他说了这些干货

该文章尚未提供 العربية 解读,以下为中文版内容。

核心内容总结

2026世界人工智能大会(WAIC)上,“强化学习之父”、2024图灵奖得主理查德·萨顿分享了他的创业逻辑、AI技术未来方向(从依赖人类数据转向“经验学习”)、具身智能的实践(机器人幼儿园项目),以及对年轻人的成长建议。他强调营利与非营利机构互补支撑科研,AI需回归“从经验中学习”的本质,机器人要像婴儿一样试错成长,年轻人要坚持独立思考。

一、创业逻辑:营利与非营利的“双轮驱动”

萨顿创办营利性公司Oak Lab,不是为了单纯赚钱,而是和他的非营利机构Openmind“互补干活”:

  • 非营利的作用:Openmind负责开源知识、传播智能原理,让更多人用得上AI,还能降低技术被滥用的风险(比如不让少数人垄断核心技术)。
  • 营利的价值:前沿AI研究需要烧钱(比如买算力、雇团队),营利公司可以通过短期专利变现,反哺科研。虽然技术最终会开源,但短期保护能让创新持续下去。

简单说,非营利管“普惠和安全”,营利管“钱袋子和持续研发”,两者缺一不可。

二、AI技术的“大转向”:告别人类数据,拥抱“经验学习”

现在的大语言模型(比如ChatGPT)靠“喂”大量人类数据(文章、视频、对话)训练,但萨顿认为这是“走偏了”:

  • 问题在哪? 传统模型太费电(比如训练一次要花几百万度电),而人类大脑仅用60瓦就能处理复杂任务。原因是现有计算机用“冯·诺依曼架构”,数据在存储和处理器之间来回跑,像你每次算题都要从抽屉拿书再放回去,浪费能量。
  • 未来方向:学大脑的“并行架构”——让数据待在原地,不用来回传输,这样效率能提升N倍。更重要的是,AI要像AlphaGo那样“从经验中学习”:不是靠别人给的数据,而是自己在场景里试错(比如机器人自己学走路,摔几次就会了),哪怕样本很少也能快速调整。

萨顿说,过去8年行业沉迷“人类数据红利”,现在该回到“经验学习”的正途了,未来10年这会成主流。

三、具身智能的突破:让机器人像婴儿一样“试错成长”

萨顿参与的“机器人幼儿园”项目,解决了传统机器人的大痛点:

  • 传统机器人的问题:只能按指令做事,一试错就坏(比如摔倒就报废),没法像婴儿那样摸爬滚打学技能。
  • 项目怎么做? 打造能“抗造”的机器人,让它们在专门空间里试错几个月(像婴儿学走路、抓玩具),通过强化学习积累底层技能。比如机器人自己尝试抓杯子,掉了就调整姿势,直到学会。
  • 未来价值:等机器人能像人一样掌握基础技能,就能去照顾老人(帮拿东西、陪聊天)、当老师(辅导孩子),填补劳动力缺口(比如未来人口老龄化,缺护工)。

四、给年轻人的建议:独立思考比“追热点”更重要

萨顿对两类年轻人的建议很实在:

1. AI研究者:别盲从权威,用“第一性原理”思考(比如问“AI的本质是什么”,而不是跟着别人做大模型),每天写一页笔记梳理思路,坚持一年就能看到效果。

2. 普通年轻人:区分“计算”和“智能”——计算是工具(比如用电脑办公),但通用智能(像人一样思考)是颠覆。未来14年左右可能出现通用智能,所以要构建自己的“认知壁垒”(比如深耕一个领域,能独立拆解问题),别被AI淘汰。

他强调:“科学界没有绝对权威,你要对自己的思考负责,用事实验证观点,而不是听别人说什么。”

五、未来十年AI趋势:“经验时代”要来了

萨顿预测,未来10年“经验学习”会成为AI行业的核心方向:

  • 资本已经在追这个赛道(比如杨立昆的公司也在做),他自己的Oak Lab融资进展顺利。
  • 8年后,“经验学习”的地位会像现在的大语言模型一样重要——那时的AI不再靠人类数据“喂饭”,而是能自己在现实中学习、成长,变得更智能、更高效。

总的来说,萨顿的核心观点是:AI要回归“智能的本质”——从经验中学习,而不是依赖人类数据;同时,科研需要营利和非营利结合,才能走得更远。对年轻人来说,独立思考和深耕自己的领域,是应对AI变革的最好方式。