虎嗅

RSI:当AI学会自我进化,强者真的会愈强吗?

核心内容总结

2026年,硅谷最激烈的技术竞赛围绕RSI(递归自进化)展开——简单说就是让AI自己找问题、优化自己,形成“发现→改进→更强→再发现”的循环加速。OpenAI、Anthropic等巨头和学术界都在押注,争议焦点是“巨头会靠算力通吃,还是后来者能靠突破逆袭”,同时安全和组织效率也成了关键变量。这场竞赛不仅关乎AI行业格局,更触及“人类是否会交出进化主导权”的深层问题。

一、RSI是什么?为什么2026年突然火了?

RSI的核心是“AI自己改进自己的闭环”:AI发现自身模型的弱点→优化→变得更强→更强的AI能发现更深的问题→再优化……这个循环不断加速。

它现在火不是偶然,两个条件成熟了:

1. AI会“干活”了:比如编程智能体能自己写代码、跑实验、看结果;

2. AI懂“自己”了:能像研究员一样分析自己的模型弱点。

更关键的是反馈周期被压缩到分钟级:以前人类做实验,从想法到结果要几天甚至几周(导师→学生→实验→反馈);现在AI几分钟就能完成“想→写代码→跑实验→出结果”,循环转得飞快,就像以前骑自行车爬坡,现在换成了电动车加速。

各大玩家都在行动:OpenAI定了时间表(2026年做AI研究实习生),Anthropic的Claude已经独立完成800小时AI安全研究(比人类效率高4倍),ICLR顶会还专门开了RSI专场——这说明RSI已经从“小众方向”变成行业共识。

二、RSI和10年前的AutoML有啥不一样?

很多人会问:10年前Google的AutoML不也是“AI优化AI”吗?区别大了:

  • 以前的AI是“圈养”:人类先画好一个小圈子(比如规定搜索范围),AI只能在圈子里找最优解,像被关在笼子里的鸟;
  • 现在的AI是“半野生”:大模型能自己理解AI架构和问题,不用人类画圈,搜索范围变大且智能,比如能自己找到优化模型的新方向。

简单说,以前是人主导细节,AI打杂;现在AI能帮人“想方向”,人只需要做更高层的判断——参与层级变了。

三、核心争议:巨头通吃还是后来者有机会?

这是最刺激的部分,分两派:

  • “堆就能赢”派:认为谁算力强、Coding能力好,谁先转起RSI飞轮,加速度会越来越大,把别人甩得永远追不上(比如OpenAI、Anthropic这类巨头);
  • “突破不可预测”派:认为智能提升不是平滑曲线,而是“快速增长→平台期→再突破”的台阶式。平台期的突破靠的是新原理(比如牛顿发现万有引力),不是堆算力。这意味着小团队如果先撞上新原理,也能逆袭。

行业里的分歧其实是“信仰之争”:一派信“缩放定律”(算力越大越牛),另一派信“突破靠灵感”。Anthropic的联合创始人甚至把2028年底设为“证伪点”——如果到时候还没实现完全自动化RSI,说明有根本约束。

四、RSI现在进展如何?最缺什么?

目前RSI还在“初级阶段”:

  • 已实现的:在“能打分、反馈快”的任务上(比如优化算法、提效提速),AI已经很厉害。比如Anthropic的Claude写了公司80%的代码,工程师效率是2024年的8倍;清华的OpenRSI模型在小算力下能逼近GPT-5.6的水平。
  • 最缺的是“品味”:就是人类研究员的“方向感”——比如从少量样本里找规律、抽象问题的能力。大模型靠海量数据吃饭,但科学突破往往是“无数据”的(比如解释AI的“顿悟”现象),这是AI的软肋。

RSI不是“要么0要么100”,而是有台阶:第一级是提效(已实现),第二级是挖深层规律(正在努力),终极目标是让AI像爱因斯坦那样靠少量样本搞突破(还远)。

五、被低估的两个变量:安全和组织

  • 安全:没那么容易失控

外行担心AI自我进化后失控,但从业者觉得离那一天还远——现在训练AI像“训练狗”,用奖惩机制约束,AI很难有自我意识。Anthropic甚至公开说“如果能全球协同放慢发展换应对时间,是好事”,但难点是怎么监督(训练比导弹发射井隐蔽多了)。

  • 组织:大厂未必跑得过小团队

RSI需要快反馈,大厂层级多(导师→学生→管理者),信息传递慢,容易掉回“以天为周期”的低速循环。而小团队(比如核心团队保持在150人以内,符合“邓巴数”)沟通直接,效率更高。所以组织灵活度可能和算力一样重要。

最后:你该相信哪种未来?

RSI的诱惑是“强者愈强”,但也存在“突破改写格局”的可能。这场竞赛最迷人的地方就是不确定性:你可以相信巨头通吃,也可以相信小团队逆袭。但无论哪种,RSI都是AI发展的必经之路——当AI能自己优化自己,进化的主导权会不会从人类手里滑落?这个问题没有答案,但值得我们认真盯着。