虎嗅

Anthropic研究员因担心AGI失控而辞职:或十年内致人类灭绝

一、核心内容总结

这是一个分量极重的行业信号:在AI两大顶流公司OpenAI、Anthropic都做过3年核心预训练研究的资深研究员Jacob,最近从全行业公认“最重视AI安全”的Anthropic辞职,直接退出整个AI行业。他作为最懂前沿AI研发的内部人公开喊话:现在头部AI公司在竞争压力下根本顾不上风险管控,照当前的研发速度,最快明年年底AI就可能进入“自己研发自己、越变越强人类拦不住”的失控状态;而目前全行业既没有政府强制监管,又被高估值的商业利益绑死,连最有安全意识的公司都没法独善其身,他站出来呼吁全球监管和行业协调,给AI研发强制踩刹车。

---

二、详细维度解读

1. 【这不是外行蹭热度的末日谣言:发言者的身份分量重到离谱】

很多人看到“AI要毁灭人类”第一反应又是网红博眼球,这次真的不一样。Jacob是实打实扎在AI最核心的研发岗干了3年,而且待的是全行业最顶尖的两家公司:OpenAI和Anthropic。更关键的是,他当年从OpenAI跳去Anthropic,就是冲着Anthropic全行业“最重视AI安全”的招牌去的——等于他本来就是来做AI安全的“自己人”。

之前已经有好几个头部实验室的核心安全岗员工离职吐槽,但之前大家都是从“不够安全的公司”跳去“更安全的公司”,这次Jacob是在公认最重视安全的Anthropic干到绝望,直接整个行业都不待了,相当于你本来是去消防大队当消防员,结果干了几年发现消防大队自己都在偷偷放火,这个信号的可信度比外面任何评论家说的都高。

2. 【他说的“明年AI就失控”,到底怕的是什么事?】

很多人以为他怕的是AI变聪明了跟电影里一样拿枪打人类,根本不是,他怕的是一个叫“递归自我改进”的循环跑通了。大白话讲就是:以前所有AI的升级,都是人类工程师熬夜写代码、调参数、喂数据,一点点把AI改得更强。但现在AI已经能帮人类干很多AI研发的活了,比如写AI代码、测AI性能。

要是哪天AI能力强到,自己就能独立研发出比自己还聪明的下一代AI,那这个循环一旦启动就完了:新的更强的AI,转头就能搞出比自己还强2倍的AI,这个加速的速度是指数级的,可能人类还没反应过来,AI的智力就已经甩人类十万八千里了,到时候它想干啥人类根本拦不住。Jacob算下来现在各家都在往这个终点冲,照现在的速度,最快明年年底就摸到这个临界点了。

3. 【两家顶流公司的“不负责任”,本质都是被竞赛架住下不来】

Jacob把两家公司的状态看得特别透:OpenAI那边大部分人根本没意识到AI失控是能毁灭全人类级别的风险,满脑子想的是赶紧出新功能赚流量赚营收,把安全扔到一边;而Anthropic更拧巴:从上到下所有人都清楚AI的风险有多大,但所有人都被卷进了一个“囚徒困境”——我要是主动减速搞安全,竞争对手就会先把更强的AI搞出来,到时候钱、市场、话语权全是别人的,最后反而可能是不重视安全的团队先搞出危险AI,那还不如我自己赶紧跑快点,至少我还懂安全。

等于两家公司都在一个没人敢停的跑步机上,你减速就会被甩下去摔死,哪怕你明知道往前跑最后可能掉悬崖,也不敢停。而且现在还有其他国家的AI团队在后面追,这个赛跑的压力就更大了。

4. 【现在造超级AI的离谱程度,比当年造核弹还疯10倍】

Jacob把现在的AI研发比作“放在工程师MacBook上的曼哈顿计划”,这个比喻特别准。当年美国造原子弹的曼哈顿计划,那是举全国之力,把几千个科学家关在新墨西哥的沙漠地堡里,军队24小时把守,每一步研发都要政府高层审批,全世界盯着,就怕这个能灭全人类的东西乱搞。

结果现在呢?能决定全人类未来命运的超级AI,就是硅谷几个创业公司的普通办公室里,工程师用自己的笔记本敲代码搞出来的,没有政府审批,没有军事管控,所谓的“安全协议”就是几家公司老板坐下来签了个自愿遵守的承诺书,不想遵守了随时可以撕。等于现在把造核弹的权限开放给了创业团队,谁先做出来谁就能拿几十亿上百亿的融资,这不是疯了是什么?

5. 【2万亿估值的死结:安全承诺在钱面前根本不堪一击】

最讽刺的是现在Anthropic正在筹备IPO,估值要冲到2万亿美元,这个事直接把所有安全承诺的底裤都扒了。你要撑2万亿的估值,就得给投资人讲一个故事:我的AI能力会越来越强,能渗透到全世界所有行业,赚的钱比现在谷歌、苹果加起来还多。

但你转头又要跟公众说:等我的AI强到一定程度,我就主动暂停研发,花大量成本搞安全,不赚钱了。这两个事从根上就是矛盾的:投资人花几百亿买你股票是要赚更多钱的,你要是敢为了安全主动减速、放弃赚大钱的机会,第二天投资人就能把你整个管理层全换掉。哪怕Anthropic现在真的是真心想搞安全,等真到了“要安全就要损失几千亿市值”的选择点上,没人能扛得住这个压力。