虎嗅

走进Anthropic:造最危险的技术,还想当个好人

该文章尚未提供 Deutsch 解读,以下为中文版内容。

核心内容总结

Anthropic是一家从OpenAI出走的AI公司,如今估值逼近万亿,一边以“AI安全”为招牌,一边却因与五角大楼合作、开发能击穿网络安全的超级模型Mythos陷入伦理争议。创始人兄妹Dario和Daniela Amodei既担忧AI可能引发文明崩溃、消灭大量工作岗位,又不得不推动技术前进,在“做安全”和“赚大钱”“帮军方”之间反复权衡,暴露了AI巨头在理想与现实间的挣扎。

详细拆解解读

1. 从OpenAI出走:不是安全吵架,是信不过对方了

很多人以为Anthropic离开OpenAI是因为“安全理念不合”,但Dario直言:核心是不信任。他说,安全分歧可以讨论,但当你发现对方“价值观和说的不一样”“做事理由不诚实”时,就没必要耗着了。比如OpenAI后来的发展方向,可能让他们觉得偏离了最初的愿景。出走后,Anthropic的早期创始人全留到现在,这在AI圈很少见——说明他们确实想按自己的方式做“靠谱”的AI。

2. 反战者签国防部合同?一边怕AI作恶,一边帮军方自卫

Dario年轻时是反战青年,但现在Anthropic却和五角大楼签了合同。他解释:世界变了。看到俄罗斯入侵乌克兰,他觉得民主国家需要自卫。但他们有红线:不做大规模监控,不做自主杀手机器人。比如美军用Claude辅助打击目标,但最终决定权在人手里。他说,如果民主国家靠“作恶”才能赢,那这种赢不值得——但现实是,AI已经成了战争工具,他们只能尽量守住底线。

3. Mythos:能偷银行、瘫痪基础设施的超级模型,为啥不敢发布?

Anthropic内部有个叫Mythos的模型,厉害到能找出几乎所有主流系统的漏洞,甚至能直接变成攻击工具(比如入侵银行、窃密)。他们不敢全发布,只给少数机构用。有人说“开源模型也能做到”,Dario反驳:不一样。Mythos能主动扫描整个代码库找漏洞,而开源模型得你指到具体哪一行才会发现。他说,这模型像“超级武器”,发布了会被坏人利用——但不发布又损失商业利益,这就是他们的两难。

4. AI会抢多少工作?初级白领先遭殃,但新岗位也在冒头

Dario一年前说“1-5年内消灭一半初级白领岗位”,现在还是这态度。比如写代码的,AI已经能包办大部分;但新岗位也在出现:比如“应用AI架构师”(帮客户用AI解决问题)、“前线工程师”(和客户沟通+技术)。Daniela举医疗的例子:AI能诊断病情,但医生的“床畔服务”(安慰病人、摸脉)是AI替代不了的。Dario担心的是:蛋糕变大了,但岗位不是一一对应——比如100个初级码农失业,可能只需要10个架构师,剩下90人得找新活干。

5. 创始人的焦虑:AI可能让文明崩溃,但我们在尽力降低风险

Dario说,AI导致文明崩溃的概率是10%-25%(这可不是小数字)。他把自己比作“更安全的航空公司”:不能保证飞机永远不坠毁,但能比别人安全10倍。他们做了啥?比如公司有个“长期利益信托”,能罢免董事会(包括他自己),防止权力滥用;还呼吁政府立法监管AI。他说,硅谷以前要么“反监管”要么“喊国有化”,其实需要中间路线——既不让AI失控,也不让创新被扼杀。

最后:Anthropic值得信任吗?

Dario说“看我们做过什么”。他们推迟过Claude发布、不做自主武器、限制Mythos使用,但也和军方合作、推动AI发展。就像那匹叫Calypso的马——它不知道AI的喧嚣,而我们躲不开:AI是工具,关键是谁用、怎么用。Anthropic的挣扎,其实是整个AI行业的缩影:想做好人,但手里的技术太危险,谁也不知道最终会走向哪里。