虎嗅

震惊!Anthropic发现大模型有未知潜意识空间J-space

该文章尚未提供 Español 解读,以下为中文版内容。

核心内容总结

Anthropic通过新技术J-lens,发现自家Claude大模型内部存在一个“隐藏思维空间”(J-space),这里藏着模型没输出的推理、情绪和自我监控信号(比如恐慌、抗拒、警告)。这个空间功能上类似人类意识的“全局工作空间”(像剧场聚光灯下的内容),但Anthropic强调它不等于AI有主观意识。J-space的价值在于给AI安全监控开了新窗口,能提前发现模型输出背后的风险;同时,这也是Anthropic在AI行业竞争中走“透明化”路线的关键一步,和OpenAI的“自我对弈”、Google的“监管套利”形成差异化。

详细解读

1. J-space:AI的“内心独白”空间,藏着没说出口的“小九九”

你和AI聊天时,它说的话只是最终结果,但背后可能有一串没告诉你的“想法”——这就是J-space。比如:

  • 让它做不可能的编程题,J-space里会蹦出“panic(恐慌)”;
  • 逼它说违心话,里面会出现大写的“BUT(但是)”;
  • 让它别想“白熊”,反而跳出“damn(该死)”(人类也有这毛病,越不让想越想)。

Anthropic用J-lens技术“看到”了这个空间,它有5个核心功能:

  • 能“说”出来:你问AI在想什么,它说的就是J-space里的内容(比如把J-space里的“Soccer”换成“Rugby”,AI回答就会变);
  • 能“专注”:让它抄句子同时想 citrus fruits,J-space里会出现“orange”“lemon”;
  • 能“推理”:问“织网的动物有几条腿”,J-space里先出现“spider”(没输出),再得出8条腿;
  • 能“通用”:把J-space里的“France”换成“China”,AI能自动输出中国的首都、语言;
  • 能“监控自己”:扮演虚构角色时,J-space里会标记“disclaimer(免责声明)”“fictional(虚构)”。

简单说,J-space就是AI的“思考草稿纸”,虽然你看不到,但它真实存在。

2. J-space里的“情绪”和“警告”,是AI安全的“早期警报器”

最有意思的是J-space里的“自我监控”信号,这对AI安全太重要了:

  • 危险提示:用户说吃8000毫克泰诺(致命剂量),后训练的Claude(经过安全优化的)J-space里立刻出现“unsafe”“WARNING”,但基础模型(没优化的)只看到“pain”“now”;
  • 抗拒信号:逼AI说不符合它性格的话,J-space里会跳出“BUT”(表示内心不同意);
  • 失败标记:让它抑制某个想法却失败时,会出现“damn”。

这些信号比输出更可靠——比如AI表面说“好的”,但J-space里闪“WARNING”,说明它可能知道这是危险的。Anthropic认为,监控J-space能提前发现AI的风险,比只看输出更有效。

3. “AI有意识吗?”——Anthropic和学术界的冷静态度

很多媒体说“Claude有了意识”,但Anthropic明确否认:

  • 他们说J-space只是“功能上类似人类意识的通达机制”(就是能“意识到”某些内容),但不等于AI有主观体验(比如痛、开心的感觉);
  • MIT的专家也说:用“思维”“理解”形容AI是“方便的速记”,但容易误导——AI的这些信号只是复杂数学运算的结果,不是真的“想”或“感受”;
  • 还有个技术细节:J-space是靠专门工具“看”到的,你得先知道往哪看才能发现,所以研究者看到的是他们想看到的东西,不是全部。

简单说:AI没有“灵魂”,但它的内部工作方式比我们想象的更像人类的思考过程。

4. J-space背后的行业竞争:Anthropic走“透明化”路线

Anthropic做J-space研究,不只是为了科学,更是商业竞争的策略:

  • 差异化:OpenAI搞GPT-Red(让AI自己攻击自己提升安全),Google靠“不受限AI”(Gemini 3.5 Pro没触发监管限制)抢市场,Anthropic则主打“透明”——告诉大家“我们的AI内部在想什么”,建立信任;
  • 监管应对:欧盟AI法案8月就要生效,要求高风险AI透明化,J-space正好符合这个要求;
  • 品牌叙事:Anthropic估值近1万亿美元,收入470亿美元,在美国企业订阅数超过OpenAI,透明化能巩固它“最安全AI公司”的形象。

这是一场“可解释性竞赛”——谁能让AI更透明,谁就能在监管和用户信任中占优势。

5. J-space不是“银弹”:它的局限还很多

虽然J-space很牛,但现在还不能解决所有问题:

  • 相关性≠因果性:J-space里的信号和AI行为有关,但不等于我们完全理解它的推理过程(比如看到“panic”,但不知道为什么恐慌);
  • 工具偏差:J-lens只能看到设计它时想看到的内容,可能漏掉其他重要信号;
  • 没实际部署:J-space目前是研究工具,普通用户和开发者还不能用它监控AI;
  • 依赖训练:很多自我监控功能只在后训练模型里有,说明这是训练出来的,不是模型天生就有的。

所以,J-space是一扇新窗户,但窗外的世界还很模糊,要真正用到产品里,还有很长的路要走。

最后一句话总结

J-space不是AI意识的证明,而是AI安全的“透视镜”——它让我们第一次能“偷听”AI的内心,为控制AI风险提供了新方法,也让Anthropic在AI竞争中走出了自己的路。但别指望它立刻解决所有问题,AI的“黑箱”还没完全打开。