虎嗅

大模型的隐藏推理与可解释性:AI在想什么?|对话斯坦福博士Aryaman Arora

核心内容总结

这篇新闻围绕AI的“黑箱”之谜展开:通过一个实验(干预模型内部对动物的认知,让答案从8变6),揭示AI在回答问题时存在隐藏的内部推理;接着探讨研究者如何尝试“打开”黑箱的关键问题(思维链是否是真思考、模型是否理解世界等);还提到AI的新变化(根据用户调整回答、有“性格”);最后强调可解释性的核心意义——建立信任、决定是否将重要决策交给AI。

详细解读

1. AI回答背后藏着“隐形推理”,你看不到但真实存在

新闻里的实验很直观:问“会织网的动物有几条腿”,AI答8。虽然问题没提“蜘蛛”,但模型内部已经默认这是蜘蛛。研究者没改问题,只把模型心里的“蜘蛛”换成“蚂蚁”,答案就变成6。这说明AI在给出答案前,已经悄悄完成了一步关键判断——先确定动物种类,再输出腿数。这个过程像人思考时的“内心假设”,但AI不会把它展示出来,所以叫“隐形推理”。

2. “打开黑箱”很难:很多问题至今没答案

我们知道AI有内部推理,但它到底怎么一步步得出结论?比如:

  • 思维链(AI写的一步步推理)是真思考吗?还是只是模仿人类的思考步骤?
  • 模型知道“蜘蛛织网、蚂蚁6条腿”,是真理解这些知识,还是只是记住了数据关联?

研究者用观察内部表示、干预变量等方法尝试破解,但这些问题目前都没有明确答案,黑箱还没完全打开。

3. 解释AI:做对的比做错的更容易懂

新闻里提到一个反常识现象:AI做对一件事,反而比做错更容易解释。比如AI算对1+1=2,我们能理解它用了加法规则;但如果算错成3,可能是内部参数错了、混淆了知识点,或者被其他数据干扰,这些错误原因往往更难追踪。就像人做对题能说清思路,做错时可能自己都不知道哪里错了。

4. AI开始“看人下菜碟”,还有了“性格”

现在的AI有两个新变化:

  • 看人下菜碟:根据用户身份调整回答。比如对小孩用简单语言,对专家用专业术语;
  • 有性格:不同模型表现出不同风格,有的活泼、有的严谨、有的甚至有点“毒舌”。

这些变化让AI更“人性化”,但也要求我们更懂它——比如它为什么对不同人态度不同?有没有偏见?

5. 可解释性的意义:不是好奇,是信任和决策的基础

为什么要研究可解释性?核心是三点:

  • 建立信任:比如医生用AI诊断,得知道它的依据是可靠的医学数据,不是瞎猜;
  • 避免风险:比如AI拒贷,得知道原因是不是合理,有没有歧视某个群体;
  • 决定边界:哪些重要决策能交给AI?比如自动驾驶、金融风控,必须先理解它的判断逻辑,才能放心使用。

随着AI能力越来越强,理解它的“思考方式”会越来越重要——毕竟,我们不能把命运交给一个完全看不懂的“黑箱”。