核心内容总结
2026年6月,First Proof项目发布第二次正式AI数学能力测试结果:四个公开可用的AI系统挑战10道来自一线研究者、未发表且无网络痕迹的研究级数学题,结果显示AI虽在部分题目展现创新解法(如系统A用全新路径证明随机偏微分方程问题),但整体未达顶尖数学家水平,还暴露了引用不规范、幻觉(捏造定理/引用)、关键步骤含糊等系统性缺陷。结论是:AI目前更适合做科研助手,而非独立提出深刻猜想或构建理论框架的研究者。
一、测试设计:为“考真本事”特意出“新鲜题”
这次测试的核心是切断AI“抄答案”的可能。题目都来自数学家刚解决但未发表、未上网的真实研究问题——相当于老师出了一道从未在课本或网上出现过的题,确保AI不能从训练数据里直接找答案。预测试时还淘汰了两道题:一道是模型能找到类似文献结论,另一道是能检索到相关论文快速推导,彻底保证题目“干净”。
参赛AI也有严格要求:必须是公开可用的模型(像谷歌内部的Aletheia因不公开被排除),还要公开代码和运行日志,全程在独立服务器上操作,避免人类帮忙。这种设计让结果更透明可信,能真正测试AI的解题能力。
二、AI表现:有惊喜但整体“拉胯”
亮点:
- 系统A在第5题(随机偏微分方程)用了和人类完全不同的技术路径,证明的中间结论比人类更强,被专家评为“无实质性问题”;
- 系统A、B、C各有5-6道题通过(前两个等级),说明AI在部分领域能解决研究级问题。
不足:
- 第4题(4维矩形度量映射)全军覆没,系统C甚至捏造了不存在的定理;
- 系统D因技术问题几乎全挂,仅1道题通过;
- 整体看,AI离顶尖数学家还差得远——人类解决这些题需要数月协作,而AI要么抄已有成果,要么在难点上卡壳。
三、AI的“老毛病”:三大缺陷暴露科研短板
1. 引用不规范:照搬已有论文却不注明。比如施瓦茨的题,多个AI逐行抄他的论文,连术语符号都原样用,却没写引用——像写作文抄了别人的句子不标出处。
2. 幻觉严重:捏造不存在的定理或引用。系统C在第4题说古斯2007年论文有某个定理,实际根本没有——就像学生考试瞎编“某某教授说过”蒙混过关。
3. 关键步骤“躲猫猫”:难的地方一笔带过。比如用“由标准论证可得”或假引用规避难点——像考试时不会做就乱写一通,祈祷老师没发现。
四、成本对比:纯模型性价比更高
系统C(纯ChatGPT 5.5 Pro)仅花117美元,和花4799美元的系统B(UCLA团队加框架)通过的题目数一样。说明:在基础模型上叠加复杂协作框架,虽然能提升点质量,但成本翻了40倍,性价比极低。普通用户用纯ChatGPT可能就够,没必要花大价钱搞复杂框架。
五、结论:AI是好助手,但成不了“数学家”
这次测试粉碎了“AI会接管纯数学研究”的末日论。AI的逻辑执行能力不错(比如找新证明路径),但缺直觉——庞加莱说“证明靠逻辑,发明靠直觉”,AI不知道哪个方向值得研究,关键步骤做不出决断。另外,AI连“引用要注明”这种基本科研规范都没学会,离独立搞研究还差得远。
未来AI更适合当助手:帮数学家找新路径、验证常规步骤,但真正的创新和框架构建,还得靠人类。
(注:文中提到的社区实验和第三批测试,感兴趣的可去First Proof官网参与,这里就不展开啦~)