研究人员尝试限制训练数据,测试AI能否重新发现广义相对论等突破,结果揭示了模型缺乏直觉与溯因推理的短板。

1915年,Albert Einstein提出了广义相对论,将引力解释为质量对时空的弯曲,颠覆了人类对物理世界的认知。如今,这成了检验人工智能是否具备通用智能的试金石。在2024年的印度AI峰会上,谷歌深度思维负责人Demis Hassabis建议,如果给大语言模型只喂入1911年以前的数据,看看它能否独立推导出相对论,这才是对AI能力的真正测试。
为了验证这一设想,多支团队展开了尝试。在真实人工智能组织的Owain Evans讨论古级AI模型后,独立研究员Michael Hla使用1900年以前的数据训练了名为Machina Mirabilis的模型,并在给出光电效应与电梯思想实验等提示下,测试AI能否推导出量子力学与相对论。尽管模型在面对光电效应时偶有灵光一闪,提出光会碎裂成独立冲量,但整体上依然失败了,它缺乏对物理世界的理解,更多只是在复述看似合理的词汇。
独立计算机科学家Nick Levine尝试利用1930年以前的数据构建历史模型。然而团队遇到了棘手的数据泄漏问题,模型频繁使用1950年代的知识回答关于Franklin D. Roosevelt政策的提问,原因在于历史文献缺乏精准日期标注。苏黎世大学与苏黎世联邦理工学院的Daniel Göttlich等人也构建了带有不同历史时间节点的Ranke4B模型家族,试图寻找AI产生科学思想的火花。
这些尝试暴露出当前大语言模型的局限。以色列理工学院的Ido Kaminer与谷歌深度思维的Tom Zahavy指出,科学上的重大飞跃需要的不是归纳推理,而是为异常现象发明原因的溯因推理,即一种创造性飞跃。当前AI擅长在庞大数据中寻找相关性,但真正的科学颠覆往往始于数据匮乏或无法解释的异常。正如Johannes Kepler对行星运动的观测引导Isaac Newton推导出万有引力,科学突破需要建立底层世界模型。
麻省理工学院的Sendhil Mullainathan向轨道力学模型输入符合牛顿力学的模拟数据,结果模型从未推导出真正的万有引力定律,而是为每个系统都拟合出了错误定律。虽然开放人工智能公司的模型在2024年证明了Paul Erdős留下的80年数学猜想,表现出某种逻辑直觉,但这更多是基于现有文献的组合。
麻省理工学院的Jacob Andreas分析,AI能随机生成大量理论,但难点在于甄别正误。Erwin Schrödinger提出波动力学方程,或者Max Planck在1900年解决黑体辐射异常时,绝非通过随机枚举理论来筛选。人类科学家能够长期执念于极小的离群数据,这种认知风格是AI难以企及的。阿尔伯塔大学的Rich Sutton曾提出苦涩的教训,即简单追求计算力与数据量的统计预测,无法揭示物理现象背后的真实过程。科学家认为,AI若想做出爱因斯坦式的突破,必须超越单纯的预测准确率,对物理真实世界与数学空间建立深度模型。
原文:https://www.nature.com/articles/d41586-026-02804-x