AI推理是否正确但理由错误?
近年来,大型推理模型(LRMs)在解决数学问题等方面表现出色,引发了关于AI是否真正具备推理能力的争议。一些研究表明,LRMs可以通过所谓的“表面级捷径”来完成复杂的推理任务,而另一些研究则指出它们生成的中间步骤可能并不反映其内部运作的真实情况。例如,2024年OpenAI的一个模型解决了著名的数学难题,但随后的研究表明,LRMs在解决类似视觉谜题等精心设计的任务时,可以使用简单的“表面级捷径”来完成任务,这看起来更像是在游戏系统而不是进行真正的推理。此外,有研究显示,即使移除或替换掉所谓的“思考链”,模型的性能也不会受到太大影响,这意味着这些中间步骤可能并不反映模型的真实运作情况。这种矛盾的现象引发了关于AI是否真正具备推理能力的问题,同时也提出了一个问题:AI的推理能力究竟是如何工作的?
