CellPress细胞出版社
26-06-08 21:00 微博认证:隶属于励德爱思唯尔信息技术(北京)有限公司

【原来AI做数学题,对错也全靠蒙?】近日,一项发表在期刊Patterns的最新研究揭示,当前大语言模型的“幻觉”检测工具在数学推理领域几乎全面失灵http://t.cn/AXXpvghd。这些工具能较好识别日常知识错误,却既抓不住数学题中的假答案,也认不出真解法,即便用专业数学数据特训后依然无效。为此,团队推出“AIME数学幻觉”基准与SelfCheck-Eval黑盒检测框架,证实数学推理需要超越统计学习的全新检测路径,为高风险场景下的可信AI部署敲响警钟。

发布于 河北