为何AI算不对9.11和9.9的大小?

大模型答错数学题的现象
当前,AI在回答诸如“9.11和9.9哪个大”这样简单的数学问题时,表现得不尽人意。7月17日,第一财经报道了国内外“12个大模型8个都会答错”这一现象,引发了广泛的讨论。
答对答错是概率问题
大模型的架构和运行机制决定了其回答的不稳定性。以通义千问等为代表的大模型大多基于Transformer架构,本质上是通过预测下一个词出现的概率来进行训练和回答。这就导致大模型在回答问题时,“答对”或“答错”成为了一个概率事件。
腾讯混元团队也指出,大模型是一个概率模型,对于数字间的运算或比较规则掌握不够精准,容易出现错误判断。比如在面对9.11和9.9时,可能会因错误理解而认为9.11大于9.9。
提问技巧影响答案准确度
由于大模型的核心架构和运行机制,提问的技巧对答案的准确度有着重要影响。大模型并非以人类的常规思路理解问题,数字的多种进制、不同指代以及类似日期、版本号的数字格式,都可能导致其理解偏差。

例如,在大模型的理解中,9.11可能被拆分为“9”“.”和“11”,而9.9被拆分为“9”“.”“9”,从而得出错误结论。但改变提问方式,如明确询问“哪个数字更大?9.11还是9.9”,或者要求大模型逐步分析,部分大模型就能给出正确答案。
彻底解决需要大模型升级
当前大模型的能力存在不均衡,能处理复杂问题却在简单数学计算上出错。要彻底解决这一问题,需要大模型的升级。
业内人士指出,大模型数学能力不足的根本原因在于训练数据中数学相关数据占比少。通过选用更优质的训练数据、更好的算法,以及针对数学进行专门训练,能够提升大模型的数学能力。
集成外部工具能力,如计算器、代码执行器等,也能拓展大模型的能力,提高解决数学问题的效率和准确性。
大模型的反思与订正能力
在大模型的答题测试中,一个有趣的现象是,当模型回答错误,提问者质疑或否认后,多数大模型会转而承认错误,并给出正确解答过程和答案。这一方面是大模型预测的随机性,另一方面也得益于其具备的上下文理解能力。
用户的追问相当于对大模型的调教过程,使其能够根据追问作为下一轮预测的基础,从而提高准确率。
大模型能力的探索仍处于早期阶段
人类对大模型的能力探索还处于非常早期的阶段,无论是其能做到的还是做不到的,都还有很多未知。边界案例的发现有助于增加对大模型能力边界的了解,推动其不断发展和完善。
虽然大模型在数学计算方面存在不足,但随着技术的不断进步和优化,未来有望取得更好的表现。

相关问答
为什么大模型回9哪个大”会出错?
大模型基于概率进行回答,架构和运行机制导致回答不稳定,且对数字运算和比较规则掌握不精准,容易出现理解偏差。
提问技巧怎样影响大模型的回答准确度?
不精确的提问可能导致大模型误解,改变提问方式,如明确数学问题、要求逐步分析等,能提高回答准确度。
如何彻底解决大模型数学能力差的问题?
根本上需要大模型升级,选用优质数学训练数据、更好的算法,集成外部工具能力,针对数学进行专门训练。
大模型回答错误后为什么能订正?
一方面是随机性,另一方面是具备上下文理解能力,用户追问起到调教作用。
大模型的能力探索处于什么阶段?
人类对大模型的能力探索还在非常早期,很多方面尚不明确,边界案例有助于了解其能力边界。
怎样提升大模型解决数学问题的能力?
增加数学相关训练数据占比,选用优质数据和算法,集成外部工具,针对数学进行专门训练。

