大模型为何在简单数学题上频频翻车?

大模型的数学错题风波
在数学领域,一个看似简单的比较大小问题——“9.11和9.9哪个大?”,却让众多大模型纷纷“翻车”。第一财经记者对12个大模型进行测试,结果令人惊讶,仅有4个答对,8个答错。这一现象引发了广泛关注和思考。
答错的多样表现
这些答错的大模型各有各的逻辑和表达错误。例如,ChatGPT在比较时错误地认为小数点后面的数字“11大于9”,即便将小数转化成分数比较,最终仍得出错误结论。国内的大模型也存在类似问题,月之暗面旗下的kimi错误地比较小数部分,字节豆包虽举了生活例子却胡说八道,智谱清言得出了令人意外的错误结论。商汤商量在推演过程中逻辑混乱,阶跃星辰跃问回答前后不一致且未意识到错误。

大模型数学能力差并非新问题
实际上,大模型数学能力不足并非首次出现。此前的高考全卷测试中,包括GPT-4在内的多个大模型在数学科目上均不及格。老师们发现大模型在主观题回答上较为凌乱,过程错误但有时能得到正确答案,这表明其公式记忆能力强,但灵活应用能力弱。
数学不好的原因探究
行业人士认为,大模型数学不好的原因主要有两方面。一方面,大语言模型的架构存在问题,其通过预测下一个词的监督学习方式进行训练,学到的是相关性而非因果性,这与数学的高度抽象和逻辑驱动的本质不同。另一方面,分词器的数字切分问题也不容忽视。早期的分词器未对数字进行特殊处理,可能破坏数字的整体性,导致模型难以准确理解和计算。
提升大模型数学能力的途径
虽然目前存在问题,但也有解决的方向。训练语料的优化是关键,大语言模型主要通过互联网文本数据训练,其中数学问题和解决方案相对较少。未来,大模型的训练需要更体系地构建,构造更多过程性的内容,如解几何题的具体过程数据。这对于大模型在复杂推理和关键应用场景,如金融、工业等领域的落地至关重要。
大模型在数学能力上的提升还有很长的路要走,但随着技术的不断进步和训练方法的改进,相信未来它们能够更好地应对各种数学问题,为人们提供更准确、可靠的服务。

大模型在哪些数学测试中表现不佳?
在高考全卷测试和比较9大小的测试中表现不佳。
大模型答错数学题的常见错误有哪些?
常见错误包括错误比较小数部分、逻辑混乱、未正确处理数字整体性等。
大模型数学能力差的主要原因是什么?
主要原因包括架构问题和分词器数字切分问题,以及训练语料中数学内容少。
如何提升大模型的数学能力?
可以通过优化训练语料,构造更多数学解题过程数据等方式提升。
大模型数学能力的提升对哪些领域重要?
对金融、工业等对数字准确性和可靠性要求高的领域重要。
大模型未来能克服数学能力不足的问题吗?
随着技术进步和训练改进,有希望克服,但需要时间和努力。
转载声明:欢迎分享本文,转载请保留出处!
本文网址:https://www.caiair.cn/post/da-moxing-shuxue-nengli-cuoti-yuanyin-365820.html

