大模型为何在小数比较上集体“翻车”

大模型的惊人失误
大模型在处理“9.11和9.9哪个大”这样一个看似简单的小数比较问题时,竟然集体出现了错误。像GPT-4o、谷歌GeminiAdvanced付费版、Claude3.5Sonnet等主流大模型,都给出了错误的答案,这实在让人惊讶。
不同大模型的表现
不同的大模型在这个问题上的表现各异。GPT-4o坚定地认为9.11更大,谷歌GeminiAdvanced付费版也持有同样的错误观点。而Claude3.5Sonnet虽然给出了计算过程,但最终结果依然是错误的。

测试方法的变化
艾伦AI研究所成员林禹臣通过更换数字进行测试,发现GPT-4o依旧翻车。提示工程师RileyGoodside也尝试了多种问法和限定条件,结果还是不尽人意。
国产大模型的情况
国产大模型在这个问题上的表现也参差不齐。Kimi直接给出错误结论,智谱清言APP上的ChatGLM虽有计算过程但执行错误,文心一言原本做对却突然出错。不过,腾讯元宝和字节豆包表现相对较好。
出错原因的探究
对于大模型出错的原因,有多种推测。一方面,大模型以token的方式理解文字,在处理数字时可能会出现误解。另一方面,训练数据中关于此类基础算数的内容较少,导致模型在面对这类问题时容易出错。
如何引导正确理解
为了让大模型正确理解这类问题,人们进行了多种尝试。Zero-shotCoT思维链,即“一步一步地想”的方法是有效的,但角色扮演提示的作用有限。
新模型的期待
与此OpenAI的新模型在内部测试中表现出色,但在没有额外提示的情况下能否正确解决“9.11和9.9哪个大”的问题,还需拭目以待。
大模型在小数比较问题上的集体“翻车”,给我们带来了诸多思考。这不仅提醒我们要更加谨慎地使用大模型的结果,也促使研究人员进一步改进模型,提高其准确性和可靠性。

相关问答
为什么大模型会在小数比较上出错?
大模型以token的方式理解文字,可能对数字处理产生误解,且训练数据中基础算数内容较少。
哪些国产大模型在这个问题上表现较好?
腾讯元宝和字节豆包在“9哪个大”的问题上表现相对较好。
有什么方法能引导大模型正确理解小数比较问题?
Zero-shotCoT思维链,即“一步一步地想”的方法有效。
OpenAI的新模型在内部测试中的表现如何?
在内部测试中表现出色,但能否解决小数比较问题还不确定。
角色扮演提示在这类问题中作用如何?
角色扮演提示在引导大模型正确理解小数比较问题上作用有限。
大模型出错对我们有什么启示?
提醒我们谨慎使用大模型结果,促使改进模型以提高准确性和可靠性。

