大模型为何在小数比较上集体“翻车”

财云财经阅读:25352024-07-17 17:28:00评论:0
摘要: 大模型在“9.11和9.9哪个大”这一简单问题上几乎都答错,原因复杂,还引发众多测试。

大模型的惊人失误

大模型在处理“9.11和9.9哪个大”这样一个看似简单的小数比较问题时,竟然集体出现了错误。像GPT-4o、谷歌GeminiAdvanced付费版、Claude3.5Sonnet等主流大模型,都给出了错误的答案,这实在让人惊讶。

不同大模型的表现

不同的大模型在这个问题上的表现各异。GPT-4o坚定地认为9.11更大,谷歌GeminiAdvanced付费版也持有同样的错误观点。而Claude3.5Sonnet虽然给出了计算过程,但最终结果依然是错误的。

大模型为何在小数比较上集体“翻车”

测试方法的变化

艾伦AI研究所成员林禹臣通过更换数字进行测试,发现GPT-4o依旧翻车。提示工程师RileyGoodside也尝试了多种问法和限定条件,结果还是不尽人意。

国产大模型的情况

国产大模型在这个问题上的表现也参差不齐。Kimi直接给出错误结论,智谱清言APP上的ChatGLM虽有计算过程但执行错误,文心一言原本做对却突然出错。不过,腾讯元宝和字节豆包表现相对较好。

出错原因的探究

对于大模型出错的原因,有多种推测。一方面,大模型以token的方式理解文字,在处理数字时可能会出现误解。另一方面,训练数据中关于此类基础算数的内容较少,导致模型在面对这类问题时容易出错。

如何引导正确理解

为了让大模型正确理解这类问题,人们进行了多种尝试。Zero-shotCoT思维链,即“一步一步地想”的方法是有效的,但角色扮演提示的作用有限。

新模型的期待

与此OpenAI的新模型在内部测试中表现出色,但在没有额外提示的情况下能否正确解决“9.11和9.9哪个大”的问题,还需拭目以待。

大模型在小数比较问题上的集体“翻车”,给我们带来了诸多思考。这不仅提醒我们要更加谨慎地使用大模型的结果,也促使研究人员进一步改进模型,提高其准确性和可靠性。

大模型为何在小数比较上集体“翻车”

相关问答

为什么大模型会在小数比较上出错?

大模型以token的方式理解文字,可能对数字处理产生误解,且训练数据中基础算数内容较少。

哪些国产大模型在这个问题上表现较好?

腾讯元宝和字节豆包在“9哪个大”的问题上表现相对较好。

有什么方法能引导大模型正确理解小数比较问题?

Zero-shotCoT思维链,即“一步一步地想”的方法有效。

OpenAI的新模型在内部测试中的表现如何?

在内部测试中表现出色,但能否解决小数比较问题还不确定。

角色扮演提示在这类问题中作用如何?

角色扮演提示在引导大模型正确理解小数比较问题上作用有限。

大模型出错对我们有什么启示?

提醒我们谨慎使用大模型结果,促使改进模型以提高准确性和可靠性。

声明

转载声明:欢迎分享本文,转载请保留出处!

本文网址:https://www.caiair.cn/post/da-moxing-xiaoshu-bijiao-fanche-705259.html

上一篇:

下一篇:

排行榜