DeepSeek上新,首个奥数金牌水平的模型意味着什么?

DeepSeek-Math-V2模型的发布
模型开源情况
11月27日晚,DeepSeek在HuggingFace上开源了DeepSeek-Math-V2模型。这一模型专注于数学领域,是目前行业内首个达到IMO金牌水平且开源的模型,在数学模型发展历程中具有重要意义。
行业竞争态势
当前行业头部厂商模型迭代频繁。11月OpenAI发布GPT-5.1,几天后xAI发布Grok4.1,上周谷歌发布Gemini3系列。在此背景下,DeepSeek推出Math-V2,引发了广泛关注,也让行业对其后续发展充满期待。

Math-V2模型的性能表现
基准测试结果
在IMO-ProofBench基准测试中,DeepSeek-Math-V2在Basic基准上表现出色,达到近99%的高分,远超其他模型,而谷歌的GeminiDeepThink(IMOGold)为89%。在更难的Advanced子集上,Math-V2分数为61.9%,略逊于GeminiDeepThink(IMOGold)的65.7%。
数学竞赛成绩
Math-V2在IMO2025和CMO2024上取得了金牌级成绩,在Putnam2024上通过扩展测试计算实现了接近满分的成绩(118/120)。这些成绩充分展示了该模型在数学推理方面的强大能力。
模型的创新与突破
从结果导向到过程导向
以往的AI在数学推理上存在局限,以正确答案为奖励无法保证推理正确。而DeepSeek推出的Math-V2从结果导向转向过程导向,教会AI像数学家一样审查证明过程,提升解决高难度数学证明题的能力。
自我验证的重要性
DeepSeek认为自我验证对于扩展测试时间计算很关键,特别是对于无已知解决方案的开放问题。Math-V2通过自我验证,展示了可自我验证的数学推理是可行的研究方向,有助于开发更强大的数学AI系统。
海外对DeepSeek此次动作反应热烈,有网友感慨其以10个百分点优势击败谷歌的IMOGold获奖模型。行业期待DeepSeek后续能带来更多惊喜,比如其旗舰模型的更新,进一步推动AI在数学领域的发展。

相关问答
DeepSeek-Math-V2在基准测试中的表现如何?
在Basic基准上,DeepSeek-Math-V9%,略逊于谷歌的GeminiDeepThink(IMOGold)。
Math-V2在数学竞赛中取得了哪些成绩?
在IMO2025和CMO2024上取得金牌级成绩,在Putnam2024上通过扩展测试计算实现接近满分的成绩(118/120)。
当前AI在数学推理方面存在什么局限?
以正确答案为奖励不能保证推理正确,许多数学任务需严格分步推导,最终答案奖励不适用于定理证明等任务。
DeepSeek推出的Math-V2有什么创新?
从结果导向转向过程导向,教会AI审查证明过程,通过自我验证提升解决高难度数学证明题的能力。
海外对DeepSeek推出Math-V2有什么反应?
海外反应热烈,有网友感慨其以10个百分点优势击败谷歌的IMOGold获奖模型,期待其后续动作。
行业对DeepSeek还有哪些期待?
行业更关注DeepSeek旗舰模型何时更新,期待其能带来更多创新,进一步推动AI在数学领域及其他方面的发展。

