DeepSeek-R1-0528模型更新,到底是小升级还是另有隐情?

DeepSeek的更新动态
小更新背后的关注度
昨日凌晨,DeepSeek有新动作,DeepSeek-R1-0528模型在HuggingFace平台开源。发布前几小时,官方小助手低调通知R1模型小版本试升级,用户可多渠道测试体验,且API接口等未变。不过这次小更新备受关注。
回顾此前的小版本升级
今年3月也曾有过类似情况,DeepSeek对V3模型开展小版本升级。当时同样先在交流群发布消息,之后才公布详情。此次R1-0528的更新也采用了类似方式。

模型的实际性能表现
代码测试平台的成绩
在代码测试平台LiveCodeBench中,DeepSeek-R1-0528取得73.1分,排名第四,接近OpenAI的o3和o4-mini。这一成绩让其性能可与o3媲美,引发社区对版本的各种推测。
行业人士的看法
一些行业人士认为参数量攀升至685B等是大幅增加,猜测这应该是原本的R2,只是效果未达内部预期所以未升级版本号。
用户体验反馈
多方反馈的进步方面
经过用户反馈,DeepSeek-R1-0528在编程能力、逻辑推理能力以及交互能力等多方面有很大进步,在X平台上也总结出了一些亮点,如深度推理、文本生成优化等。
不同使用者效果差异及其他反馈
不同使用者因prompt输入不同,生成效果差异较大,有人将其代码能力类比Claude3.7。更广泛用户反馈感觉幻觉率下降、文字水平有提升,说明该模型在不断优化。
这次DeepSeek的更新成为热议话题,其虽称小更新,但实际在模型性能和用户体验方面都有可圈可点之处,未来发展值得关注,也给国产闭源大模型带来了挑战。

相关问答
DeepSeek-R1-0528模型是在哪里开源的?
在HuggingFace平台正式开源。
此次模型升级API接口有改动吗?
此次升级后,API接口及使用方式均维持原状,未作改动。
代码测试平台中DeepSeek-R1-0528取得了什么成绩?
在代码测试平台LiveCodeBench中取得了1分的成绩,排名第四。
行业人士为什么猜测这可能是原本的R2模型?
因为参数量攀升至685B,上下文达到164K,是大幅增加,但效果不及内部预期所以没升级版本号。
用户反馈中提到该模型有哪些亮点?
可以像谷歌模型一样进行深度推理;文本生成优化,更自然,格式更好;独特的推理风格,快速且更深度;长时思考,单任务处理时长可达30-60分钟。
不同使用者生成效果差异大的原因是什么?
由于prompt输入的不同,导致不同使用者生成的效果差异较大。

