DeepSeek上新两款模型,开源与闭源差距究竟有多大?

财云财经阅读:66962025-12-03 20:26:00评论:0
摘要: 12月1日晚,DeepSeek上新两款模型,推理能力出色。虽有成就,但承认与闭源模型有差距。开源与闭源模型差距拉大,DeepSeek提出机制改进,成果引发关注。

DeepSeek新模型亮相

两款模型定位不同

12月1日晚,DeepSeek推出两款新模型。DeepSeek-V3.2旨在平衡推理能力与输出长度,适用于日常问答等场景。9月底的实验版此次更新为正式版,公开推理测试中达到GPT-5水平,略逊于谷歌Gemini3Pro。

Speciale成重头戏

DeepSeek-V3.2-Speciale目标是将开源模型推理能力推向极致。它是V3.2的长思考增强版,结合了定理证明能力,在多个数学竞赛测试中超越Gemini3Pro,在编程等测试中略逊一筹,还斩获多项竞赛金牌。

DeepSeek上新两款模型,开源与闭源差距究竟有多大?

开源与闭源差距凸显

承认存在局限性

DeepSeek在技术报告中承认,自家模型与GeminiPro等闭源模型有差距。V3.2的世界知识广度落后,令牌效率低,解决复杂任务能力不足。团队计划增加预训练计算量等改进。

差距呈扩大趋势

推理模型发布推动大模型发展,但开源与闭源模型差距在拉大。架构上过度依赖标准注意力机制,资源分配上开源模型后训练计算投入不足,智能体领域泛化和指令遵循能力差。

DeepSeek的应对举措

提出稀疏注意力机制

9月底DeepSeek发布实验版V3.2-Exp时提出稀疏注意力机制,经两个月实验确认有效。此次两款新模型均引入该机制,提升了V3.2性能,缩小与前沿专有模型差距且降低成本。

服务形式与社区反响

目前,DeepSeek官方网页端等已更新为正式版V3.2,增强的Speciale版本仅以临时API服务开放。海外社媒上,网友认为这是了不起的成就,但也需正视开源与闭源差距。

DeepSeek上新两款模型,开源与闭源差距究竟有多大?

相关问答

DeepSeek新发布的两款模型有何不同定位?

DeepSeek-V2-Speciale旨在将开源模型推理能力推向极致,结合多种能力,在数学竞赛测试中有出色表现。

DeepSeek承认的自家模型与闭源模型的差距有哪些?

V2的世界知识广度落后,令牌效率低,解决复杂任务能力不如前沿模型。团队计划通过增加预训练计算量等改进。

开源与闭源模型差距拉大的原因是什么?

架构上过度依赖标准注意力机制,开源模型后训练计算投入不足,在智能体领域泛化和指令遵循能力差。

稀疏注意力机制有什么作用?

大幅降低计算复杂度,在不牺牲长上下文性能的前提下,2性能,缩小与专有模型差距并降低成本。

目前DeepSeek新模型的服务形式是怎样的?

官方网页端、2,增强的Speciale版本仅以临时API服务形式开放,供社区评测与研究。

网友对DeepSeek此次发布有何看法?

有网友认为这是了不起的成就,匹配GPT-5和Gemini3Pro的开源模型出现,但也需正视开源与闭源在整体性能上的差距。

声明

转载声明:欢迎分享本文,转载请保留出处!

本文网址:https://www.caiair.cn/post/deepseek-268729.html

上一篇:

下一篇:

排行榜