DeepSeek系列模型的高性能与低成本如何影响AI产业?

DeepSeek用户增长与模型性能
用户量增长趋势
DeepSeek坚定走开源路线,不断有新模型发布。例如2024年12月26日的DeepSeek-V3,2025年1月20日的DeepSeek-R1以及2025年1月27日的Janus-Pro和JanusFlow-1.3B等。这些模型以低成本、高性能吸引了全球用户。Web端访问量从2024年10月到12月不断增长,11月和12月同比增长明显。APP端在官方APP上线后,受益于R1模型,产品关注度裂变式增长,在多个平台下载量剧增,日活用户增长速度远超ChatGPT。其用户数还将持续高速增长,一方面受全球开发者关注,另一方面国内渗透率因春节信息传播下沉而提升。
R1和Janus-pro性能表现
DeepSeek-R1在推理任务上接近OpenAI-o1性能。在以教育为导向的知识任务中,R1相比DeepSeek-V3在多数基准测试上表现优越,如MMLU和GPQADiamond。在中英文搜索和数据分析任务中,R1在英文事实基准测试上优于V3,但在中文事实基准测试上因安全强化学习有差异。在数学和编码任务上,R1也表现出与o1相当的性能。蒸馏技术可提升小模型推理能力。Janus-Pro在多模态理解和生成方面表现优秀,在多模态理解基准测试中总体结果最佳,在文本-图像生成方面也超过其他模型。
DeepSeek-V3模型训练成本
DeepSeek通用及推理模型成本远低于OpenAI同类模型。如DeepSeek-V3的API服务定价与OpenAIGPT-4o对比,推理模型DeepSeek-R1的API服务定价与OpenAIo1对比。DeepSeek-V3总训练成本仅为557.6万美元,其成本低缘于多种因素,如通过DeepSeekMoE架构提高计算资源利用率、采用MLA算法减少计算量、DualPipe框架提高GPU利用率、利用细粒度混合精度框架优化训练效率等。

DeepSeek技术革新与数据集特点
DeepSeek-V3/R1技术革新
DeepSeek-V3在架构方面有诸多创新。其多头潜在注意力(MLA)机制进一步减少键值缓存需求;DeepSeekMoE架构优化激活参数并通过无辅助损失负载均衡策略提高性能;多token预测(MTP)方法提升训练和推理性能。在基础设施方面也有优化,如创新的管道并行算法DualPipe、用于FP8训练的混合精度框架以及采用英伟达PTX汇编级编程等。R1-Zero体现纯强化学习对推理能力的提升,但面临挑战,R1则通过冷启动和多阶段训练解决问题,同时R1系列模型提供了RLScalingLaw的可行方向,蒸馏使小模型具备较强逻辑推理能力的思路与OpenAIo1-mini不同。
Janus系列模型技术革新
Janus系列模型的核心是实现多模态理解与生成的解耦,通过2个独立的视觉编码路径缓解两者冲突,提高模型能力和可扩展性。目前多模态生成模型架构包括自回归、扩散模型和掩码自回归图像生成三类架构,自回归和扩散模型持续发展,Janus系列模型一定程度提升了多模态模型表现,后续相关技术将进一步优化模型性能。
DeepSeek数据集的特点
合成(生成)数据在大模型训练中作用重要。在通用大模型训练中用于丰富数据集,如DeepSeek-V3借助DeepSeek-R1生成样本数据提升推理能力。在推理模型训练中优化训练流程,如DeepSeek-R1在不同阶段利用生成数据进行微调。在多模态模型训练中改善数据质量,如Janus-Pro引入合成美学数据样本提升图像生成质量。GRPO算法使模型摆脱人类经验束缚,让模型通过自我博弈拓展性能。
DeepSeek对AI产业与投资的影响
R1与AI平权的关系
DeepSeek-R1开源引发全球复现热潮,全球多团队积极复现且取得成效。全球大厂纷纷接入R1,尽管美国质疑其安全性等问题。OpenAI受冲击战略方向或转向。参考安卓和iOS的发展,开源模式能为AI产业注入活力。DeepSeek-R1性能接近o1,一定程度反映了AI平权,开源模式下全球团队可使开源模型性能保持前列,且R1使小模型具备推理能力有利于AI落地。
DeepSeek出圈对产业的影响
DeepSeek以低成本、高性能全面影响AI产业链各层。在算力层,影响算力需求增长与否取决于算力价格弹性,DeepSeek-R1加速下游应用产生,算力需求可能增加且凸显自主可控重要性。在模型层,反映中美前沿大模型差距缩小,大厂可能跟进研发,技术开源将促进更多探索。在应用层,DeepSeek-V3/R1性能升级增加应用落地可能性,其低成本可降低应用开发门槛,可能引发价格战,还能为国内开发者提供稳定服务。在数据层,系列模型训练凸显高质量数据重要性。
DeepSeek带来的投资机会
在算力方面,算力需求持续增长,中美AI竞争使高端算力芯片自主可控更重要,建议关注国产算力和AI推理需求相关的算力配套产业。在应用方面,DeepSeek-R1可能引发API降价,小模型推理能力提升促使更多应用落地,建议关注B端Agent相关软件公司。在端侧方面,小模型能力提升促进端侧模型部署,看好AI+教育等场景下的终端需求,建议关注相关终端供应商或软件供应商。在数据方面,高质量数据不可或缺,建议关注向量数据库、数据处理企业和有专业数据的厂商。

相关问答
DeepSeek-R1模型的推理性能是如何提升的?
DeepSeek-R1模型通过冷启动和多阶段训练提升推理性能。冷启动阶段用数千条优质长链思维数据微调,然后进行大规模强化学习,之后融入其他领域数据,最后实施次级RL阶段提高有用性、无害性并精炼推理能力。
Janus-Pro模型在多模态任务中的优势是什么?
Janus-Pro模型在多模态任务中的优势在于将多模态理解和生成的视觉编码解耦。在多模态理解基准测试中取得总体最佳结果,在文本-图像生成方面,在GenEval和DPG-Bench测试中的准确率和得分超过其他模型。
DeepSeek-V3模型的低成本是如何实现的?
DeepSeek-V3模型的低成本通过多种方式实现。其采用DeepSeekMoE架构提高计算资源利用率,MLA算法减少计算量,DualPipe框架提高GPU利用率,还有细粒度混合精度框架优化训练效率等。
为什么说DeepSeek-R1反映了AI平权?
DeepSeek-R1开源且性能接近头部闭源模型o1。全球团队积极复现,各厂接入,而开源模式能吸引全球开发者参与创新,当开源模型性能可追赶闭源模型时,全球团队能使开源模型性能保持前列,所以一定程度反映了AI平权。
DeepSeek对AI应用层有哪些具体影响?
DeepSeek-V3/R1性能升级增加应用落地可能。其低成本可降低开发门槛,可能引发价格战,为开发者提供更多性价比之选。还能为国内开发者提供稳定服务,促进各类应用产生。
DeepSeek的技术革新对小模型有什么意义?
DeepSeek的技术革新对小模型意义重大。如DeepSeek-R1通过蒸馏可提升小模型推理能力,小模型有望通过能力分治模式具备大模型的能力,这对于中小型开发者部署模型更加友好。

