DeepSeek成本计算背后:大模型训练成本的秘密?

财云财经阅读:74032025-02-21 11:53:00评论:0
摘要: DeepSeek因低成本训练出强大模型引发关注。它有多种类型大模型,能力各有优劣。大模型训练成本包括硬件、数据、人工等,DeepSeek在多方面优化降本,其降本方式给行业带来启发。

DeepSeek模型的类型与能力

被误解的DeepSeek模型

DeepSeek被大众熟知的是推理大模型DeepSeek-R1,但它还有其他大模型。人们常将其以偏概全地看待。例如557.6万美元是通用大模型DeepSeek-V3的GPU花费,并非全部模型的成本。而且通用大模型和推理大模型功能不同,技术差别在于训练数据。通用大模型是问题加答案,推理大模型是问题加思考过程加答案。

推理与通用大模型对比

通用大模型接收明确指令,回复速度快,基于概率预测。而推理大模型接收聚焦目标任务,回复慢,基于链式思维。很多人错误认为推理大模型更高级,但其实对于简单问题,像查询省会城市,推理大模型可能不如通用大模型好用,还可能消耗更多算力并出错。对于复杂任务,推理模型效果更佳。

DeepSeek的真实实力

在推理大模型领域,第一梯队有OpenAI、Google、DeepSeek-R1、阿里等的模型。从技术角度,DeepSeek-R1与OpenAI最新模型有差距,但缩小了国内外差距。在通用大模型领域,第一梯队有Google、OpenAI、Anthropic、DeepSeek、阿里等的模型。每个模型都有优缺点,DeepSeek的多模态大模型Janus-Pro使用效果一般。

DeepSeek成本计算背后:大模型训练成本的秘密?

大模型训练成本的构成

大模型的训练流程

大模型诞生分预训练和后训练两个阶段。预训练是让模型摄取知识,如将大量文本语料给模型。后训练是教模型运用知识,包括模型微调(SFT)和强化学习(RLHF)。国内外的通用大模型、推理大模型在最底层的模型构成和训练步骤无本质区别。

成本差异的因素

大模型训练成本在硬件、数据、人工方面差别大。硬件方面,买或租价格差异大。数据上,购买现成数据或自己爬取差异大。每次训练成本也不同,如首次训练要做数据筛选等工作,后续版本可能成本降低。而且模型迭代版本数量也影响成本,但大模型公司很少透露。

DeepSeek的成本情况

外界估算GPT-4等顶尖模型的训练成本,但因闭源难以准确知晓。DeepSeek-V3训练成本557.6万美元只是最后一次成功训练成本,前期成本未包含,R1成本未提及。考虑其他因素,DeepSeek总成本4年内可能达25.73亿美元,但相比其他公司投入仍较低,且其在调用推理阶段成本也低。

DeepSeek的降本策略与启示

模型结构优化

很多大模型采用MoE模型,DeepSeek采用细粒度专家分割和共享专家隔离达到终极专家专业化水平,用约40%计算量达到与LLaMA2-7B差不多效果。这在模型结构上提高了效率,减少了计算量,从而降低成本。

数据处理优化

数据处理上,DeepSeek采用FP8低精度训练,比多数大模型使用的FP16或BF16混合精度训练速度快很多。这种数据处理方式能提高计算效率,同时降低对内存和带宽等硬件的需求,进而降低成本。

后训练与推理优化

后训练中的强化学习,DeepSeek选择GRPO算法而非PPO算法,减少了算力要求节省成本。在推理层面,用多头潜在注意力机制(MLA)降低显存占用和计算复杂度,使API接口费用下降。DeepSeek的降本方式给从业者带来启发,做推理模型有多种方式。其降本方式也影响着AI公司发展路径,证明“算法效率”范式的可行性,未来大模型训练成本还会进一步降低。

DeepSeek成本计算背后:大模型训练成本的秘密?

DeepSeek-R1和DeepSeek-V3有什么不同?

DeepSeek-R1是推理大模型,DeepSeek-V3是通用大模型。它们在接收任务类型、回复速度、思维方式以及训练数据方面存在不同。

大模型训练成本中的硬件部分有哪些影响因素?

硬件方面影响因素包括是购买还是租用设备。购买前期投入大但后期主要是电费,租用前期投入小但成本持续存在,这都会影响大模型训练成本。

为什么说DeepSeek在模型结构上进行了优化?

DeepSeek采用细粒度专家分割和共享专家隔离的MoE模型,提高了参数效率和性能,用较少计算量达到类似效果,所以说在模型结构上进行了优化。

FP8低精度训练对DeepSeek有什么好处?

FP8低精度训练可加速DeepSeek的深度学习训练,提高计算效率,同时降低内存和带宽等硬件需求,有助于降低训练成本。

GRPO算法如何帮助DeepSeek节省成本?

GRPO算法在进行算法优化时不借助价值模型,通过组内相对奖励估计优势函数,相比PPO算法算力要求小,从而节省了成本。

DeepSeek的降本方式对AI公司发展有何影响?

DeepSeek的降本方式证明了以产业落地为目标,通过架构创新和工程化能力推出低成本高性能模型的“算法效率”范式的可行性,影响AI公司的发展路径选择。

声明

转载声明:欢迎分享本文,转载请保留出处!

本文网址:https://www.caiair.cn/post/deepseek-423092.html

上一篇:

下一篇:

排行榜