95后AI“天才少女”罗福莉被雷军高薪招揽,她有何过人之处?

DeepSeek的卓越成就与影响力
DeepSeek-V3的性能与成本优势
DeepSeek-V3作为深度求索自研的MoE模型,有着卓越的性能。它的参数量、激活参数以及预训练token量等指标表现优秀,多项评测成绩超越其他开源模型,与顶尖闭源模型也不相上下。而且它的训练成本极低,仅用不到280万GPU小时,总训练成本不到600万美元,相比其他模型成本大幅降低,这使得它在全球范围内引起广泛关注,被众多圈内大佬点赞。
DeepSeek的过往成绩与行业推动作用
DeepSeek并非首次引起关注。之前发布的DeepSeek-V2性能达到GPT-4级别,且开源、可免费商用、API价格低。它采用创新架构,实现了高经济性的训练效果和高效推理。DeepSeek还是国内大模型降价的源头和推动者,在它之后,许多厂商纷纷跟进降价,它以小团队且不依靠外部融资做出被认可的大模型,在行业内有着独特的地位。

罗福莉的学术与工作历程
学术成就与早期工作经历
罗福莉本科就读于北京师范大学计算机专业,硕士毕业于北京大学计算语言学专业。她在2019年就展现出强大的学术能力,在人工智能领域顶级国际会议ACL上发表8篇论文,其中2篇一作,这一成绩让她登上知乎热搜。硕士毕业后,她进入阿里达摩院从事人工智能研究,负责开源项目,主导开发多语言预训练模型VECO。
在DeepSeek的工作及对模型的见解
2022年罗福莉加入幻方量化后跳槽到DeepSeek担任深度学习研究员,参与研发DeepSeek-V2。在DeepSeek-V2发布后,她在知乎上发表看法,认为该模型中文水平处在国内外闭源模型第一梯队,且价格极具性价比。她在模型研发过程中的贡献,也体现了她在人工智能领域的专业能力。
小米的AI布局与罗福莉的契合点
小米AI实验室的组建与发展
小米在2023年4月正式组建AI实验室大模型团队,不断挖掘用户场景,以开放态度寻求合作机会。2024年11月成立专门的AI平台部,由技术大牛张铎负责。小米在AI领域不断布局,显示出其对AI大模型发展的重视。
罗福莉对小米AI布局的价值
罗福莉被雷军招揽到小米AI实验室领导大模型团队。小米在大模型业务中讲究性价比,正在搭建GPU万卡集群提升算力储备。罗福莉有着DeepSeek-V2的研发背景,这与小米主力突破轻量化和本地部署的思路相契合,她的加入有助于小米在大模型领域的发展。

相关问答
DeepSeek-V3为何被称为“AI界拼多多”?
DeepSeek-V3有着极高的性价比,其性能可与顶尖模型媲美,但训练成本极低,就像拼多多以低价提供优质商品一样,所以被称为“AI界拼多多”。
罗福莉在ACL会议上发表多篇论文有何意义?
这表明她在人工智能领域有着很强的研究能力和学术水平,在国际顶级会议上发表论文是对她学术成果的认可,也为她后续的工作发展奠定了良好基础。
阿里达摩院的工作经历对罗福莉有何帮助?
在阿里达摩院从事预训练语言模型相关工作,让她积累了丰富的人工智能研究经验,尤其是在开源项目方面,提升了她主导开发模型的能力。
小米成立AI平台部的目的是什么?
为了更好地发展AI大模型业务,挖掘更多AI相关的用户场景,发挥自身技术优势,以开放的态度与合作伙伴开拓更多机会。
DeepSeek能够以小团队做出优秀大模型的原因有哪些?
一是早期投入大量资源购买算力卡进行研究;二是作为量化公司,没有大厂的多种盈利需求,能更专注于模型开发。
罗福莉的专业背景如何与小米的发展思路相匹配?
罗福莉参与DeepSeek-V2研发,有相关模型研发经验。小米重视性价比和本地部署,罗福莉的背景有助于小米在大模型研发中平衡成本,符合小米的发展需求。

