95后AI“天才少女”罗福莉被雷军高薪招揽,她有何过人之处?

DeepSeek-V3的卓越表现与影响力
性能与成本优势
DeepSeek-V3是一款引人瞩目的混合专家大模型。它参数量为671B,激活参数为37B,预训练token量达14.8万亿。在多项评测成绩中表现卓越,超越众多开源模型,与顶尖闭源模型性能相当。其训练成本极低,仅用不到280万GPU小时,若按H800租金计算,总训练成本不到600万美元,与其他模型相比性价比超高。
引发全球关注
这一模型一经发布便在国内外引发广泛关注。前OpenAI联创AndrejKarpathy表示若其优良表现得到验证,将是资源有限下研究和工程的出色展示。Meta的田渊栋和ScaleAI创始人AlexandrWang等业内人士也纷纷点赞。它让DeepSeek这个由幻方量化创立的公司再次受到重视。
DeepSeek的发展历程与独特之处
早期的成功出圈
DeepSeek并非首次受到关注。早在半年前发布的DeepSeek-V2就已引发业内重视。它性能达GPT-4级别,且开源、可免费商用、API价格低。采用创新架构如MLA和DeepSeekMoE架构等,实现了高效训练和推理。
推动大模型价格战
DeepSeek在训练效率和成本方面具有优势,是国内最早开启大模型降价的厂商,也是价格战的源头和推动者。众多大厂在其发布DeepSeek-V2之后纷纷跟进降价。并且它储备了万张A100芯片,为早期技术研发提供了算力基础。

罗福莉的AI之路与被招揽原因
学术与工作经历
罗福莉本科就读于北京师范大学计算机专业,硕士毕业于北京大学计算语言学专业。在硕士期间就在ACL发表8篇论文。毕业后进入阿里达摩院从事预训练语言模型工作,主导开发VECO模型。之后进入幻方量化和DeepSeek,参与DeepSeek-V2研发。
与小米的契合点
罗福莉被雷军招揽到小米AI实验室领导大模型团队。小米正在全面发力AI大模型,组建团队、搭建GPU万卡集群等。罗福莉有DeepSeek-V2的研发背景,小米讲究性价比,她的经验有助于小米在大模型业务中平衡成本。

相关问答
DeepSeek-V3为何被称为“AI界的拼多多”?
DeepSeek-V3具有很高的性价比,性能卓越能媲美顶级模型,但训练成本极低,就像拼多多以低价提供优质商品一样,所以被称为“AI界的拼多多”。
罗福莉在DeepSeek-V2研发中起到了什么作用?
罗福莉是DeepSeek-V2的关键开发者之一,她凭借自己在深度学习等方面的专业知识,参与到模型研发过程中,对模型的成功开发有着重要意义。
DeepSeek能做出性价比高的模型有哪些原因?
一是早期购买大量算力卡投入研究,二是作为量化公司没有大厂的多种盈利需求,能更专注于模型开发,所以能做出性价比高的模型。
小米在AI大模型业务中有哪些布局?
小米2023年4月组建AI实验室大模型团队,11月成立AI平台部,还着手搭建GPU万卡集群,提升算力储备以支持大模型研发。
罗福莉的学术成果有哪些?
罗福莉在硕士期间于人工智能领域顶级国际会议ACL上发表8篇论文,其中2篇为一作,还主导开发了阿里达摩院的多语言预训练模型VECO。
雷军看重罗福莉的什么能力?
雷军看重罗福莉在DeepSeek-V2研发中的经验,她能够帮助小米在大模型业务中平衡成本,助力小米在AI大模型领域发展。

