95后AI“天才少女”罗福莉被雷军高薪招揽,她有何过人之处?

财云财经阅读:67732024-12-30 23:12:00评论:0
摘要: 95后AI“天才少女”罗福莉随DeepSeek-V3模型发布进入大众视野,雷军以千万年薪将其招入小米。DeepSeek-V3性价比高,罗福莉参与研发且在AI领域成果多。

DeepSeek-V3的卓越表现与影响力

性能与成本优势

DeepSeek-V3是一款引人瞩目的混合专家大模型。它参数量为671B,激活参数为37B,预训练token量达14.8万亿。在多项评测成绩中表现卓越,超越众多开源模型,与顶尖闭源模型性能相当。其训练成本极低,仅用不到280万GPU小时,若按H800租金计算,总训练成本不到600万美元,与其他模型相比性价比超高。

引发全球关注

这一模型一经发布便在国内外引发广泛关注。前OpenAI联创AndrejKarpathy表示若其优良表现得到验证,将是资源有限下研究和工程的出色展示。Meta的田渊栋和ScaleAI创始人AlexandrWang等业内人士也纷纷点赞。它让DeepSeek这个由幻方量化创立的公司再次受到重视。

DeepSeek的发展历程与独特之处

早期的成功出圈

DeepSeek并非首次受到关注。早在半年前发布的DeepSeek-V2就已引发业内重视。它性能达GPT-4级别,且开源、可免费商用、API价格低。采用创新架构如MLA和DeepSeekMoE架构等,实现了高效训练和推理。

推动大模型价格战

DeepSeek在训练效率和成本方面具有优势,是国内最早开启大模型降价的厂商,也是价格战的源头和推动者。众多大厂在其发布DeepSeek-V2之后纷纷跟进降价。并且它储备了万张A100芯片,为早期技术研发提供了算力基础。

95后AI“天才少女”罗福莉被雷军高薪招揽,她有何过人之处?

罗福莉的AI之路与被招揽原因

学术与工作经历

罗福莉本科就读于北京师范大学计算机专业,硕士毕业于北京大学计算语言学专业。在硕士期间就在ACL发表8篇论文。毕业后进入阿里达摩院从事预训练语言模型工作,主导开发VECO模型。之后进入幻方量化和DeepSeek,参与DeepSeek-V2研发。

与小米的契合点

罗福莉被雷军招揽到小米AI实验室领导大模型团队。小米正在全面发力AI大模型,组建团队、搭建GPU万卡集群等。罗福莉有DeepSeek-V2的研发背景,小米讲究性价比,她的经验有助于小米在大模型业务中平衡成本。

95后AI“天才少女”罗福莉被雷军高薪招揽,她有何过人之处?

相关问答

DeepSeek-V3为何被称为“AI界的拼多多”?

DeepSeek-V3具有很高的性价比,性能卓越能媲美顶级模型,但训练成本极低,就像拼多多以低价提供优质商品一样,所以被称为“AI界的拼多多”。

罗福莉在DeepSeek-V2研发中起到了什么作用?

罗福莉是DeepSeek-V2的关键开发者之一,她凭借自己在深度学习等方面的专业知识,参与到模型研发过程中,对模型的成功开发有着重要意义。

DeepSeek能做出性价比高的模型有哪些原因?

一是早期购买大量算力卡投入研究,二是作为量化公司没有大厂的多种盈利需求,能更专注于模型开发,所以能做出性价比高的模型。

小米在AI大模型业务中有哪些布局?

小米2023年4月组建AI实验室大模型团队,11月成立AI平台部,还着手搭建GPU万卡集群,提升算力储备以支持大模型研发。

罗福莉的学术成果有哪些?

罗福莉在硕士期间于人工智能领域顶级国际会议ACL上发表8篇论文,其中2篇为一作,还主导开发了阿里达摩院的多语言预训练模型VECO。

雷军看重罗福莉的什么能力?

雷军看重罗福莉在DeepSeek-V2研发中的经验,她能够帮助小米在大模型业务中平衡成本,助力小米在AI大模型领域发展。

声明

转载声明:欢迎分享本文,转载请保留出处!

本文网址:https://www.caiair.cn/post/95-hou-ai-tiancai-shaonv-117608.html

上一篇:

下一篇:

排行榜