蚂蚁集团推出MoE大模型,如何用国产芯片降低训练成本?

蚂蚁集团MoE大模型的推出
两款大模型的参数规模
蚂蚁集团Ling团队推出了百灵轻量版(Ling-Lite)与百灵增强版(Ling-Plus)两款MoE大语言模型。Ling-Lite参数规模为168亿(激活参数27.5亿),Ling-Plus基座模型参数规模高达2900亿(激活参数288亿),这两款模型性能处于行业领先地位。它们的推出展示了蚂蚁集团在大模型研发上的实力。
技术成果论文的意义
蚂蚁集团Ling团队发表的技术成果论文意义重大。它不仅仅是宣告两款大模型的诞生,更重要的是提出一系列创新方法。在当前大模型竞争激烈的环境下,这有助于提升资源受限环境下AI开发的效率与可及性,为更多企业和研究机构在大模型研发上提供了新思路。

低性能硬件上的高效训练
MoE模型训练的现状与挑战
MoE模型通常依赖高性能计算资源如英伟达H100/H800等先进GPU来训练。这种依赖导致了高昂的成本,制约了MoE模型在资源受限环境中的普及。并且英伟达高性能芯片持续短缺,而低性能加速器供应充足且单机成本低,构建跨异构计算单元与分布式集群无缝切换技术框架成为必然需求。
蚂蚁集团的创新策略
蚂蚁集团Ling团队提出多种创新策略。动态参数分配与混合精度调度技术革新了架构与训练策略;自适应容错恢复系统升级了训练异常处理机制,缩短中断响应时间;自动化评测框架优化了模型评估流程,压缩验证周期超50%;基于知识图谱的指令微调提升了工具调用能力,在复杂任务执行上提高了精度。
成本降低的效果
据技术论文,在Ling-Plus的预训练中,使用高性能硬件配置训练1万亿token的预训练成本约为635万元人民币。而利用蚂蚁的优化方法后,使用低规格硬件的训练成本降至508万元左右,节省近20%,最终性能与其他顶尖模型相当。这一成果如果得到推广,将使国产大模型在成本控制上更具优势。
蚂蚁集团在AI和人形机器人领域的布局
AI应用场景的布局
百灵大模型重点布局在生活服务、金融服务、医疗健康等场景。蚂蚁集团基于百灵大模型有三个重点应用方向,即生活管家、就医助理及金融助手。并且在医疗领域不断有新进展,如发布面向医疗机构、医生、用户三端的AI产品体系升级等,体现了蚂蚁集团对AI应用场景的深度挖掘。
人形机器人领域的探索
蚂蚁集团在人形机器人领域动作不断。从招聘相关岗位到注册成立上海蚂蚁灵波科技有限公司,再到该公司的揭牌仪式。蚂蚁集团希望在家庭、养老、医疗健康等领域打造领先的机器人产品。人形机器人作为新兴领域,蚂蚁集团基于自身技术优势布局该领域,有望探索新的增长点,还能与现有业务产生协同效应。

相关问答
蚂蚁集团推出的两款MoE大模型有什么特点?
蚂蚁集团推出的Ling-Lite参数规模为168亿,Ling-Plus基座模型参数规模达2900亿,两者性能处于行业领先水平,在低性能硬件上可高效训练。
蚂蚁集团的创新策略如何降低大模型训练成本?
其创新策略如动态参数分配等改进了训练流程,在Ling-Plus预训练中,高性能硬件训练成本635万,低性能硬件用优化方法后成本降至508万左右,节省近20%。
蚂蚁集团在AI医疗领域有哪些新进展?
蚂蚁集团发布面向医疗机构、医生、用户三端的AI产品体系升级,如面向医疗机构推出一体机解决方案,面向医生发布助手工具,用户端健康应用也有新功能。
人形机器人领域蚂蚁集团有哪些动作?
蚂蚁集团开放招聘相关岗位,注册成立公司,举行公司揭牌仪式,还计划在家庭、养老、医疗健康等领域打造机器人产品。
蚂蚁集团的大模型在资源受限环境下有何优势?
蚂蚁集团提出的创新方法提升了资源受限环境下AI开发效率与可及性,其大模型能在低性能设备上高效训练,降低对高性能芯片依赖,成本更低。
蚂蚁集团在AI应用场景布局有何意义?
蚂蚁集团在生活服务等多场景布局AI应用,有助于满足不同领域需求,提升用户体验,还能挖掘更多商业价值,推动相关业务的发展。

