中国大模型如何借助Infra实现降本增效?

AIInfra行业的竞争与发展
激烈的市场竞争
在国内的AIInfra行业中,竞争相当激烈。如在上海浦东酒店的企业会议上,两家做AIInfra技术的公司高管亮相。其中一家CEO得知对手出席后积极争取演讲名额,最终赢得合作订单,还在后续会议中获得新合作。这一事件是行业竞争的缩影,各企业都在争夺市场份额。
AIInfra的定义与作用
AIInfra定位于算力与应用间的“桥梁”。它为AI大模型应用提供软件系统、数据存储和处理、网络设施等技术。在当前美国对华高端AI算力限制的背景下,AIInfra能解决模型断训、英伟达与国产算力解耦等难题,对中国AI大模型产业不可或缺。
行业的发展前景
中金公司指出AIInfra产业处于早期且高速增长,未来3-5年细分赛道有望超30%增长。基金管理机构和其他机构数据显示,随着AI发展,全球数据中心投资巨大,AI市场规模将飙升,AI基础设施层投资可观,这表明AIInfra行业潜力巨大。

AI算力的现状与挑战
高昂的算力成本
从GPT系列模型来看,参数量剧增,算力消耗极大。像GPT-3.5在微软云的算力消耗以及ChatGPT使用的英伟达高端GPU数量众多且成本高昂。字节跳动的大模型训练架构也显示出算力利用率低且单次训练费用高,这都是AI算力成本高的体现。
算力的构成要素
算力与芯片、基础设施、数据紧密结合。芯片决定计算能力强弱,如CPU、GPU等芯片很关键;基础设施推动算力发展,像5G网络、数据中心等;数据价值是算力存在与发展的意义。但目前随着AI大模型发展,算力发展存在分化与鸿沟问题。
中国的算力困境
在中国,AI算力获取成本高,“东数西算”导致训练慢,部分GPU芯片受限。这使得提升算力利用率成为提升大模型性能和降低成本的关键,也凸显了AIInfra的重要意义,它能减少算力闲置、实现模型“提速降本”。
不同企业的AIInfra方案与实践
互联网大厂的方案
阿里、百度、字节等互联网大厂都有自己的AIInfra方案。阿里云的磐久AIInfra2.0服务器,其提供的功能可提升GPU故障预测准确率、连接GPU数量多、提升模型训练性能、提高AI算力利用率,从而促使基础大模型降价。百度的百舸AI异构计算平台和字节的火山引擎也各有优势。
初创公司的方案
初创公司如无问芯穹、硅基流动等,其AIInfra方案更细分。主要提供三类方案,一是类似MaaS软件解决方案,二是租用算力云和模型API平台,三是芯片+软件的端到端方案。这些方案满足不同需求,如无问芯穹在提升算力使用效率方面成果显著。
国内外对比
全球能完整提供AI算力服务的最佳公司是英伟达。美国有服务大互联网厂商的AIInfra公司。而中国的AIInfra技术和商业化规模低于英伟达,国内企业需要不断发展,如无问芯穹在异构混训方面进行探索,虽有难点但能提升效率,降低成本。
美国限制下中国大模型的发展方向
美国的限制措施
美国不断对中国AI算力进行限制,如要求台积电停止向中国大陆供货先进芯片,三星也受限制,英伟达、AMD等先进AI芯片对华限售。这表明美国在AI算力领域打压中国的决心。
中国面临的挑战
长期受美国限制,中国AI发展面临挑战。在ScalingLaw放缓、数据规模到达天花板、算力需求增加等情况下,需要通过AI系统化、计算体系结构化来解决问题。中国企业需要在这样的环境下探索发展道路。
中国的应对策略
中国要想发展自己的AI,实现全产业链自主可控很重要。如无问芯穹的初心是推动中国把所有算力用起来与美国竞争。中国需要通过体系结构变革来应对美国限制,确保AI大模型在受限的算力环境下仍能发展。

相关问答
AIInfra是如何解决中国AI算力问题的?
AIInfra通过将各类模型与各种芯片解耦适配,减少算力资源闲置,实现模型发展的“提速降本”,提升算力利用率,从而解决中国AI算力获取成本高、部分芯片受限等问题。
无问芯穹的异构混训有什么优势?
无6%,可大幅降低算力使用成本。
阿里云的磐久0服务器对模型有什么影响?
磐久0服务器提供的功能可提高模型端到端训练性能10%以上,使AI算力有效利用率超90%,从而促使基础大模型降价,让更多人使用通义模型技术和阿里云计算服务。
美国限制对华AI算力供应对中国有哪些影响?
美国的限制使中国AI算力受限,获取成本更高。长期来看会影响中国AI产业发展,中国需要在这种限制下探索新的发展道路,如通过体系结构变革、提升算力利用率等方式应对。
百度的百舸AI异构计算平台有什么特点?
百舸5%的有效训练时长,并且万卡集群运行准备时间从数周缩减至1小时。
初创公司的AIInfra方案主要满足哪些需求?
初创公司的AIInfra方案主要满足模型方的需求,如通过MaaS软件解决方案提供项目制合作;满足中小开发者成本低、算力性能要求高、场景单一的需求,提供租用算力云和模型API平台等。

