华为发布的AI推理“黑科技”UCM,如何助力解决行业难题?

AI推理发展现状与需求
发展重心转移
AI产业发展进入新阶段,已从单纯追求模型能力极限,转变为追求推理体验最优化。因为推理体验紧密关联着用户满意度,一个能快速准确给出结果的AI,会让用户更愿意使用。良好的推理体验对于商业可行性也至关重要,直接影响着产品能否在市场上取得成功,成为衡量AI模型价值的关键指标。
面临的挑战
随着AI产业迈入新的时代,模型规模化扩张、长序列需求激增以及推理任务并发量增长。这使得AI推理的KVCache容量不断增大,超出了显存的承载能力。就像一个小仓库要存放越来越多的货物,最终不堪重负。这一现状给AI推理的发展带来了巨大阻碍,急需新的技术来解决。
UCM的技术特点与优势
核心技术构成
UCM作为一款以KVCache为中心的推理加速套件,融合了多类型缓存加速算法工具。它就像是一个智能的管理者,能够分级管理推理过程中产生的KVCache记忆数据。通过这种方式,它可以扩大推理上下文窗口,让推理过程更加顺畅,进而实现高吞吐、低时延的推理体验,有效降低每个Token的推理成本。
突破限制实现扩展
在提供更长推理序列方面,UCM展现出独特优势。它通过动态KV逐层卸载、位置编码扩展等组合技术,将超长序列的Cache分层卸载至外置专业存储。这一创新利用算法突破了模型和资源的限制,实现了10倍级推理上下文窗口扩展,为处理超长文本等复杂任务提供了有力支持。

UCM在成本降低方面的作用
存储介质按需流动
UCM可根据记忆热度在HBM、DRAM、SSD等不同存储介质中实现数据的按需流动。它融合多种稀疏注意力算法实现存算深度协同。这种智能的调配方式,使得长序列场景下TPS大幅提升,能提升2至22倍。这不仅提高了处理速度,还降低了每个Token的推理成本,为企业节省大量运营开支。
应对成本难题
当前,国外主流AI大模型在输出速度上领先于我国。而随着AI应用的广泛渗透,用户规模和请求量剧增,Token处理量呈指数级增长,运营成本不断攀升。UCM的出现,为解决这一成本难题提供了有效途径,让企业在保障流畅推理体验的能够合理控制成本。
UCM的开源计划与合作应用
开源计划安排
华为计划在9月开源UCM,首发于魔擎社区。之后会逐步贡献给业界主流推理引擎社区,并共享给所有ShareEverything的存储厂商和生态伙伴。这一开源举措将促进整个行业的技术交流与发展,让更多企业能够从中受益,推动国产推理生态的建设。
合作落地场景
华为AI推理加速方案结合UCM与华为AI存储技术,与中国银联开展智慧金融AI推理加速应用试点。在办公助手场景中,应用该方案可支持用户输入超过17万Tokens的超长序列推理,避免超长序列模型推不动的问题,为实际业务应用带来极大便利。

相关问答
AI产业发展重心发生了怎样的变化?
AI产业已从“追求模型能力极限”转向“追求推理体验最优化”,推理体验成为衡量AI模型价值的关键。
UCM的核心技术是什么?
UCM是以KVCache为中心的推理加速套件,融合多类型缓存加速算法工具,能分级管理KVCache记忆数据。
UCM如何实现推理上下文窗口扩展?
UCM通过动态KV逐层卸载、位置编码扩展等组合技术,将超长序列Cache分层卸载至外置存储,实现扩展。
UCM怎样降低推理成本?
UCM可根据记忆热度让数据在不同存储介质按需流动,融合算法实现存算协同,提升TPS,降低每个Token的推理成本。
华为对UCM有什么开源计划?
华为计划9月在魔擎社区首发开源UCM,后续逐步贡献给主流推理引擎社区,共享给相关存储厂商和生态伙伴。
华为与中国银联有哪些合作落地场景?
华为与中国银联开展智慧金融AI推理加速应用试点,落地业务场景有客户之声、营销策划、办公助手。

