大模型预训练“狼人杀”,谁会成为掉队者?

财云财经阅读:14172024-10-25 19:40:00评论:0
摘要: 大模型初创公司面临预训练抉择,成本、资源、能力等因素会影响,部分公司可能放弃,这会影响模型上限、应用落地等。

大模型预训练:一场昂贵的博弈

预训练的概念与意义

预训练的定义:预训练在大模型构建中是非常关键的一步。就像我们前面提到的,它是利用大规模数据对模型进行无特定任务的初步训练。这就好比是在培养一个全能型的人才,先让他广泛涉猎各种知识,而不是一开始就针对某一个具体的专业领域进行培养。例如,一个孩子在上学之前,会先通过日常生活中的各种经历去认识世界,这就是一种预训练的类似过程。

预训练的重要性:预训练为模型打下坚实的基础。经过预训练的模型能够获得更广泛的语言理解能力和基础的智能表现。这就像是盖房子打地基一样,如果地基打得牢固,那么后续在这个基础上盖起来的房子(针对特定任务的模型微调等操作)就会更加稳固。比如GPT-3,它在预训练阶段使用了海量的互联网文本数据,通过无监督学习让模型学习语言的统计规律和语义知识,这为它在各种自然语言处理任务中的出色表现奠定了基础。

预训练的成本之高

算力资源的消耗:预训练需要大量的算力资源。像OpenAI在训练GPT-3的时候,使用了微软提供的超级计算机系统,这个系统拥有超285,000个CPU核心和10,000个GPU,而且训练一次的费用就高达460万美元,总成本约1200万美元。GPT-3的训练还消耗了约3640PF-days的算力。这是一个非常庞大的数字,对于很多公司来说,这样的算力消耗是难以承受的。

数据资源的需求:除了算力,高质量的数据也是预训练不可或缺的。GPT-3使用了45TB的预训练数据,这些数据来源广泛,包括CommonCrawl、网络文本、维基百科等。收集和整理这些数据需要耗费大量的人力、物力和时间。

大模型预训练“狼人杀”,谁会成为掉队者?

人才资源的投入:有了数据和算力,还需要专业的人才来操作。预训练过程涉及到复杂的算法和技术,需要工程师具备较高的技术水平。从算法的设计到数据的处理,每一个环节都需要专业人才的参与,这也是一项不小的成本。

AI初创公司的十字路口:做与不做预训练

AI六小虎的现状

部分公司的转变:在被称为“AI六小虎”的中国大模型独角兽中,有消息称其中两家公司已经决定逐步放弃预训练模型,缩减预训练算法团队人数,将业务重心转向AI应用。这一转变反映出这些公司在预训练上面临着巨大的压力。

不同公司的考量因素:对于这些公司来说,预训练过程中的黑箱特质以及投入产出比是主要的考量因素。如果投入大量的资源进行预训练,但是得到的结果却不如开源的模型,那么继续坚持预训练就不是一个明智的选择。

不同公司面临的不同境遇

智谱AI、零一万物和DeepSeek:智谱AI有着“清华系国家队”的称号,背后有强大的资源支持;零一万物创始人在AI领域深耕多年,公司布局AIInfra且有新融资;DeepSeek背靠幻方量化,拥有上万张GPU。这些公司在资源和能力方面都有一定的优势,所以在预训练方面有更强的支撑。

月之暗面和MiniMax:月之暗面从一开始就明确ToC的决心,虽然是估值较高的企业,但除了首次发布的模型外,再未透露更多基座模型的消息,有声音称其基座模型是在已有模型基础上微调得来的。MiniMax的海外应用表现不错,但ABAB大模型进展缓慢。对于这两家公司来说,在预训练上投入更多资源可能面临投入产出比不高的问题。

阶跃星辰和百川智能:阶跃星辰急于证明自己的技术实力,虽然发布了千亿和万亿参数的模型,但在国际权威Benchmark上成绩仍弱于GPT-4-1107。百川智能在基座模型上的发展脚步在降速,在国际权威榜单上未上榜或未获好成绩。这两家公司在预训练方面似乎也面临着一些挑战。

预训练对模型性能和应用的影响

模型性能的上限

预训练与后训练的关系:后训练虽然可以提升模型在特定任务上的性能,但是它无法改变模型在预训练阶段学到的基础特征表示。这就意味着预训练很大程度上决定了模型性能的基准线和潜在的上限。例如LlaMa67B与LlaMa3.170B的模型后训练上限是不同的,这与它们的预训练结果密切相关。

技术优势的建立:如果一个公司能够在预训练阶段训练出优于LlaMa的自有模型,那么与在LlaMa基础上后训练的公司相比,就具备了技术上的天然优势。这种优势的建立需要技术能力和算力资源的双重支撑。

应用落地的考量

成本因素:从应用落地的角度来说,预训练能够让公司在模型的推理成本优化上有更多的掌控权。只有经过预训练,才能够深入了解模型架构,从而与AIInfra团队深度共建,以软硬件协同逼近理论上的最低推理成本。例如,字节跳动自研的豆包大模型,在预训练等多方面的努力下,以高性价比闻名。

安全因素:对于企业级和政府级客户而言,模型的安全性是非常重要的。与接入开源模型相比,自研的预训练模型更加安全可控。这直接关系到这些客户的核心利益,所以预训练在应用安全方面也有着重要的意义。

预训练中的人才流动与竞争

人才流动的现象

行业内的频繁流动:自ChatGPT爆火之后,国内对于AI领域的顶级研发人才的需求持续走高,人才在不同公司之间的流动非常频繁。例如原滴滴出行AILabs首席算法工程师李先刚在多家公司之间频繁跳槽,还有周畅、周昕宇、秦禹嘉等人才在不同的大模型相关企业之间流动。

国际间的类似情况:这种人才流动不仅在国内,在国际上也是如此。OpenAI、Google、微软、Meta、xAI等顶尖公司之间也存在预训练人才的互相流动。

人才对预训练的重要性

提升模型性能:人才资源的投入在模型预训练方面有着立竿见影的效果。零一万物就是一个例子,他们邀请了来自阿里、华为等大厂的高管、骨干加盟组建AIInfra核心团队,仅用2000张GPU、1个半月时间就训练出了超越GPT-4o(5月份版本)的Yi-Lightning。

构建竞争壁垒:一个模型要想在性能上达到世界第一梯队,并且做到又快又便宜,让用户用得好用得起,需要模型训练团队、AIInfra团队都具备世界顶尖水准,并且要深度共建共创。单靠挖一位算法负责人是无法实现的,这体现了人才在构建公司预训练竞争壁垒方面的重要性。

大模型初创公司的未来走向

能力与资源的平衡

资源劣势与能力凸显:在大厂入局之后,大模型初创公司在资源方面存在明显的劣势。但是这也凸显了能力方面的重要性。初创公司需要思考如何用自己的技术实力来弥补资源上的差距。例如,通过提高算法、AIInfra能力来降低训模成本和推理成本,或者增强资源整合能力来支撑在模型预训练上的尝试。

开源模型的警示:LlaMa3.1405B、Qwen-Max等顶尖开源模型的发布对大模型初创公司是一种警示,促使它们尽早做出关于预训练的选择。

分野与分化:中国大模型“小虎”们已经开始出现分野,从预训练这个环节开始,技术领先者已经逐渐脱颖而出。有些公司可能会放弃预训练,从而走下AGI的牌桌,而有些公司则会继续坚持,努力在大模型竞争中占据一席之地。不过,一旦掉队,再想赶上的难度会越来越高。

大模型预训练“狼人杀”,谁会成为掉队者?

相关问答

大模型预训练为什么成本这么高?

大模型预训练成本高主要体现在几个方面。首先是算力资源的消耗,像OpenAI训练GPT-3时使用大量CPU核心和GPU,训练一次费用就很高,还消耗大量PF-days的算力。其次是数据资源的需求,要收集如CommonCrawl、网络文本、维基百科等来源的大量高质量数据,这需要耗费很多人力、物力和时间。最后是人才资源的投入,预训练涉及复杂算法和技术,需要专业工程师参与,这些都导致成本很高。

预训练对大模型的性能有什么决定性影响?

预训练很大程度上影响着大模型性能的基准线和潜在上限。后训练虽能提升特定任务性能,但无法改变预训练阶段学到的基础特征表示。例如不同版本的LlaMa模型后训练上限不同就和预训练有关,能在预训练阶段训练出优于其他模型的自有模型,就会具备技术优势。

哪些因素会让AI初创公司考虑放弃预训练?

对于AI初创公司来说,如果预训练过程中的投入产出比不高,就会考虑放弃。比如花费大量资源做预训练,但成果比不上开源模型,像月之暗面和MiniMax在自己的业务发展过程中,面临预训练投入资源后成果不理想,在ToC业务或海外应用布局上投入更多资源可能更划算,就会倾向放弃预训练。

人才流动对大模型预训练有什么作用?

人才流动对大模型预训练有很大作用。一方面,人才资源投入能立竿见影提升预训练效果,像零一万物邀请大厂骨干加盟,短时间训练出优秀模型。另一方面,人才是构建公司在预训练方面竞争壁垒的关键,模型要性能好、性价比高,需要训练和AIInfra团队顶尖且深度共创,单靠个别算法人才无法达成。

大模型预训练在应用落地方面有哪些好处?

在应用落地方面,预训练有成本和安全两方面好处。从成本看,预训练能让公司深入了解模型架构,与AIInfra团队协同优化推理成本,如字节跳动豆包模型性价比高就得益于预训练。从安全看,对于企业和政府客户,自研预训练模型比接入开源模型更安全可控,关系到客户核心利益。

大模型初创公司如何应对资源劣势?

大模型初创公司应对资源劣势可以从提升能力方面入手。一是提高算法、AIInfra能力,用各种方式降低训模成本和推理成本,二是增强资源整合能力,支撑在模型预训练上不断尝试,从而用技术实力弥补资源差距。

声明

转载声明:欢迎分享本文,转载请保留出处!

本文网址:https://www.caiair.cn/post/da-moxing-yu-xunlian-ziyuan-928722.html

上一篇:

下一篇:

排行榜