海内外视频模型API开放,商业化空间有多大?

AI视频模型的密集发布
国内外的发布情况
近年来,AI视频模型的发布呈现出密集的态势。无论是国外的Meta、谷歌、Runway、Pika,还是国内的字节跳动、快手、阿里、Minimax等公司,都积极投身于AI视频模型的研发与发布。这些模型都具备生成5秒以上视频的能力,在色彩、动态、质量等方面普遍达到了较高的水平。
以Meta为例,它作为一家科技巨头,在AI领域的布局深远。其AI视频功能将集成在Facebook、Instagram等社交平台,这无疑会借助平台庞大的用户基础,进一步提升用户渗透率。在国内,虽然有部分模型公司如Kimi、阶跃星辰等尚未发布视频模型,但根据行业发展趋势以及市场竞争压力,后续有望推出自己的视频模型。
大厂与创业公司的推动
在国内,视频模型主要由大厂和AI创业公司共同研发。其中,AI创业公司中的Minimax和智谱AI已经发布了视频模型,并且在性能上位于国内第一梯队。根据媒体报道,月之暗面、阶跃星辰也有望在年内发布视频模型。这些创业公司的积极参与,为整个行业注入了新的活力。而科技大厂也不甘示弱,快手可灵自6月发布以来已经完成了10次迭代,其AI视频编辑功能即将上线,这将大大增加可灵的实用性。字节的豆包视频模型也已经在内测API和应用,国庆节后会放出更多公开API。

API开放与商业化展望
API的开放现状
API的开放是AI视频商业化的重要一步。近期,快手可灵、智谱、Runway等模型均开放了视频模型API。从收费情况来看,平均生成一段5秒的视频收费在0.5元-2元不等。这一收费标准反映了目前市场对于AI视频生成的成本与价值的初步衡量。
商业化空间的拓展
随着AI视频在C端娱乐社交、B端影视内容制作等场景下的应用渗透率不断提升,再加上API成本的持续下降,AI视频的商业化空间有望被打开。在C端,用户对于娱乐性的AI视频应用有着较高的需求,而在B端,影视制作等行业对于提高效率、降低成本的AI工具需求强烈且付费意愿较高。
性能迭代:动态效果与功能创新
动态效果的提升
核心能力进展:在AI视频的发展中,动态效果的提升是一个关键的方面。物体进行自然流畅的运动,并保持一致性和物理性一直是AI视频的主要难点之一。随着技术的发展,这一难点正在逐步被攻克。动态表现对于AI视频能否大规模应用有着重要的影响。一方面,动态效果的优化使得AI视频内容可以从单纯的背景、转场拓展至物体运动,大大丰富了视频内容的表现形式;另一方面,在影视制作领域,动态效果的制作成本高、耗时长,AI技术在这方面的进步可以实现降本增效。例如国内的可灵、豆包和海外的MetaMovieGen在动态效果方面就表现得较为出色。
具体模型表现:以快手可灵为例,其1.5模型的动态质量相比1.0模型有了显著提升。在可灵AI出圈案例“小男孩吃面”中,1.5模型能够更逼真地展现面条从被夹起到入口的过程,面条的弹性、垂坠感表现较好,同时小男孩手握筷子和咀嚼面条的动作也更加自然流畅,整体运动合理性增强。字节的豆包在动作连贯和运镜表现方面也非常突出,根据Demo视频,人物可以完成“摘下墨镜、站起身、走向雕像”的连贯动作,还能实现360度围绕主体环绕、前后景变焦、目标跟随、升降镜头等视角切换,极大地提高了物体动态的动感和沉浸式感受。
功能创新的成果
视频编辑功能:AI视频的可控性一直是一个问题,仅靠提示词难以达到预期效果。不过,一些公司已经在这方面取得了进展。例如Runway和爱诗科技分别在23年11月和24年6月发布了运动笔刷功能,通过箭头、滑块等控制物体的运动方向和距离。近期发布的MetaMovieGen更是可以通过文本提示词,对视频局部元素进行编辑,如添加、移除和替换元素、修改背景、修改视频风格等,视频编辑的精准度和便利性显著提高。
音效匹配功能:之前,现有产品普遍只能生成静音的视频,这主要是因为AI配音面临着较多的难点,如物体和场景识别、声音模式检索、声音元素重组等。但是,Pika在今年3月率先推出了音效生成功能SoundEffects,支持根据Prompt或视频内容生成音效,例如车鸣声、广播声和欢呼声。阿里万相在9月发布时也带有音效,虽然目前经实测音效是自动生成的,无法通过提示词定制或修改,但MetaMovieGen包含最大参数130亿的音频生成模型,可以基于视频和可选的文本提示词生成最长45秒的高质量保真音频,包括环境声音、音效和背景音乐,并且音效将与视频内容同步。
个性化视频功能:在当前公开可用的视频模型中,生成视频的时长最长约10秒,如果想要生成微短剧等影视作品,就需要将多个视频拼接到一起,并且要保证各个视频中的人物、风格是一致的。PixVerse在24年4月率先推出“角色”功能,基于用户输入的人物图像,生成该人物的视频;7月在V2版本中进一步升级一致性功能,支持一次性生成最多5段8秒视频,且片段之间会保持主体形象、画面风格和场景元素的一致。MetaMovieGen也同样支持个性化视频生成,随着这类功能的普及,AI视频有望在短剧制作等对情节一致性要求较高的场景加速落地。
视频特效功能:Pika1.5增加了Pikaffects,包含压扁、融化、被切开、爆炸、挤压、膨胀等一系列物理特效功能。这一功能的增加有望拓展趣味视频、表情包生成等C端场景,增加AI视频的趣味性和可玩性。
应用落地:三大场景的展望
C端社交娱乐场景
需求与现状:从去年至今,妙鸭相机、Remini粘土特效、对嘴型唱歌等AI玩法的出圈,充分验证了用户对娱乐类AI多模态场景的高需求。对于普通用户而言,视频剪辑和生成都不是高频功能,并且现有视频模型对prompt的要求仍然比较高。所以,C端产品需要聚焦具体且刚需的社交娱乐场景。
Meta与字节的布局:以Meta为例,旗下的社交应用有望集成AI视频能力。目前MetaAI已经集成在公司旗下各个App中,提供资料搜索、文字和图像生成、图像理解等功能,其月活已超5亿,在Meta旗下应用的月活渗透率已超10%。据Meta官网消息,AI视频能力有望在25年集成至Instagram等社交应用中,用途包括制作生活日常短视频并在Reels上发布、定制生日问候并通过WhatsApp发送给朋友等。字节跳动也在积极布局,字节豆包首款AI智能体耳机OlaFriend已于24年10月发布,售价1199元。该产品接入豆包大模型,用户戴上耳机后无需打开手机就可以直接通过语音唤起豆包进行对话。耳机的语音识别能力较强,在日常信息查询、旅游出行、英语学习等场景用途较大。随着豆包视频模型的全面开放,AI硬件有望为豆包的AI技术提供新的落地方式,可能会带来新的AI玩法,如自动剪辑设备录制的音视频、实时AI虚拟人对话等。
中短视频内容创作场景
工作流的重构:目前,快手可灵和字节即梦已经分别集成至快影和剪映两大视频剪辑App中,重构了短视频创作工作流。AI短片产品的落地速度也比较快,美图公司的AI短片创作工具MOKI已全面开放,昆仑万维旗下的AI短剧平台SkyReels已发布并即将开启内测。
以MOKI为例的创作流程:以美图的MOKI为例,用户只需经过三大步骤就可以完成AI短片制作。首先是前期设定,设定好脚本、角色形象和视觉风格;然后是生成视频素材,AI会生成相应的分镜图,再生成视频片段;最后是连接成完整的长视频,各个视频片段组合成完整的长视频,并且支持用户为特定篇端增加音效、驱动角色说话等。
专业级影视创作场景
行业需求与合作情况:专业的影视创作场景对AI工具需求高、付费意愿强。根据动画艺术家工会的问卷调查,美国55万名影视行业从业者中,已经有69%的公司在使用生成式AI技术,其中约44%的公司将其应用于生成3D模型,39%的公司应用于设计角色和环境。因此,Sora、Runway、MetaMovieGen、快手可灵等头部视频模型均积极与影视行业开展合作。
具体合作案例:9月Runway与狮门影业达成AI电影制作的合作,狮门影业将开放其丰富的影视资源库,包含超两万部影视作品,Runway将基于该影视数据构建一个定制化的AI视频生成和编辑模型,旨在辅助狮门影业的创意团队提升制作效率。同期,快手可灵携手李少红、贾樟柯等九位中国导演,共同启动了中国首个AIGC电影短片共创计划,智谱也与华策影视合作开发视频模型。这些合作表明AI技术有望逐步渗透影视行业制作全流程,推动AI视频技术在影视行业加速落地。
技术创新:Meta的新路线及其影响
Meta的新架构
MetaMovieGen提出了新的AI视频技术路线,采用了Transformer+流匹配(FlowMatching)的技术架构。这与之前Sora验证的DiT架构有所不同。Sora的DiT架构需要多步迭代以靠近目标,因为扩散模型的生成过程是从随机噪声开始,通过去除噪声来生成样本,需要大量的迭代步数逐步逼近目标分布,DiT架构是把Transformer的能力引入到这个扩散模型里,本质上还是扩散的思路,需要大量的迭代来接近目标。而Transformer+FlowMatching的新思路则是直接学习样本从噪声向目标数据分布转化的速度,模型只需通过估计如何在每个时间步中演化样本,即可生成高质量的结果,无需大量的逐步迭代。因此,与扩散模型相比,新方法训练更加高效,计算成本更低,并且生成的结果在时间维度上具有更好的连续性和一致性。
技术报告的意义
Meta对外展示了MetaMovieGen的92页技术论文,包括架构、训练细节、测评方法和结果等内容。这一做法延续了Meta在大模型领域较为开放、共享的思路。根据技术论文,MovieGen由两个模型组成,包括300亿参数的视频模型MovieGenVideo和130亿参数的音频模型MovieGenVide,沿用了较多Llama3的架构设计。在测评方面,由于视频模型涉及一致性、流畅度、色彩等大量主观评价标准,Meta主要采用人工比较的方式,对现有视频模型进行多维度的评估,结果显示MovieGen的视频生成效果小幅度超越Sora和可灵1.5,显著超过RunwayGen-3和Luma。Meta还开源了多个基准测试数据集,包括MovieGenVideoBench、MovieGenEditBench和MovieGenAudioBench,为其他视频厂商和研究者提供了权威的评测工具和方法,有利于加速AI视频领域的进步。
AI视频面临的风险
版权与知识产权风险
在AI视频的发展过程中,版权保护力度不及预期是一个潜在的风险。由于AI视频生成涉及到大量的数据和算法,知识产权的划分往往不够明确。这可能导致IP影响力下降,例如如果无法明确视频内容的版权归属,可能会影响到相关IP的价值和影响力。与IP或明星合作也可能会因为版权问题而中断,从而影响AI视频的发展。
市场与用户风险
大众审美取向发生转变是市场风险的一个方面。如果AI视频的风格和内容不能及时跟上大众审美变化的步伐,可能会导致用户对其失去兴趣。竞争加剧也是一个不容忽视的风险,随着更多的公司进入AI视频领域,市场竞争会愈发激烈。如果产品不能持续创新和优化,就可能会被市场淘汰。而且,用户付费意愿低、消费习惯难以改变等问题也会影响AI视频的商业化进程。
公司内部风险
关联公司公司治理风险可能会影响到AI视频业务的发展。如果公司内部管理不善,可能会导致决策效率低下、资源分配不合理等问题。内容上线表现不及预期也是一个风险,例如如果AI视频内容的质量、趣味性等不能满足用户的期望,可能会导致用户流失。生成式AI技术发展不及预期、产品研发难度大、产品上线延期、营销买量成本上升、人才流失、人力成本上升以及政策监管等风险,都会对AI视频的发展产生不同程度的影响。

相关问答
什么是AI视频模型?
AI视频模型是一种利用人工智能技术构建的模型,能够生成具有一定时长、在色彩、动态、质量等方面达到较高水平的视频。
API开放对AI视频商业化有什么作用?
API开放使得更多的应用能够集成视频生成能力,随着API成本下降和应用渗透率提升,可吸引更多用户和企业使用,从而拓展商业化空间。
AI视频模型在动态效果方面有哪些提升?
物体运动更自然流畅且保持一致性和物理性,从背景转场拓展到物体运动,像可灵5模型展现面条动态更逼真,字节豆包动作连贯运镜表现佳。
AI视频有哪些创新功能?
有视频编辑如MetaMovieGen可文本提示词编辑视频元素,音效匹配如MetaMovieGen可生成音频,个性化视频如PixVerse保持角色一致,视频特效如Pika5的物理特效。
AI视频在C端社交娱乐有哪些应用可能?
Meta可能将AI视频集成到Instagram等用于制作日常短视频等,字节豆包的AI硬件可能带来自动剪辑设备录制音视频等新玩法。
AI视频在影视创作中有哪些合作案例?
Runway与狮门影业合作构建定制化模型,快手可灵携手中国导演启动共创计划,智谱与华策影视合作开发视频模型。

