AI视频发展迅速,能否超越好莱坞?

AI视频的热闹开场
近年来,AI技术在各个领域大放异彩,AI视频领域更是掀起了一阵热潮。自年初Sora露面后,国内外众多公司纷纷涌入这一赛道,试图用AI颠覆好莱坞。近期,AI视频圈的动态可谓是目不暇接,新产品一个接一个地发布,竞争异常激烈。
国内外的激烈竞争
在国外,AI视频初创公司Luma推出了DreamMachine视频生成模型,还发布了令人惊叹的电影级别宣传片,并提供免费试用;Runway也不甘示弱,宣布将Gen-3Alpha模型向部分用户开启测试,声称能精细地生成光影等细节。
而在国内,快手的可灵Web端能让用户生成长达10秒的视频内容,还具备多种控制功能。字节旗下的即梦制作的AI科幻短剧《三星堆:未来启示录》等作品也相继亮相。
可用产品有限,技术难题待解
可用产品的困境
虽然AI视频赛道推出的产品/模型众多,但真正能让大众方便使用的却十分有限。很多产品仍处于内测阶段,如国外的Sora,国内阿里达摩院的“寻光”、百度的UniVG等。即使是能使用的产品,也存在使用门槛,部分需要用户付费或具备一定技术知识。

技术难题
在技术方面,生成视频的清晰度和时长是竞争的重点。目前,国内外大多数AI视频支持的分辨率有限,且生成长秒数的能力参差不齐。生成的视频内容还需要具备合理性和准确性。
AI视频的评估维度
准确性
准确性体现在对内容结构、流程控制和静态数据建模的准确理解。例如生成“两个女孩在操场看篮球比赛”的视频,要确保出现的是两个女孩,投篮动作和篮球的运动轨迹符合实际,且不会出现错误的物体。
一致性
一致性包括主体注意力和长期注意力。主体注意力要求主要人物在画面中保持稳定,长期注意力则要保证元素在运动中不丢失不变形。
丰富性
丰富性意味着AI能自主生成合理的细节内容,增强视频的逻辑性和吸引力。
解决办法与现状
图生视频的尝试
为了解决人物一致性等问题,一些产品采用图生视频的方式,但这并非新技术突破,且存在诸多限制,目前还未达到商用程度。
技术叠加的探索
大多数模型在原有底层DIT大模型基础上叠加技术,以加深AI对主角面部特征的记忆,但仍未完全解决人物一致性问题。
AI视频发展缓慢的原因
底层技术与训练数据
目前,AI视频在底层技术上基本一致,更多的竞争在于训练数据。现有的可用训练数据挖掘殆尽,需要寻找新的办法制造更多有效数据。
模型风格与应用领域
每个AI视频模型都有擅长的风格,且数据支撑决定了其优势领域。在短视频领域,AI要实现大规模商用和超越好莱坞,还有很长的路要走。

AI视频生成技术现在成熟了吗?
还没有成熟,虽然取得了一些进步,但技术水平还不足以支撑大范围商业化。
为什么AI视频的训练数据挖掘困难?
因为AI视频又搭了一个时间轴,且训练视频模型比文字、图片更难,现有的可用数据已基本用尽。
图生视频有什么优缺点?
优点是在实际场景中效果更符合用户预期,对生成视频有帮助;缺点是难度低于文生视频,有时间和效果的限制。
AI视频模型的风格是怎么形成的?
由其训练数据和所采用的技术决定,不同的数据和技术导致模型在某些方面表现更出色,形成独特风格。
AI视频在短视频领域面临哪些挑战?
面临精准度、可控度不足,训练数据有限,以及尚未形成有影响力作品等挑战。
怎样解决AI视频生成的人物一致性问题?
目前通过图生视频、在原有模型基础上叠加技术等方法尝试解决,但还未完全成功。

