视频生成模型大战开启,谁能笑到最后

视频生成模型的兴起
在当今的科技世界中,AI的发展可谓是日新月异。其中,视频生成模型成为了一个备受瞩目的领域。今年以来,越来越多的公司纷纷投身于视频生成模型的研发,使得这一领域呈现出一片繁荣景象。
MiniMax的入局
8月31日,MiniMax这个一向低调的“AI六小龙”之一,首次正式对外亮相,并在上海举办了“MiniMaxLink伙伴日”活动。其创始人闫俊杰宣布推出视频生成模型和音乐模型,还预告了新版对标GPT-4o的大模型abab7即将发布。
Video-1的特点
MiniMax推出的视频生成模型video-1具有压缩率高、文本响应好和风格多样的特点,能够生成原生高分辨率、高帧率的视频。目前虽然只提供了文生视频功能,但未来会不断迭代,增加图生视频、可编辑、可控性等功能。

行业的整体态势
自2月OpenAI发布视频大模型Sora以来,行业内众多知名企业纷纷跟进。4月生数科技发布视频大模型Vidu,6月快手发布AI视频生成大模型可灵,7月Runway宣布文生视频模型Gen-3Alpha向所有用户开放使用……短短几个月内,几十款视频生成模型相继问世,这无疑是AI视频生成领域的一个历史性时刻。
视频生成模型的体验与效果
用户体验
目前,所有用户都可以登录海螺AI官网体验video-1的视频生成功能。记者现场体验发现,输入简单的提示词,大概等待1-2分钟,就能生成6秒的视频。从输出效果来看,画面基本覆盖了提示词的要点,高清、色调审美合格,但人物面部细节仍有待改进。
效果评估
虽然视频生成模型取得了一定的成果,但距离用户的理想预期仍有差距。模型在生成过程中往往存在不懂物理规则、难以控制等问题,容易出现多出或少出东西、手穿模等结构性和细节性错误。
视频生成面临的挑战
技术难题
视频生成的工作复杂度远超文本生成。视频的上下文文本天然很长,输入和输出的数据量巨大,这对数据处理、清洗和标注提出了极高的要求。而且,之前基于文本建立的底层基础设施在处理视频数据时不太适用,需要进行升级。
开源困境
与文本生成领域不同,视频生成领域的开源内容相对较少。这意味着企业在研发过程中,很多工作需要从头开始,需要付出更多的耐心和努力。
视频生成的未来展望
行业变革
启明创投认为,结合3D能力,可控的视频生成将对影视、动画、短片的生产模式带来变革。未来图像和视频隐空间表示的压缩率有望提升五倍以上,从而使生成速度大幅提高。
发展前景
尽管当前面临诸多挑战,但随着技术的不断进步和创新,视频生成模型有望在未来取得更加出色的成果,为人们的生活和工作带来更多便利和惊喜。

什么是视频生成模型?
视频生成模型是利用人工智能技术,根据输入的文本、图像等信息生成视频内容的工具。
MiniMax的视频生成模型有何特点?
MiniMax的video-1模型具有压缩率高、文本响应好、风格多样的特点,能生成高分辨率高帧率视频,目前只有文生视频,未来会增加更多功能。
目前视频生成模型的效果如何?
目前能生成基本覆盖提示词要点的视频,但存在不懂物理规则、难控制、细节不足等问题,距离理想预期有差距。
视频生成面临哪些技术难题?
工作复杂度高,数据量大,上下文文本长,底层基础设施需升级,且开源内容少,很多工作要从头开始。
视频生成的未来会怎样?
有望对影视等领域生产模式带来变革,压缩率和生成速度会提升,尽管当前有挑战但前景乐观。
为什么众多公司纷纷涉足视频生成模型?
因为人类社会信息多体现于多模态内容,为提高用户覆盖度和使用深度,输出多模态内容是必然趋势。
转载声明:欢迎分享本文,转载请保留出处!
本文网址:https://www.caiair.cn/post/shipin-shengcheng-moxing-ai-jingzheng-502369.html

