腾讯混元视频生成大模型上线开源,它在评测中的表现如何?

腾讯混元视频生成大模型上线
上线情况
12月3日,腾讯混元视频生成大模型正式上线。此前混元大模型已推出多种能力,此次视频生成能力的推出,补齐了混元系列大模型的重要一块。这一模型的推出标志着腾讯在人工智能领域的持续拓展。
开源情况
腾讯宣布开源该视频生成大模型,参数量达130亿个,是当前最大的视频开源模型。通过腾讯元宝App能使用该功能,不过前期需要申请。其在HuggingFace平台及Github发布完整模型,可供免费使用与开发插件。
评测表现优秀的体现
输入与输出特点
记者体验得知,用户输入一段描述就能生成视频,支持中英文双语输入、多种尺寸和清晰度。这一操作方式和多数视频生成大模型相似,但也有自身的优势。
多维度领先
腾讯将混元视频生成大模型与其他顶尖模型评测对比,在文本视频一致性、运动质量和画面质量等多维度效果领先。例如能生成超写实画质、符合提示词的画面且流畅不易变形。

场景表现出色
在人物、人造场所等场景下表现尤为出色。像在冲浪、跳舞等大幅度运动画面生成中,镜头流畅合理,物体不易变形,光影反射符合物理规律,还能自动切镜头,这是很多模型不具备的。
在竞争赛道中的地位
赛道竞争状况
自OpenAI发布Sora后,视频生成大模型赛道竞争激烈。国内也有众多企业相继推出相关模型,如字节跳动、商汤等。腾讯虽不是最早推出的企业,但产品性能表现不错。
自身优势体现
腾讯混元视频生成大模型最长可生成16秒视频,和Meta相当。其领先能力源于技术创新,采用类似Sora的DiT架构并升级,还有适配的文本编码器等多种先进技术。
商业场景应用
可用于工业级商业场景,如广告宣传、动画制作等。已有多家媒体在内部测试阶段用于创意视频制作,制作出多部优秀作品。
混元系列大模型全面开源的意义
开源吸引开发力量
大模型开源可吸引全球开发者参与改进优化,国内外已有不少开源大模型。腾讯混元系列之前已开源部分模型,此次视频生成大模型开源后实现全面开源。
助力行业创新步伐
基于开源模型,开发者和企业无需从头训练,可直接推理,还能打造专属应用和服务,能节约人力和算力,从而加速行业创新发展。

相关问答
腾讯混元视频生成大模型如何使用?
可以通过腾讯元宝App,先后点击“AI应用”“AI视频”来使用,但前期需要申请。
腾讯混元视频生成大模型在评测中哪方面表现最好?
在文本视频一致性、运动质量和画面质量多个维度效果领先,特别是在人物、人造场所等场景下表现尤为出色。
腾讯混元视频生成大模型开源有什么好处?
可供企业与个人开发者免费使用和开发生态插件,吸引全球开发者参与改进优化,加速行业创新步伐。
腾讯混元视频生成大模型的技术创新点有哪些?
使用类似Sora的DiT架构并多处升级,适配新一代文本编码器,采用统一全注意力机制,还有先进的图像视频混合VAE。
腾讯混元视频生成大模型能用于哪些商业场景?
可用于广告宣传、动画制作、创意视频生成等工业级商业场景。
与其他视频生成大模型相比,腾讯混元的优势是什么?
其在多维度评测中领先,最长可生成16秒视频,具备多种技术创新,在一些场景下有独特表现,如自动切镜头等。
转载声明:欢迎分享本文,转载请保留出处!
本文网址:https://www.caiair.cn/post/tengxun-hunyuan-shipin-shengcheng-da-moxing-537387.html

