开源文生视频模型如何追赶Sora?

话题来源: 【每日AI必读资讯】AI智能体与大模型最新动态精选10条2024年12月16日

Sora的发布把文生视频竞争从“能否生成动态画面”推进到“能否稳定模拟复杂世界”。开源模型要追赶Sora,关键不在于简单扩大参数规模,而在于同时解决时空一致性、运动规律、镜头控制和长序列生成等问题。2024年12月,腾讯混元在Sora正式开放前后上线文生视频能力,并以130亿参数规模成为当时参数量最大的开源视频生成模型,开放模型权重、推理代码和模型算法。这说明开源阵营已经具备追赶的起点,但距离顶尖闭源系统仍需要系统性突破。

第一关:从“看起来像”到“运动合理”

视频模型的难点不是单帧画质,而是连续画面之间的因果关系。物体的形状、光照、遮挡和运动轨迹必须保持稳定,否则就会出现人物身份变化、肢体结构错乱、物体突然消失等问题。开源模型需要更高质量、更多样化的视频数据,并建立针对时间一致性的训练与评测机制。仅凭静态图像能力或参数规模,无法直接推导出可靠的视频生成能力。

第二关:降低推理门槛,扩大真实反馈

闭源模型的优势通常不仅来自模型本身,也来自算力、工程优化和持续迭代。开源路线应把模型权重、推理代码和算法开放转化为开发者生态,让更多人围绕视频尺寸、清晰度、镜头控制和行业场景进行实验。腾讯混元支持中英文输入、多种视频尺寸和清晰度,体现出产品化接口对生态扩张的重要性。只有生成成本可控、部署路径清晰,社区反馈才能反过来推动模型改进。

真正的追赶是评测体系的追赶

开源模型不能只展示少量精选样片,而应公开比较文本遵循度、动作连续性、物理合理性、画面稳定性和推理效率。未来的竞争也不会只是“谁先复刻Sora”,而是谁能在透明评测、可复现训练和垂直场景适配上形成优势。Sora提供了能力标杆,开源模型则需要用开放数据、开放工程和开放反馈,把一次发布变成持续演进的技术体系。

发表回复

登录后才能评论