7月9日,蚂蚁集团旗下蚂蚁灵波科技正式宣布开源LingBot-Video,这是全球首个基于MoE(混合专家)架构、面向具身智能的开源视频生成基础模型。该模型的发布,标志着视频生成技术正从“数字内容创作”向“物理世界理解”开辟出全新的演进方向。
LingBot-Video采用了DiT(扩散Transformer)+MoE的架构设计。其核心创新在于用MoE架构替代了传统的稠密(Dense)架构,通过30B(300亿)的总参数,在推理时仅激活约3B(30亿)参数,相比同等参数规模的稠密架构,推理效率提升了约3倍。这一设计使得模型在获得大参数视觉表达能力的同时,满足了具身智能对高效推理的严苛要求。
与通用视频模型不同,LingBot-Video从架构、数据到训练目标,全链路都是为机器人和人形智能体量身打造的。
LingBot-Video的开源,为具身智能研究提供了一个强大的基础模型。它可用于机器人动作预测、仿真数据生成、世界模型研究等多个前沿方向。