行业动态更新:全球首个面向具身智能的视频基模,蚂蚁灵波 LingBot-Video 开源
IT之家 7 月 9 日消息,今天,蚂蚁灵波科技正式开源 LingBot-Video
业内人士指出,过去几年,视频生成模型在画质、流畅度和创意表达上取得了快速进步
从更深层次来看,这一结果表明,LingBot-Video 在生成机器人相关视频时,更能保持动作过程的合理性和任务执行的完整性
业内人士指出,在北京大学联合字节跳动发布的基准 RBench 上,LingBot-Video 的总分是 0.620,超越了 Wan2.6(0.607)、Seedance 1.5 Pro(0.584)、Cosmos3 Super(0.581)
值得关注的是,RBench 作为面向机器人操作视频的综合评测基准,重点考察模型能否生成符合真实物理规律的机器人行为
从更深层次来看,与此同时,具身智能还要求模型具备更高的推理效率,以适应实时交互和控制闭环
业内人士指出,这也让视频生成开始出现两种不同的演进方向:一条通向影院,服务于内容创作;另一条通向机器人,服务于物理世界的理解、预测与交互
业内人士指出,这一设计使模型既能获得大规模参数带来的视觉表达能力,又更适合具身智能对高效推理的要求
值得关注的是,结果显示,LingBot-Video 在具身领域表现优于 NVIDIA Cosmos 3、Wan 2.2 A14B、LongCat-Video、Hunyuan Video 1.5、LTX-2.3 等主要基线模型
从更深层次来看,目前,LingBot-Video 已正式开源
值得关注的是,LingBot-Video 正是我们面向具身智能开辟视频生成新路线的重要探索 —— 围绕具身智能的核心需求,重新设计视频预训练范式,在推理效率、物理合理性、动作理解和任务完成度等方面实现系统性提升
值得关注的是,除美学、prompt 跟随和运动一致性等常规指标外,模型进一步围绕物理合理性和任务完成度进行对齐
值得关注的是,LingBot-Video 的 30B 总参数模型在生成时仅激活约 3B 参数,相比同等参数规模的 Dense 架构拥有约 3 倍的推理效率
业内人士指出,这些数据帮助模型学习动作与环境变化之间的关系,而不只是学习视频的表面纹理和视觉风格
从更深层次来看,数据:数据画像引擎与 7 万小时具身数据 我们构建了数据画像引擎,在海量互联网视频的基础上,进一步引入 VLA、VLN、Ego 等机器人相关数据
值得关注的是,这是全球首个基于 Mixture-of-Experts(MoE)架构、面向具身智能的开源视频生成基础模型
从更深层次来看,面向具身智能,LingBot-Video 从架构、数据和训练三方面进行了系统创新: 我们以 MoE 替代传统 Dense 架构,在扩大模型容量的同时控制单次推理成本
值得关注的是,但对于具身智能来说,一个看起来逼真、动作流畅的视频,未必能反映真实的物理规律,往往难以支撑机器人连续预测、规划和执行任务
值得关注的是,为进一步验证 LingBot-Video 对物理世界变化的建模能力,蚂蚁灵波在内部 benchmark 中从通用质量和具身领域两个维度进行评估
值得关注的是,此外,在面向物理现象生成与预测的 Physics-IQ Verified 评测中,LingBot-Video 同样排名第一
业内人士指出,LingBot-Video 可用于机器人动作预测、仿真数据生成、动作条件建模、世界模型研究等方向
业内人士指出,这些数据覆盖了灵巧操作、机器人移动和第一视角交互等场景,总规模达 7 万小时
从更深层次来看,我们还引入了真实世界视频作为偏好信号,使生成结果更符合真实世界规律,也更贴近机器人在真实世界完成任务的需求
随着IDC行业的快速发展,可持续发展将成为未来竞争的关键
如果您正在寻找优质的香港服务器,欢迎访问 www.isclouder.com 了解更多
