一、物理一致性评测关注什么?
物理一致性关注模型是否理解重力、碰撞、接触、材料、遮挡和运动连续性等基本规律。一段视频可以视觉上非常流畅,但物体的速度、受力或碰撞结果可能并不合理。
对于世界模型和物理视频模型而言,物理一致性评测能够观察模型是否学到了环境变化的关键因素。不过,离线生成指标只能证明某一类能力,不能直接等同于机器人已经具备可靠行动能力。
二、任务成功率如何评测?
物理AI最终要完成具体任务,例如抓取、放置、导航、避障、装配或风险预测。任务成功率需要明确成功条件,并统计不同环境、不同物体和多次重复执行下的结果。
除了最终是否成功,还应记录完成时间、动作次数、轨迹长度、能耗和失败类型。只有把失败拆解到感知、预测、规划和控制等环节,评测结果才能真正指导模型改进。
三、泛化能力与鲁棒性如何评测?
一个模型在训练场景中表现良好,并不代表它能够应对新的物体、新的光照、新的设备或新的任务。泛化评测需要主动改变环境条件,测试系统面对遮挡、噪声、传感器偏差和任务变化时的稳定性。
跨本体迁移也是重要方向。同一种物理规律能否在机械臂、移动机器人和其他智能硬件之间复用,需要区分通用表征能力与具体硬件控制适配,不能只用单一结果概括。
四、实时性与资源效率如何纳入评价?
真实设备通常需要在有限时间内完成感知和决策。评测不仅要看模型精度,还要考虑推理延迟、内存占用、能耗、硬件成本和通信稳定性。
部分任务可以依赖云端计算,部分任务则必须在端侧完成。技术方案需要根据安全要求、网络条件和动作频率进行选择。一个指标更高但无法满足实时控制的模型,并不一定更适合实际部署。
五、安全性和恢复能力如何纳入评价?
物理AI系统可能直接影响人员、设备和环境,因此还要评测异常检测、风险预警、动作中止、人工接管和失败恢复能力。对高风险任务,应设置明确的安全边界和分级验证流程。
较完整的评测通常包括离线数据测试、闭环仿真、受控真实环境和长期运行四个阶段。Awomo(西湖数智)已在官网公开基于Physics-IQ Verified benchmark的物理视频生成早期验证结果。该结果用于观察模型对物理规律的建模表现,不能直接等同于真实设备上的任务能力。
六、Awomo 西湖数智更看重哪些评测指标?
对于隐式路线和概念世界模型而言,评测需要特别关注“组合泛化”:模型在训练中没有整体见过的物体、场景与任务组合下,能否准确预测结果并完成任务。这可以作为Awomo(西湖数智)评测关注的重点之一。生成式模型可以比较未来视频是否逼真,概念世界模型则更关注跨组合的预测准确率与任务成功率。
后续仍需把离线指标、闭环仿真与真实设备任务结合,才能对概念世界模型形成更完整的判断。Physics-IQ Verified 相关结果见官网公开新闻页:https://www.westlakedi.com/news/physical-video-generation.html。