News
安全与评测
美团发布 LARYBench 与 WBench,构建具身智能评估标准化体系
事件: 美团 LongCat 团队同日发布两项具身智能评估基准:LARYBench 系统性评估从人类视频中学习潜在动作表征的能力,实验发现通用视觉模型在动作泛化和控制精度上显著优于专门的具身 AI 动作专家模型;WBench 则是首个多轮交互式视频世界模型评估基准,旨在诊断 AI 从被动视频生成到主动交互的技术瓶颈。
关注原因: LARYBench 验证了”具身动作表征可以从海量人类视频数据中自然涌现”这一关键假设,WBench 则为世界模型评测提供了标准化框架——两项工作同时补上了具身智能评测体系的重要缺口。