← 返回 2026-09-27 简报

HappyWorld-Bench

HappyWorld-Bench

语音播报
摘要
事件:研究团队推出HappyWorld-Bench基准测试,旨在评估视频、空间及具身世界模型在交互与修改下的可靠性与一致性表现。 要点:构建涵盖1138个视频提示等数据的框架,通过HappyWorld-Arena进行人工对比并计算Elo评分,结合自动化指标量化行为正确性。 影响:揭示当前模型在长程一致性和状态保持上的不足,促使开发者从单纯关注视觉质量转向重视交互响应与物理规则的正确性。

评估世界模型需要同时评估其生成世界的质量,以及在探索、交互和修改过程中的稳定性和响应能力。我们推出了 HappyWorld-Bench,这是一个全面的基准测试,用于评估生成的世界在智能体与其交互时是否保持可靠。我们的设计基于六个世界能力(W1-W6)的分层能力框架,从生成式构建到统一的世界建模,并在三个独立的评估赛道中实现:视频世界模型、空间世界模型和具身世界模型。HappyWorld-Bench 包含 1,138 个视频提示、300 个空间场景和 254 个具身测试用例。在所有三个赛道中,我们构建并运行了 HappyWorld-Arena,以组织人类 A/B 比较并得出模型级别的 Elo 评级,这些评级与旨在捕捉行为正确性的全新设计的自动化指标相辅相成。在此统一框架下,我们评估了 14 个视频世界模型、9 个空间系统和 8 个具身候选模型。结果表明,所有三个赛道仍存在可靠性差距:视频模型在长程生成和重新访问期间表现出一致性下降;空间模型最多仅能达到 70.14% 的放置准确率和 73.33% 的编辑执行率;而具身模型难以在多步动作中保持状态一致,并对改变的动作条件和物理规则做出精确响应。这些发现凸显了评估世界模型时不仅要看视觉质量,还要看状态一致性以及其对动作和干预响应的正确性。

本条评分 9.8 score-v1
  • 来源权威 9
    注册表 priority=9(HuggingFace Daily Papers)
  • 时效 0.772
    发布 70.5 小时前,衰减到 0.77/3.0
  • 多源印证 0
    只有 1 家在报(无旁证)
  • 社区信号 0
    无社区数据(本管线走 RSS,HN 的 hn_fetcher 未接入)
历史
刊期得分排名结果
2026-09-27 9.77 15 入选
2026-09-26 10.22 22 未入选
2026-09-25 10.95 15 未入选
原文链接:https://huggingface.co/papers/2609.24308
来源:HuggingFace Daily Papers
以上内容由 AI 自动翻译,仅供参考。
← 返回简报