← 返回 2026-10-05 简报

EgoTools:迈向真实世界第一人称视频中的工具中心推理

EgoTools: Towards Tool-Centric Reasoning in Real-World Egocentric Videos

语音播报
摘要
事件:研究团队发布EgoTools,包含100小时第一人称视频数据集及诊断基准,旨在解决具身智能在工具推理上的数据缺失问题。 要点:构建千题基准测试,揭示顶尖模型在感知 grounding 上仅51.7%准确率;利用该数据微调Qwen3-VL-8B,准确率提升至60.9%。 影响:为具身智能提供统一训练与评估资源,推动多模态模型从通用视频理解向真实世界工具中心推理能力跃迁。

论文

arxiv:2609.39378
复制 Markdown

EgoTools:迈向真实世界第一人称视频中的以工具为中心的推理

发布于 9月30日
·
提交者
Shulin Tian
于 10月2日
·
Ropedia

作者:
Shulin Tian
,
Junsu Kim
,
Shuai Liu
,
Hao Li
,
Yujiao Shen
,
Sihan Li
,
Zhe Yang
,
Yeongon Kim
,
Feiyu Li
,
Jialin Wu
,
Yichi Zhang
,
Wenhui Wang
,
Runmao Yao
,
Yuhao Dong
,
Zhaoxi Chen
,
Fangzhou Hong
,
Antonino Furnari
,
Jingkang Yang
,
Hongyuan Zhu
,
Ziwei Liu

摘要

现实世界中的具身任务,从日常活动到专业流程,要求智能体在物理约束下行动,同时跟踪不断变化的物体和任务状态。工具使用处于此类任务的核心地位,因为许多日常和专业活动都是通过工具介导的。理解这些任务需要对可供性、手-工具-物体的几何关系、程序进展以及对目标对象的因果效应进行推理。然而,尽管在诸如图像描述和通用视频问答等以感知为导向的视频任务中表现强劲,当前的多模态视频模型在以工具为中心的具身推理方面仍然受限。这一方向的进展受到缺乏真实世界第一人称数据和诊断基准的限制。为了弥补这一空白,我们引入了 EgoTools,这是首个针对第一人称工具使用理解的综合性套件。它由两个互补的部分组成:EgoTools-Data,一个包含100小时以工具为中心的第一人称录制的庞大语料库,配有同步音频、密集描述、侧重推理的旁白以及补充的3D信息;以及 EgoTools-Bench,一个涵盖四个赛道的诊断基准测试,包含1,000个问答对,覆盖了从感知和几何到程序和因果推理的工具使用理解。实验结果表明,当前模型在将工具使用与视觉证据对应方面仍面临困难:Gemini-3.1-Pro 的整体准确率为 66.9%,但在“感知与定位”赛道上仅为 51.7%。除了评估之外,我们还验证了 EgoTools-Data 作为训练资源的价值。在完整的1,000题基准测试中,严格分离源视频的情况下,全监督微调使 Qwen3-VL-8B-Instruct 的性能从 50.0% 提升至 60.9%。综上所述,这些结果确立了 EgoTools 作为用于训练和诊断评估真实世界第一人称工具使用理解的统一资源。

查看 arXiv 页面
查看 PDF
项目主页
GitHub
7
添加到收藏
社区

shulin16
论文提交者
3天前

项目页:https://ropedia.github.io/egotools/
代码:https://github.com/Ropedia/EgoTools
数据:https://huggingface.co/datasets/ropedia-ai/egotools-data

查看翻译
回复

librarian-bot
约20小时前

这是来自图书管理员机器人(Librarian Bot)的自动消息。我发现以下论文与本文相似。

以下论文由 Semantic Scholar API 推荐

RoboChrono:一个用于流式任务理解的真实机器人基准测试 (2026)
CapMem:一个基于第一人称视频中基于描述的片段记忆的基准测试 (2026)
EgoMonth:一个用于长期时空记忆的第一人称视频月度级基准测试 (2026)
本地视频理解能否跨场景迁移?EgoGears 基准测试 (2026)
GST-Bench:视觉语言模型(VLMs)能否从视频中发展出全局空间意识?(2026)
ICM-Bench:具有长期记忆的多模态智能体中的人级身份推理 (2026)
MachEmbodied-U0:具身智能的统一理解与生成模型 (2026)

如果您觉得此评论有帮助,请点赞!

如果您希望获取 Hugging Face 上任何论文的推荐,请访问此空间

您可以通过在评论中标记它直接向 Librarian Bot 请求论文推荐:@librarian-bot recommend

查看翻译
回复
编辑
预览

通过拖拽、粘贴或点击此处上传图片、音频和视频。
评论

· 注册或登录以发表评论

赞成票
57
+45

在您的智能体中获取此论文:

hf papers read 2609.39378
没有最新的 CLI?
引用此论文的模型
0

无链接此论文的模型

在模型 README.md 中引用 arxiv.org/abs/2609.39378,以便从本页面链接到该论文。
引用此论文的数据集
0

没有数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2609.39378,以便从本页面链接到该论文。
引用此论文的 Spaces
0

没有 Space 链接此论文

在 Space README.md 中引用 arxiv.org/abs/2609.39378,以便从本页面链接到该论文。
包含此论文的集合
2
推理
集合
161 项
•
更新于 2 天前
•
6
工具
集合
12 项
•
更新于 2 天前

本条评分 9.8 score-v1
  • 来源权威 9
    注册表 priority=9(HuggingFace Daily Papers)
  • 时效 0.772
    发布 70.5 小时前,衰减到 0.77/3.0
  • 多源印证 0
    只有 1 家在报(无旁证)
  • 社区信号 0
    无社区数据(本管线走 RSS,HN 的 hn_fetcher 未接入)

首次收录 · 2026-10-05 · 9.77 分

原文链接:https://huggingface.co/papers/2609.39378
来源:HuggingFace Daily Papers
以上内容由 AI 自动翻译,仅供参考。
← 返回简报