← 返回 2026-10-02 简报

重新审视潜在视觉推理:将潜在推理锚定于视觉证据

Rethinking Latent Visual Reasoning: Grounding Latent Reasoning in Visual Evidence

语音播报
摘要
事件:亚马逊团队提出ReaLVR框架,通过视觉证据监督解决多模态大模型潜在推理中信息缺失问题,提升连续隐式计算的可解释性与准确性。 要点:揭示潜在证据信用缺口,利用正负答案对比强化监督。在Qwen2.5-VL-7B上达63.7%均值,并扩展至235B参数规模仍有效。 影响:为多模态模型提供可验证的推理路径,降低幻觉风险。开发者可利用该框架优化大模型视觉理解能力,推动潜在推理技术落地应用。

论文
arxiv:2609.34563
复制 Markdown
重新思考潜在视觉推理:将潜在推理建立在视觉证据之上
发布于 9月28日
·
提交者
Xi Xiao
于 10月1日

2 今日论文

·
亚马逊
作者:
Xi Xiao
,
Tianchen Zhao
,
Youngeun Kim
,
Zhuowei Li
,
Linghan Xu
,
Jiaye Wu
,
Zheng Zhang
,
Xiang Xu
,
Xuanbai Chen
,
Farhan Tejani
,
Jakub Zablocki
,
Julia Xu
,
Yifan Xing

摘要

潜在视觉推理(LVR)使多模态大语言模型(MLLMs)能够在连续的潜在标记中进行中间计算,而不是将每个推理步骤都用文字表达出来。然而,与文本思维链(CoT)不同,潜在推理无法直接观察,这使得监督潜在标记学习什么变得困难。在本工作中,我们首先对潜在标记的行为进行了彻底分析,并发现了一个“潜在证据-信用差距”:潜在标记对改变正确答案的图像扰动反应微弱。我们假设这个问题源于 GRPO 训练期间缺乏显式监督。这些发现表明,最终答案奖励在指导保留哪些视觉证据或如何在潜在标记之间分配信用方面提供的信息太少。为了弥合这一差距,我们提出了 ReaLVR,它将视觉证据监督引入模型自身的自由运行潜在轨迹中。ReaLVR 通过对比正确答案和模型生成的错误答案来确定需要更强监督的位置,并通过相关和不匹配的视觉证据来指定应保留的内容。在三个模型系列中,ReaLVR 始终优于所评估的 LVR 基线,在 Qwen2.5-VL-7B 上取得了 63.7% 的最高五项任务平均成绩。至关重要的是,我们是第一个在潜在空间中扩展视觉推理的研究者,表明我们的框架在高达 235B 的前沿模型规模上持续提供稳健的改进。进一步的分析显示,潜在标记的位置对问题更敏感,与相关视觉区域的对齐更强,并且对最受关注的潜在标记具有更大的固定上下文依赖性。

查看 arXiv 页面
查看 PDF
项目页面
GitHub
7
添加到收藏集
社区
MarkShaw99
论文提交者
大约 8 小时前

请查看最新的潜在视觉推理论文。

查看翻译
回复
编辑
预览
通过拖拽、粘贴或点击此处上传图片、音频和视频。
评论

· 注册或登录以发表评论

赞成票
200
+188

在您的代理中获取此论文:

hf papers read 2609.34563
没有最新的 CLI?
引用此论文的模型
0

无链接此论文的模型

在模型的 README.md 中引用 arxiv.org/abs/2609.34563 以从本页面链接它。
引用此论文的数据集
0

无链接此论文的数据集

在数据集的 README.md 中引用 arxiv.org/abs/2609.34563 以从本页面链接它。
引用此论文的 Spaces
0

无链接此论文的 Space

在 Space 的 README.md 中引用 arxiv.org/abs/2609.34563 以从本页面链接它。
包含此论文的收藏集
0

无包含此论文的收藏集

将此论文添加到收藏集以从本页面链接它。

本条评分 10.9 score-v1
  • 来源权威 9
    注册表 priority=9(HuggingFace Daily Papers)
  • 时效 1.945
    发布 22.5 小时前,衰减到 1.94/3.0
  • 多源印证 0
    只有 1 家在报(无旁证)
  • 社区信号 0
    无社区数据(本管线走 RSS,HN 的 hn_fetcher 未接入)

首次收录 · 2026-10-02 · 10.95 分

原文链接:https://huggingface.co/papers/2609.34563
来源:HuggingFace Daily Papers
以上内容由 AI 自动翻译,仅供参考。
← 返回简报