← 返回 2026-09-27 简报

以过往帧框定未来:自回归视频生成中的记忆机制

The Past Frames the Future: Memory for Autoregressive Video Generation

语音播报
摘要
事件:本文系统综述自回归视频生成中的记忆机制,解决长序列生成中历史关键信息因上下文窗口限制而丢失的问题。 要点:提出统一框架,从形式、功能、操作、学习和评估五个维度梳理文献,界定持久历史信息在因果链中的作用。 影响:为构建可靠的状态条件视频生成系统奠定基础,推动可组合架构及标准化评估等开放挑战的研究进展。

生成式模型的进步提高了视频保真度,使得长时域生成、交互式世界建模以及不断演变的视觉环境成为可能。自回归(AR)视频生成通过因果展开来扩展视觉序列。然而,一个根本性的瓶颈随之出现:随着生成序列的扩展,实际模型必须在严格受限的上下文窗口、存储和计算能力下运行。因此,关键的历史信息,例如实体身份、动态状态以及由干预引发的因果变化,往往在它们的相关性降低之前很久就脱离了活跃上下文。克服这一限制并维持时间持久性构成了一个根本性的记忆问题。我们系统地综述了AR视频生成中的记忆机制。我们将记忆操作性地定义为跨外层AR步骤维持的持久历史信息,即使原始证据不再在局部可访问,它仍能影响未来的生成。基于这一统一框架,我们通过五个互补的视角组织文献:(I)形式,即历史的表征载体;(II)功能,即需要保留的具体语义和物理信息;(III)操作,即记忆的写入、读取、更新、管理和整合的生命周期;(IV)学习,即在闭环展开下对记忆行为的优化;以及(V)评估,即诊断真正记忆能力的范式。最后,我们综合了开放挑战,包括可组合且资源感知的记忆架构、可信的状态更新、自展开学习以及标准化评估。通过连接表征、机制和学习范式,本文建立了开发可靠的条件记忆视频生成系统的结构化基础。

本条评分 9.8 score-v1
  • 来源权威 9
    注册表 priority=9(HuggingFace Daily Papers)
  • 时效 0.772
    发布 70.5 小时前,衰减到 0.77/3.0
  • 多源印证 0
    只有 1 家在报(无旁证)
  • 社区信号 0
    无社区数据(本管线走 RSS,HN 的 hn_fetcher 未接入)
历史
刊期得分排名结果
2026-09-27 9.77 16 入选
2026-09-26 10.22 23 未入选
原文链接:https://huggingface.co/papers/2609.28466
来源:HuggingFace Daily Papers
以上内容由 AI 自动翻译,仅供参考。
← 返回简报