← 返回 2026-10-05 简报

实现连贯长视频生成的自动化

Automating coherent long-form video generation

语音播报
摘要
事件:Google Research推出AI视频联合导演框架,结合Gemini与Veo模型,解决长视频生成的连贯性难题。 要点:通过Co-Director等多代理架构处理全局优化与世界状态追踪,有效抑制视觉漂移和级联故障。 影响:大幅降低人工干预需求,提升多镜头叙事一致性,让创作者专注于故事本身而非技术细节。

近期视频扩散技术的进展展示了令人瞩目的超高保真生成能力,相关模型能够在数秒内渲染出逼真的场景。然而,尽管扩散模型能够生成高保真的视频片段,但将其转化为连贯的长篇叙事引擎仍然充满挑战。

现有的大多数智能体流水线通过链式模块自动化这一过程,但由于采用独立的、手工设计的提示词,它们往往存在语义漂移(即镜头间角色服装或景物的细微变化)和级联故障(例如上游资产伪影破坏下游视频合成)的问题。由于早期错误会传播并破坏长周期的连贯性,该过程通常需要详尽的人工干预。从结构角度来看,这反映了经典的信用分配问题,因为终端故障难以追溯至特定的提示词。此外,现有方法还存在特征漂移问题,即实体和环境逐渐发生非预期的变化,或者内容坍塌问题,即叙事无法有意义地推进。

今天,我们介绍了关于AI视频联合导演的一项研究,这是一个统一的、多智能体框架,明确规划多镜头叙事中的视觉连续性。该框架构建在Gemini和Veo之上作为编排层,原生继承了如SynthID水印等安全机制。通过将长格式生成视为全局优化和世界状态跟踪问题,我们开发了一系列框架——Co-Director(将发表于COLM 2026)、CANVAS(将发表于EMNLP 2026)、A²RD和VQQA——它们通过自动化重复的编排任务,从多模型提示词和镜头链接到闭环视觉优化,将高层的人类创意规范转化为执行。

我们设计这些框架旨在作为响应式的创意伙伴,抽象出维持视觉连续性的负担,使用户能够专注于讲故事的艺术。这种架构通过将质量建模为测试时目标,将创意合成与一致性解耦。在全面的评估中,我们的框架在多镜头叙事一致性和角色持久性方面取得了显著的提升,成功生成了长达数分钟的视频,同时减轻了视觉漂移和流水线错误传播的问题。

本条评分 8.4 score-v1
  • 来源权威 8
    注册表 priority=8(Google Research)
  • 时效 0.4
    发布 10.1 天前,已衰减到地板 0.4
  • 多源印证 0
    只有 1 家在报(无旁证)
  • 社区信号 0
    无社区数据(本管线走 RSS,HN 的 hn_fetcher 未接入)
历史
刊期得分排名结果
2026-10-05 8.4 20 入选
2026-10-04 8.4 33 未入选
2026-10-03 8.4 44 未入选
2026-09-25 10.84 16 入选
原文链接:https://research.google/blog/coherent-long-form-video-generation/
来源:Google Research
以上内容由 AI 自动翻译,仅供参考。
← 返回简报