← 返回 2026-09-25 简报

实现连贯长视频生成的自动化

Automating coherent long-form video generation

语音播报
摘要
事件:Google Research推出AI视频联合导演框架,基于Gemini和Veo构建多智能体系统,旨在自动化解决长视频生成的连贯性难题。 要点:通过全局优化和世界状态跟踪,利用Co-Director等框架实现闭环视觉精炼,显著减少语义漂移和级联失败,提升角色持久性。 影响:开发者可自动生成分钟级连贯视频,无需繁琐手动干预,大幅降低长叙事视频制作门槛,释放创意精力聚焦故事本身。

近期视频扩散技术的进步展示了令人瞩目的高保真生成能力,模型能够在数秒内渲染出逼真的场景。然而,尽管扩散模型能够生成高保真的视频片段,但将它们转化为连贯的长篇叙事引擎仍然充满挑战。

现有的大多数智能体管道通过链式模块自动化这一过程,但由于独立的手写提示(prompting),它们往往受到语义漂移(镜头间角色服装或景致的细微变化)和级联故障(例如,上游资产瑕疵破坏下游视频合成)的影响。由于早期错误会传播并破坏长视域的一致性,该过程通常需要详尽的人工干预。从结构角度来看,这反映了经典的信用分配问题,因为终端故障难以追溯至特定的提示词。此外,现有方法还存在特征漂移的问题,即实体和环境逐渐发生非预期的变化,或者内容崩溃,即叙事无法有意义地推进。

今天,我们介绍了关于AI视频联合导演(co-director)的研究,这是一个统一的多智能体框架,明确规划多镜头叙事中的视觉连续性。该框架构建在Gemini和Veo之上作为编排层,原生继承了如SynthID水印等安全机制。通过将长格式生成视为全局优化和世界状态跟踪问题,我们开发了一系列框架——Co-Director(将发表于COLM 2026)、CANVAS(将发表于EMNLP 2026)、A²RD和VQQA——它们通过自动化重复的编排任务(从多模型提示到镜头链式连接,再到闭环视觉优化),将高层的人类创意规范转化为执行。

我们设计这些框架旨在作为响应式的创意伙伴,抽象掉维持视觉连续性的负担,让用户能够专注于讲故事的艺术。这种架构通过将质量建模为测试时目标(test-time objective),将创意合成与一致性解耦。在全面的评估中,我们的框架在多镜头叙事一致性和角色持久性方面取得了显著的提升,成功生成了长达数分钟的视频,同时减轻了视觉漂移和管道错误传播的问题。

本条评分 10.8 score-v1
  • 来源权威 8
    注册表 priority=8(Google Research)
  • 时效 2.84
    发布 2.8 小时前,衰减到 2.84/3.0
  • 多源印证 0
    只有 1 家在报(无旁证)
  • 社区信号 0
    无社区数据(本管线走 RSS,HN 的 hn_fetcher 未接入)
历史
刊期得分排名结果
2026-10-05 8.4 20 入选
2026-10-04 8.4 33 未入选
2026-10-03 8.4 44 未入选
2026-09-25 10.84 16 入选
原文链接:https://research.google/blog/coherent-long-form-video-generation/
来源:Google Research
以上内容由 AI 自动翻译,仅供参考。
← 返回简报