AVA-Encoder:面向智能体原生视频表征学习框架
arXiv:2608.12313v1
摘要
当前创意智能体难以从成熟人类影视作品中学习创作逻辑,核心瓶颈是缺少一套智能体原生结构化视频表征:该表征需要同时完整留存影片细节、适配大模型推理、支持灵活编辑。本文提出AVA-Encoder(智能体原生视频自编码框架),将原始视频转换为知识图谱(K(\mathcal{G}))表征并实现完整视频重建。
该图谱以分层文本节点为核心,配套多媒体素材存储层;通过分类边记录剧情、人物、镜头、音视频之间的关联关系,天然支持智能体查询、修改、复用。基于重建误差设计双循环文本梯度优化机制:外层循环完成与数据无关的编码策略伪训练,内层循环针对单条视频做数据驱动的知识图谱精细化修正。
在标准化重建基准测试中,AVA-Encoder相较最优基线整体指标提升20.7个百分点;仅使用优化后的编码策略(关闭图谱内层修正)时,对比人工精心调校的提示词方案,指标提升1.4个百分点,同时提示词token用量降低74.3%。
本文开源完整AVA-Encoder框架、标准化智能体视频重建评测基准、全球首套电影知识图谱数据集;配套图编辑工具可实现跨镜头一致性视频修改。
目录
- 引言
2 相关工作
2.1 智能体视频生成系统
2.2 智能体原生视频表征
3 任务定义
3.1 问题形式化
3.2 优化目标
4 方法:AVA-Encoder整体架构
4.1 智能体视频编码器
4.2 知识图谱表征结构
4.3 双循环文本梯度演化机制
4.3.1 重建误差与两类优化指标
4.3.2 外层循环:数据无关编码策略伪训练
4.3.3 内层循环:数据驱动图谱精细化修正
5 实验
5.1 实验配置
5.1.1 数据集
5.1.2 模型配置
5.1.3 评测体系
5.1.4 对比基线
5.1.5 自动化图编辑实验
5.1.6 研究问题(RQ)设计
5.2 RQ1:视频重建保真度整体结果
5.3 RQ2:双循环模块独立贡献与消融
5.3.1 分层理解与策略迭代效果
5.3.2 内外循环独立增益
5.3.3 接纳门控消融实验
5.4 RQ3:知识图谱可编辑性实验
5.5 RQ4:下游视频生成复用实验
6 结论
参考文献
附录
A 文本梯度与AVA-Encoder自优化原理
A.1 Text(\mathcal{G})rad基础理论
A.2 AVA-Encoder结构化文本梯度实现
B 重建评测全套指标
B.1 四大评测维度与八大评估方向
B.2 直接视频/关键帧打分规则
B.3 盲反向字幕打分规则
B.4 重建评测专用系统提示词
B.5 基准分数聚合计算方式
B.6 人工评测对齐验证
C 循环优化所用重建奖励函数
C.1 奖励函数配套提示词
C.2 奖励函数在双循环中的调用逻辑
D 双循环接纳门控细则
D.1 关键帧图谱修正门控
D.2 视频镜头图谱修正门控
D.3 编码策略伪训练接纳门控
D.4 编码策略伪训练完整流程
E 智能体编码器全套系统提示词
F 基线模型适配与公平性控制方案
F.1 VideoAnalyzer基线适配
F.2 Storyboard Studio基线适配
F.3 soap2soap基线适配
F.4 原始像素禁用规则
F.5 表征token预算约束
F.6 生成器共享与时序对齐方案
(\mathcal{G}) 数据集与可复现性完整说明
(\mathcal{G}).1 开源电影知识图谱数据集
(\mathcal{G}).2 伪训练/评测视频库
(\mathcal{G}).2.1 伪训练视频集
(\mathcal{G}).2.2 评测视频集
H 细粒度重建定量结果附表
I 消融实验定义与指标差值
J 知识图谱构建与编辑完整规范
J.1 图谱存储范式
J.2 图谱构建与修改传播机制
K 额外定性可视化结果
K.1 多方法重建对比图
K.2 图谱拓扑编辑案例
K.2.1 素材闭合规则
K.2.2 语义一致性校验
K.2.3 分层更新逻辑
K.2.4 按编辑类型传播规则
L 下游故事视频评测细则
M 全套系统原始提示词文本
1 引言
近两年大模型驱动的视频智能体已实现剧本撰写、分镜设计、短视频生成,但现有系统难以产出院线级完整影视作品。核心短板是缺少完整影视创作规划能力,无法统筹剧本、人物、镜头、视听多维度复杂决策。
高质量专业影片蕴含海量编剧、人物塑造、运镜、节奏、视听协调知识,但现有智能体无法直接学习影片经验:原始视频是密集多模态混合载体,而智能体依靠文本、图谱、规划等结构化信息完成推理,二者存在天然表征鸿沟。
理想的智能原生视频表征需同时满足三大条件:
- 智能体可读:文本化结构,大模型可直接解析;
- 智能体可操作:支持检索、局部修改、批量更新;
- 高保真:完整留存重建所需全部视听、叙事信息。
现有表征方案存在明显短板:
- 底层像素/视频嵌入:视觉信息完整,但智能体无法直接解读、修改;
- 线性字幕文本:易丢失人物关系、时序事件、跨模态关联等结构化信息;
- 传统场景图/视频知识图谱:仅适配检索、问答等理解任务,丢失大量生成所需细粒度视听细节。
针对上述痛点,本文设计电影知识图谱表征:将故事、事件、镜头分层存储结构化文本;人物、场景、物体、运镜、音频等状态节点配套关联素材层;通过分类边记录跨层级、跨模态依赖。修改局部节点后可自动同步所有关联镜头素材。
基于该图谱,本文提出AVA-Encoder自编码框架:输入视频编码为知识图谱,再固定解码器完成视频重建;以重建误差作为优化信号,分别迭代全局共享编码策略、单视频专属图谱。
本文三大核心贡献:
- 提出智能体视频自编码范式AVA-Encoder,设计双循环文本梯度优化机制;在标准基准上整体重建指标达49.0%,领先最优基线20.7个百分点;仅使用外层伪训练策略时,提示词token相比人工方案减少74.3%,指标提升1.4%;
- 搭建全球首套面向重建保真度的视频表征评测基准,包含4大评测维度、8类影视评估方向;自动评测结果与人工标注匹配度97.3%;
- 开源首套大规模电影知识图谱数据集与配套图编辑工具,支持可控视频改写、影片混剪、下游生成模型复用。
图1 AVA-Encoder完整流程:
(a) 自编码闭环:原始视频经智能编码器生成知识图谱,固定解码器重建视频;重建残差分别触发外层策略伪训练、内层图谱精细化修正;
(b) 分层智能编码器:依次完成影片、镜头、关键帧三级理解,全局上下文注入+人物/场景/物体注册库;
© 知识图谱分层结构:故事-事件-镜头层级,配套多模态素材层,支持子图拓扑联动编辑。
2 相关工作
2.1 智能体视频生成系统
现有LLM驱动视频智能体依靠规划、工具调度完成生成/改写,分为多智能协作生成框架、单模型编辑工具两大类。但现有系统缺少标准化高质量影片学习素材,无法复用专业影视的成熟创作逻辑。AVA-Encoder将原始影片转化为可推理知识图谱,提供完整创作记录,支持智能体学习与联动编辑。
2.2 智能体原生视频表征
现有表征分为三类:
- 底层像素/隐向量:信息完整,但无法直接编辑;
- 线性字幕文本:丢失结构化关联;
- 视频场景图:仅面向检索、问答,缺失生成所需视听细节。
本文AVA-Encoder图谱以重建保真度为优化目标,专为视频生成设计,完整留存叙事、镜头、色彩等创作信息。
3 任务定义
本文将影视创作建模为智能体自编码任务,输入原始视频,输出可编辑知识图谱表征,再通过固定解码器还原视频。
3.1 问题形式化
- 智能体视频编码器E
由三层策略P = ( P f i l m , P s h o t , P k f ) P=(P_{film},P_{shot},P_{kf})P=(Pfilm,Pshot,Pkf)(影片/镜头/关键帧提示词)控制,输入视频V VV输出知识图谱KaTeX parse error: Can't use function '\(' in math mode at position 1: \̲(̲\mathcal{G}\):
KaTeX parse error: Can't use function '\(' in math mode at position 1: \̲(̲\(\mathcal{G}\)… - 知识图谱隐空间KaTeX parse error: Can't use function '\(' in math mode at position 10: \mathcal{\̲(̲\mathcal{G}\)}
文本为核心分层结构:故事/事件/镜头三层叙事节点,人物/场景/物体/运镜/音频状态节点;图像、音频、成片仅作为关联素材存储,原始像素不参与表征存储。 - 固定解码器Dec
两阶段固定生成管线:文本生成关键帧、关键帧生成完整镜头;全程不读取原始视频像素,仅依托图谱文本素材重建:
KaTeX parse error: Can't use function '\(' in math mode at position 23: …htarrow{E(;P)} \̲(̲\mathcal{G}\) \…
3.2 优化目标
- 外层循环(数据无关策略伪训练)
使用批量训练视频{ V n } \{V_n\}{Vn}优化镜头级编码策略P s h o t P_{shot}Pshot,影片、关键帧策略与生成模型全部冻结。最大化单视频平均重建奖励:
KaTeX parse error: Can't use function '\(' in math mode at position 90: …}\sum_{n=1}^{L}\̲(̲R_{\mathrm{rewa… - 内层循环(数据驱动图谱修正)
编码策略冻结后,仅优化当前输入视频专属图谱,在可达图谱空间内最大化重建奖励:
KaTeX parse error: Can't use function '\(' in math mode at position 1: \̲(̲\mathcal{G}\)_{…
内外循环不同时更新,外层优化全局通用提示策略,内层仅修正单条视频图谱。
4 方法:AVA-Encoder整体架构
AVA-Encoder四大核心模块:分层智能视频编码器、文本知识图谱表征、双循环文本梯度演化、重建误差优化指标。
4.1 智能体视频编码器
输入视频V VV经镜头分割算子划分为有序镜头序列;执行粗到细三级分层理解,上层全局上下文向下传递,同时维护全局人物/场景/物体注册库,保证跨镜头实体一致性:
C f i l m = E f i l m ( V ; P f i l m ) C s h o t , i = E s h o t ( s i , C f i l m ; P s h o t ) C k f , i = E k f ( f i ∗ , C s h o t , i ; P k f ) \begin{align} \mathcal{C}_{\mathrm{film}} &=E_{\mathrm{film}}(V;P_{\mathrm{film}}) \\ \mathcal{C}_{\mathrm{shot},i} &=E_{\mathrm{shot}}(s_i,\mathcal{C}_{\mathrm{film}};P_{\mathrm{shot}}) \\ \mathcal{C}_{\mathrm{kf},i} &=E_{\mathrm{kf}}(f_i^{*},\mathcal{C}_{\mathrm{shot},i};P_{\mathrm{kf}}) \end{align}CfilmCshot,iCkf,i=Efilm(V;Pfilm)=Eshot(si,Cfilm;Pshot)=Ekf(fi∗,Cshot,i;Pkf)
分层上下文整合后,自动构建完整知识图谱:
KaTeX parse error: Can't use function '\(' in math mode at position 1: \̲(̲\mathcal{G}\)=\…
4.2 知识图谱表征结构
图谱KaTeX parse error: Can't use function '\(' in math mode at position 1: \̲(̲\mathcal{G}\)=(…分为文本节点、分类边、素材层三部分:
- 文本节点(仅存储文本描述)
分层叙事:Story、Event、Shot
镜头状态:Character、Scene、Object、Style、Camera、Audio - 关键帧资产节点:关联生成图片素材,不存储原图像素
- 11类有向边:层级包含、时序序列、人物关联、素材引用、音频归属、风格传递等;
优势:修改任意节点后,沿边自动更新全部关联镜头与素材,实现全局一致性编辑。
4.3 双循环文本梯度演化机制
文本梯度:以自然语言形式输出重建错误修正方向,无需数值梯度,适配LLM推理优化。
图2 (a)内层循环:单视频图谱迭代修正,抗退化接纳门控;(b)外层循环:编码策略伪训练,抗遗忘回放门控。
4.3.1 重建误差与两类优化指标
- 循环优化奖励KaTeX parse error: Can't use function '\(' in math mode at position 1: \̲(̲R_{\mathrm{rewa…:用于内外循环迭代更新,基于原子QA问答正确率计算,定位具体错误、生成文本梯度;
- 最终评测指标R e v a l R_{\mathrm{eval}}Reval:统一四大维度、八大影视维度聚合分数,仅用于横向对比基线,不参与训练优化。
KaTeX parse error: Can't use function '\(' in math mode at position 1: \̲(̲R_{\mathrm{rewa…单镜头计算公式:
KaTeX parse error: Can't use function '\(' in math mode at position 1: \̲(̲R_{\mathrm{rewa…
R e v a l R_{\mathrm{eval}}Reval加权聚合公式:
R e v a l ( V , V ^ ) = ∑ d = 1 D ω d e v a l ( 1 − r d e v a l ) , ∑ d = 1 D ω d e v a l = 1 R_{\mathrm{eval}}(V,\hat{V})=\sum_{d=1}^{D}\omega_{d}^{\mathrm{eval}}(1-r_{d}^{\mathrm{eval}}),\quad\sum_{d=1}^{D}\omega_{d}^{\mathrm{eval}}=1Reval(V,V^)=d=1∑Dωdeval(1−rdeval),d=1∑Dωdeval=1
4.3.2 外层循环:数据无关编码策略伪训练
批量输入视频序列,迭代更新镜头级提示词P s h o t P_{shot}Pshot;每轮生成候选策略后,通过回放记忆验证历史视频性能,防止过拟合遗忘。
接纳门控三大约束:当前视频奖励提升、视觉指标小幅下降可控、历史回放指标不衰退。完整伪训练流程见算法1。
4.3.3 内层循环:数据驱动图谱精细化修正
编码策略冻结后,对当前视频图谱迭代优化,分关键帧修正、完整镜头修正两种模式;通过抗退化门控过滤会降低重建质量的候选图谱,多次修正无改善则移交人工调整。完整流程见算法2。
5 实验
5.1 实验配置
5.1.1 数据集
伪训练集:6段无重叠公开影视片段;
评测集:18段动画、院线电影、AI短片,共129个镜头、246个关键帧,全程与训练集无交集。
5.1.2 模型基座
理解/评测模型:(\mathcal{G})emini-3.1-Pro-Preview
文本梯度改写模型:Qwen-3.7-Max
图像生成器:Nano Banana Pro
视频生成器:HappyHorse 1.0
全部大模型权重冻结,仅迭代文本提示策略、图谱文本内容。
5.1.3 四大评测维度
- Video(V):原始视频直接对比
- Keyframe(KF):关键帧视觉细节对比
- V-BC:视频盲反向字幕匹配
- KF-BC:关键帧盲反向字幕匹配
八大评估维度:人物、场景、空间位置、运动、音频、美术风格、运镜、叙事(关键帧评测不含音频)。
自动评测与人工标注匹配度97.3%。
5.1.4 对比基线
VideoAnalyzer、Storyboard Studio、soap2soap;全部基线共享图像/视频生成器,禁止读取原始像素用于生成,保证公平对比。
5.1.5 自动化图编辑
修改图谱人物/风格节点,自动传播至全部关联镜头,可视化展示跨镜头一致性改写效果。
5.1.6 四大研究问题
RQ1:AVA-Encoder整体重建保真度是否超越现有基线;
RQ2:外层策略伪训练、内层图谱修正各自独立贡献;
RQ3:知识图谱拓扑联动编辑可行性;
RQ4:该表征能否提升各类下游视频生成模型效果。
5.2 RQ1:重建保真度整体结果
表1 各方法重建整体指标(越高越好)
| 方法 | Video(%) | KF(%) | V-BC(%) | KF-BC(%) | Overall(%) |
|---|---|---|---|---|---|
| VideoAnalyzer | 26.1 | 28.5 | 9.7 | 21.7 | 21.5 |
| Storyboard Studio | 16.4 | 28.6 | 9.6 | 23.0 | 19.4 |
| soap2soap | 36.7 | 39.5 | 15.8 | 21.3 | 28.3 |
| AVA-Encoder(完整) | 57.8 | 73.7 | 29.7 | 34.6 | 49.0 |
| 结论:AVA-Encoder全部维度最优,整体指标领先最强基线soap2soap 20.7个百分点。 | |||||
5.3 RQ2:双循环模块消融实验
表2 模块消融整体指标
| 实验配置 | V | KF | V-BC | KF | Overall |
|---|---|---|---|---|---|
| 单层编码器,无任何循环 | 35.1 | 38.4 | 15.4 | 21.1 | 27.5 |
| 分层编码器,仅内层图谱修正 | 52.7 | 71.8 | 23.9 | 33.1 | 45.4 |
| 分层编码器,仅外层策略训练 | 55.6 | 68.3 | 26.6 | 32.7 | 45.8 |
| 分层编码器,无内外循环 | 50.7 | 67.6 | 21.2 | 29.9 | 42.4 |
| 人工调校编码策略(无循环) | 53.5 | 68.1 | 25.8 | 30.2 | 44.4 |
| 移除所有接纳门控 | 53.1 | 67.2 | 24.3 | 29.4 | 43.5 |
| 完整AVA-Encoder | 57.8 | 73.7 | 29.7 | 34.6 | 49.0 |
| 核心结论: |
- 分层三级理解相比单层提升18.3个百分点;
- 仅外层策略训练:对比人工调校提示词提升1.4%,token从31336降至8052(减少74.3%);
- 内外循环同时启用相比无循环基线,整体提升6.6个百分点(相对+15.6%);
- 接纳门控有效防止优化退化,增加5.5个百分点收益。
5.4 RQ3:知识图谱可编辑性
图谱支持四类标准化编辑:人物替换、美术风格统一、剧情修改、运镜参数调整;修改单一节点自动遍历所有关联子图,无关镜头保持不变。
图4 (a)现代短片多镜头人物替换;(b)古装剧跨镜头人物统一替换,人物形象全局同步,场景、剧情不受干扰。
5.5 RQ4:下游生成复用实验
表3 有无AVA图谱参考下游生成评分(1-4分)
| 生成框架 | 无图谱参考 | 引入图谱参考 | 提升维度 |
|---|---|---|---|
| MovieAgent | 2.47 | 3.30 | 人物、叙事、美术 |
| FilmAgent | 1.85 | 2.83 | 人物、镜头、风格 |
| Anim-Director | 1.85 | 2.50 | 人物、运镜 |
| VideoStudio | 1.90 | 1.95 | 运镜、美术 |
| 结论:全部主流智能视频生成框架引入AVA图谱后综合质量提升,图谱提供完整标准化叙事、视听先验,降低生成逻辑断裂、人物崩坏概率。 |
6 结论
本文提出AVA-Encoder智能体原生视频自编码框架,以电影知识图谱作为中间表征,搭配分层编码器、双循环文本梯度优化机制,实现高保真影片编码与重建。
完整系统整体重建指标49.0%,相较最优基线提升20.7个百分点;仅外层策略方案提示词开销降低74.3%,性能优于人工调校提示。图谱支持拓扑联动编辑,可无缝对接各类下游视频智能体。
未来方向:拓展长时序多集剧集图谱、融合音频时序表征、支持交互式图谱可视化编辑工具。
参考文献
(原文参考文献完整保留,见arxiv原文https://arxiv.org/html/2608.12313v1)
附录
附录A 文本梯度与AVA-Encoder自优化原理
A.1 Text(\mathcal{G})rad基础
Text(\mathcal{G})rad将LLM流程建模为文本计算图,以自然语言反馈作为反向梯度,无需数值微分,适配提示词、图谱文本类变量迭代更新。
A.2 AVA-Encoder结构化文本梯度
定义原子修正记录KaTeX parse error: Can't use function '\(' in math mode at position 38: …u_{i}^{\mathrm{\̲(̲\mathcal{G}\)T}…,存储错误维度、真值事实、重建事实、视听证据、修正指令;批量错误记录聚合生成策略/图谱两类文本梯度,分别用于内外循环更新。
附录B 重建评测全套指标
完整打分流程、四类评测方向、八大维度细则、人工对齐实验数据、VLM评测专用提示词完整原文。
附录C 循环优化所用重建奖励函数
QA问答库构建规则、视频/关键帧问答提示词、奖励函数在内外循环的调用计算流程、阈值参数完整数值。
附录D 双循环接纳门控细则
关键帧/镜头内层修正门控、外层伪训练抗遗忘回放门控、全部阈值、采样规则、伪训练分步伪代码。
附录E 智能体编码器全套系统提示词
初始策略、伪训练后策略、人工调校策略三套中英文完整提示文本。
附录F 基线模型适配与公平性控制
VideoAnalyzer/Storyboard Studio/soap2三套基线适配改造方案;原始像素禁用规则、单镜头提示词token上限1200、每镜头最多5张生成参考图约束、统一图像/视频生成器细节。
附录(\mathcal{G}) 数据集与可复现性
(\mathcal{G}).1 开源电影知识图谱数据集
数万条影视结构化知识图谱,仅开放文本节点,不含原始音视频素材,支持自行对接生成模型渲染成片。
(\mathcal{G}).2 视频库
伪训练6段影视、评测18段影视完整片单、公开数据源链接、训练/测试无重叠划分规则。
附录H 细粒度重建定量附表
V、KF维度分维度完整数值表,对应八大影视维度单项指标。
附录I 消融实验定义与指标差值
全部消融配置单项提升/下降绝对值、相对增益百分比。
附录J 知识图谱构建与编辑完整规范
J.1 图谱存储节点、边完整Schema
J.2 编辑传播四大规则:素材闭合、语义校验、分层更新、分编辑类型子图遍历算法。
附录K 额外定性可视化
多基线重建对比图、风格统一编辑可视化、图谱交互界面截图
附录L 下游故事视频评测细则
无参考人工式打分标准、五大下游评估维度分级规则。
附录M 全套系统原始提示词
编码器、奖励函数、评测、关键帧对比全部中英文提示原文,存放于附件PDF:appendix_prompts/AV-AE-system-prompts.pdf
资源下载链接
论文原文网页:https://arxiv.org/html/2608.12313v1
开源协议:CC BY-NC-ND 4.0
数据集、代码、全套提示词、实验脚本存放于arxiv论文附件;
基线复现完整训练/推理流程见附录F、(\mathcal{G});
内外循环算法伪代码见原文算法1、算法2;
全部消融、定量实验完整表格、可视化图原文附录H-K。