VideoTreeSearch:基于树形自校正智能体的长视频时序定位问答

📅 2026/7/20 17:40:51 👁️ 阅读次数 📝 编程学习
VideoTreeSearch:基于树形自校正智能体的长视频时序定位问答

VideoTreeSearch:基于树形自校正智能体的长视频时序定位问答

arXiv:2607.16189v1 [cs.CV] 2026-07-17
开源代码仓库:https://github.com/CeeZh/VTS

摘要

带时序定位的长视频问答(Grounded LVQA)任务要求模型回答问题的同时,定位视频中支撑答案的证据片段。现有智能体方案仅提供单一crop_video裁剪动作,只能由粗到细收敛,缺少回溯纠错能力,极易提前收敛、陷入早期错误无法恢复。
本文提出VideoTreeSearch(VTS)框架,将长视频问答建模为自适应时序树上的迭代自校正搜索。

  1. 基于CLIP视觉变化边界构建非均匀时序树,每个节点对应语义连贯视频片段;
  2. 设计四类离散导航动作:zoom_in下探子段、zoom_out回溯父段、shift切换同级片段、answer输出结果,把回溯纠错转为可学习显式原语;
  3. 设计轨迹合成流水线,生成包含误入错误分支再回溯修复的多步导航路径;
  4. 采用监督微调+强化学习两阶段训练,时序交并比(IoU)、答案准确率双指标联合奖励。
    在CG-Bench、Haystack-LVBench、Haystack-Ego4D三大时序定位基准上,VTS相比最优基线在CG-Bench提升12.5 mIoU,Haystack-Ego4D提升7.4 T-F1;同时可泛化至通用长视频问答任务,在Video-MME、MLVU、LVBench最高提升7.1准确率。消融实验证明:分层树形搜索、显式回溯是性能提升核心模块。

关键词:长视频问答;时序定位;多模态智能体;树形分层搜索;自校正回溯;强化学习;VLM

1 引言

1.1 任务痛点

以一小时烹饪教程视频提问为例:“厨师放入烤箱前往碗里加了什么?”,模型需要先定位放碗的片段,再往前追溯加料画面。长视频中有效证据仅占极小片段,均匀采样要么漏关键帧、要么超出多模态上下文窗口,必须迭代式时序检索。
现有裁剪式智能体仅支持连续区间裁剪,存在两大结构性缺陷:

  1. 动作空间不对称:只有缩小搜索范围的操作,没有从细粒度退回粗粒度的回溯手段;
  2. 无分层视频分解,模型只能从原始像素回归时间戳,搜索空间扁平无先验,极易提前收敛、无法修正早期错误。

1.2 VTS核心创新

将长视频构建为语义自适应时序树,智能体通过四类离散动作遍历树结构,把定位、纠错变为独立可学习行为:

  1. 自适应分段:基于CLIP帧嵌入视觉突变边界划分节点,而非固定均匀切分;
  2. 四元离散导航动作,解耦探索与纠错;
  3. 轨迹合成数据集:构造“误入错分支+回溯修复”样本,解决现有数据集缺少纠错监督的问题;
  4. 两阶段训练:先模仿合成轨迹监督微调,再基于定位、答案双奖励强化学习。

1.3 核心结论

  1. 时序树+显式回溯大幅提升长视频证据定位精度,视频越长增益越明显;
  2. 智能体平均4.8轮搜索,60%轨迹会触发回溯动作,证明模型主动使用纠错机制;
  3. 仅用时序定位数据训练,可零成本泛化到无定位要求的通用长视频问答。

2 相关工作

2.1 长视频与时序定位问答

传统长视频方案:超长上下文VLM、帧压缩、关键帧筛选、视频摘要流水线,均为单次前向推理,无法迭代检索时序片段。
时序定位Grounded LVQA要求输出答案+对应视频区间,代表基准CG-Bench、Haystack系列;现有TimeChat、VideoITG等模型采用固定递归流程,不支持动态回溯修正。

2.2 视频分层树形表示

VideoTree、VideoMiner将视频构建树形结构,但均为静态一次性编码,仅单次前向使用;VTS创新点:树作为可交互环境,智能多轮遍历、支持回溯重访历史节点。

3 方法:VideoTreeSearch整体框架

整体流程:输入长视频+问题 → 自适应构建时序树 → 智能体多轮树导航(zoom_in/zoom_out/shift)→ 输出答案与时序证据区间。

3.1 自适应时序树构建

  1. 对任意视频片段均匀1fps采样最多64帧,计算CLIP帧间嵌入余弦距离表征视觉变化;
  2. 自适应阈值τ=mean(δ)+k⋅std(δ)\tau=\text{mean}(\delta)+k\cdot\text{std}(\delta)τ=mean(δ)+kstd(δ),在突变位置切分;
  3. 约束每个父节点子片段数量3~8,片段短于64秒直接作为叶子节点;
  4. 懒加载机制:仅智能体访问节点时才生成子树,降低算力开销。

3.2 四类离散导航动作

  1. zoom_in(c):进入第c个子片段,由粗到细缩小检索范围;
  2. zoom_out():返回父节点,完成回溯纠错;
  3. shift(s):切换至同层级第s个兄弟片段,横向排查;
  4. answer(答案, [起始秒, 结束秒]):终止搜索,输出答案与时序证据。
    对比连续crop方案:树形分层天然匹配多尺度时序线索,回溯是独立动作而非隐式反复裁剪。

3.3 多轮导航内存机制

内存存储两部分轻量化信息,避免上下文溢出:

  1. 已访问树形结构+各节点文本摘要;
  2. 全部历史动作时序日志;
    智能体仅读取当前节点原始帧,其余节点仅读取文字摘要,大幅节省视觉token。

3.4 轨迹合成流水线(训练数据核心)

现有数据集只有最优检索路径,缺少“犯错再修复”样本,本文自动生成带迂回轨迹:

  1. 控制器基于Qwen3-VL打分,优先走向含真值子段;
  2. 允许主动误入错误分支,连续两轮错分支强制回溯;
  3. 每一步附带DeepSeek-R1生成推理文本;
    数据源:CG-Bench、Haystack-Ego4D、自制LongClueQA无标注长YouTube视频集,最终过滤得到6537条可用训练轨迹。

3.5 两阶段训练方案

阶段1:监督微调SFT

损失仅作用有效纠错动作(正确下探、错分支zoom_out、shift切换),误入错误分支的步骤仅作为上下文、不参与梯度回传。
损失公式:
LSFT=−∑(Ot−1,Mt,Rt,At)log⁡pθ(Rt,At∣Ot−1,Mt,Q)\mathcal{L}_{\text{SFT}}=-\sum_{(O_{t-1},M_{t},R_{t},A_{t})}\log p_{\theta}(R_{t},A_{t}\mid O_{t-1},M_{t},Q)LSFT=(Ot1,Mt,Rt,At)logpθ(Rt,AtOt1,Mt,Q)

阶段2:GR强化学习(GRPO)

复合奖励函数,三项加权求和:
R(τ)=λfmtRfmt+λIoURIoU+λaccRτR(\tau)=\lambda_{\text{fmt}}R_{\text{fmt}}+\lambda_{\text{IoU}}R_{\text{IoU}}+\lambda_{\text{acc}}R_{\tau}R(τ)=λfmtRfmt+λIoURIoU+λaccRτ

  • KaTeX parse error: Expected '}', got 'EOF' at end of input: R_{\text{fmt}:动作格式合法性奖励;
  • RIoUR_{\text{IoU}}RIoU:预测片段与真值时序交并比;
  • RaccR_{\text{acc}}Racc:选择题答案正确率;
    采用KL散度约束策略不偏离SFT初始模型,防止崩溃。

3.6 实现细节

基础VLM:Qwen3-VL-8B;
分段超参k=1.5k=1.5k=1.5
每轮采样64帧1fps;
训练硬件:4张H100;
模型版本:VTS-SFT(仅微调)、VTS-RL(微调+强化,主实验模型)。

4 实验设置

4.1 评测数据集

  1. 时序定位Grounded LVQA(核心任务)
    • CG-Bench mini子集:指标mIoU、问答准确率;
    • Haystack-LVBench:指标T-F1时序F1、准确率;
    • Haystack-Ego4D(第一视角长视频,最难):T-F1、准确率。
  2. 通用长视频问答(泛化测试)
    Video-MME、MLVU、LVBench,仅评测选择题准确率。

4.2 对比基线分类

  1. 均匀采样VLM:Qwen3-VL-8B(256/384帧)、Video-R1;
  2. 摘要LLM流水线:SiLVR(密集帧描述+大模型推理);
  3. 裁剪式智能体:LongVT、Video-o3、VideoZoomer、TimeSearch-R。

4.3 主实验结果(时序定位任务)

方法CG-Bench(mIoU/Acc)Haystack-LVBench(T-F1/Acc)Haystack-Ego4D(T-F1/Acc)
Qwen3-VL 384帧12.1/23.69.2/39.57.0/33.4
SiLVR10.1/31.88.5/57.06.3/46.4
LongVT4.3/17.45.4/46.23.7/42.1
TimeSearch-R-/-8.1/52.111.0/53.5
VTS(本文)16.8/36.415.2/58.318.4/66.1
结论:CG-Bench相比最优基线LongVT mIoU提升12.5;Ego4D长视频场景T-F1提升7.4,视频越长树形回溯增益越大。

4.4 效率对比

VTS平均仅处理328帧,少于均匀采样384帧、SiLVR 450帧,但定位与准确率全面领先。

5 消融与性能分析

5.1 核心模块消融

实验配置CG mIoUHaystack-Ego4D T-F1
连续crop动作替代树形15.514.2
树形但禁用zoom_out/shift回溯14.415.5
树形无分层(平铺均分)15.318.9
完整VTS16.818.4
  1. 回溯模块移除后所有数据集指标暴跌,证明自校正为核心增益;
  2. 分层树形优于平铺均分,仅线索极短的Ego4D平铺有微弱时序提升,但问答准确率下降。

统计:VTS 60%轨迹触发回溯,裁剪基线仅7%~15%;42.7%回溯后能找到正确证据片段。

5.2 训练策略消融

  1. 仅零样本提示:12.8 mIoU;
  2. SFT微调:+2.1 mIoU;
  3. SFT+GR强化:再+1.9 mIoU;
  4. 只用最优路径训练:仅10.4 mIoU,证明带迂回的纠错轨迹是关键训练信号。

5.3 主干模型泛化测试

替换同等规模Qwen2.5-VL-7B后,VTS依旧全面超越所有裁剪智能体,证明增益来自框架而非基座模型。

5.4 通用长视频问答泛化结果

方法Video-MMEMLVULVBench
LongVT67.0-41.3
VideoZoomer65.255.841.5
VTS67.558.254.7
仅针对时序定位训练的导航策略,可直接迁移至无片段定位的通用长视频理解任务。

6 结论与局限

结论

本文提出VTS树形自校正长视频检索智能体,自适应时序树+四类可学习导航动作解决传统裁剪智能体无法回溯纠错的缺陷。在三大时序定位基准大幅领先现有方案,且导航策略具备跨任务泛化能力,分层时序搜索是长视频推理有效归纳偏置。

局限性

  1. 当前仅支持单段连续证据,无法处理分散多段线索问题;
  2. 分段依赖CLIP视觉突变,画面高度同质视频边界划分精度下降;
  3. 轨迹合成依赖外部VLM/LLM,训练数据质量受外部模型上限约束。

未来工作

  1. 扩展多证据分支聚合问答;
  2. 优化同质视频场景时序边界检测器;
  3. 轻量化树形推理,降低长视频推理算力;
  4. 拓展多轮多模态交互长视频智能体。

附录A 实现完整细节

A1 自适应分段伪代码

算法1 自适应视频分段 输入:片段S、CLIP编码器E、阈值系数k、最小/最大子段N_min,N_max 1. 均匀1fps采样S内最多64帧F 2. 对所有帧提取CLIP嵌入e_i 3. 计算相邻帧视觉距离 δ_i = 1 - cos(e_i, e_{i+1}) 4. 计算阈值 τ = 均值(δ) + k*标准差(δ) 5. 收集所有δ_i>τ的分割边界B 6. 若边界过多:保留δ最大前N_max-1条 7. 若边界过少:补充δ次大边界至N_min-1条 8. 根据边界切分视频,返回子片段列表

A2 树形导航推理伪代码

算法2 分层树搜索推理 输入:视频V、问题Q、智能体策略π、摘要模型Φ、最大轮次T_max 1. 当前片段S = 完整视频区间 2. 初始化内存M(树结构+动作历史) 3. for t in 1~T_max: 1. 自适应切分S得到子片段集合 2. 采样各子片段帧作为观测O 3. 策略输出推理文本R + 动作A 4. 分支处理动作: zoom_in:切换至对应子段 zoom_out:回到父节点 shift:切换同级兄弟片段 answer:直接返回答案与时序区间 5. 生成所有子片段文本摘要,更新内存M 4. 达到最大轮次强制输出最优结果

A3 标准Prompt模板

系统提示
你是长视频时序检索智能体,可分层遍历视频时序树,每次执行四类动作之一:

  1. zoom_in <编号>:进入细分子片段缩小检索;
  2. zoom_out:回溯上层粗片段,修正错误;
  3. shift <编号>:切换同层级其他片段;
  4. answer <选项字母> <起始秒> <结束秒>:输出答案与支撑证据区间。

用户输入固定结构
当前视频片段时间范围:xxx
子片段帧视觉内容:xxx
内存记录(树形结构+历史动作):xxx
问题:xxx
选择题选项:A/B/C…

A4 训练超参

  1. SFT阶段:2 epoch,batch=16,lr=1e-5,冻结视觉编码器;
  2. GR强化:LoRA rank=32,lr=5e-5,每组提示8条轨迹,KL系数0.04;
  3. 推理:vLLM加速,温度0,最大交互轮次10。

附录B 评测数据集过滤规则

CG-Bench原始数据存在大量无意义样本,四层过滤流程:

  1. 多真值片段、覆盖超30%视频、无效时长样本直接删除;
  2. 仅用问题文本即可答对的样本剔除(无视频依赖);
  3. 仅真值片段可答对,其余帧无法作答才保留;
  4. 去除真值外画面也能答对的模糊样本;
    过滤后剩余1176条高质量时序定位样本。

附录C 数据集构建LongClueQA

C1 数据采集

爬取10~90分钟YouTube创意共享长视频,基于CLIP帧相似度过滤视觉单调内容,保留教程、叙事、运动等具备时序变化视频。

C2 QA生成流水线

  1. 视频每10秒切分片段,Qwen3-VL生成带时间戳画面摘要;
  2. Qwen3大模型基于摘要生成选择题,绑定对应证据时间;
  3. 生成语义相似干扰选项,确保仅目标片段可唯一确定答案。

C3 轨迹合成数据过滤

CG-Bench、Haystack-Ego4D、LongClueQA统一四步过滤,仅保留可生成有效纠错路径样本,最终6537条训练轨迹。

附录D 定性案例

  1. 富士电视台22楼窗口案例:智能体先误入一楼售票大厅分支,连续两轮后zoom_out回溯,切换同级片段找到高层窗户证据;
    2 厨具案例:单次zoom_in直接定位橱柜水果,无需回溯,体现简单线索快速收敛能力。

开源资源

完整代码仓库:https://github.com/CeeZh/VTS
数据集构建脚本、训练推理代码、评测复现脚本全部开源。