VideoTreeSearch:基于树形自校正智能体的长视频时序定位问答
VideoTreeSearch:基于树形自校正智能体的长视频时序定位问答
arXiv:2607.16189v1 [cs.CV] 2026-07-17
开源代码仓库:https://github.com/CeeZh/VTS
摘要
带时序定位的长视频问答(Grounded LVQA)任务要求模型回答问题的同时,定位视频中支撑答案的证据片段。现有智能体方案仅提供单一crop_video裁剪动作,只能由粗到细收敛,缺少回溯纠错能力,极易提前收敛、陷入早期错误无法恢复。
本文提出VideoTreeSearch(VTS)框架,将长视频问答建模为自适应时序树上的迭代自校正搜索。
- 基于CLIP视觉变化边界构建非均匀时序树,每个节点对应语义连贯视频片段;
- 设计四类离散导航动作:
zoom_in下探子段、zoom_out回溯父段、shift切换同级片段、answer输出结果,把回溯纠错转为可学习显式原语; - 设计轨迹合成流水线,生成包含误入错误分支再回溯修复的多步导航路径;
- 采用监督微调+强化学习两阶段训练,时序交并比(IoU)、答案准确率双指标联合奖励。
在CG-Bench、Haystack-LVBench、Haystack-Ego4D三大时序定位基准上,VTS相比最优基线在CG-Bench提升12.5 mIoU,Haystack-Ego4D提升7.4 T-F1;同时可泛化至通用长视频问答任务,在Video-MME、MLVU、LVBench最高提升7.1准确率。消融实验证明:分层树形搜索、显式回溯是性能提升核心模块。
关键词:长视频问答;时序定位;多模态智能体;树形分层搜索;自校正回溯;强化学习;VLM
1 引言
1.1 任务痛点
以一小时烹饪教程视频提问为例:“厨师放入烤箱前往碗里加了什么?”,模型需要先定位放碗的片段,再往前追溯加料画面。长视频中有效证据仅占极小片段,均匀采样要么漏关键帧、要么超出多模态上下文窗口,必须迭代式时序检索。
现有裁剪式智能体仅支持连续区间裁剪,存在两大结构性缺陷:
- 动作空间不对称:只有缩小搜索范围的操作,没有从细粒度退回粗粒度的回溯手段;
- 无分层视频分解,模型只能从原始像素回归时间戳,搜索空间扁平无先验,极易提前收敛、无法修正早期错误。
1.2 VTS核心创新
将长视频构建为语义自适应时序树,智能体通过四类离散动作遍历树结构,把定位、纠错变为独立可学习行为:
- 自适应分段:基于CLIP帧嵌入视觉突变边界划分节点,而非固定均匀切分;
- 四元离散导航动作,解耦探索与纠错;
- 轨迹合成数据集:构造“误入错分支+回溯修复”样本,解决现有数据集缺少纠错监督的问题;
- 两阶段训练:先模仿合成轨迹监督微调,再基于定位、答案双奖励强化学习。
1.3 核心结论
- 时序树+显式回溯大幅提升长视频证据定位精度,视频越长增益越明显;
- 智能体平均4.8轮搜索,60%轨迹会触发回溯动作,证明模型主动使用纠错机制;
- 仅用时序定位数据训练,可零成本泛化到无定位要求的通用长视频问答。
2 相关工作
2.1 长视频与时序定位问答
传统长视频方案:超长上下文VLM、帧压缩、关键帧筛选、视频摘要流水线,均为单次前向推理,无法迭代检索时序片段。
时序定位Grounded LVQA要求输出答案+对应视频区间,代表基准CG-Bench、Haystack系列;现有TimeChat、VideoITG等模型采用固定递归流程,不支持动态回溯修正。
2.2 视频分层树形表示
VideoTree、VideoMiner将视频构建树形结构,但均为静态一次性编码,仅单次前向使用;VTS创新点:树作为可交互环境,智能多轮遍历、支持回溯重访历史节点。
3 方法:VideoTreeSearch整体框架
整体流程:输入长视频+问题 → 自适应构建时序树 → 智能体多轮树导航(zoom_in/zoom_out/shift)→ 输出答案与时序证据区间。
3.1 自适应时序树构建
- 对任意视频片段均匀1fps采样最多64帧,计算CLIP帧间嵌入余弦距离表征视觉变化;
- 自适应阈值τ=mean(δ)+k⋅std(δ)\tau=\text{mean}(\delta)+k\cdot\text{std}(\delta)τ=mean(δ)+k⋅std(δ),在突变位置切分;
- 约束每个父节点子片段数量3~8,片段短于64秒直接作为叶子节点;
- 懒加载机制:仅智能体访问节点时才生成子树,降低算力开销。
3.2 四类离散导航动作
zoom_in(c):进入第c个子片段,由粗到细缩小检索范围;zoom_out():返回父节点,完成回溯纠错;shift(s):切换至同层级第s个兄弟片段,横向排查;answer(答案, [起始秒, 结束秒]):终止搜索,输出答案与时序证据。
对比连续crop方案:树形分层天然匹配多尺度时序线索,回溯是独立动作而非隐式反复裁剪。
3.3 多轮导航内存机制
内存存储两部分轻量化信息,避免上下文溢出:
- 已访问树形结构+各节点文本摘要;
- 全部历史动作时序日志;
智能体仅读取当前节点原始帧,其余节点仅读取文字摘要,大幅节省视觉token。
3.4 轨迹合成流水线(训练数据核心)
现有数据集只有最优检索路径,缺少“犯错再修复”样本,本文自动生成带迂回轨迹:
- 控制器基于Qwen3-VL打分,优先走向含真值子段;
- 允许主动误入错误分支,连续两轮错分支强制回溯;
- 每一步附带DeepSeek-R1生成推理文本;
数据源:CG-Bench、Haystack-Ego4D、自制LongClueQA无标注长YouTube视频集,最终过滤得到6537条可用训练轨迹。
3.5 两阶段训练方案
阶段1:监督微调SFT
损失仅作用有效纠错动作(正确下探、错分支zoom_out、shift切换),误入错误分支的步骤仅作为上下文、不参与梯度回传。
损失公式:
LSFT=−∑(Ot−1,Mt,Rt,At)logpθ(Rt,At∣Ot−1,Mt,Q)\mathcal{L}_{\text{SFT}}=-\sum_{(O_{t-1},M_{t},R_{t},A_{t})}\log p_{\theta}(R_{t},A_{t}\mid O_{t-1},M_{t},Q)LSFT=−(Ot−1,Mt,Rt,At)∑logpθ(Rt,At∣Ot−1,Mt,Q)
阶段2:GR强化学习(GRPO)
复合奖励函数,三项加权求和:
R(τ)=λfmtRfmt+λIoURIoU+λaccRτR(\tau)=\lambda_{\text{fmt}}R_{\text{fmt}}+\lambda_{\text{IoU}}R_{\text{IoU}}+\lambda_{\text{acc}}R_{\tau}R(τ)=λfmtRfmt+λIoURIoU+λaccRτ
- KaTeX parse error: Expected '}', got 'EOF' at end of input: R_{\text{fmt}:动作格式合法性奖励;
- RIoUR_{\text{IoU}}RIoU:预测片段与真值时序交并比;
- RaccR_{\text{acc}}Racc:选择题答案正确率;
采用KL散度约束策略不偏离SFT初始模型,防止崩溃。
3.6 实现细节
基础VLM:Qwen3-VL-8B;
分段超参k=1.5k=1.5k=1.5;
每轮采样64帧1fps;
训练硬件:4张H100;
模型版本:VTS-SFT(仅微调)、VTS-RL(微调+强化,主实验模型)。
4 实验设置
4.1 评测数据集
- 时序定位Grounded LVQA(核心任务)
- CG-Bench mini子集:指标mIoU、问答准确率;
- Haystack-LVBench:指标T-F1时序F1、准确率;
- Haystack-Ego4D(第一视角长视频,最难):T-F1、准确率。
- 通用长视频问答(泛化测试)
Video-MME、MLVU、LVBench,仅评测选择题准确率。
4.2 对比基线分类
- 均匀采样VLM:Qwen3-VL-8B(256/384帧)、Video-R1;
- 摘要LLM流水线:SiLVR(密集帧描述+大模型推理);
- 裁剪式智能体:LongVT、Video-o3、VideoZoomer、TimeSearch-R。
4.3 主实验结果(时序定位任务)
| 方法 | CG-Bench(mIoU/Acc) | Haystack-LVBench(T-F1/Acc) | Haystack-Ego4D(T-F1/Acc) |
|---|---|---|---|
| Qwen3-VL 384帧 | 12.1/23.6 | 9.2/39.5 | 7.0/33.4 |
| SiLVR | 10.1/31.8 | 8.5/57.0 | 6.3/46.4 |
| LongVT | 4.3/17.4 | 5.4/46.2 | 3.7/42.1 |
| TimeSearch-R | -/- | 8.1/52.1 | 11.0/53.5 |
| VTS(本文) | 16.8/36.4 | 15.2/58.3 | 18.4/66.1 |
| 结论:CG-Bench相比最优基线LongVT mIoU提升12.5;Ego4D长视频场景T-F1提升7.4,视频越长树形回溯增益越大。 |
4.4 效率对比
VTS平均仅处理328帧,少于均匀采样384帧、SiLVR 450帧,但定位与准确率全面领先。
5 消融与性能分析
5.1 核心模块消融
| 实验配置 | CG mIoU | Haystack-Ego4D T-F1 |
|---|---|---|
| 连续crop动作替代树形 | 15.5 | 14.2 |
| 树形但禁用zoom_out/shift回溯 | 14.4 | 15.5 |
| 树形无分层(平铺均分) | 15.3 | 18.9 |
| 完整VTS | 16.8 | 18.4 |
- 回溯模块移除后所有数据集指标暴跌,证明自校正为核心增益;
- 分层树形优于平铺均分,仅线索极短的Ego4D平铺有微弱时序提升,但问答准确率下降。
统计:VTS 60%轨迹触发回溯,裁剪基线仅7%~15%;42.7%回溯后能找到正确证据片段。
5.2 训练策略消融
- 仅零样本提示:12.8 mIoU;
- SFT微调:+2.1 mIoU;
- SFT+GR强化:再+1.9 mIoU;
- 只用最优路径训练:仅10.4 mIoU,证明带迂回的纠错轨迹是关键训练信号。
5.3 主干模型泛化测试
替换同等规模Qwen2.5-VL-7B后,VTS依旧全面超越所有裁剪智能体,证明增益来自框架而非基座模型。
5.4 通用长视频问答泛化结果
| 方法 | Video-MME | MLVU | LVBench |
|---|---|---|---|
| LongVT | 67.0 | - | 41.3 |
| VideoZoomer | 65.2 | 55.8 | 41.5 |
| VTS | 67.5 | 58.2 | 54.7 |
| 仅针对时序定位训练的导航策略,可直接迁移至无片段定位的通用长视频理解任务。 |
6 结论与局限
结论
本文提出VTS树形自校正长视频检索智能体,自适应时序树+四类可学习导航动作解决传统裁剪智能体无法回溯纠错的缺陷。在三大时序定位基准大幅领先现有方案,且导航策略具备跨任务泛化能力,分层时序搜索是长视频推理有效归纳偏置。
局限性
- 当前仅支持单段连续证据,无法处理分散多段线索问题;
- 分段依赖CLIP视觉突变,画面高度同质视频边界划分精度下降;
- 轨迹合成依赖外部VLM/LLM,训练数据质量受外部模型上限约束。
未来工作
- 扩展多证据分支聚合问答;
- 优化同质视频场景时序边界检测器;
- 轻量化树形推理,降低长视频推理算力;
- 拓展多轮多模态交互长视频智能体。
附录A 实现完整细节
A1 自适应分段伪代码
算法1 自适应视频分段 输入:片段S、CLIP编码器E、阈值系数k、最小/最大子段N_min,N_max 1. 均匀1fps采样S内最多64帧F 2. 对所有帧提取CLIP嵌入e_i 3. 计算相邻帧视觉距离 δ_i = 1 - cos(e_i, e_{i+1}) 4. 计算阈值 τ = 均值(δ) + k*标准差(δ) 5. 收集所有δ_i>τ的分割边界B 6. 若边界过多:保留δ最大前N_max-1条 7. 若边界过少:补充δ次大边界至N_min-1条 8. 根据边界切分视频,返回子片段列表A2 树形导航推理伪代码
算法2 分层树搜索推理 输入:视频V、问题Q、智能体策略π、摘要模型Φ、最大轮次T_max 1. 当前片段S = 完整视频区间 2. 初始化内存M(树结构+动作历史) 3. for t in 1~T_max: 1. 自适应切分S得到子片段集合 2. 采样各子片段帧作为观测O 3. 策略输出推理文本R + 动作A 4. 分支处理动作: zoom_in:切换至对应子段 zoom_out:回到父节点 shift:切换同级兄弟片段 answer:直接返回答案与时序区间 5. 生成所有子片段文本摘要,更新内存M 4. 达到最大轮次强制输出最优结果A3 标准Prompt模板
系统提示
你是长视频时序检索智能体,可分层遍历视频时序树,每次执行四类动作之一:
- zoom_in <编号>:进入细分子片段缩小检索;
- zoom_out:回溯上层粗片段,修正错误;
- shift <编号>:切换同层级其他片段;
- answer <选项字母> <起始秒> <结束秒>:输出答案与支撑证据区间。
用户输入固定结构
当前视频片段时间范围:xxx
子片段帧视觉内容:xxx
内存记录(树形结构+历史动作):xxx
问题:xxx
选择题选项:A/B/C…
A4 训练超参
- SFT阶段:2 epoch,batch=16,lr=1e-5,冻结视觉编码器;
- GR强化:LoRA rank=32,lr=5e-5,每组提示8条轨迹,KL系数0.04;
- 推理:vLLM加速,温度0,最大交互轮次10。
附录B 评测数据集过滤规则
CG-Bench原始数据存在大量无意义样本,四层过滤流程:
- 多真值片段、覆盖超30%视频、无效时长样本直接删除;
- 仅用问题文本即可答对的样本剔除(无视频依赖);
- 仅真值片段可答对,其余帧无法作答才保留;
- 去除真值外画面也能答对的模糊样本;
过滤后剩余1176条高质量时序定位样本。
附录C 数据集构建LongClueQA
C1 数据采集
爬取10~90分钟YouTube创意共享长视频,基于CLIP帧相似度过滤视觉单调内容,保留教程、叙事、运动等具备时序变化视频。
C2 QA生成流水线
- 视频每10秒切分片段,Qwen3-VL生成带时间戳画面摘要;
- Qwen3大模型基于摘要生成选择题,绑定对应证据时间;
- 生成语义相似干扰选项,确保仅目标片段可唯一确定答案。
C3 轨迹合成数据过滤
CG-Bench、Haystack-Ego4D、LongClueQA统一四步过滤,仅保留可生成有效纠错路径样本,最终6537条训练轨迹。
附录D 定性案例
- 富士电视台22楼窗口案例:智能体先误入一楼售票大厅分支,连续两轮后zoom_out回溯,切换同级片段找到高层窗户证据;
2 厨具案例:单次zoom_in直接定位橱柜水果,无需回溯,体现简单线索快速收敛能力。
开源资源
完整代码仓库:https://github.com/CeeZh/VTS
数据集构建脚本、训练推理代码、评测复现脚本全部开源。