文章主要内容与创新点总结
一、主要内容
本文针对大型视觉语言模型(LVLMs)在实例级任务(如目标跟踪)中性能不足的问题,提出了一种统一的行人跟踪框架OmniPT。该框架能够同时完成传统多目标跟踪(MOT)、指代多目标跟踪(RMOT)、跨视角指代多目标跟踪(CRMOT)和语义多目标跟踪(SMOT)四大任务,核心是通过语义理解增强跟踪稳定性,同时实现指令交互下的跟踪与语义分析。
为适配LVLMs的能力特性,设计了四阶段训练策略:
- 第一阶段RL:采用GRPO算法,规范模型输出固定格式的边界框(x,y,w,h);
- 中期训练(Mid Training):基于行人相关数据集,通过图像文本对齐、目标检测、位置预测、行人重识别等代理任务,增强模型对行人语义描述的敏感性;
- 监督微调(SFT):将跟踪任务解耦为VQA形式,针对四大核心任务设计训练样本与查询格式;
- 第二阶段RL:进一步提升模型跟踪性能与指令遵循能力。
在DanceTrack、BenSMOT、Refer-KITTI-V2、CRTrack等数据集上的实验表明,OmniPT在跟踪精度(HOTA、MOTA等指标)和语义理解(BLEU、CIDEr等指标)上均达到当前最优水平,例如在BenSMOT上HOTA得分75.04,较此前最佳结果提升3.06。
二、创新点
- 统一范式设计:首次提出"一体化"行人跟踪框架,兼容传统跟踪与语义导向型跟踪任务,实现跟踪与语义理解的交互式统一;
- 任务转化方案:将实例级跟踪