三亩地 三亩地SAN MU DI · CODE DIARY
ARTICLE DETAIL

日记详情

真实记录编程学习的某一天,欢迎挑你感兴趣的翻一翻。

OmniPT: Unleashing the Potential of Large Vision Language Models for Pedestrian Tracking and Unde...

OmniPT: Unleashing the Potential of Large Vision Language Models for Pedestrian Tracking and Unde...

文章主要内容与创新点总结

一、主要内容

本文针对大型视觉语言模型(LVLMs)在实例级任务(如目标跟踪)中性能不足的问题,提出了一种统一的行人跟踪框架OmniPT。该框架能够同时完成传统多目标跟踪(MOT)、指代多目标跟踪(RMOT)、跨视角指代多目标跟踪(CRMOT)和语义多目标跟踪(SMOT)四大任务,核心是通过语义理解增强跟踪稳定性,同时实现指令交互下的跟踪与语义分析。

为适配LVLMs的能力特性,设计了四阶段训练策略:

  1. 第一阶段RL:采用GRPO算法,规范模型输出固定格式的边界框(x,y,w,h);
  2. 中期训练(Mid Training):基于行人相关数据集,通过图像文本对齐、目标检测、位置预测、行人重识别等代理任务,增强模型对行人语义描述的敏感性;
  3. 监督微调(SFT):将跟踪任务解耦为VQA形式,针对四大核心任务设计训练样本与查询格式;
  4. 第二阶段RL:进一步提升模型跟踪性能与指令遵循能力。

在DanceTrack、BenSMOT、Refer-KITTI-V2、CRTrack等数据集上的实验表明,OmniPT在跟踪精度(HOTA、MOTA等指标)和语义理解(BLEU、CIDEr等指标)上均达到当前最优水平,例如在BenSMOT上HOTA得分75.04,较此前最佳结果提升3.06。

二、创新点

  1. 统一范式设计:首次提出"一体化"行人跟踪框架,兼容传统跟踪与语义导向型跟踪任务,实现跟踪与语义理解的交互式统一;
  2. 任务转化方案:将实例级跟踪
← 返回列表