OmniPT: Unleashing the Potential of Large Vision Language Models for Pedestrian Tracking and Unde...

发布时间:2026/10/3 13:23:53
OmniPT: Unleashing the Potential of Large Vision Language Models for Pedestrian Tracking and Unde... 文章主要内容与创新点总结一、主要内容本文针对大型视觉语言模型(LVLMs)在实例级任务(如目标跟踪)中性能不足的问题,提出了一种统一的行人跟踪框架OmniPT。该框架能够同时完成传统多目标跟踪(MOT)、指代多目标跟踪(RMOT)、跨视角指代多目标跟踪(CRMOT)和语义多目标跟踪(SMOT)四大任务,核心是通过语义理解增强跟踪稳定性,同时实现指令交互下的跟踪与语义分析。为适配LVLMs的能力特性,设计了四阶段训练策略:第一阶段RL:采用GRPO算法,规范模型输出固定格式的边界框(x,y,w,h);中期训练(Mid Training):基于行人相关数据集,通过图像文本对齐、目标检测、位置预测、行人重识别等代理任务,增强模型对行人语义描述的敏感性;监督微调(SFT):将跟踪任务解耦为VQA形式,针对四大核心任务设计训练样本与查询格式;第二阶段RL:进一步提升模型跟踪性能与指令遵循能力。在DanceTrack、BenSMOT、Refer-KITTI-V2、CRTrack等数据集上的实验表明,OmniPT在跟踪精度(HOTA、MOTA等指标)和语义理解(BLEU、CIDEr等指标)上均达到当前最优水平,例如在BenSMOT上HOTA得分75.04,较此前最佳结果提升3.06。二、创新点统一范式设计:首次提出"一体化"行人跟踪框架,兼容传统跟踪与语义导向型跟踪任务,实现跟踪与语义理解的交互式统一;任务转化方案:将实例级跟踪

关于本文作者

来自尧图内容编辑团队

尧图内容编辑团队 内容团队

尧图内容编辑团队

本文由尧图网络内容编辑团队执笔。团队由资深项目经理、前端工程师与设计师组成,所有内容均来自亲手交付的真实项目,先讲清问题、再给出可落地的解法。尧图深耕北京网站建设十年,服务过京华建材集团、智造科技等各行业客户,把一线经验沉淀为可复用的行业观察。

  • 十年建站经验,覆盖建材、制造、服务、文创等
  • 项目经理把关选题与事实准确性
  • 工程师与设计师联合撰写专业细节
  • 统一编辑规范,保证文风与排版一致
  • 每月复盘转化数据,迭代选题方向

延伸阅读

相关资讯与近期热门内容

深度阅读推荐

建站决策前值得细读的三篇

网站改版的5个关键决策
2024-08-12

网站改版的5个关键决策

什么时候该改版、改到什么程度、如何避免流量掉光,京华建材集团改版复盘给出答案。

获取专属建站方案

看完文章,把您的行业与预算告诉我们,免费获取一份量身定制的官网建设方案与报价。

立即免费咨询