Pinpointing Trigger Moment for Grounded Video QA: Enhancing Spatio-temporal Grounding in Multimod...

发布时间:2026/9/22 11:52:55
Pinpointing Trigger Moment for Grounded Video QA: Enhancing Spatio-temporal Grounding in Multimod... 一、文章主要内容总结该研究针对ICCV 2025感知测试挑战赛中的接地视频问答(GVQA)任务,提出了一种三阶段 pipeline 框架,核心目标是解决视频内容的复杂推理、视觉证据关联与目标对象时序跟踪问题。任务背景:GVQA 任务要求模型不仅能对视频内容进行多模态推理,还需将答案与视觉证据绑定,并跟踪目标对象的时序轨迹。现有 VideoQA 模型常依赖语言捷径而非视觉因果信息,因此需要更可靠的视觉接地与跟踪方案。三阶段框架:(1)视频推理与问答(Video Reasoning QA):采用 Gemini 2.5 Pro 模型,通过 CORTEX 提示词策略,识别目标对象并输出详细描述,同时定位“触发时刻”(trigger moment)——目标对象最清晰可见的单帧;(2)时空接地(Spatio-temporal Grounding):使用 Molmo 模型在触发时刻帧中定位目标对象,生成初始边界框;若接地失败,采用滑动窗口、反向播放等 fallback 策略;(3)跟踪(Tracking):基于 SAM2 模型,从初始边界框出发进行双向跟踪,生成目标对象在全视频中的轨迹。实验结果:该方法在测试集上取得 0.4968 的 HOTA 分数,显著超越 2024 年冠军的 0.2704 和基线模型的 0.0574,验证了框架的有效性。局限与展望:当前框架适用于单一事件场景

关于本文作者

来自尧图内容编辑团队

尧图内容编辑团队 内容团队

尧图内容编辑团队

本文由尧图网络内容编辑团队执笔。团队由资深项目经理、前端工程师与设计师组成,所有内容均来自亲手交付的真实项目,先讲清问题、再给出可落地的解法。尧图深耕北京网站建设十年,服务过京华建材集团、智造科技等各行业客户,把一线经验沉淀为可复用的行业观察。

  • 十年建站经验,覆盖建材、制造、服务、文创等
  • 项目经理把关选题与事实准确性
  • 工程师与设计师联合撰写专业细节
  • 统一编辑规范,保证文风与排版一致
  • 每月复盘转化数据,迭代选题方向

延伸阅读

相关资讯与近期热门内容

深度阅读推荐

建站决策前值得细读的三篇

网站改版的5个关键决策
2024-08-12

网站改版的5个关键决策

什么时候该改版、改到什么程度、如何避免流量掉光,京华建材集团改版复盘给出答案。

获取专属建站方案

看完文章,把您的行业与预算告诉我们,免费获取一份量身定制的官网建设方案与报价。

立即免费咨询