Pinpointing Trigger Moment for Grounded Video QA: Enhancing Spatio-temporal Grounding in Multimod...

发布时间:2026/7/25 2:44:23
Pinpointing Trigger Moment for Grounded Video QA: Enhancing Spatio-temporal Grounding in Multimod... 一、文章主要内容总结该研究针对ICCV 2025感知测试挑战赛中的接地视频问答(GVQA)任务,提出了一种三阶段 pipeline 框架,核心目标是解决视频内容的复杂推理、视觉证据关联与目标对象时序跟踪问题。任务背景:GVQA 任务要求模型不仅能对视频内容进行多模态推理,还需将答案与视觉证据绑定,并跟踪目标对象的时序轨迹。现有 VideoQA 模型常依赖语言捷径而非视觉因果信息,因此需要更可靠的视觉接地与跟踪方案。三阶段框架:(1)视频推理与问答(Video Reasoning QA):采用 Gemini 2.5 Pro 模型,通过 CORTEX 提示词策略,识别目标对象并输出详细描述,同时定位“触发时刻”(trigger moment)——目标对象最清晰可见的单帧;(2)时空接地(Spatio-temporal Grounding):使用 Molmo 模型在触发时刻帧中定位目标对象,生成初始边界框;若接地失败,采用滑动窗口、反向播放等 fallback 策略;(3)跟踪(Tracking):基于 SAM2 模型,从初始边界框出发进行双向跟踪,生成目标对象在全视频中的轨迹。实验结果:该方法在测试集上取得 0.4968 的 HOTA 分数,显著超越 2024 年冠军的 0.2704 和基线模型的 0.0574,验证了框架的有效性。局限与展望:当前框架适用于单一事件场景