Imagine Before Concentration: Diffusion-Guided Registers Enhance Partially Relevant Video Retrieval

发布时间:2026/8/30 20:23:50
Imagine Before Concentration: Diffusion-Guided Registers Enhance Partially Relevant Video Retrieval 基础信息题目Imagine Before Concentration: Diffusion-Guided Registers Enhance Partially Relevant Video Retrieval作者Jun Li1,2,3, Xuhang Lou1, Jinpeng Wang1*, Yuting Wang, Yaowei Wang1,3, Shu-Tao Xia2,3, Bin Chen1,3单位1哈尔滨工业大学深圳2清华大学深圳国际研究生院3鹏城实验室下载https://arxiv.org/abs/2604.03653代码https://github.com/lijun2005/CVPR26-DreamPRVR01 摘要部分相关视频检索PRVR旨在基于仅描述部分事件的文本查询来检索未裁剪的视频。现有方法受制于不完整的全局上下文感知难以应对查询歧义以及由虚假响应引起的局部噪声。为了解决这些问题我们提出了DreamPRVR它采用了一种由粗到细的表示学习范式。该模型首先生成全局上下文语义寄存器作为覆盖整个视频的粗粒度高光特征然后集中进行细粒度相似度优化以实现精准的跨模态匹配。具体而言这些寄存器的生成方式是从概率变分采样器产生的以视频为中心的分布中进行初始化然后通过由文本监督的截断扩散模型进行迭代细化。在此过程中文本语义结构学习构建了一个结构良好的文本潜在空间增强了全局感知的可靠性。随后这些寄存器通过寄存器增强的高斯注意力块与视频token进行自适应融合从而实现上下文感知的特征学习。大量实验表明DreamPRVR优于最先进的方法。02 研究动机核心思想a. 缺乏全局上下文导致的检索失败展示了由于模型缺乏上下文感知一个整体无关的“划船”视频由于碰巧产生了局部的错误响应局部尖峰激活其相关性得分反而超过了真正符合查询语句“对着镜头展示手风琴”的Ground Truth视频。b. 传统MIL学习范式的缺陷现有的多实例学习MIL范式通常只考虑最匹配的那一对片段这导致监督信号非常稀疏大量其他的视频token处于“训练不足undertrained”的状态。c. DreamPRVR的“由粗到细”范式本文提出的模型首先通过文本监督的扩散过程“想象Imagine”出全局寄存器然后在此基础上“集中Concentrate”进行细粒度学习。这种方式实现了由粗到细的跨模态对齐并联合优化所有的视频token以形成一个连贯的嵌入空间。03 核心方法先想后聚人类在回忆一段视频时通常会先在脑海中浮现出整个事件的“全局轮廓”然后再去搜索具体的“局部细节”。DreamPRVR正是借鉴了这种人类认知规律提出了一种全新的“由粗到细Coarse-to-fine”表示学习范式。模型巧妙地引入了“全局寄存器Global Registers”的概念。你可以把它理解为视频的“摘要小抄”。在进行精细的图文匹配前模型会先“想象Imagine”出这些寄存器用它们来锚定视频的全局语义随后再将注意力“集中Concentrate”在细粒度的特征对齐上。那么这个“想象”的过程是如何硬核实现的呢作者给出了三大核心技术“连招”核心一文本语义结构学习Textual Semantic Structure Learning为了给后续的“想象”提供精准的监督信号模型构建了一个结构良好的文本潜在空间。首先通过“查询相似度保持QSP”策略将属于同一视频的不同文本查询视为互补的正样本并拉近距离同时推开不同视频的查询避免了传统方法盲目推开所有查询的弊端。其次引入“文本摄动采样器TPS”通过在文本特征中注入可控的扰动来显式建模文本查询的不确定性从而为寄存器生成提供稳健的语义指导。核心二基于截断扩散模型的寄存器生成Register Generation via Truncated Diffusion这是模型“想象”全局上下文的核心环节。与从纯随机高斯噪声开始的传统扩散模型不同DreamPRVR设计了“概率变分采样器PVS”直接从视频特征中提取出以视频为中心的分布作为生成的初始状态。随后“扩散寄存器估计器DRE”在前面TPS构建的文本特征监督下进行迭代去噪。通过这种截断式的扩散过程模型一步步剔除冗余噪声最终提炼出高度纯净且包含完整全局语义的最优寄存器。核心三寄存器增强的视频表示学习Register-Augmented Video Representation在提炼出包含全局上下文的最优寄存器后模型需要将其用于增强细粒度的视频特征。这一步通过“寄存器增强注意力块RAB”实现。RAB采用了一种特殊设计的非对称高斯注意力掩码普通的视频片段或帧既能相互交互也能“看到”全局寄存器而寄存器则只与视频片段交互。这种机制有效抑制了由于局部偶然相似带来的噪声干扰利用全局上下文信息实现了高精度的跨模态检索。04 硬核验证刷新纪录对比实验如表1所示DreamPRVR在ActivityNet Captions、Charades-STA和TVR三大基准数据集上均实现了新的SOTA表现。其整体检索指标SumR分别达到156.1、80.0和193.1全面超越了现有的各类视频检索基线模型。这充分证明了扩散生成的全局寄存器能有效补足全局上下文感知提取出可靠的整体语义从而显著提升了检索精度。参数分析表2主要评估了模型的训练与推理效率。结果显示尽管基于扩散的迭代寄存器生成引入了轻微的计算开销DreamPRVR依然保持了与HLFormer相当的高效性。这种微小的效率权衡换来了显著的性能提升SumR其整体训练和推理时间完全在可接受的范围内证明了该框架在具备高性能的同时也拥有极高的实用效率。消融实验表3的消融实验精简有力地证明了DreamPRVR各组件的“缺一不可”。数据表明如果放弃截断扩散策略如移除寄存器、改用简单池化、去掉迭代去噪或视频先验检索性能均会明显下滑。同时若剥离专属的损失函数体系仅保留基础检索损失模型效果直接垫底。这充分证实了扩散生成机制与配套监督策略在提炼高质量全局语义中的核心价值。t-SNE可视化图4的t-SNE可视化直观地证明了通过引入查询相似度保持Lqsp等文本结构学习策略DreamPRVR 成功将原本“一盘散沙”的文本特征图4a重塑为一个“物以类聚”、界限分明的结构化潜在空间图4b从而为后续生成高质量的全局寄存器提供了极其精准的语义靶点。实例分析图5直观展现了“全局寄存器”的实战威力。回看图1中那个“骗”过传统模型的“划船”视频在全局上下文的加持下DreamPRVR成功压制了它的局部错误高分。同时模型在真正的目标视频上打出了更高得分且峰值与真实片段完美对齐。这生动证明DreamPRVR真正做到了“纵览全局精准定位”彻底告别局部噪声干扰05 视频检索 全文总结DreamPRVR 为部分相关视频检索PRVR任务交出了一份惊艳的答卷。通过引入轻量级的截断扩散模型研究团队巧妙地将“生成”与“判别”结合起来用“先想后聚”的类人认知逻辑彻底打破了长久以来的局部噪声与查询歧义困境。这不仅是一次性能指标上的全面飞跃更为跨模态对齐与多模态特征交互提供了一个全新的视角。它向我们证明在处理极其复杂的未裁剪长视频时赋予模型“想象”全局上下文的能力远比盲目增加局部匹配的复杂度要高效得多。