Skip to main content
QUICK REVIEW

[论文解读] Reinforcement Learning for Weakly Supervised Temporal Grounding of Natural Language in Untrimmed Videos

Jie Wu, Guanbin Li|arXiv (Cornell University)|Sep 18, 2020
Multimodal Machine Learning Applications参考文献 41被引用 10
一句话总结

本文提出边界自适应精炼(Boundary Adaptive Refinement, BAR),一种基于强化学习的弱监督视频时序定位框架,仅依赖视频级描述进行训练。BAR利用跨模态对齐评估器提供定制化奖励,实现无需滑动窗口的自适应、边界灵活的时序片段精炼,在Charades-STA与ActivityNet数据集上达到最先进性能,甚至超越部分全监督方法。

ABSTRACT

Temporal grounding of natural language in untrimmed videos is a fundamental yet challenging multimedia task facilitating cross-media visual content retrieval. We focus on the weakly supervised setting of this task that merely accesses to coarse video-level language description annotation without temporal boundary, which is more consistent with reality as such weak labels are more readily available in practice. In this paper, we propose a \emph{Boundary Adaptive Refinement} (BAR) framework that resorts to reinforcement learning (RL) to guide the process of progressively refining the temporal boundary. To the best of our knowledge, we offer the first attempt to extend RL to temporal localization task with weak supervision. As it is non-trivial to obtain a straightforward reward function in the absence of pairwise granular boundary-query annotations, a cross-modal alignment evaluator is crafted to measure the alignment degree of segment-query pair to provide tailor-designed rewards. This refinement scheme completely abandons traditional sliding window based solution pattern and contributes to acquiring more efficient, boundary-flexible and content-aware grounding results. Extensive experiments on two public benchmarks Charades-STA and ActivityNet demonstrate that BAR outperforms the state-of-the-art weakly-supervised method and even beats some competitive fully-supervised ones.

研究动机与目标

  • 解决在仅有视频级语言描述可用的弱监督设定下,未剪辑视频中的时序定位挑战。
  • 克服提案-排序框架中固定滑动窗口方法在边界灵活性与内容感知能力方面的局限。
  • 设计一种基于强化学习的框架,实现无需细粒度标注的自适应边界精炼,以提升跨模态对齐效果。
  • 设计基于跨模态对齐分数的奖励机制,以在缺乏成对边界监督的情况下指导策略学习。
  • 通过将耗时的滑动窗口扫描替换为动态、环境感知的精炼过程,同时提升准确率与效率。

提出的方法

  • 该框架采用强化学习智能体,通过方向与步长动作迭代调整时序边界。
  • 上下文感知特征提取器编码当前状态,包括视频片段与查询嵌入,以支持决策制定。
  • 自适应动作规划器基于当前状态与对齐分数选择边界调整,实现灵活的窗口缩放。
  • 跨模态对齐评估器利用视频间与视频内排序损失,估算视频片段与查询之间的语义匹配程度。
  • 对齐评估器通过比较连续片段-查询对的对齐分数,提供密集且连续的奖励信号,支持有效的策略优化。
  • 引入长度惩罚以抑制过长或过短的片段,提升收敛性与性能表现。

实验结果

研究问题

  • RQ1在缺乏真实边界标注的情况下,强化学习能否有效应用于弱监督时序定位?
  • RQ2在缺乏成对片段-查询监督的情况下,如何设计可靠且信息丰富的奖励函数?
  • RQ3边界自适应精炼策略是否能在准确率与效率上超越固定滑动窗口方法?
  • RQ4引入视频内排序损失在多大程度上提升了对齐与定位性能?
  • RQ5长度惩罚与停止信号策略如何影响精炼过程的收敛性与鲁棒性?

主要发现

  • BAR在Charades-STA与ActivityNet数据集上达到最先进性能,优于现有弱监督方法,甚至超越部分全监督基线模型。
  • 在Charades-STA上,当引入上下文信息时,BAR将tIoU@0.5提升2.53%,tIoU@0.7提升2.35%,证明了内容感知建模的优势。
  • 消融实验表明,若移除视频内排序损失(L_intra),tIoU@0.3从51.64%降至46.82%,证实其在对齐准确率中的关键作用。
  • 对齐分数S与真实IoU之间的皮尔逊相关系数(CC)达到0.79,表明S是匹配质量的可靠代理指标。
  • BAR将平均推理时间缩短至0.068秒,每视频仅保留1个候选片段,相较TGA的0.104秒与65.11个候选片段,实现显著效率提升。
  • 最优超参数为δ = 0.35与τ = 0.5,当这些值过大或过小时,性能显著下降。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。