Skip to main content
QUICK REVIEW

[论文解读] WSLLN: Weakly Supervised Natural Language Localization Networks

Mingfei Gao, Larry S. Davis|arXiv (Cornell University)|Aug 31, 2019
Multimodal Machine Learning Applications参考文献 39被引用 5
一句话总结

WSLLN 提出了一种弱监督深度学习框架,用于未剪辑视频中的自然语言定位,仅使用视频-句子对进行训练,无需片段级别的时序标注。通过采用双分支端到端架构,联合优化片段-文本对齐与时序片段选择,WSLLN 在 ActivityNet Captions 上实现了最先进性能(mIoU 为 32.2%),在 DiDeMo 上也取得了具有竞争力的结果,展现出在极少监督下的鲁棒性与高效性。

ABSTRACT

We propose weakly supervised language localization networks (WSLLN) to detect events in long, untrimmed videos given language queries. To learn the correspondence between visual segments and texts, most previous methods require temporal coordinates (start and end times) of events for training, which leads to high costs of annotation. WSLLN relieves the annotation burden by training with only video-sentence pairs without accessing to temporal locations of events. With a simple end-to-end structure, WSLLN measures segment-text consistency and conducts segment selection (conditioned on the text) simultaneously. Results from both are merged and optimized as a video-sentence matching problem. Experiments on ActivityNet Captions and DiDeMo demonstrate that WSLLN achieves state-of-the-art performance.

研究动机与目标

  • 为解决监督时序动作定位中高昂的标注成本,消除对片段级别时序标注(开始/结束时间)的需求。
  • 通过仅使用视频-句子对实现语言定位模型的端到端训练,减少数据收集过程中的人工投入。
  • 通过联合优化片段-文本对齐与时序片段选择,提升弱监督自然语言定位的性能。
  • 尽管仅使用弱监督,仍能与监督方法相比取得具有竞争力的性能。

提出的方法

  • WSLLN 采用双分支神经网络:一个分支计算视觉片段与文本查询之间的对齐得分,另一个分支基于查询执行时序片段选择。
  • 模型通过一个联合损失函数进行优化,该函数平衡视频-句子匹配、片段-文本一致性与时序片段选择,使用可学习的权重系数 λ。
  • 通过基于文本嵌入的可微分 top-k 选择机制实现片段选择,支持端到端训练。
  • 该框架采用视频-句子匹配目标,实现正样本对的对齐并抑制负样本对,仅依赖视频级别的监督。
  • 模型集成了一个精炼模块,基于文本上下文对片段预测进行优化,λ 控制对齐损失与检测损失之间的权衡。
  • 方法使用 BERT 进行句子编码,且不进行微调,同时基于从 RGB 或光流输入中提取的片段级特征进行运算。

实验结果

研究问题

  • RQ1弱监督模型是否能在不依赖片段级别时序标注的情况下,实现自然语言定位的强性能?
  • RQ2在弱监督设置下,联合优化片段-文本对齐与时序片段选择如何提升定位准确率?
  • RQ3架构设计——特别是双分支结构——对弱监督定位中的性能与鲁棒性有何影响?
  • RQ4在弱监督设置下,句子编码器的选择(如 BERT 与 GRU)对性能有何影响?
  • RQ5WSLLN 在 ActivityNet Captions 和 DiDeMo 等标准基准上,与弱监督和强监督基线相比表现如何?

主要发现

  • 在 ActivityNet Captions 上,WSLLN 在三次运行中实现了 32.2% ± 0.05 的平均交并比(mIoU),展现出高度的鲁棒性,并在弱监督方法中达到最先进性能。
  • 在 IoU=0.1 时 R@1 达到 74.0%,WSLLN 超过所有基线模型,包括弱监督的 WSDEC-W 和监督的 CTRL,表明其在灵活 IoU 阈值下具有强大的泛化能力。
  • 在 DiDeMo 上,WSLLN 的 R@1 分别达到 19.4%(RGB)和 18.4%(flow),优于监督模型 LOR(R@1 为 16.2%),并接近监督模型 MCN(使用光流时 R@1 为 25.8%)。
  • 消融实验表明两个分支均不可或缺:仅对齐分支(Align-only)和仅检测分支(Detect-only)的 mIoU 分别仅为 13.4% 和 13.6%,显著低于 WSLLN 性能。
  • 模型对超参数 λ 具有鲁棒性,在 λ ∈ [0.1, 0.4] 范围内性能稳定;当 λ 设为 0(无精炼)或 0.5(检测损失权重过大)时,性能下降。
  • 将 BERT 替换为 GRU 后性能相当(mIoU 31.8% vs. 32.2%),表明模型性能的提升并非完全依赖于 BERT 的表征能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。