Skip to main content
QUICK REVIEW

[论文解读] Embracing Uncertainty: Decoupling and De-bias for Robust Temporal Grounding

Hao Zhou, Chongyang Zhang|arXiv (Cornell University)|Mar 31, 2021
Multimodal Machine Learning Applications参考文献 48被引用 7
一句话总结

该论文提出 DeNet,一种用于鲁棒时序定位的新框架,通过将语言查询解耦为基于名词/动词的关系特征与基于形容词/副词的修饰特征,以处理查询不确定性,同时采用采样与多选学习相结合的去偏机制,生成在标签不确定性下的多样化预测。DeNet 在 Charades-STA 和 ActivityNet Captions 上达到最先进性能,通过显式建模不确定性,展现出更强的鲁棒性与泛化能力。

ABSTRACT

Temporal grounding aims to localize temporal boundaries within untrimmed videos by language queries, but it faces the challenge of two types of inevitable human uncertainties: query uncertainty and label uncertainty. The two uncertainties stem from human subjectivity, leading to limited generalization ability of temporal grounding. In this work, we propose a novel DeNet (Decoupling and De-bias) to embrace human uncertainty: Decoupling - We explicitly disentangle each query into a relation feature and a modified feature. The relation feature, which is mainly based on skeleton-like words (including nouns and verbs), aims to extract basic and consistent information in the presence of query uncertainty. Meanwhile, modified feature assigned with style-like words (including adjectives, adverbs, etc) represents the subjective information, and thus brings personalized predictions; De-bias - We propose a de-bias mechanism to generate diverse predictions, aim to alleviate the bias caused by single-style annotations in the presence of label uncertainty. Moreover, we put forward new multi-label metrics to diversify the performance evaluation. Extensive experiments show that our approach is more effective and robust than state-of-the-arts on Charades-STA and ActivityNet Captions datasets.

研究动机与目标

  • 为解决时序定位中查询不确定性与标签不确定性并存的问题,后者限制了模型的泛化能力。
  • 通过在学习过程中显式拥抱不确定性,建模人类在语言表达与时间标注中的主观性。
  • 生成多样化且合理的预测,使其与多个由人类标注的时间边界对齐,减少单一标注风格带来的偏差。
  • 开发适用于每条查询存在多个标注的基准数据集的新多标签评估指标。
  • 提升时序定位模型在真实世界开放词汇场景下的鲁棒性与泛化能力。

提出的方法

  • 利用词性(PoS)标注将每个语言查询分解为两种独立特征:基于名词与动词的关系特征,用于提供一致且具有判别性的信息;基于形容词与副词的修饰特征,用于表达主观且个性化的表达。
  • 将修饰特征在潜在空间中编码为高斯分布,以支持随机采样,并生成多种多样化的查询表示。
  • 采用基于多选学习(MCL)的最小损失目标的去偏机制,优化多输出分支,即使在仅使用单一风格标注进行训练时,也能生成多样化预测。
  • 采用双头回归头结构:一个用于预测起止时间边界,另一个用于预测中心-宽度,共享时间块以建模长距离依赖关系。
  • 在推理阶段引入聚类,将多个预测结果整合为一个多样化且合理的预测集合,使其与多个由人类标注的边界相匹配。
  • 引入新的多标签评估指标(如 R@5,IoU=0.5),以在存在多个真实边界的情况下公平评估模型性能。

实验结果

研究问题

  • RQ1如何有效建模因同一事件存在多样化语言表达而产生的查询不确定性?
  • RQ2如何缓解训练数据中单一标注风格导致的预测偏差?
  • RQ3我们能否生成多样化但合理的预测,使其与多个由人类标注的时间边界对齐?
  • RQ4显式解耦关系特征与修饰特征在多大程度上提升了时序定位的鲁棒性?
  • RQ5在存在标签不确定性的情况下,新多标签指标在多大程度上更准确地反映了模型性能?

主要发现

  • 在 Charades-STA 上,DeNet 在 R@1 达到 59.70%,在 R@5,IoU=0.5 时达到 64.04%,优于最先进方法。
  • 在 ActivityNet Captions 上,DeNet 在 R@1 达到 58.12%,在 R@5,IoU=0.5 时达到 61.76%,展现出跨数据集的强大泛化能力。
  • 消融实验表明,基于词性标注的解耦显著提升性能,DeNet 相较于 DeNet w/o PoS 在 R@1 上提升 1.25%。
  • 将修饰特征编码为高斯分布(DeNet)相比将关系特征编码为高斯分布(DeNet-Relation)能获得更好的多样性,R@5,IoU=0.5 提升 1.92%。
  • 若移除最小损失目标(DeNet w/o min-loss),R@5,IoU=0.5 下降 22.13%,证实其在多预测学习中的必要性。
  • 最优架构在 Charades-STA 上使用 3 个堆叠的时间块,在 ActivityNet Captions 上使用 4 个,表明建模能力与过拟合之间存在权衡。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。