Skip to main content
QUICK REVIEW

[论文解读] Towards Debiasing Temporal Sentence Grounding in Video

Hao Zhang, Aixin Sun|arXiv (Cornell University)|Nov 8, 2021
Multimodal Machine Learning Applications参考文献 48被引用 6
一句话总结

本文提出了两种去偏策略——基于视频截断的过采样数据去偏与使用单模态视频和查询分支的模型去偏,以减少视频中时序句子定位(TSGV)的分布偏见。通过平衡训练数据分布并利用损失调整解耦偏见,该方法在分布外测试集上提升了泛化能力,在Charades-CD上实现13.84%的性能差距缩减,在ActivityNet-CD上实现63.05%的差距缩减,显著增强了模型的鲁棒性。

ABSTRACT

The temporal sentence grounding in video (TSGV) task is to locate a temporal moment from an untrimmed video, to match a language query, i.e., a sentence. Without considering bias in moment annotations (e.g., start and end positions in a video), many models tend to capture statistical regularities of the moment annotations, and do not well learn cross-modal reasoning between video and language query. In this paper, we propose two debiasing strategies, data debiasing and model debiasing, to "force" a TSGV model to capture cross-modal interactions. Data debiasing performs data oversampling through video truncation to balance moment temporal distribution in train set. Model debiasing leverages video-only and query-only models to capture the distribution bias, and forces the model to learn cross-modal interactions. Using VSLNet as the base model, we evaluate impact of the two strategies on two datasets that contain out-of-distribution test instances. Results show that both strategies are effective in improving model generalization capability. Equipped with both debiasing strategies, VSLNet achieves best results on both datasets.

研究动机与目标

  • 为解决时序句子定位在视频(TSGV)数据集中因模型对时刻注释中的统计规律过度拟合而产生的分布偏见问题。
  • 通过减轻对有偏注释模式的依赖,提升模型在分布外(ood)测试集上的泛化能力。
  • 提出并验证两种互补的去偏策略——数据去偏与模型去偏,分别针对数据和模型层面的偏见。
  • 证明去偏可提升模型在分布外泛化上的鲁棒性与性能,同时不损害分布内性能。

提出的方法

  • 数据去偏通过视频截断,从每段视频中生成多个非重叠的片段,创建新的训练样本,以改变时刻注释的时间分布。
  • 该方法对代表性不足的时间区域中的时刻进行过采样,促使模型关注跨模态交互而非统计偏见。
  • 模型去偏引入两个单模态分支——一个用于仅视频输入,一个用于仅查询输入,以独立学习和估计偏见分布。
  • 训练过程中应用损失调整:对单模态模型预测为有偏的样本降低梯度,对较不偏的样本增强梯度,以促进鲁棒的跨模态学习。
  • 去偏框架与VSLNet基础模型集成,实现端到端训练,仅需极少的架构修改。
  • 该方法在Charades-CD和ActivityNet-CD上进行评估,这两个数据集均设有专门的分布内(iid)和分布外(ood)测试集,用于衡量泛化能力。

实验结果

研究问题

  • RQ1TSGV数据集中分布偏见如何影响模型在分布外测试集上的泛化能力?
  • RQ2通过视频截断进行数据层面增强,能否有效重平衡时刻注释分布并减少模型对统计规律的依赖?
  • RQ3单模态视频和查询模型在训练过程中在多大程度上能帮助将偏见从主TSGV模型中解耦?
  • RQ4结合数据与模型去偏策略是否能带来优于单一策略的泛化性能?
  • RQ5当未缓解偏见时,模型在ood集上的性能如何退化?所提方法能在多大程度上逆转这种退化?

主要发现

  • 在Charades-CD数据集中,VSLNet在分布内与分布外测试集之间的性能差距(p_gap)从30.70%降至13.84%,表明数据去偏显著提升了泛化能力。
  • 仅使用模型去偏时,VSLNet在Charades-CD上的p_gap降至15.67%,表明通过单模态分支可有效实现偏见解耦。
  • 当同时应用数据与模型去偏时,VSLNet在两个数据集上均取得最佳整体性能,尤其在分布外泛化方面提升最为显著。
  • 在更复杂的ActivityNet-CD数据集中,结合两种去偏策略后,VSLNet的p_gap从63.05%降至30.70%,证明了在复杂多样的数据上的鲁棒性。
  • 数据去偏中的片段数量(N_clip)影响性能:N_clip = 5在两个数据集上均实现最佳的ood泛化性能,优于N_clip = 4和6。
  • 消融实验证实,视频单模态分支与查询单模态分支均对有效模型去偏至关重要,仅使用其中一个会导致ood集上性能次优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。