[论文解读] Transferring Domain-Agnostic Knowledge in Video Question Answering
本文提出了一种基于知识的迁移学习框架,用于视频问答(VideoQA),将与领域无关的知识(例如,常识推理)与特定领域的知识分离,从而实现在不同数据集之间的有效迁移。通过使用与领域无关的知识作为媒介微调预训练模型,并引入一个新的数据集KnowIT-X(包含21,412个人工标注的QA对及其相关知识),该方法显著提升了性能,证明了与领域无关的知识具有可迁移性,并在未见领域上将VideoQA准确率最高提升了10.5%。
Video question answering (VideoQA) is designed to answer a given question based on a relevant video clip. The current available large-scale datasets have made it possible to formulate VideoQA as the joint understanding of visual and language information. However, this training procedure is costly and still less competent with human performance. In this paper, we investigate a transfer learning method by the introduction of domain-agnostic knowledge and domain-specific knowledge. First, we develop a novel transfer learning framework, which finetunes the pre-trained model by applying domain-agnostic knowledge as the medium. Second, we construct a new VideoQA dataset with 21,412 human-generated question-answer samples for comparable transfer of knowledge. Our experiments show that: (i) domain-agnostic knowledge is transferable and (ii) our proposed transfer learning framework can boost VideoQA performance effectively.
研究动机与目标
- 探究VideoQA中的与领域无关的知识是否可在不同视频领域之间实现迁移。
- 通过减轻特定领域知识的干扰,弥合源领域与目标领域在VideoQA中的性能差距。
- 开发一种以知识为导向的迁移学习框架,通过与领域无关知识的迁移提升模型的泛化能力。
- 构建一个新的大规模VideoQA数据集KnowIT-X,包含人工标注的QA对及其相关知识,以支持有效的迁移学习。
- 评估检测(DET)和对齐(DA)模块结合使用对知识定位与推理性能的提升效果。
提出的方法
- 该框架将知识划分为与领域无关和特定领域的类别,其中与领域无关的知识作为跨数据集的可迁移媒介。
- 构建了一个新的VideoQA数据集KnowIT-X,包含21,412个人工生成的QA对,每对均标注了相关知识,数据源自电视剧《老友记》(Friends),与源数据集(《生活大爆炸》The Big Bang Theory)的领域不同。
- 该方法在源数据集(KnowIT)上进行预训练,随后在目标数据集(KnowIT-X)上进行微调,使用检索到的知识和真实知识作为监督信号。
- 检测(DET)模块用于识别问题和视频片段中的命名实体,对齐(DA)模块则将这些实体与相关知识对齐,从而提升知识定位与推理能力。
- 模型使用图像、字幕和面部特征作为视觉输入,知识从外部来源或真实标注中检索,并在小样本设置下应用反向翻译进行数据增强。
- 通过使用源模型的权重初始化目标模型,并利用与领域无关的知识进行微调,实现迁移学习,从而最小化特定领域偏差。
实验结果
研究问题
- RQ1VideoQA中的与领域无关的知识是否可在不同视频领域之间有效迁移?
- RQ2在目标数据集(领域不同)上,引入与领域无关的知识对VideoQA性能有何影响?
- RQ3结合检测(DET)和对齐(DA)模块对知识定位与答案准确率的影响如何?
- RQ4训练数据规模在多大程度上影响VideoQA中迁移学习的性能?
- RQ5使用检索知识与真实知识对模型泛化能力与鲁棒性的影响如何?
主要发现
- 所提出的迁移学习框架相较于直接训练,将KnowIT-X上的VideoQA准确率最高提升了10.5%,当同时使用DET和DA模块时性能最佳。
- 在KnowIT上预训练并在KnowIT-X上微调的模型,使用真实知识时在完整KnowIT-X数据集上的视频推理准确率达到0.850,比直接学习高出10.5%。
- 在所有设置中,使用字幕作为视觉输入的性能最高,当启用迁移学习及DET和DA模块时,准确率达到0.758。
- 同时使用DET和DA模块相比仅使用其中一个或都不使用,准确率提升了3.5至5.5个百分点,证明了二者在知识定位中的互补作用。
- 在完整KnowIT-X数据集(v-full)上训练的模型,使用真实知识时达到0.850的准确率,表明充足的训练数据与知识注入对高性能至关重要。
- 定性分析表明,迁移学习能更好地将知识与问题及正确答案对齐,而直接学习则过度聚焦于特定领域实体(如“帽子”)。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。