[论文解读] Winning the ICCV'2021 VALUE Challenge: Task-aware Ensemble and Transfer Learning with Visual Concepts
本论文展示了在ICCV 2021 VALUE挑战赛中获胜的解决方案,提出了三种关键策略:任务特定的微调配置优化、将视觉概念(物体与属性)作为辅助信号整合,以及任务感知的模型集成。通过为每项任务定制训练超参数,利用丰富的视觉语义信息,并应用专门的集成方法,该方法在VALUE和QA评估阶段均获得第一名,显著优于基线模型,在检索、问答和字幕生成任务中表现突出。
The VALUE (Video-And-Language Understanding Evaluation) benchmark is newly introduced to evaluate and analyze multi-modal representation learning algorithms on three video-and-language tasks: Retrieval, QA, and Captioning. The main objective of the VALUE challenge is to train a task-agnostic model that is simultaneously applicable for various tasks with different characteristics. This technical report describes our winning strategies for the VALUE challenge: 1) single model optimization, 2) transfer learning with visual concepts, and 3) task-aware ensemble. The first and third strategies are designed to address heterogeneous characteristics of each task, and the second one is to leverage rich and fine-grained visual information. We provide a detailed and comprehensive analysis with extensive experimental results. Based on our approach, we ranked first place on the VALUE and QA phases for the competition.
研究动机与目标
- 为解决训练单一通用模型以应对具有异质特征的多样化视频-语言任务的挑战。
- 通过结合全局片段级特征与细粒度的视觉概念(物体与属性),提升多模态表征学习能力。
- 通过针对不同输出格式(检索、问答、字幕)定制的任务感知集成策略,增强模型泛化能力与性能。
- 系统性地为每项独立任务优化训练配置(学习率、批量大小、梯度累积等),以最大化性能。
提出的方法
- 通过大量验证实验,选择任务特定的超参数(包括学习率、批量大小、GPU数量和梯度累积步数)对单模型进行微调优化。
- 将从帧中提取的视觉概念(物体与属性)作为辅助输入,与片段级特征结合,以增强视觉表征并提升模型对细粒度细节的敏感性。
- 采用两阶段微调策略:首先进行全任务(AT)微调,随后进行单任务(ST)微调,以提升泛化能力与任务特定性能。
- 通过基于验证分数选择前K个模型,并应用任务特定的融合规则实现任务感知集成:字幕任务使用共识评分,问答任务使用加权投票,检索任务使用基于相似度的选择。
- 以预训练的HERO模型作为基础架构,使用来自TV和HowTo100M数据集的自监督特征进行初始化,并利用片段级视觉特征(如Clip-ViT+SlowFast、MIL-NCE)进行微调。
- 在集成推理中使用句子嵌入(如paraphrase-MiniLM-L3-v2)计算余弦相似度,以实现字幕共识。
实验结果
研究问题
- RQ1如何为每项任务优化训练超参数,以提升在异质性视频-语言任务上的性能?
- RQ2视觉概念(物体与属性)在视频-语言理解任务中的性能提升程度如何?
- RQ3任务感知集成策略在检索、问答和字幕等不同输出格式任务中如何提升性能?
- RQ4使用不同视觉特征组合(如Clip-ViT+SlowFast与MIL-NCE)对下游任务性能有何影响?
主要发现
- 优化后的单模型微调策略在大多数任务中均取得显著性能提升,最佳配置因任务与领域而异,尤其在使用Clip-ViT+SlowFast特征和AT→ST微调策略时表现更优。
- 整合视觉概念在11项任务中的5项中提升了性能,其中在VATEX检索与字幕任务及问答任务中提升最大,表明其在复杂、开放域理解任务中具有显著优势。
- 任务感知集成策略在检索任务中带来最大性能提升(相对提升最高达+39.55%),其次为字幕与问答任务,所有任务的平均提升达+7.45%。
- 在YouCook2数据集上,使用MIL-NCE特征的微调表现最佳,表明当任务与预训练领域一致时,领域内预训练具有显著优势。
- 基于验证分数选择前K个模型(检索任务K=32,问答任务K=16,字幕任务K=8)的集成方法始终优于单个模型,证实了模型选择多样性在性能提升中的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。