[论文解读] Temporal Attentive Alignment for Large-Scale Video Domain Adaptation
该论文提出TA3N,一种时间注意力对抗自适应网络,通过显式关注高差异性时间动态,实现更有效的特征对齐,从而提升大规模视频域自适应性能。在两个新引入的大规模视频DA数据集——UCF-HMDB full和Kinetics-Gameplay上,TA3N实现了最先进性能,相较于'仅源域'方法,在HMDB→UCF上取得7.9%的准确率提升,在Kinetics→Gameplay上取得10.3%的提升。
Although various image-based domain adaptation (DA) techniques have been proposed in recent years, domain shift in videos is still not well-explored. Most previous works only evaluate performance on small-scale datasets which are saturated. Therefore, we first propose two large-scale video DA datasets with much larger domain discrepancy: UCF-HMDB_full and Kinetics-Gameplay. Second, we investigate different DA integration methods for videos, and show that simultaneously aligning and learning temporal dynamics achieves effective alignment even without sophisticated DA methods. Finally, we propose Temporal Attentive Adversarial Adaptation Network (TA3N), which explicitly attends to the temporal dynamics using domain discrepancy for more effective domain alignment, achieving state-of-the-art performance on four video DA datasets (e.g. 7.9% accuracy gain over "Source only" from 73.9% to 81.8% on "HMDB --> UCF", and 10.3% gain on "Kinetics --> Gameplay"). The code and data are released at http://github.com/cmhungsteve/TA3N.
研究动机与目标
- 为解决视频中领域偏移问题,特别是现有大规模、高差异性视频域自适应(DA)基准的缺乏。
- 探究在视频DA中对齐时间动态与对齐空间特征的有效性,证明时间对齐比DA方法选择更为关键。
- 提出一种新方法TA3N,通过基于领域分布感知的注意力机制,联合学习时间动态并关注高差异性时间特征,以实现更优的对齐效果。
- 发布两个新的大规模视频DA数据集——UCF-HMDB full和Kinetics-Gameplay,以支持未来视频DA方法的严格评估与基准测试。
提出的方法
- 提出两个新的大规模视频DA数据集:UCF-HMDB full(UCF101与HMDB51之间有12个重叠类别)和Kinetics-Gameplay(与Kinetics-600有30个重叠类别),以超越现有小规模基准的领域差异。
- 引入TA2N作为基线方法,同时对齐空间与时间特征,表明对齐时间动态优于仅对齐空间特征的方法。
- 提出TA3N,利用可学习注意力机制聚焦于对领域差异贡献最大的时间动态,基于领域分布差异进行建模。
- 采用对抗训练策略,使用多个领域判别器对齐源域与目标域的嵌入特征空间,同时通过领域差异调制注意力机制。
- 仅使用RGB帧,避免使用光流,通过时间关系(TemRelation)和时间池化(TemPooling)模块实现时间特征编码。
- 在对抗训练过程中,应用领域差异感知注意力,动态加权时间特征,优先关注源域与目标域之间差异更大的部分。
实验结果
研究问题
- RQ1通过显式对齐时间动态而非仅对齐空间特征,能否实现有效的视频域自适应?
- RQ2在视频域自适应中,DA方法的选择是否比对齐特征的选择更为重要?
- RQ3时间动态中的领域差异如何影响整体领域偏移?是否可被用于实现更优的对齐?
- RQ4聚焦于高差异性时间特征的可学习注意力机制,能否提升视频域自适应性能?
- RQ5像Kinetics-Gameplay和UCF-HMDB full这样的大规模、高差异性视频DA数据集,相较于现有基准,在挑战性和真实性方面有何表现?
主要发现
- 在HMDB→UCF数据集上,TA3N相较于'仅源域'基线实现7.9%的准确率提升,从73.9%提高至81.8%。
- 在更具挑战性的Kinetics→Gameplay数据集上,TA3N相较'仅源域'实现10.3%的准确率提升,表明其对高领域差异具有强鲁棒性。
- 所提出的UCF-HMDB full和Kinetics-Gameplay数据集相较于现有基准(如UCF-HMDB small)展现出显著更高的领域差异,因此更适用于评估视频DA方法。
- 对齐时间动态(通过TA2N实现)优于仅对齐空间特征,且对齐内容的选择比所用DA方法的复杂度更为关键。
- 消融实验表明,对高差异性时间特征的关注能带来更优的对齐效果,TA3N在所有数据集上均优于TA2N和非注意力基线方法。
- 尽管仅使用RGB帧,TA3N仍实现最先进性能,表明时间注意力可有效弥补缺乏光流或运动建模的不足。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。