Skip to main content
QUICK REVIEW

[论文解读] Unsupervised Multi-Source Domain Adaptation for Person Re-Identification

Zechen Bai, Zhigang Wang|arXiv (Cornell University)|Apr 27, 2021
Video Surveillance and Tracking Methods参考文献 42被引用 8
一句话总结

该论文提出了一种新颖的无监督多源域自适应框架,用于行人重识别,通过引入两个互补模块:用于减少域特定特征并增强身份可分性的校正域特定批归一化(RDSBN),以及基于图卷积网络的多域信息融合(MDIF)模块,以最小化域间差异。该方法实现了最先进性能,优于现有无监督方法,并在无需后处理的情况下接近监督基线。

ABSTRACT

Unsupervised domain adaptation (UDA) methods for person re-identification (re-ID) aim at transferring re-ID knowledge from labeled source data to unlabeled target data. Although achieving great success, most of them only use limited data from a single-source domain for model pre-training, making the rich labeled data insufficiently exploited. To make full use of the valuable labeled data, we introduce the multi-source concept into UDA person re-ID field, where multiple source datasets are used during training. However, because of domain gaps, simply combining different datasets only brings limited improvement. In this paper, we try to address this problem from two perspectives, \ie{} domain-specific view and domain-fusion view. Two constructive modules are proposed, and they are compatible with each other. First, a rectification domain-specific batch normalization (RDSBN) module is explored to simultaneously reduce domain-specific characteristics and increase the distinctiveness of person features. Second, a graph convolutional network (GCN) based multi-domain information fusion (MDIF) module is developed, which minimizes domain distances by fusing features of different domains. The proposed method outperforms state-of-the-art UDA person re-ID methods by a large margin, and even achieves comparable performance to the supervised approaches without any post-processing techniques.

研究动机与目标

  • 为解决在无监督行人重识别中,多源数据集中的丰富标注数据未被充分利用的问题。
  • 缓解在合并具有不同特性(如光照、摄像头视角、色彩)的多个源域时,因域间差异导致的性能下降问题。
  • 开发一种方法,同时减少域特定特征并有效融合多域特征,以提升泛化能力。
  • 在细粒度、开放集重识别设置下,实现有效的无监督域自适应,其中各域之间的身份互不重叠。
  • 证明结合域特定与域融合视角,可获得优于现有单一视角方法的性能。

提出的方法

  • 提出校正域特定批归一化(RDSBN),该方法为每个域使用独立的BN分支,并通过校正过程自适应地调整每个样本的BN参数,以抑制域特定特征并增强与身份相关表征。
  • 提出基于图卷积网络(GCN)的多域信息融合(MDIF)模块,通过建模域代理节点来表示全局域级特征,并在实例与域代理节点之间实现信息流动,以完成域级融合。
  • 采用两阶段训练流程:在多个标注的源数据集上进行预训练,并在无标注目标数据上通过伪标签进行迭代微调,且在两个阶段均激活RDSBN和MDIF模块。
  • 使用域代理节点,通过加权平均聚合来自同一域的特征,其中注意力权重可学习,以突出更具代表性或一致性的特征。
  • 设计GCN架构时,第一层省略域内连接,以避免过度平滑并保留实例级细节,而域间连接则促进域对齐。
  • 推理阶段,通过训练期间的移动平均统计量实现域代理节点,确保无需额外计算。

实验结果

研究问题

  • RQ1在无监督域自适应中,结合多个标注的源数据集是否能提升行人重识别性能,超越单源基线?
  • RQ2在细粒度、开放集重识别设置下,如何有效减少域特定特征,同时保持或增强身份可分性?
  • RQ3图卷积网络能否被有效适配以建模多域特征融合,并在行人重识别中减少域间分布差异?
  • RQ4所提出的RDSBN模块是否在处理多源域偏移方面优于标准的域特定批归一化?
  • RQ5RDSBN与MDIF模块之间如何相互作用?二者结合是否比单独使用任一模块更有效?

主要发现

  • 在Market+CUHK → Duke基准上,所提方法达到65.0% mAP和79.1% rank-1准确率,mAP较基线提升6.7个百分点,rank-1准确率提升6.3个百分点。
  • 仅使用RDSBN模块时,在Market+Duke+CUHK03数据集上,类间距离提升12.4%,类内方差降低18.3%,表明其具有更强的特征可分性。
  • MDIF模块在ResNet50上应用时,mAP提升4.4%,rank-1准确率提升4.1%;即使与RDSBN结合,仍实现1.5% mAP和1.8% rank-1的增益。
  • 在MMT框架下,所提方法在Market+CUHK → Duke上达到69.0% mAP和81.2% rank-1准确率,较基线提升9.9% mAP和4.6% rank-1准确率。
  • MDIF的“加权平均代理节点”变体始终优于其他设计变体,证实了基于注意力的域级特征聚合的有效性。
  • 消融实验表明,RDSBN与MDIF具有互补性:两者结合时性能最佳,表明域特定与域融合视角的联合使用可显著提升自适应效果。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。