[论文解读] Frustratingly Easy Person Re-Identification: Generalizing Person Re-ID in Practice
本文提出了一种简单但极为有效的行人重识别领域泛化(DG)基线方法,通过在浅层使用实例归一化(IN),深层使用特征归一化(FN),以缓解因数据集间风格和内容差异导致的领域偏移问题。该方法在无需任何目标域数据参与训练的情况下,实现了即开即用的最先进性能,在VIPeR、PRID、GRID和i-LIDS上的rank-1准确率分别提升了11.8%、33.2%、12.8%和8.5%。
Contemporary person re-identification ( eid) methods usually require access to data from the deployment camera network during training in order to perform well. This is because contemporary eid{} models trained on one dataset do not generalise to other camera networks due to the domain-shift between datasets. This requirement is often the bottleneck for deploying eid{} systems in practical security or commercial applications, as it may be impossible to collect this data in advance or prohibitively costly to annotate it. This paper alleviates this issue by proposing a simple baseline for domain generalizable~(DG) person re-identification. That is, to learn a eid{} model from a set of source domains that is suitable for application to unseen datasets out-of-the-box, without any model updating. Specifically, we observe that the domain discrepancy in eid{} is due to style and content variance across datasets and demonstrate appropriate Instance and Feature Normalization alleviates much of the resulting domain-shift in Deep eid{} models. Instance Normalization~(IN) in early layers filters out style statistic variations and Feature Normalization~(FN) in deep layers is able to further eliminate disparity in content statistics. Compared to contemporary alternatives, this approach is extremely simple to implement, while being faster to train and test, thus making it an extremely valuable baseline for implementing eid{} in practice. With a few lines of code, it increases the rank 1 eid{} accuracy by {11.8\%, 33.2\%, 12.8\% and 8.5\%} on the VIPeR, PRID, GRID, and i-LIDS benchmarks respectively. Source codes are available at \url{https://github.com/BJTUJia/person_reID_DualNorm}.
研究动机与目标
- 为解决行人重识别中的关键挑战:在某一数据集上训练的模型在未见的摄像头网络上表现不佳的问题。
- 开发一种实用的即开即用重识别解决方案,无需目标域数据或微调即可泛化至新型部署环境。
- 提出一种极简、高效且稳定的领域泛化方法,超越复杂先进的SOTA方法在重识别领域泛化中的表现。
- 证明简单的归一化技术可有效缓解深度重识别模型中的风格与内容领域偏差。
提出的方法
- 在早期卷积层中应用实例归一化(IN),以过滤掉不同数据集中存在的光照、对比度和色彩饱和度等风格差异。
- 在深层使用特征归一化(FN),以减少视点、姿态和焦距变化等内容统计差异。
- 将IN与FN集成到标准CNN主干网络(如ResNet50或MobileNetV2)中,仅需少量代码修改,架构改动极小。
- 仅使用标注的源域数据端到端从零开始训练模型,训练过程中完全不访问目标域数据。
- 在特征编码后的倒数第二层应用FN,以归一化跨领域的全局特征统计量。
- 采用双归一化策略,联合缓解风格与内容领域偏差,提升特征的通用性与领域无关表示能力。
实验结果
研究问题
- RQ1基于简单归一化的方法是否能在不使用任何目标域数据的情况下,有效泛化行人重识别模型至未见的摄像头网络?
- RQ2在浅层使用实例归一化、深层使用特征归一化,在多大程度上可减轻由风格与内容差异引起的领域偏移?
- RQ3在零样本领域泛化设置下,所提出的DualNorm方法与复杂的元学习或无监督领域自适应方法相比表现如何?
- RQ4所提出的方法是否也能提升在数据集内重识别基准上的性能,从而表明其对域内差异的鲁棒性?
主要发现
- 与原始ResNet50相比,所提出的DualNorm方法在VIPeR基准上实现了rank-1准确率11.8%的绝对提升。
- 在PRID数据集上,该方法相比基线模型将rank-1准确率提升了33.2%,显著优于现有DG方法与监督方法。
- 在GRID基准上,该方法实现了43.7%的rank-1准确率,在i-LIDS上达到78.2%,展现出在多样化领域间的强大泛化能力。
- 即使在数据集内基准如Market-1501和DukeMTMC-reID上,该方法也分别将rank-1准确率提升了5.4%和6.2%,表明其在跨域设置之外同样有效。
- 消融实验表明,IN与FN的结合具有互补优势,其中浅层使用IN、深层使用FN的策略最为有效。
- 与现有DG方法(如DIMN)相比,该方法在推理速度与实现复杂度上更具优势,后者需依赖元学习与动态模型构建,而本方法更适用于实际部署。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。