[論文レビュー] Improved Mutual Mean-Teaching for Unsupervised Domain Adaptive Re-ID
本論文は、非教師ありドメイン適応(UDA)のための、構造的ドメイン適応(SDA)と統合された改善版相互平均教師(MMT+)フレームワークを提案する。SDAを用いて事前学習段階で実際の画像に似たソースドメインの画像をターゲットドメインに翻訳し、MMTにドメイン間のサンプル間関係モデリングとMoCoベースのインスタンス識別を組み合わせることで、VisDA 2020 チャレンジで74.78%のmAPを達成し、2位となった。
In this technical report, we present our submission to the VisDA Challenge in ECCV 2020 and we achieved one of the top-performing results on the leaderboard. Our solution is based on Structured Domain Adaptation (SDA) and Mutual Mean-Teaching (MMT) frameworks. SDA, a domain-translation-based framework, focuses on carefully translating the source-domain images to the target domain. MMT, a pseudo-label-based framework, focuses on conducting pseudo label refinery with robust soft labels. Specifically, there are three main steps in our training pipeline. (i) We adopt SDA to generate source-to-target translated images, and (ii) such images serve as informative training samples to pre-train the network. (iii) The pre-trained network is further fine-tuned by MMT on the target domain. Note that we design an improved MMT (dubbed MMT+) to further mitigate the label noise by modeling inter-sample relations across two domains and maintaining the instance discrimination. Our proposed method achieved 74.78% accuracies in terms of mAP, ranked the 2nd place out of 153 teams.
研究の動機と目的
- 合成データと実世界の人物再識別データセットの間の大きなドメインギャップを、非教師ありドメイン適応(UDA)の文脈で解消すること。
- ノイズの多い予測を軽減することで、ターゲットドメインにおける偽ラベルのロバスト性を向上させること。
- ドメイン翻訳ベースと偽ラベルベースの手法を効果的に統合し、性能を向上させること。
- ドメイン間のサンプル間関係をモデル化し、インスタンス識別を保持することで、最先端のMMTフレームワークを強化すること。
- 合成から実世界への人物再識別におけるVisDA 2020ベンチマークで、トップクラスの性能を達成すること。
提案手法
- 本手法は三段階のパイプラインを採用する:(1) SDAを訓練し、ソースドメインの合成画像をターゲットドメインの実際の画像に似た画像に翻訳する。
- 段階IIでは、翻訳されたソース・ターゲット画像を用いて、正解ラベルを伴う再識別ネットワークを事前学習する。
- 段階IIIでは、提案されたMMT+フレームワークを用いて、ラベルなしのターゲットドメインでネットワークをファインチューニングする。この段階では、ソースおよびターゲット画像を同時に学習する。
- MMT+は、元のMMTを改善したもので、ドメイン間の同一および異種アイデンティティ間の関係をモデル化することで、偽ラベルの精度を向上させる。
- フレームワークはMoCo損失を組み込み、モーメンタムエンコーダーを用いて、インスタンス識別を維持し、より高いロバスト性を実現する。
- 後処理には特徴量のアンサンブル、カメラ類似度モデリング、再ランク処理が含まれ、性能をさらに向上させる。
実験結果
リサーチクエスチョン
- RQ1ドメイン翻訳と偽ラベル化フレームワークを統合することで、人物再識別における非教師ありドメイン適応の性能が向上するか?
- RQ2ドメイン間のサンプル間関係をモデル化することで、UDA再識別における偽ラベルの品質とmAPにどのような影響を与えるか?
- RQ3MoCo損失によるインスタンス識別を組み込むことで、ターゲットドメイン学習におけるノイズの多い偽ラベルの影響をどれほど軽減できるか?
- RQ4SDAによって生成された翻訳画像を用いた事前学習は、元のソース画像を用いた場合よりも一般化性能が向上するか?
- RQ5困難な合成→実世界のUDA設定において、元のMMTと比較して改善されたMMT+フレームワークの性能向上はどの程度か?
主な発見
- 提案手法はVisDA 2020チャレンジで74.78%のmAPを達成し、153チーム中2位となった。
- SDAによって生成された画像を用いた事前学習により、mAPは元のソース画像(61.0%)から71.2%に向上し、ドメイン翻訳の有効性が裏付けられた。
- 改善されたMMT+フレームワークは、検証セットで81.2%のmAPを達成し、元のMMT(78.4% mAP)と比較して2.6%の向上を示した。
- 異なるバックボーンの中では、DenseNet169-IBNがMMT+で検証セットで最高のmAP84.1%を記録した。
- 複数のバックボーン(ResNeSt50, ResNeSt101, DenseNet169-IBN, ResNeXt101-IBN)をアンサンブルすることで、検証セットのmAPは86.3%にさらに向上した。
- アブレーションスタディの結果、SDAベースの事前学習とMMT+のファインチューニングの両方が、最高性能を達成するために不可欠であることが確認された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。