[論文レビュー] Domain Adversarial Reinforcement Learning for Partial Domain Adaptation
本論文は、共有クラスからのソースインスタンスを自動的に選択するとともに、ドメイン敵対的学習を活用してドメインシフトを低減する、部分的ドメイン適応のための新しいフレームワークであるドメイン敵対的強化学習(DARL)を提案する。DARLは、インスタンス選択とドメイン不変特徴学習を同時に最適化することで、困難な設定において平均で最大6.34%の性能向上を達成し、最先端の性能を実現する。
Partial domain adaptation aims to transfer knowledge from a label-rich source domain to a label-scarce target domain which relaxes the fully shared label space assumption across different domains. In this more general and practical scenario, a major challenge is how to select source instances in the shared classes across different domains for positive transfer. To address this issue, we propose a Domain Adversarial Reinforcement Learning (DARL) framework to automatically select source instances in the shared classes for circumventing negative transfer as well as to simultaneously learn transferable features between domains by reducing the domain shift. Specifically, in this framework, we employ deep Q-learning to learn policies for an agent to make selection decisions by approximating the action-value function. Moreover, domain adversarial learning is introduced to learn domain-invariant features for the selected source instances by the agent and the target instances, and also to determine rewards for the agent based on how relevant the selected source instances are to the target domain. Experiments on several benchmark datasets demonstrate that the superior performance of our DARL method over existing state of the arts for partial domain adaptation.
研究の動機と目的
- ソースドメインとターゲットドメインのラベル空間の不一致によって引き起こされる負の転送を是正すること。
- 共有クラスからのソースインスタンスの選択を自動化し、肯定的な知識転送を可能にすること。
- エンドツーエンドのフレームワークを通じて、ドメイン不変特徴の学習とインスタンス選択の最適化を同時に実行すること。
- ターゲットドメインのラベル数がソースドメインより少ない現実世界のシナリオにおいて、一般化性能とロバスト性を向上させること。
提案手法
- 深層Q学習エージェントが、特徴表現から導出された推定Q値に基づいて、共有クラスからのソースインスタンスを選択する。
- 行動価値関数は、ソースインスタンスの特徴を入力とする深層ニューラルネットワークによって近似される。
- ドメイン敵対的学習コンponentは、選択されたインスタンスにおけるドメインシフトを最小化するように、特徴抽出器とドメイン識別器を訓練する。
- エージェントの報酬信号は、ドメイン識別器がソースとターゲットを区別する能力から導かれるもので、関連性の高いインスタンスへの選択を促進する。
- 反復的な最適化プロセスにより、深層Qネットワークとドメイン敵対的ネットワークをエンドツーエンドで同時に訓練する。
- 経験再生と$\epsilon$-グリーディ探索を用いて、学習の安定性を向上させる。
実験結果
リサーチクエスチョン
- RQ1教師なしの疑似ラベルに依存せずに、強化学習が部分的ドメイン適応におけるソースインスタンス選択を効果的に自動化できるか?
- RQ2深層Q学習とドメイン敵対的学習を組み合わせることで、ドメイン間での特徴の転送性がどのように向上するか?
- RQ3インスタンス選択における関連性ベースの報酬関数におけるしきい値$\tau$の影響は何か?
- RQ4多様なドメインシフトのシナリオにおいて、DARLは最先端の手法と比較して、精度とロバスト性の面で優れているか?
主な発見
- DARLは、Office+Caltech-10、Office-31、Caltech-Officeデータセットで最先端の性能を達成し、すべての転送タスクにおいて既存手法を上回る。
- 困難なCaltech-Officeデータセットにおいて、DARLはSANおよびIWANに対して、それぞれ平均で4.65%および6.34%の精度向上を達成した。
- アブレーションスタディの結果、深層Q学習を削除すると性能が著しく低下することが確認され、これが効果的なインスタンス選択における役割を裏付けた。
- 深層Q学習を疑似ラベルベースの選択に置き換えると、精度が低下するため、本タスクにおいて強化学習の優位性が示された。
- フレームワークは安定して収束し、C256→W10タスクにおけるテスト誤差が学習イテレーションに伴い一貫して減少した。
- 最適なしきい値$\tau$は、AlexNetでは0.3、ResNet-50では0.1であり、それより高い値や低い値に設定すると性能が低下した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。