[論文レビュー] Pixel and Feature Level Based Domain Adaption for Object Detection in Autonomous Driving
本稿では、自動運転におけるオブジェクト検出のための新しい教師なしドメイン適応フレームワークを提案する。このフレームワークは、ピクセルレベルの画像変換と特徴量レベルの敵対的適応を同時に実行する。CycleGANを用いたドメイン不変の画像変換と、領域提案に基づく特徴量の敵対的トレーニングを活用することで、合成された運転画像と実際の運転画像の間のドメインシフトを顕著に低減し、エンド・トゥ・エンドのトレーニングにより最大2%の精度向上を達成し、最先端の検出性能を実現した。
Annotating large scale datasets to train modern convolutional neural networks is prohibitively expensive and time-consuming for many real tasks. One alternative is to train the model on labeled synthetic datasets and apply it in the real scenes. However, this straightforward method often fails to generalize well mainly due to the domain bias between the synthetic and real datasets. Many unsupervised domain adaptation (UDA) methods are introduced to address this problem but most of them only focus on the simple classification task. In this paper, we present a novel UDA model to solve the more complex object detection problem in the context of autonomous driving. Our model integrates both pixel level and feature level based transformtions to fulfill the cross domain detection task and can be further trained end-to-end to pursue better performance. We employ objectives of the generative adversarial network and the cycle consistency loss for image translation in the pixel space. To address the potential semantic inconsistency problem, we propose region proposal based feature adversarial training to preserve the semantics of our target objects as well as further minimize the domain shifts. Extensive experiments are conducted on several different datasets, and the results demonstrate the robustness and superiority of our method.
研究の動機と目的
- 合成データと現実世界のドライビングデータセットの間のドメインシフト問題に対処すること。
- 実際の自動運転環境に展開する際、合成データでトレーニングされたモデルの一般化性能を向上させること。
- ピクセルレベルおよび特徴量レベルの両方で動作する統合的で教師なしのドメイン適応フレームワークを開発すること。
- ドメイン適応中に、車両や歩行者などの重要なオブジェクトの意味的整合性を保持すること。
- 画像変換と検出性能を同時に最適化するエンド・トゥ・エンドのトレーニングを可能にすること。
提案手法
- CycleGANにサイクル整合性損失を適用し、合成画像(例:Sim10k)を実データセット(例:Cityscapes, KITTI)の視覚的スタイルに変換する。
- 生成的敵対的ネットワークを用いて、ソースドメインとターゲットドメイン間の画像分布をピクセルレベルのドメイン適応(PDA)モジュールで一致させる。
- 領域提案に基づく特徴量の敵対的トレーニング(FDA)を導入し、特徴空間におけるドメイン差を最小化するとともに、オブジェクトの意味を保持する。
- PDAとFDAモジュールを統合し、エンド・トゥ・エンドのトレーニングパイプラインを構築することで、画像変換と検出性能を同時に最適化する。
- 翻訳済みのソース画像でトレーニングされたFaster R-CNN検出器を用い、実際のターゲットドメインにおける検出一般化性能を向上させる。
- 2段階のトレーニングプロセスを採用:まずPDAおよびFDAモジュールを別々に事前トレーニングし、その後10エポックにわたりフルネットワークをエンド・トゥ・エンドで微調整する。
実験結果
リサーチクエスチョン
- RQ1ピクセルおよび特徴量レベルの統合的ドメイン適応は、合成データから現実世界のドライビングデータセットへの移行において、オブジェクト検出性能を向上させるか?
- RQ2サイクル整合性を伴うCycleGANによる画像変換は、オブジェクト検出におけるドメインシフト低減にどの程度効果的か?
- RQ3領域提案に基づく特徴量の敵対的トレーニングは、車両や歩行者といった重要なオブジェクトの意味的整合性を適応過程で保持できるか?
- RQ4分離されたモジュールトレーニングと比較して、エンド・トゥ・エンドの微調整はどの程度検出精度を向上させるか?
- RQ5天候の変化(霧、雨)やシーンレイアウトの違い(高速道路対都市部)を含む多様なドメインシフトに対して、本手法はどの程度頑健か?
主な発見
- 提案手法は、Sim10k → Cityscapes、Cityscapes → KITTI、Cityscapes → Foggy-Cityscapesを含む複数のクロスドメインオブジェクト検出ベンチマークで最先端の性能を達成した。
- エンド・トゥ・エンドのトレーニングにより、非エンド・トゥ・エンドのベースラインと比較して1%~2%のmAP向上を達成し、統合最適化の利点を示した。
- 画像変換の結果、道路に沿った構造的レイアウトが保持されており、ドメインシフトの影響にもかかわらず、車両などの主要オブジェクトの意味的特徴が維持されている。
- Foggy-Cityscapesへの変換やVKITTI-Rainyへの変換からも、霧や雨といった困難なドメインシフトに対しても本手法が効果的に対処できていることが示された。
- 定性的な結果から、エンド・トゥ・エンドのトレーニングが、特に背景と重なっているか近接しているオブジェクトの詳細(例:車の屋根)の保持を強化していることが確認された。
- 推論時間は標準的なFaster R-CNN(VGG16、Tesla M40で165 ms)と同一であり、テスト時には画像変換モジュールが削除されるため、変化がない。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。