Skip to main content
QUICK REVIEW

[論文レビュー] Bi-Mix: Bidirectional Mixing for Domain Adaptive Nighttime Semantic Segmentation

Guanglei Yang, Zhun Zhong|arXiv (Cornell University)|Nov 19, 2021
Advanced Neural Network Applications参考文献 27被引用数 7
ひとこと要約

本稿では、ドメイン適応型夜間セマンティックセグメンテーションのための1段階的双方向混合フレームワーク、Bi-Mixを提案する。本手法は、粗く整合された昼間・夜間ペアを共同で活用することで、画像のリライティングとセグメンテーションの適応を向上させる。クラスバランスの取れた混合サンプリングを用いた、翻訳→セグメンテーションとセグメンテーション→翻訳の学習を交互に実行することで、Dark ZurichおよびNighttime Drivingデータセットで最先端の性能を達成し、それぞれmIoUスコアが47.3%および51.6%を記録した。

ABSTRACT

In autonomous driving, learning a segmentation model that can adapt to various environmental conditions is crucial. In particular, copying with severe illumination changes is an impelling need, as models trained on daylight data will perform poorly at nighttime. In this paper, we study the problem of Domain Adaptive Nighttime Semantic Segmentation (DANSS), which aims to learn a discriminative nighttime model with a labeled daytime dataset and an unlabeled dataset, including coarsely aligned day-night image pairs. To this end, we propose a novel Bidirectional Mixing (Bi-Mix) framework for DANSS, which can contribute to both image translation and segmentation adaptation processes. Specifically, in the image translation stage, Bi-Mix leverages the knowledge of day-night image pairs to improve the quality of nighttime image relighting. On the other hand, in the segmentation adaptation stage, Bi-Mix effectively bridges the distribution gap between day and night domains for adapting the model to the night domain. In both processes, Bi-Mix simply operates by mixing two samples without extra hyper-parameters, thus it is easy to implement. Extensive experiments on Dark Zurich and Nighttime Driving datasets demonstrate the advantage of the proposed Bi-Mix and show that our approach obtains state-of-the-art performance in DANSS. Our code is available at https://github.com/ygjwd12345/BiMix.

研究の動機と目的

  • 自動運転におけるドメインシフトの課題に取り組むこと、特に昼間のモデルが夜間条件に一般化しにくいこと。
  • 中間の曇り時間領域に依存せずに、粗く整合された昼間・夜間画像ペアを用いて、画像リライティングの品質を向上させること。
  • 適応段階においてクラスバランスの取れた混合サンプリングを導入することで、夜間セグメンテーションのクラス不均衡を軽減すること。
  • 画像翻訳とセグメンテーション適応を1つの効率的な1段階フレームワークに統合し、複数段階の学習による誤差蓄積を回避すること。
  • 双方向学習により、翻訳モデルとセグメンテーションモデルの間で相互監視を強化すること。

提案手法

  • Bi-Mixは、二つの方向を持つ双方向学習フレームワークを採用する:'翻訳→セグメンテーション'(Trans2Seg)と'セグメンテーション→翻訳'(Seg2Trans)。
  • Trans2Segでは、画像翻訳モデルが夜間画像をリライティングし、その後、セグメンテーションヘッドを用いてセグメンテーション損失および adversarial 損失を用いて分類する。
  • Trans2Segでは、昼間画像のランダムに選択されたクラスのピクセルと夜間画像を組み合わせることで、クラス分布のバランスを取る混合サンプリングを適用する。
  • Seg2Transでは、予測されたセグメンテーションマスクを用いて混合サンプルを作成し、昼と夜の画像間でコンテンツの一貫性を保証する。
  • Seg2Transでは、翻訳された画像と元の昼間画像を一致させるための整合性損失を適用し、翻訳品質を向上させる。
  • 本フレームワークは、混合サンプリング、リライティング、自己教師学習のバランスを取るための3つのハイパーパramータ(μ₁, μ₂, μ₃)を用い、最適値はそれぞれ0.001、0.001、1に特定された。

実験結果

リサーチクエスチョン

  • RQ1中間領域を必要とせず、画像翻訳とセグメンテーション適応を統合的に学習することで、夜間セマンティックセグメンテーションの性能が向上するか?
  • RQ2粗く整合された昼間・夜間画像ペアを効果的に活用することで、リライティングおよびセグメンテーション品質が向上するか?
  • RQ3混合サンプリング戦略により、セマンティック一貫性を保ちながら、夜間セグメンテーションにおけるクラス不均衡が軽減されるか?
  • RQ4翻訳モデルとセグメンテーションモデル間の双方向学習が、相互に向上をもたらし、より良いドメイン適応を実現するか?
  • RQ5混合サンプリングおよび自己教師学習を制御するハイパーパrameterに、本手法はどれほど感受性を示すか?

主な発見

  • Bi-Mixは、Nighttime Drivingテストセットで47.3%というmIoUの新記録を達成し、従来手法を上回った。
  • Dark Zurichテストセットでは51.6%のmIoUを達成し、未観測の夜間シーンへの強い一般化能力を示した。
  • アブレーションスタディの結果、Trans2SegおよびSeg2Transの両方向における単方向の混合サンプリングが、ベースラインのDANNetを上回る性能を発揮した。
  • リライティングネットワークは性能を顕著に向上させ、これを除去するとmIoUが著しく低下し、画像品質向上の重要性を裏付けた。
  • パラメータ解析の結果、最適な性能はμ₁ = 0.001、μ₂ = 0.001、μ₃ = 1で得られ、それ以上の値では性能が低下した。
  • 定性的な結果では、Bi-Mixがベースライン手法と比較して、より現実的で意味的に一貫性のあるリライティング画像を生成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。