Skip to main content
QUICK REVIEW

[論文レビュー] Adaptive Semantic Segmentation with a Strategic Curriculum of Proxy Labels

Kashyap Chitta, Jianwei Feng|arXiv (Cornell University)|Nov 8, 2018
Topic Modeling参考文献 27被引用数 15
ひとこと要約

本稿では、代理ラベルを用いた教師なしドメイン適応のための戦略的カリキュラムを提案する。この手法は、ターゲットドメインからの代理ラベルを用い、ラベル付きソースデータからのハードサンプルと、代理ラベル付きターゲットデータからのイージーサンプルを組み合わせる。動的にバランスの取れたこれらのサンプルの混合で訓練し、予測信頼度を評価するデュアルデコーダー構造を用いることで、敵対的特徴アライメントを用いないまま、合成ドメインから実ドメインへの適応ベンチマークで最先端の性能を達成する。

ABSTRACT

Training deep networks for semantic segmentation requires annotation of large amounts of data, which can be time-consuming and expensive. Unfortunately, these trained networks still generalize poorly when tested in domains not consistent with the training data. In this paper, we show that by carefully presenting a mixture of labeled source domain and proxy-labeled target domain data to a network, we can achieve state-of-the-art unsupervised domain adaptation results. With our design, the network progressively learns features specific to the target domain using annotation from only the source domain. We generate proxy labels for the target domain using the network's own predictions. Our architecture then allows selective mining of easy samples from this set of proxy labels, and hard samples from the annotated source domain. We conduct a series of experiments with the GTA5, Cityscapes and BDD100k datasets on synthetic-to-real domain adaptation and geographic domain adaptation, showing the advantages of our method over baselines and existing approaches.

研究の動機と目的

  • ソースドメインで学習したモデルがドメインシフトのためターゲットドメインに一般化しにくくなるという、ドメインシフトに起因するセマンティックセグメンテーションの課題に対処すること。
  • ターゲットドメインの高価なピixeLレベルのアノテーションに依存を減らすために、アンラベルドターゲットデータを代理ラベリングによって活用すること。
  • ソースドメインとターゲットドメインからのイージーサンプルとハードサンプルをバランスさせるカリキュラムベースのトレーニング戦略を通じて、教師なしドメイン適応の性能を向上させること。
  • アンサンブルアヘッドマップを用いた効果的なサンプル難易度推定を可能にする、軽量で敵対的でないアーキテクチャを開発すること。
  • 特徴アライメントを明示的に行わない状況でも、合成ドメインから実ドメイン、およびクロスシティドメイン適応ベンチマークで優れた性能を示すこと。

提案手法

  • ラベル付きソースドメインデータと、代理ラベル付きターゲットドメインデータの混合を用いた自己訓練により、モデルの一般化性能を段階的に向上させる。
  • 予測の整合性から整合性マップを生成する2つのブランチを持つデュアルデコーダー構造を採用し、サンプル難易度を推定する。
  • 予測整合性が低い(ハードな)サンプルに対しては勾配更新を抑制する勾配フィルタリングを適用し、信頼性の高い予測に集中してトレーニングを進める。
  • ソースドメインおよびターゲットドメインの両方におけるクラス不均衡に対処するため、クラスごとの損失重み付けを実装する。
  • 戦略的カリキュラムスケジューリングを適用:段階的にターゲットドメインデータの割合を増やし、イージーな代理ラベル付きサンプルとハードなラベル付きソースサンプルを優先する。
  • 信頼度ベースのマイニングを適用:ターゲットドメインからのイージーサンプルとソースドメインからのハードサンプルを用い、トレーニングプロセスをガイドする。

実験結果

リサーチクエスチョン

  • RQ1代理ラベル付きターゲットデータとソースドメインからのハードサンプルを組み合わせたカリキュラムベースのトレーニング戦略は、セマンティックセグメンテーションにおける教師なしドメイン適応の性能を向上させることができるか?
  • RQ2デュアルデコーダー整合性による不確実性推定は、リソースが限られた環境下でのモデルのロバスト性と一般化性能をどのように向上させるか?
  • RQ3提案手法は、合成ドメインから実ドメインへの適応およびクロスシティドメイン適応タスクにおいて、既存の特徴アライメントベースの手法を上回る性能を示すか?
  • RQ4代理ラベリングと選択的サンプルマイニングは、自己訓練における誤差拡大をどの程度軽減できるか?
  • RQ5本手法は、解像度やコンテンツが著しく異なるソースドメインとターゲットドメイン間でも、BDD100kのような多様なターゲットドメインに一般化可能か?

主な発見

  • GTA5 → Cityscapesベンチマークにおいて、mIoUが48.4に達し、GTA5のラベルのみを用いたすべての先行研究を上回る最先端の性能を達成した。
  • 19クラス中9クラスで、最も優れた既存手法を上回るIoUを達成し、特に車両や人物のクラスで顕著な向上を示した。
  • 予測整合性に基づく勾配フィルタリングにより、自己訓練における誤差拡大を低減し、より安定した収束を実現した。
  • デュアルデコーダー整合性マップは、曖昧な領域やクラス境界を効果的に特定し、モデルの不確実性の可視化を可能にした。
  • BDD100kでも競争力ある性能を示し、GTA5からの適応がCityscapesからの適応よりもわずかに高いmIoUを達成した。これは、合成から実への適応に非常に適していることを示している。
  • 本手法はCyCADAのような敵対的特徴アライメント手法と直交しており、両者を組み合わせることでさらなる性能向上が期待できるが、ハイパーパramータチューニングの難易度は依然として高い。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。