Skip to main content
QUICK REVIEW

[論文レビュー] Unsupervised Domain Adaptation for Video Semantic Segmentation

Inkyu Shin, Kwanyong Park|arXiv (Cornell University)|Jul 23, 2021
Domain Adaptation and Few-Shot Learning参考文献 32被引用数 4
ひとこと要約

本稿では、動画のアドバーシャルトレーニング(VAT)と時間的特徴アライメント、および動画自己トレーニング(VST)とフローフィードバック付き疑似ラベル精錬を組み合わせた、動画セマンティックセグメンテーションのための新規二段階非教師付きドメイン適応フレームワークを提案する。この手法は、空間的・時間的文脈を活用することで、VIPERからCityscapes-VPSへのベンチマークで最先端の性能を達成し、すべての先行画像ベースのUDA手法をmIoUおよびVPQ指標において上回った。

ABSTRACT

Unsupervised Domain Adaptation for semantic segmentation has gained immense popularity since it can transfer knowledge from simulation to real (Sim2Real) by largely cutting out the laborious per pixel labeling efforts at real. In this work, we present a new video extension of this task, namely Unsupervised Domain Adaptation for Video Semantic Segmentation. As it became easy to obtain large-scale video labels through simulation, we believe attempting to maximize Sim2Real knowledge transferability is one of the promising directions for resolving the fundamental data-hungry issue in the video. To tackle this new problem, we present a novel two-phase adaptation scheme. In the first step, we exhaustively distill source domain knowledge using supervised loss functions. Simultaneously, video adversarial training (VAT) is employed to align the features from source to target utilizing video context. In the second step, we apply video self-training (VST), focusing only on the target data. To construct robust pseudo labels, we exploit the temporal information in the video, which has been rarely explored in the previous image-based self-training approaches. We set strong baseline scores on 'VIPER to CityscapeVPS' adaptation scenario. We show that our proposals significantly outperform previous image-based UDA methods both on image-level (mIoU) and video-level (VPQ) evaluation metrics.

研究の動機と目的

  • 非教師付きセマンティックセグメンテーションにおける動画固有のドメイン適応技術の不足に対処すること。
  • 最小限の現実世界のアノテーションで大規模な合成動画データを活用することで、Sim2Realの転送性を向上させること。
  • 動画フレーム間の時間的文脈を効果的に活用し、強力なドメイン適応を実現する手法を開発すること。
  • 複雑な都市環境における非教師付き動画ドメイン適応のための新ベンチマークを確立すること。
  • 動画固有の適応が動画セグメンテーションタスクにおいて、画像レベルの適応を著しく上回ることを実証すること。

提案手法

  • 二段階フレームワークを提案:まず動画アドバーシャルトレーニング(VAT)を実行し、その後動画自己トレーニング(VST)を実施する。
  • VATでは、空間的・時間的特徴を用いてソースドメインとターゲットドメインの分布を一致させるためのシーケンス識別器を用いる。
  • 物体の境界や形状の時間的変化を明示的にモデル化するためのチューブマッチング損失を導入する。
  • VSTでは、隣接フレームからのフローベースのワーピングを用いて疑似ラベルを生成し、一貫性を向上させる。
  • 欠損領域を埋めるのではなく、一貫性のない疑似ラベルを破棄するカットアウトベースの精錬戦略を採用する。
  • 参照フレームからのラベル伝搬にフローベースのワーピング関数 $ W_{t-\tau \Rightarrow t} $ を使用し、非隠蔽マスク $ \mathbb{I}_{t-\tau \Rightarrow t} $ を併用する。

実験結果

リサーチクエスチョン

  • RQ1画像ベースのUDA手法と比較して、二段階の動画ドメイン適応フレームワークが、現実世界の動画データにおけるセマンティックセグメンテーション性能を著しく向上させることができるか?
  • RQ2時間的文脈を明示的にモデル化することで、動画セマンティックセグメンテーションにおけるドメイン適応がどのように向上するか?
  • RQ3疑似ラベル精錬戦略(埋め込み vs. カットアウト)が最終的なセグメンテーション精度に与える影響は何か?
  • RQ4真のラベルが存在しない状況下で、フローベースのラベル伝搬は疑似ラベル品質をどの程度向上させるか?
  • RQ5本手法は、シミュレーションから現実世界のCityscapes-VPSへのドメインシフトに対して、どの程度頑健であるか?

主な発見

  • 提案手法は、VIPERからCityscapes-VPSへのベンチマークで51.91 mIoUおよび36.43 VPQ$^s$を達成し、すべての先行画像ベースのUDA手法を著しく上回った。
  • カットアウトベースの疑似ラベル精錬戦略は、埋め込みベースのベースラインを上回り、ノイズの多い疑似ラベルによる誤差蓄積を低減した。
  • 時間的集約により疑似ラベル品質が顕著に向上し、ラベル割合30%でのP-mIoUが68.8に達し、クラスバランス型およびインスタンス適応型のベースラインを上回った。
  • 定性的な結果から、フレーム間で一貫性があり明確な予測が得られていることが確認され、本手法の頑健性と時間的整合性が裏付けられた。
  • 本手法は、多様な物体カテゴリーや運動パターンを有する複雑な都市環境において優れた一般化性能を示し、一貫した性能を発揮した。
  • 制限事項として、ワーピングにFlowNetに依存しているため、'sidewalk'などのクラスでは動き推定の誤差により性能が低下する可能性がある。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。