[論文レビュー] Semi-supervision semantic segmentation with uncertainty-guided self cross supervision
本稿では、不確実性を用いた自己クロスサプベーション(USCS)を提案する。これは、マルチインプットマルチアウトプット(MIMO)モデルを用いることで、効率的な自己クロスサプベーションを可能にする、新しい半教師ありセマンティックセグメンテーション手法である。これにより、パラメータで40.5%、MACsで49.1%のトレーニングコスト削減が達成される。さらに、予測の不確実性を用いてトレーニング中にノイズの多い疑似ラベルの影響を低減することで、ラベルデータの1/8のみを用いてPASCAL VOC 2012で最先端のmIoUを達成する。
As a powerful way of realizing semi-supervised segmentation, the cross supervision method learns cross consistency based on independent ensemble models using abundant unlabeled images. However, the wrong pseudo labeling information generated by cross supervision would confuse the training process and negatively affect the effectiveness of the segmentation model. Besides, the training process of ensemble models in such methods also multiplies the cost of computation resources and decreases the training efficiency. To solve these problems, we propose a novel cross supervision method, namely uncertainty-guided self cross supervision (USCS). In addition to ensemble models, we first design a multi-input multi-output (MIMO) segmentation model which can generate multiple outputs with shared model and consequently impose consistency over the outputs, saving the cost on parameters and calculations. On the other hand, we employ uncertainty as guided information to encourage the model to focus on the high confident regions of pseudo labels and mitigate the effects of wrong pseudo labeling in self cross supervision, improving the performance of the segmentation model. Extensive experiments show that our method achieves state-of-the-art performance while saving 40.5% and 49.1% cost on parameters and calculations.
研究の動機と目的
- 既存のクロスサプベーション手法における高い計算コストとノイズの伝播を解決すること。
- 複数の独立したモデルを用いるアンサンブルモデルのトレーニングコストを、単一のMIMOアーキテクチャに置き換えることで削減すること。
- 予測の不確実性を信頼度に応じたサプベーション信号として活用することで、ノイズの多い疑似ラベルに対するモデルのロバスト性を向上させること。
- リソース消費を著しく削減しつつ、半教師ありセマンティックセグメンテーションで最先端の性能を達成すること。
提案手法
- 1回のフォワードパスで複数の予測を生成できるマルチインプットマルチアウトプット(MIMO)セグメンテーションモデルを提案し、複数の独立したモデルをトレーニングせずに効率的な自己クロスサプベーションを実現する。
- MIMOモデルの出力同士の一貫性を強制することで、従来の別々のアンサンブルモデル間のクロスサプベーションを置き換える自己クロスサプベーションを実装する。
- 不確実性マップを用いて疑似ラベルサプベーションの重みを調整する不確実性を用いた学習を導入し、信頼度が低いノイズの多い予測の影響を低減する。
- トレーニング中に疑似ラベルの不確実性が高い領域を動的に抑制するため、学習可能な不確実性閾値γを採用する。
- MIMOサブネットワークの多様性と性能を向上させるために、グリッドミキシングおよび特徴量統合戦略を採用する。
- モデル容量とサブネットワークの独立性のバランスを最適化するため、入力の繰り返し確率ρを適用する。
実験結果
リサーチクエスチョン
- RQ1マルチインプットマルチアウトプット(MIMO)アーキテクチャは、半教師ありセマンティックセグメンテーションにおけるクロスサプベーションにおいてアンサンブルモデルを効果的に置き換えられ、計算コストを削減できるか?
- RQ2不確実性推定は、半教師あり学習における疑似ラベルサプベーションのロバスト性をどのように向上させるか?
- RQ3MIMOベースの自己クロスサプベーションフレームワークにおいて、サブネットワークの多様性とモデル容量の最適なバランスは何か?
- RQ4不確実性を用いた学習メカニズムは、ノイズの多い疑似ラベルがモデル収束に与える悪影響をどのように軽減するか?
- RQ5提案手法は、分類精度を維持または向上させつつ、どの程度トレーニングコストを削減できるか?
主な発見
- 提案手法は、PASCAL VOC 2012データセットにおいてラベルデータの1/8の条件下で、74.88%の最先端のmIoUを達成した。
- 標準的なクロスサプベーション手法と比較して、モデルパラメータを40.5%、MACsを49.1%削減し、トレーニング効率を顕著に向上させた。
- ResNet-50を用いた場合、ベースラインのCPS手法に比べて1.23%のmIoU向上を達成したが、追加の計算コストは発生しなかった。
- 最適な不確実性閾値γは0.5であり、この値で性能がピークに達し、過剰な抑制により信頼度の高い予測が損なわれる前に低下を示した。
- 入力の繰り返し確率ρ = 0.4が、サブネットワークの多様性とモデル容量の最良のトレードオフを実現し、最高の性能を達成した。
- グリッドミキシングによる特徴量統合で、ブロックサイズg=1が、加算やより大きなグリッドサイズよりも優れた性能を示し、最高のmIoUと非オーバーラップ比を達成した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。