[論文レビュー] Unsupervised Semantic Segmentation by Contrasting Object Mask Proposals
本稿では、自己教師ありサリエンシーを活用してオブジェクトマスク候補を生成し、その後そのマスクを対照的学習のミドルレベルの事前知識として用いる、2段階の自己教師ありセマンティックセグメンテーションフレームワークを提案する。この手法は、PASCAL VOCで完全自己教師あり設定下で最先端の性能を達成し、過クラスタリングを用いることで平均IoUが53.6%に達する。また、COCO や DAVIS への転移学習においても良好な一般化性能を示す。
Being able to learn dense semantic representations of images without supervision is an important problem in computer vision. However, despite its significance, this problem remains rather unexplored, with a few exceptions that considered unsupervised semantic segmentation on small-scale datasets with a narrow visual domain. In this paper, we make a first attempt to tackle the problem on datasets that have been traditionally utilized for the supervised case. To achieve this, we introduce a two-step framework that adopts a predetermined mid-level prior in a contrastive optimization objective to learn pixel embeddings. This marks a large deviation from existing works that relied on proxy tasks or end-to-end clustering. Additionally, we argue about the importance of having a prior that contains information about objects, or their parts, and discuss several possibilities to obtain such a prior in an unsupervised manner. Experimental evaluation shows that our method comes with key advantages over existing works. First, the learned pixel embeddings can be directly clustered in semantic groups using K-Means on PASCAL. Under the fully unsupervised setting, there is no precedent in solving the semantic segmentation task on such a challenging benchmark. Second, our representations can improve over strong baselines when transferred to new datasets, e.g. COCO and DAVIS. The code is available.
研究の動機と目的
- PASCAL VOC のような大規模かつ多様なベンチマークにおいて、完全自己教師ありセマンティックセグメンテーション手法の不足を補う。
- インスタンス識別に基づく自己教師学習の限界を克服し、ピクセルレベルでのセマンティッククラスの区別を可能にする。
- 自己教師ありサリエンシーから得られるオブジェクトマスク候補というミドルレベルの視覚的事前知識を導入し、ピクセル埋め込みの対照的学習をガイドする。
- 人為的アノテーションマスクを一切用いずに、学習された埋め込みを直接クラスタリングして意味的なセマンティックグループに分類可能であることを実現する。
- COCO や DAVIS のような下流データセットへの表現の転送性を、半自己教師学習または微調整設定で示す。
提案手法
- まず、自己教師ありサリエンシー推定器を用いてオブジェクトマスク候補を生成し、オブジェクトレベルの情報を含むミドルレベルの事前知識として用いる。
- 次に、同じマスク候補内にあるピクセル埋め込みを引き寄せ、異なる候補同士のピクセル埋め込みを引き離す対照的学習目的関数を適用する。
- ImageNet や MoCo で事前学習済みの重みを初期値とするResNet-50バックボーンに、拡張畳み込みを適用して特徴を抽出する。
- 正例ペアを同じマスク候補内にあるピクセル、負例ペアを異なる候補からのピクセルとして扱う対照的損失を適用する。
- 最終的なピクセル埋め込みに対してK-Meansクラスタリングを実行し、クラスタ割り当てを元の解像度にアップサンプリングし、ハンガリアンアルゴリズムを用いて真のラベルとマッチングする。
- 半自己教師学習の微調整では、バックボーンの上に線形分類器ヘッドを設け、層ごとに学習率を調整し、ポリ減衰スケジューラーを用いる。
実験結果
リサーチクエスチョン
- RQ1オブジェクトマスク候補をミドルレベルの事前知識として用いる対照的学習フレームワークは、人為的アノテーションマスクを一切用いずに、セマンティッククラスを判別可能なピクセル埋め込みを学習できるか?
- RQ2ピクセルレベルのセマンティック表現学習において、オブジェクトレベルの事前知識と、低レベルの事前知識(例:エッジや境界)とを比較した場合、どちらが優れているか?
- RQ3PASCAL VOC のような挑戦的なベンチマークにおいて、完全自己教師あり設定下で学習されたピクセル埋め込みを直接クラスタリングして意味的なセマンティックグループに分類できるか?
- RQ4転送または微調整された場合、学習された表現がCOCO や DAVIS などの他のデータセットにどの程度一般化できるか?
- RQ5PASCAL VOC のような不均衡で複雑なデータセットにおいて、埋め込みの過クラスタリングは、セマンティック整合性と性能向上に寄与するか?
主な発見
- 提案手法は、200個の予測クラスタを用いた過クラスタリングを適用した場合、PASCAL VOC で53.6%の平均IoUを達成し、先行する自己教師あり手法を顕著に上回る。
- 500個の予測クラスタを用いた場合、マスク候補に教師ありサリエンシーを用い、MoCoで事前学習した場合、平均IoUが57.0%に達する。
- PASCAL VOC における完全自己教師ありセマンティックセグメンテーションにおいて、本手法は新たな最先端性能を確立した。ここには、かつての類似手法の先行事例が存在しなかった。
- 学習された表現はCOCO や DAVIS へも効果的に転送され、限られたアノテーションを用いた微調整で強力なベースラインを上回る性能を示す。
- 過クラスタリングにより性能が向上し、平均IoUが200クラスタの45.0%から500クラスタの57.0%に上昇した。これは、局所的な埋め込み近傍に意味的に一貫性のあるグループが存在することを示唆している。
- 定性的な結果から、学習された埋め込みが意味的に意味のある構造を捉えていることが示され、インスタンス識別やSWAVベースラインと比較して、真のラベルとの整合性が優れている。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。