[論文レビュー] Towards Unsupervised Open World Semantic Segmentation
本稿では、人間によるアノテーションデータが不要な状態で、未知のオブジェクトクラスを検出・学習できる非教師ありオープンワールドセマンティックセグメンテーション手法を提案する。畳み込みニューラルネットワーク(CNN)の埋め込み特徴を用いて低品質なセグメンテーションコンポーネントをクラスタリングし、それらに疑似ラベルを付与して段階的な学習を実施することで、未学習クラスにおいて顕著なセグメンテーション精度を達成した。これは、自動運転のような実世界のシナリオにおいて、強力なゼロショットクラス拡張を実現していることを示している。
For the semantic segmentation of images, state-of-the-art deep neural networks (DNNs) achieve high segmentation accuracy if that task is restricted to a closed set of classes. However, as of now DNNs have limited ability to operate in an open world, where they are tasked to identify pixels belonging to unknown objects and eventually to learn novel classes, incrementally. Humans have the capability to say: I don't know what that is, but I've already seen something like that. Therefore, it is desirable to perform such an incremental learning task in an unsupervised fashion. We introduce a method where unknown objects are clustered based on visual similarity. Those clusters are utilized to define new classes and serve as training data for unsupervised incremental learning. More precisely, the connected components of a predicted semantic segmentation are assessed by a segmentation quality estimate. connected components with a low estimated prediction quality are candidates for a subsequent clustering. Additionally, the component-wise quality assessment allows for obtaining predicted segmentation masks for the image regions potentially containing unknown objects. The respective pixels of such masks are pseudo-labeled and afterwards used for re-training the DNN, i.e., without the use of ground truth generated by humans. In our experiments we demonstrate that, without access to ground truth and even with few data, a DNN's class space can be extended by a novel class, achieving considerable segmentation accuracy.
研究の動機と目的
- 深層ニューラルネットワーク(DNN)が、以前に見られなかったオブジェクトクラスを検出・学習しなければならないオープンワールド設定における限界を克服すること。
- 真のラベルが入手できない状況下でも、非教師ありの段階的学習による新規セマンティッククラスの学習を可能にすること。
- セグメンテーション品質の推定を通じて未知のオブジェクトを特定し、視覚的類似性に基づいてそれらをクラスタリングする手法を開発すること。
- 新規クラスのための自動生成された疑似ラベルを用いてDNNを再訓練することで、既存クラスの性能を維持すること。
提案手法
- 真のラベルが不要な状況下で、エントロピー、マージン、ばらつき比などの指標を用いて、連結成分ごとのセグメンテーション品質を推定するメタ回帰器を用いる。
- 品質の閾値に基づき、低品質なセグメントを「懸念されるオブジェクト」(潜在的な新規インスタンス)に集約する。
- 懸念されるオブジェクトの画像パッチを抽出し、事前学習済みのCNN(例:DenseNet201、ResNet18)を用いて特徴埋め込みを取得する。
- 特徴量を次元削減(例:2次元に)することで、視覚的類似性に基づく非教師ありクラスタリング(例:DBSCAN)を可能にする。
- 各クラスタに疑似ラベルを割り当て、それらの疑似ラベル付きピクセルを用いてセグメンテーションモデルの再学習を段階的に行う。
- 人間によるアノテーションデータなしで、元のデータセットに加え、新たに発見されたクラスを含む拡張データセットを用いてDNNを再訓練する。
実験結果
リサーチクエスチョン
- RQ1深層ニューラルネットワークは、人間によるアノテーションデータがなければ、オープンワールド環境下で新規オブジェクトクラスを検出し、学習できるか?
- RQ2セグメンテーション品質推定は、未知または新規のオブジェクトに属するピクセルを特定するのにどの程度有効か?
- RQ3視覚的特徴に基づいて低品質なセグメントをクラスタリングすることで、新規セマンティッククラスの正確な発見がどの程度可能か?
- RQ4段階的学習の過程で、以前に知られていたクラスの性能をどの程度維持できるか?
- RQ5異なる特徴抽出器が、新規クラス発見の性能およびセグメンテーション精度に与える影響は何か?
主な発見
- 本手法は、DeepLabV3+モデルに新規クラス「human」を追加する際、Cityscapesデータセットで73.99 ± 0.38の平均IoUを達成した。特徴抽出器としてDenseNet201が使用された。
- 既存クラスに対する性能は高い安定性を示しており、複数回の実験における平均IoUの標準偏差は1.20%未満であった。
- ある実験では、新規クラスのIoUの標準偏差が4.80%に達したが、依然として妥当な範囲内にあり、耐久性に問題がないことが示された。
- 低品質なセグメントをクラスタリングした上で疑似ラベルを付与することで、限られたデータと人間によるアノテーションなしでも、効果的な段階的学習が可能である。
- 本手法は、実世界のシナリオにおいて、e-scooter やボートトレーラーなどの新規オブジェクトを効果的に検出し、セグメンテーションすることが可能であり、CityscapesおよびA2D2データセットで妥当性が確認された。
- モジュラーな設計により、特に特徴抽出器を容易に交換可能であり、性能の著しい低下を伴わずに、ResNet18、ResNet152、DenseNet201の間で同等の結果が得られた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。