Skip to main content
QUICK REVIEW

[論文レビュー] AttrSeg: Open-Vocabulary Semantic Segmentation via Attribute Decomposition-Aggregation

Chaofan Ma, Yuhuan Yang|arXiv (Cornell University)|Aug 31, 2023
Multimodal Machine Learning ApplicationsComputer Science被引用数 3
ひとこと要約

本稿では、曖昧または未知のカテゴリ名を多様な属性記述に分解し、階層的に統合することで、現実世界のテキスト的不完全性に強いセマンティックセグメンテーションを実現する新規なオープンボックス分類フレームワーク、AttrSegを提案する。本手法は属性レベルの推論を活用することで、オープンボックスベンチマークで最先端の性能を達成し、不完全、誤り、または未確認のカテゴリ名に対しても頑健であることを示した。

ABSTRACT

Open-vocabulary semantic segmentation is a challenging task that requires segmenting novel object categories at inference time. Recent studies have explored vision-language pre-training to handle this task, but suffer from unrealistic assumptions in practical scenarios, i.e., low-quality textual category names. For example, this paradigm assumes that new textual categories will be accurately and completely provided, and exist in lexicons during pre-training. However, exceptions often happen when encountering ambiguity for brief or incomplete names, new words that are not present in the pre-trained lexicons, and difficult-to-describe categories for users. To address these issues, this work proposes a novel attribute decomposition-aggregation framework, AttrSeg, inspired by human cognition in understanding new concepts. Specifically, in the decomposition stage, we decouple class names into diverse attribute descriptions to complement semantic contexts from multiple perspectives. Two attribute construction strategies are designed: using large language models for common categories, and involving manually labeling for human-invented categories. In the aggregation stage, we group diverse attributes into an integrated global description, to form a discriminative classifier that distinguishes the target object from others. One hierarchical aggregation architecture is further proposed to achieve multi-level aggregations, leveraging the meticulously designed clustering module. The final results are obtained by computing the similarity between aggregated attributes and images embeddings. To evaluate the effectiveness, we annotate three types of datasets with attribute descriptions, and conduct extensive experiments and ablation studies. The results show the superior performance of attribute decomposition-aggregation.

研究の動機と目的

  • 推論時において完全で、語彙に埋め込まれており、完全なテキスト的カテゴリ名を前提としている既存のオープンボックスセマンティックセグメンテーション手法の限界を解決すること。
  • 実際のビジョンアプリケーションにおける語彙的曖昧性、新語、記述不能または記述が難しいカテゴリといった現実世界の課題に立ち向かうこと。
  • カテゴリを複数の属性に分解し、それらを統合的に統合する人間の認知的理解を模倣するフレームワークの開発。
  • 階層的集約とフィルタリング機構を用いて、訓練時および推論時におけるノイズありまたは誤った属性に対してもモデルの頑健性を向上させること。

提案手法

  • 一般的なカテゴリに対して大規模言語モデルを用いて、バニラカテゴリ名を多様な属性記述に分解する。人為的または希少なカテゴリについては、手動ラベルを用いる。
  • 複数段階にわたる属性のグループ化を可能にする階層的集約アーキテクチャを構築し、クラスタリングモジュールを用いてグローバルで判別力のあるクラス表現を形成する。
  • 集約された属性表現と画像埋め込みの類似度を計算し、セグメンテーションマスクを生成する。
  • 推論時にビジョン・ランゲージモデル(VLM)に基づくフィルタリング戦略を統合し、関係のないまたは誤った属性を抑制する。
  • 各カテゴリごとにランダムに選択された属性を用いてモデルを学習させることで、不完全または誤った属性入力に対しても頑健性を高める。
  • 属性が段階的に統合されるマルチレベル集約パイプラインを採用し、アブレーションにより4段階が最適な性能を示すことが判明した。

実験結果

リサーチクエスチョン

  • RQ1属性分解は、曖昧または不完全なテキスト的カテゴリ記述下でも、オープンボックスセマンティックセグメンテーションの性能を向上させ得るか?
  • RQ2多様な属性の階層的集約は、未確認または新語的カテゴリに対し、モデルの汎化性能と頑健性をどのように向上させるか?
  • RQ3推論時にノイズあり、誤り、または誤った属性が与えられた場合、モデルはどの程度の性能を維持できるか?
  • RQ4属性の多様性(例:色、形状、部品、その他)は、オープンボックス環境下でのセグメンテーション性能にどのような影響を与えるか?
  • RQ5属性数と集約段階数は、最終的なセグメンテーション精度と頑健性にどのような影響を与えるか?

主な発見

  • AttrSegは、完全な属性入力下でCOCO-OVSSベンチマークでmIoU 59.5を達成し、現実的なオープンボックス条件下で先行手法を上回る性能を示した。
  • 属性数が15から5に減少しても、mIoUは59.5から55.1に僅かに低下するにとどまり、不完全な記述に対しても耐性があることが示された。
  • 4段階の集約が最適な性能を示した。5段階に増加させると、低属性設定下でmIoUが低下し、過剰な集約が性能を損なう可能性があることが示された。
  • 誤った属性(例:倒れている犬に「四本足」)に対しても、モデルは耐性を示し、訓練時にそのような属性が含まれてもmIoU 59.1を達成した。
  • 誤った属性(例:「犬」に「赤い」)は性能を著しく低下させ(mIoUが55.4に低下)、しかしVLMベースのフィルタリングにより性能は58.9 mIoUまで回復し、その有効性が裏付けられた。
  • 属性の多様性は顕著な貢献を示した:色のみを用いた場合のmIoU 30.8から、色・形状・部品・その他すべての属性を組み合わせた場合のmIoU 52.3に向上し、多視点記述の価値が明確になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。