[論文レビュー] SimCon Loss with Multiple Views for Text Supervised Semantic Segmentation
本論文では、Webから収集した画像・テキストペアのノイズを低減するために、内部モード間の類似性を活用して頑健な陽性サンプルを特定する、新しい対照学習手法であるSimCon損失を提案する。この手法により、テキスト監視ゼロショットセマンティックセグメンテーションの性能が向上する。複数の画像ビューを組み合わせたMV-SimConを用いることで、SOTA性能が達成され、PASCAL VOC、PASCAL Context、MSCOCOでそれぞれ+3.0%、+3.3%、+6.9%のmIoU向上を達成。さらに、テスト時増強を適用することで、mIoUは58.7%、26.6%、33.3%に向上する。
Learning to segment images purely by relying on the image-text alignment from web data can lead to sub-optimal performance due to noise in the data. The noise comes from the samples where the associated text does not correlate with the image's visual content. Instead of purely relying on the alignment from the noisy data, this paper proposes a novel loss function termed SimCon, which accounts for intra-modal similarities to determine the appropriate set of positive samples to align. Further, using multiple views of the image (created synthetically) for training and combining the SimCon loss with it makes the training more robust. This version of the loss is termed MV-SimCon. The empirical results demonstrate that using the proposed loss function leads to consistent improvements on zero-shot, text supervised semantic segmentation and outperforms state-of-the-art by $+3.0\%$, $+3.3\%$ and $+6.9\%$ on PASCAL VOC, PASCAL Context and MSCOCO, respectively. With test time augmentations, we set a new record by improving these results further to $58.7\%$, $26.6\%$, and $33.3\%$ on PASCAL VOC, PASCAL Context, and MSCOCO, respectively. In addition, using the proposed loss function leads to robust training and faster convergence.
研究の動機と目的
- Webから収集したデータにおけるノイズの多い画像・テキストペアが、テキスト監視セマンティックセグメンテーションの性能を低下させることを是正すること。
- 密なアノテーションや弱い監視に依存せずに、ゼロショットセマンティックセグメンテーションを向上させること。
- ペア化された画像・テキストペア以外の陽性サンプルをよりよく特定できるように、内部モード間の類似性を考慮した対照損失を開発すること。
- 画像の複数の合成ビューを用いることで、訓練の頑健性と収束速度を向上させること。
- Webデータからの画像・テキストアライメントのみを用いて、ゼロショットセマンティックセグメンテーションでSOTA性能を達成すること。
提案手法
- ペア化された画像・テキストペア以外の陽性サンプルを定義するために、画像同士およびテキスト同士の内部モード類似度を計算するSimCon損失を提案する。
- 類似度スコアにしきい値を適用して、各アーキテクチャサンプルの陽性画像およびテキストを選択し、ノイズの多いデータに対して頑健性を向上させる。
- 訓練中に画像の複数の合成ビューを生成し、それらのすべてのビューにSimCon損失を適用することで、MV-SimConを導入する。
- 同じ画像の異なるビュー間で負のコサイン類似度(NCS)損失を適用し、視覚的表現の一貫性を促進する。
- 複数のビューにおける画像陽性サンプルを統合的に計算し、いずれかのビューで類似度が高い場合にそのサンプルを陽性とみなす。
- SimCon損失と複数のビュー、NCS損失を統合的に最適化することで、クロスモーダルアライメントとビュー一貫性の両方を向上させる。

実験結果
リサーチクエスチョン
- RQ1内部モード間の類似性は、テキスト監視セマンティックセグメンテーションの対照学習における陽性サンプルの選択を改善できるか?
- RQ2画像の複数の合成ビューを用いることで、ゼロショットセマンティックセグメンテーションの頑健性と性能が向上するか?
- RQ3MV-SimConは、収束速度、一般化性能、および異なるデータセットにおける性能面でInfoNCEと比べてどのように差をつけるか?
- RQ4MV-SimConは、ノイズの多いWebから収集した画像・テキストペアに対してどれほど感受性が低減されるか?
- RQ5MV-SimConは、任意の密な監視やファインチューニングなしにSOTA結果を達成できるか?
主な発見
- MV-SimConは、ゼロショット評価においてPASCAL VOCで+3.0%、PASCAL Contextで+3.3%、MSCOCOで+6.9%のmIoU向上を達成した。
- テスト時増強を適用した場合、PASCAL VOCで58.7%、PASCAL Contextで26.6%、MSCOCOで33.3%のmIoUを記録し、それぞれ新しいSOTA記録を樹立した。
- アブレーションスタディの結果、複数のビューとNCS損失を組み合わせたSimConに、統合された画像陽性サンプルが最も大きな貢献(2.7% mIoU向上)をもたらした。
- MV-SimConで学習したモデルは、より小さなバッチサイズや少ない学習データでも、InfoNCEよりも収束が早く、データ分布のシフトに対してより頑健であった。
- バッチサイズを増加させることで、MV-SimConとベースラインの両方の性能が向上したが、テストされた全バッチサイズでMV-SimConが優れた性能を維持した。
- 定性的な結果から、MV-SimConは過剰セグメンテーションとクラスの欠落を低減し、InfoNCEよりも正確で完全なマスクを生成することがわかった。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。