[論文レビュー] A Unified Transformer Framework for Group-based Segmentation: Co-Segmentation, Co-Saliency Detection and Video Salient Object Detection
本稿では、共通のアーキテクチャを用いて、グループベースのセグメンテーションタスク(共通セグメンテーション、共通顕著性検出、動画顕著オブジェクト検出)を統合的に処理する、Transformerに基づくUFOというフレームワークを提案する。長距離依存関係を捉えるためのパッチベースのトランスフォーマーブロックと、部分的活性化を抑えるためのイントラ-MLPモジュールを導入し、タスク固有の設計やオプティカルフローに依存せずに、11のベンチマークで最先端の精度とリアルタイム推論(140 FPS)を達成した。
Humans tend to mine objects by learning from a group of images or several frames of video since we live in a dynamic world. In the computer vision area, many researches focus on co-segmentation (CoS), co-saliency detection (CoSD) and video salient object detection (VSOD) to discover the co-occurrent objects. However, previous approaches design different networks on these similar tasks separately, and they are difficult to apply to each other, which lowers the upper bound of the transferability of deep learning frameworks. Besides, they fail to take full advantage of the cues among inter- and intra-feature within a group of images. In this paper, we introduce a unified framework to tackle these issues, term as UFO (Unified Framework for Co-Object Segmentation). Specifically, we first introduce a transformer block, which views the image feature as a patch token and then captures their long-range dependencies through the self-attention mechanism. This can help the network to excavate the patch structured similarities among the relevant objects. Furthermore, we propose an intra-MLP learning module to produce self-mask to enhance the network to avoid partial activation. Extensive experiments on four CoS benchmarks (PASCAL, iCoseg, Internet and MSRC), three CoSD benchmarks (Cosal2015, CoSOD3k, and CocA) and four VSOD benchmarks (DAVIS16, FBMS, ViSal and SegV2) show that our method outperforms other state-of-the-arts on three different tasks in both accuracy and speed by using the same network architecture , which can reach 140 FPS in real-time.
研究の動機と目的
- グループベースのセグメンテーションタスクにおける既存のディープラーニングフレームワークの転送性とモularityの欠如に対処すること。
- 共通セグメンテーション(CoS)、共通顕著性検出(CoSD)、動画顕著オブジェクト検出(VSOD)を1つのアーキテクチャで統合すること。
- 自己注意機構を用いて、画像または動画フレーム間の長距離特徴依存関係をモデル化すること。
- イントラ-MLP学習モジュールを導入することで、特徴マップの部分的活性化を低減し、より広範なグローバル受容場を強化すること。
- オプティカルフローに依存せず、リアルタイム推論(140 FPS)を達成すること。
提案手法
- パッチベースのビジョナルトランスフォーマーブロックが、画像特徴をトークンとして処理し、画像パッチ間のグローバル自己注意により長距離依存関係をモデル化する。
- イントラ-MLPモジュールは、各クエリピクセルをその上位K個の関連性の高いピクセルと照合することで自己マスクを計算し、特徴の活性化を強化し、部分的応答を抑制する。
- すべての3つのタスクに共通のエンコーダ-デコーダアーキテクチャを採用することで、タスク固有のネットワーク設計の必要性を排除する。
- トランスフォーマーの本質的なグローバルモデリング能力を活用することで、高価な類似度行列を回避し、計算コストを低減する。
- オプティカルフローは、動画タスクにおける前景オブジェクトの認識を向上させるために画像特徴と融合可能だが、SOTA性能を達成するには必須ではない。
- フレームワークは教師なし学習で訓練され、追加のデータオーグメンテーションや教師信号に依存せず、画像レベルのグループの一貫性のみを用いる。

実験結果
リサーチクエスチョン
- RQ11つのディープラーニングアーキテクチャが、共通部品を共有しながら共通セグメンテーション、共通顕著性検出、動画顕著オブジェクト検出を効果的に処理できるか?
- RQ2自己注意機構は、グループベースの画像セグメンテーションタスクにおける長距離特徴依存関係をどのように改善できるか?
- RQ3イントラ-MLPモジュールは、オブジェクトセグメンテーションにおける部分的活性化を低減し、特徴表現を向上させられるか?
- RQ4統合フレームワークは、オプティカルフローもタスク固有の設計も使わずに、どれほどリアルタイム推論(例:140 FPS)を達成できるか?
- RQ5提案されたフレームワークは、多様なベンチマークにおいて、精度と速度の両面でタスク固有の最先端手法を上回るか?
主な発見
- 提案されたUFOフレームワークは、4つのCoS、3つのCoSD、4つのVSODデータセットを含む11のベンチマークで、1つの共有アーキテクチャを用いて最先端の性能を達成した。
- DAVIS 16データセットでは、VGG16と224×224の入力を使用して、平均Fスコア0.959、MAE 0.013を達成し、以前のSOTA手法を上回った。
- FBMSおよびViSalでは、教師なし手法の中で最高のFスコア(0.899)とMAE(0.013)を記録し、優れた一般化性能を示した。
- リアルタイム推論において140 FPSで動作し、オプティカルフローを用いないにもかかわらず高い速度を達成した。
- オプティカルフローを用いなくても、いくつかの半教師ありVSOD手法を上回り、その強靭さと効率性を証明した。
- 定性的な結果では、複雑な背景や干渉要因に対しても優れたマスク精度を示し、PR曲線およびROC曲線がベースラインを常に上回った。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。