Skip to main content
QUICK REVIEW

[論文レビュー] Boosting Camouflaged Object Detection with Dual-Task Interactive Transformer

Zhengyi Liu, Zhili Zhang|arXiv (Cornell University)|May 21, 2022
Visual Attention and Saliency Detection被引用数 7
ひとこと要約

本稿では、クロスアテンション機構を用いて、 camouflageed object detection (COD) と境界検出を同時に最適化する二重タスク相互作用型トランスフォーマー (DTIT) を提案する。オブジェクト特徴と境界特徴を互いにクエリとして扱うことで、グローバルかつ相互作用的なアテンションにより特徴の精錬が行われ、CAMO、COD10K、NC4K の公開 COD ベンチマークで最先端の性能を達成し、精度向上とノイズ抑制を実現した。

ABSTRACT

Camouflaged object detection intends to discover the concealed objects hidden in the surroundings. Existing methods follow the bio-inspired framework, which first locates the object and second refines the boundary. We argue that the discovery of camouflaged objects depends on the recurrent search for the object and the boundary. The recurrent processing makes the human tired and helpless, but it is just the advantage of the transformer with global search ability. Therefore, a dual-task interactive transformer is proposed to detect both accurate position of the camouflaged object and its detailed boundary. The boundary feature is considered as Query to improve the camouflaged object detection, and meanwhile the object feature is considered as Query to improve the boundary detection. The camouflaged object detection and the boundary detection are fully interacted by multi-head self-attention. Besides, to obtain the initial object feature and boundary feature, transformer-based backbones are adopted to extract the foreground and background. The foreground is just object, while foreground minus background is considered as boundary. Here, the boundary feature can be obtained from blurry boundary region of the foreground and background. Supervised by the object, the background and the boundary ground truth, the proposed model achieves state-of-the-art performance in public datasets. https://github.com/liuzywen/COD

研究の動機と目的

  • 生物にインspiredされた二段階検出フレームワークの限界を克服し、オブジェクト特徴と境界特徴の並列的かつ相互作用的な学習を可能にする。
  • トランスフォーマーのグローバル受容場を活用して、オブジェクト局在と境界の明確化を同時に精錬することで、検出精度を向上させる。
  • 前景と背景特徴の差分から鋭い境界特徴を抽出する新しい境界生成戦略を開発し、曖昧領域でのエッジ詳細を強化する。
  • オブジェクト、背景、境界の正例を共同で使用することで、より強固な特徴学習を可能にする共同監視により優れた性能を達成する。
  • 従来の逐次的精錬をやめ、二重タスク間で相互作用的かつ多頭部自己アテンションを適用することで、既存のCODモデルを上回る性能を実現する。

提案手法

  • モデルは、オブジェクト特徴が境界特徴をクエリとし、逆に境界特徴がオブジェクト特徴をクエリとするクロスアテンションを用いる二重タスク相互作用型トランスフォーマー (DTIT) を採用し、双方向の特徴精錬を可能にする。
  • 前景および背景特徴は、それぞれ別々のトランスフォーマーに基づくバックボーンから抽出され、境界特徴は要素ごとの差分により生成される:境界 = 前景 − 背景。
  • 境界特徴マップはオブジェクト検出の精錬のクエリとして扱われ、オブジェクト特徴マップは境界検出の向上のクエリとして機能し、フィードバックループを形成する。
  • 多頭部自己アテンション機構が両タスクに適用され、長距離依存性を捉え、グローバルな特徴相互作用を可能にする。
  • 標準的なセグメンテーション損失関数を用いて、camouflaged オブジェクト、背景、境界の正例を共同で使用してモデルを訓練する。
  • 前景および背景における不確実領域を境界特徴に再割り当てすることで、ノイズ抑制とエッジ詳細の強化を実現するようにアーキテクチャが設計されている。

実験結果

リサーチクエスチョン

  • RQ1オブジェクト検出と境界検出の間で相互作用的かつ並列的な学習が、従来の生物的インスピレーションを受ける二段階フレームワークを上回るか?
  • RQ2オブジェクト特徴と境界特徴の間のクロスアテンションが、特徴表現とセグメンテーション精度をどのように向上させるか?
  • RQ3特に曖昧または低コントラスト領域において、前景と背景特徴の差分から境界特徴を効果的に生成できるか?
  • RQ4オブジェクト、背景、境界の正例を共同で使用する監視により、公開 COD ベンチマークでの一般化性能と性能が向上するか?
  • RQ5提案された二重タスク相互作用型トランスフォーマーは、既存手法と比較して、ノイズ低減とエッジ詳細の向上をどの程度達成するか?

主な発見

  • 提案された二重タスク相互作用型トランスフォーマー (DTIT) は、CAMO、COD10K、NC4K データセットで最先端の性能を達成し、それぞれ $F^{eta}_{\text{F}}$ が 0.796、0.695、0.792 を記録した。
  • DTIT は CAMO で $S_{\text{α}}$ を 0.857、NC4K で 0.863 まで向上させ、F-measure で次の最高性能手法を 0.01 以上上回った。
  • DTIT は CAMO で MAE を 0.050、COD10K で 0.034、NC4K で 0.041 まで低減し、セグメンテーションにおける誤差率の低減を示した。
  • アブレーションスタディの結果、DTIT におけるクロスアテンション相互作用が、初期融合や後期融合戦略よりも顕著に性能を向上させ、完全な相互作用が最良の指標を達成した。
  • 前景から背景を引いた特徴に基づく提案された境界生成法は、複雑なシーンや類似したテクスチャ領域でも、より正確で詳細な境界を生成した。
  • 可視化比較では、モデルがノイズを効果的に抑制し、蜘蛛の脚のような微細な詳細を強調できており、ベースライン手法が見逃すことが多い部位を効果的に捉えた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。