Skip to main content
QUICK REVIEW

[論文レビュー] Encoder Fusion Network with Co-Attention Embedding for Referring Image Segmentation

Guang Feng, Zhiwei Hu|arXiv (Cornell University)|May 5, 2021
Multimodal Machine Learning Applications参考文献 43被引用数 8
ひとこと要約

本稿では、参照画像セグメンテーションのためのエンコーダー融合ネットワーク(Co-Attention Embeddingを用いたCEFNet)を提案する。この手法は、エンコーダー内でのクロスモーダル統合を実現し、デコーダーではなくエンコーダーで行うことで、言語誘導型の段階的特徴精錬を可能にする。共注意力メカニズムを用いて視覚的・言語的特徴を並列で同時に更新し、意味的整合性を向上させる。さらに境界強化モジュール(BEM)を組み込み、IoUスコアを2–3%向上させ、後処理なしで4つのベンチマークで最先端の性能を達成する。

ABSTRACT

Recently, referring image segmentation has aroused widespread interest. Previous methods perform the multi-modal fusion between language and vision at the decoding side of the network. And, linguistic feature interacts with visual feature of each scale separately, which ignores the continuous guidance of language to multi-scale visual features. In this work, we propose an encoder fusion network (EFN), which transforms the visual encoder into a multi-modal feature learning network, and uses language to refine the multi-modal features progressively. Moreover, a co-attention mechanism is embedded in the EFN to realize the parallel update of multi-modal features, which can promote the consistent of the cross-modal information representation in the semantic space. Finally, we propose a boundary enhancement module (BEM) to make the network pay more attention to the fine structure. The experiment results on four benchmark datasets demonstrate that the proposed approach achieves the state-of-the-art performance under different evaluation metrics without any post-processing.

研究の動機と目的

  • デコーダー側での統合に起因する制限を是正し、マルチスケールの視覚的特徴に継続的な言語誘導を提供する。
  • 逐次的なモダリティ更新をやめ、並列な共注意力を導入することで、視覚と言語の表現間の意味的整合性を向上させる。
  • 特徴抽出の過程で失われた微細な構造的詳細、特に物体境界付近の情報を回復する。
  • 後処理や追加の計算コストなしに最先端の性能を達成する。

提案手法

  • 視覚エンコーダー(例:ResNet)をマルチモーダル特徴エンコーダーに変換し、エンコーダー段階で言語と視覚の特徴を深く統合する。
  • 共有の類似度行列を用いて視覚的・言語的特徴を同時に更新する共注意力メカニズムを導入し、共同表現学習を促進する。
  • 2種類の共注意力変種を採用:バニラ共注意力と非対称共注意力。後者はモダリティ固有の文脈理解を向上させる。
  • エッジの手がかりを活用してデコーディング段階でセグメンテーションマスクを精錬する境界強化モジュール(BEM)を統合する。
  • デコーダーでは特徴ピラミッドネットワーク(FPN)を用い、マルチスケール予測を実現。統合はエンコーダーおよびデコーダーのベースラインともに要素ごとの連結(式1)で実装される。
  • EFN(エンコーダー統合)とDFN(デコーダー統合)のアブレーションスタディを実施し、エンコーダー段階での統合が優れていることを示す。

実験結果

リサーチクエスチョン

  • RQ1エンコーダー段階でのマルチモーダル統合は、デコーダー側統合と比較して、言語誘導型特徴学習をどのように改善するか?
  • RQ2逐次的アテンションと比較して、並列な共注意力メカニズムは、クロスモーダル整合性と表現の一貫性をどのように向上させるか?
  • RQ3明示的な境界精錬は、微細な物体の輪郭におけるセグメンテーション精度をどのように向上させるか?
  • RQ4性能と推論効率の観点から、本手法は最先端の手法と比較してどのように差をつけるか?

主な発見

  • エンコーダー統合ネットワーク(EFN)は、デコーダー統合ベースライン(DFN)を顕著に上回り、計算コストの増加なしに優れた特徴学習が可能であることを示した。
  • バニラ共注意力モジュールは、UNC-val、UNC-testA、UNC-testBの各データセットで平均IoUを6.8%〜8.2%向上させた。非対称共注意力モジュールは、7.6%〜8.8%の向上を達成した。
  • 境界強化モジュール(BEM)は、全体のIoUを2%〜3%向上させ、視覚的結果では物体境界への一致がより厳密であることが確認された。
  • 本手法は、4つのベンチマークデータセット(UNC、UNC+、Google-Ref、ReferItw)で、すべての標準評価指標において最先端の性能を達成した。
  • 失敗事例の主な原因は、曖昧なクエリ、レアワード(例:'cop')や小さな物体サイズに起因しており、ゼロショット学習や入力スケーリングによる改善の余地があると考えられる。
  • アブレーションスタディ(表5)から、非対称共注意力機構は入力サイズの変動に対してより頑健であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。