Skip to main content
QUICK REVIEW

[論文レビュー] Multi-task Collaborative Network for Joint Referring Expression Comprehension and Segmentation

Gen Luo, Yiyi Zhou|arXiv (Cornell University)|Mar 19, 2020
Multimodal Machine Learning Applications参考文献 44被引用数 14
ひとこと要約

本稿では、共通のバックボーンとタスク固有のブランンチを介してタスク間の相互監視を活用することで、一括参照表現理解(REC)とセグメンテーション(RES)を統合的に処理するマルチタスク協調ネットワーク(MCN)を提案する。予測の矛盾を解消するために、一貫性エナジー最大化(CEM)と適応的ソフト非局所抑制(ASNLS)を導入し、ベンチマークデータセット上でRECで最大+7.13%、RESで最大+11.50%の性能向上を達成し、最先端の性能を実現した。

ABSTRACT

Referring expression comprehension (REC) and segmentation (RES) are two highly-related tasks, which both aim at identifying the referent according to a natural language expression. In this paper, we propose a novel Multi-task Collaborative Network (MCN) to achieve a joint learning of REC and RES for the first time. In MCN, RES can help REC to achieve better language-vision alignment, while REC can help RES to better locate the referent. In addition, we address a key challenge in this multi-task setup, i.e., the prediction conflict, with two innovative designs namely, Consistency Energy Maximization (CEM) and Adaptive Soft Non-Located Suppression (ASNLS). Specifically, CEM enables REC and RES to focus on similar visual regions by maximizing the consistency energy between two tasks. ASNLS supresses the response of unrelated regions in RES based on the prediction of REC. To validate our model, we conduct extensive experiments on three benchmark datasets of REC and RES, i.e., RefCOCO, RefCOCO+ and RefCOCOg. The experimental results report the significant performance gains of MCN over all existing methods, i.e., up to +7.13% for REC and +11.50% for RES over SOTA, which well confirm the validity of our model for joint REC and RES learning.

研究の動機と目的

  • 一括学習における予測の矛盾問題に取り組むこと。
  • 協調的マルチタスクフレームワークを設計することで、RECとRESの間で相互監視を可能にすること。
  • 共有モジュールとタスク固有モジュールを用いて、RECにおける言語・ビジョンの整合性とRESにおける空間的精度を向上させること。
  • マルチタスク設定における予測の矛盾による性能低下を軽減すること。

提案手法

  • MCNは、共有の視覚的バックボーンと言語エンコーダーを採用し、RECとRESのための別個のマルチモodal推論ブランチを設けることで、タスク固有の特徴を保持する。
  • 一貫性エナジー最大化(CEM)は、言語中心の損失であり、RECとRESの予測間の一貫性エナジーを最大化することで、両者の注目領域を類似した視覚領域に一致させる。
  • 適応的ソフト非局所抑制(ASNLS)は、学習可能なソフトアテンションメカニズムを用いて、RECの予測に基づきRESの関連のない領域の応答を抑制する。
  • モデルは1段階アーキテクチャを採用し、エンドツーエンドでREC(ボクセル境界予測)とRES(ピクセル単位のセグメンテーション)を同時に最適化する。
  • CEMはRECとRESの学習をつなぐピボットとして機能し、タスク間の整合性を強化する。
  • ASNLSは、RoIプーリングのようなハード手法とは異なり、オブジェクトの整合性を保持する柔軟なソフト後処理を可能にする。

実験結果

リサーチクエスチョン

  • RQ1RECとRESの一括学習が相互監視によって性能向上を達成できるか?
  • RQ2マルチタスク設定においてRECとRESの予測の矛盾を効果的に緩和できるか?
  • RQ3RECとRESを協調的に学習することで、言語・ビジョンの整合性がどの程度向上するか?
  • RQ4ソフトで適応的な後処理は、RESにおいてハードで固定領域の抑制手法を上回るか?
  • RQ5提案された協調フレームワークは、従来手法と比較して不整合エラーを低減するか?

主な発見

  • MCNは、RefCOCOのテストBスプリットにおいて、前回のSOTAと比較してREC性能で+7.13%の絶対的向上を達成した。
  • MCNはRefCOCO+データセットにおいてRES性能で+11.50%の絶対的向上を達成し、既存手法を著しく上回った。
  • CEMを用いることで不整合誤差(IE)は17.12%から13.51%に低下し、予測の矛盾が軽減されたことが確認された。
  • ASNLSはRoIプーリングやRoIアライメントのようなハード後処理手法を上回り、ボクセル境界外のオブジェクト部の保持において特に優れた性能を示した。
  • アブレーションスタディの結果、CEMとASNLSはそれぞれ顕著な貢献を示しており、個別に使用した場合でもRESで最大14.84%、RECで最大7.04%の向上が得られた。
  • MCNはMAttNetのようなマルチステージSOTAモデルと比較して6倍速く、高い精度と並んで効率性も実証した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。