Skip to main content
QUICK REVIEW

[論文レビュー] Disentangled Non-Local Neural Networks

Minghao Yin, Zhuliang Yao|arXiv (Cornell University)|Jun 11, 2020
Human Pose and Action Recognition参考文献 45被引用数 10
ひとこと要約

本稿では、標準的な非局所ブロックにおけるアテンション計算を、別々のホワイトニング処理を施したペairワイズ項とユニタリー項に分解することで、特徴表現学習を向上させる「分離型非局所(DNL)」ブロックを提案する。これらの項をそれぞれ専用のソフトマックス関数および埋め込み行列を用いて独立して学習させることで、Semantic Segmentation、Object Detection、Action Recognitionの各タスクにおいて顕著な性能向上を達成し、PASCAL-Contextでは最大3.4%のmIoU向上、COCOでは0.7%のmAP向上を達成した。

ABSTRACT

The non-local block is a popular module for strengthening the context modeling ability of a regular convolutional neural network. This paper first studies the non-local block in depth, where we find that its attention computation can be split into two terms, a whitened pairwise term accounting for the relationship between two pixels and a unary term representing the saliency of every pixel. We also observe that the two terms trained alone tend to model different visual clues, e.g. the whitened pairwise term learns within-region relationships while the unary term learns salient boundaries. However, the two terms are tightly coupled in the non-local block, which hinders the learning of each. Based on these findings, we present the disentangled non-local block, where the two terms are decoupled to facilitate learning for both terms. We demonstrate the effectiveness of the decoupled design on various tasks, such as semantic segmentation on Cityscapes, ADE20K and PASCAL Context, object detection on COCO, and action recognition on Kinetics.

研究の動機と目的

  • 非局所ブロックの内部メカニズムを解明し、そのアテンション計算における制限要因を同定すること。
  • ペアワイズ項とユニタリー項が同時に最適化される標準的な非局所ブロックが、なぜ性能が劣るのかを理解すること。
  • 2つのアテンション項を分離することで、独立した最適化を可能にし、視覚的表現学習を向上させること。
  • 分離設計の有効性を、セグメンテーション、検出、アクション認識といった多様なビジョンタスクにわたって検証すること。

提案手法

  • 非局所ブロックのアテンション計算を、ピクセル間の関係性を捉えるホワイトニング処理を施したペアワイズ項と、ピクセルの顕著性を表すユニタリー項に分解する。
  • ペアワイズ項とユニタリー項にそれぞれ別々のソフトマックス関数と独立した埋め込み行列を適用し、学習中に両項の結合を排除する。
  • 分離された構成要素を別々に学習させることで、それぞれの視覚的学習行動を分析する。
  • アーキテクチャの変更なしに、既存モデルの標準的な非局所ブロックをDNLブロックに置き換えることで、直接的な比較を可能にする。
  • アブレーションスタディを用いて、分離が特徴表現学習およびモデル性能の向上に寄与することを検証する。
  • オブジェクト検出およびアクション認識のための最先端モデル(例:Mask R-CNN や Slow-only ネットワーク)にDNLブロックを適用する。

実験結果

リサーチクエスチョン

  • RQ1ペアワイズ項とユニタリー項が分離された状態で、それぞれが視覚的表現学習にどのように寄与するか。
  • RQ2標準的な非局所ブロックでは、ペアワイズ項とユニタリー項が同時に最適化されることで、なぜ特徴学習が阻害されるのか。
  • RQ3これらの項を分離することで、領域内関係性および顕著な境界の学習がより良くなるか。
  • RQ4分離設計は、セマンティックセグメンテーション、オブジェクト検出、アクション認識といった多様なビジョンタスクにおいて、性能向上をもたらすか。

主な発見

  • ホワイトニング処理を施したペアワイズ項のみでは、明確な領域内関係性が学習される一方、ユニタリー項のみでは顕著な境界が学習されることから、それぞれが異なる視覚的手がかりを表していることが示された。
  • 標準的な非局所ブロックでは、両項が結合されているため、明確な視覚的パターンを学習できず、ユニタリー項のみのバージョンよりも性能が劣ることが確認された。
  • Cityscapesでは、ResNet-101バックボーンを用いた場合、標準的な非局所ブロックをDNLに置き換えることで2.0%のmIoU向上を達成した。
  • ADE20Kでは、DNLブロックが標準的な非局所ブロックよりも1.3%のmIoU向上を達成し、最小限の変更で新たなSOTAを樹立した。
  • PASCAL-Contextでは、ResNet-101を用いた場合、DNLブロックが標準的な非局所ブロックよりも3.4%のmIoU向上を達成した。
  • COCOでは、DNLブロックが標準的な非局所ブロックよりもボックスmAPで0.7%、マスクmAPで0.6%高い性能を示し、それぞれ0.7%および0.6%の向上を達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。