Skip to main content
QUICK REVIEW

[論文レビュー] Location-Sensitive Visual Recognition with Cross-IOU Loss

Kaiwen Duan, Lingxi Xie|arXiv (Cornell University)|Apr 11, 2021
Advanced Neural Network Applications被引用数 27
ひとこと要約

この論文は、アンカーポイントとランドマークのセットを予測し、マルチスケールオブジェクトを処理する新しい cross-IOU ロスを最適化する、ロケーション感度の高い視覚認識(物体検出、インスタンス分割、姿勢推定)用の統一アンカーフリーフレームワーク LSNet を紹介します。MS-COCO で最新のアンカーフリーの結果を達成し、輪郭ベースの分割と姿勢推定の性能も高いことを示します。

ABSTRACT

Object detection, instance segmentation, and pose estimation are popular visual recognition tasks which require localizing the object by internal or boundary landmarks. This paper summarizes these tasks as location-sensitive visual recognition and proposes a unified solution named location-sensitive network (LSNet). Based on a deep neural network as the backbone, LSNet predicts an anchor point and a set of landmarks which together define the shape of the target object. The key to optimizing the LSNet lies in the ability of fitting various scales, for which we design a novel loss function named cross-IOU loss that computes the cross-IOU of each anchor point-landmark pair to approximate the global IOU between the prediction and ground-truth. The flexibly located and accurately predicted landmarks also enable LSNet to incorporate richer contextual information for visual recognition. Evaluated on the MS-COCO dataset, LSNet set the new state-of-the-art accuracy for anchor-free object detection (a 53.5% box AP) and instance segmentation (a 40.2% mask AP), and shows promising performance in detecting multi-scale human poses. Code is available at https://github.com/Duankaiwen/LSNet

研究の動機と目的

  • 検出・分割・姿勢推定のための統一的なロケーション感度定式化を動機づける。
  • LSNet を開発し、アンカーポイントとランドマークを用いてオブジェクトのジオメトリを定義する。
  • グローバル IOU の精度とローカルランドマークの整合性をバランスさせる cross-IOU ロスを設計する。
  • ランドマーク周辺の Pyramid Deformable Convolution を用いて特徴を強化し、認識を向上させる。

提案手法

  • backbone の上にアンカーポイントと N 個のランドマークを予測し、オブジェクトのジオメトリを定義する。
  • オフセットベクトルを用いてグローバル IOU を近似することでランドマークのオフセットを監視する cross-IOU ロスを使用する。
  • 予測されたランドマーク周囲に Pyramid Deformable Convolution(Pyramid-DCN)を適用して識別的な特徴を抽出する。
  • アンカーポイント+ランドマークの2段階パイプラインで訓練し、分類と局在化のために DCN ベースの特徴で refinement を行う。
  • robust な局所化のために FPN と ATSS ベースの割り当てを用いてマルチスケール特徴を統合する。

実験結果

リサーチクエスチョン

  • RQ1アンカーフリーの統一フレームワークは、アンカーとランドマークを予測することで物体検出、インスタンス分割、姿勢推定を同時に扱えるか。
  • RQ2cross-IOU ロスは多尺度・多様な形状の物体に対して堅牢な監視を提供するか。
  • RQ3ランドマークベースの特徴と Pyramid DCN は各タスクで局在化と認識を改善するか。
  • RQ4LSNet は MS-COCO における最先端のアンカーフリーおよび輪郭ベース手法と比してどの程度の性能か。
  • RQ5ヒートマップなしで多尺度姿勢推定を効果的に実現できるか。

主な発見

  • LSNet はより強力なバックボーンとマルチスケールテストを用いると、MS-COCO におけるアンカーフリー物体検出で最先端に近い結果を達成する。
  • LSNet は COCO における単一スケールおよびマルチスケールテストで、輪郭ベースのインスタンス分割性能で最新の結果を達成する。
  • cross-IOU ロスは extreme bounding box 回帰とランドマークベースの監視をサポートし、滑らかな L1 や非 IOU バリアントよりも性能を向上させる。
  • ランドマーク特徴(極値点を含む)と Pyramid-DCN 特徴は検出の精度と局在化を改善する。
  • LSNet はヒートマップなしで回帰を用いた姿勢推定で競争力のある結果を示し、マルチスケールの人間姿勢にも拡張可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。