Skip to main content
QUICK REVIEW

[論文レビュー] R(Det)^2: Randomized Decision Routing for Object Detection

Yali Li, Shengjin Wang|arXiv (Cornell University)|Apr 2, 2022
Advanced Neural Network Applications被引用数 5
ひとこと要約

本稿では、ルーティング意思決定と予測値を分離するためのソフト意思決定木を意思決定ヘッドに統合することで、エンドツーエンドのオブジェクト検出フレームワークR(Det)²を提案する。ランダム化された意思決定ルーティングに加え、ノード選択型損失と関連性損失を導入することで、複数の木ノードにおける分離的かつ代表的な特徴抽出を可能にし、既存の検出器に統合することでMS-COCOで1.4–3.6%のAP向上を達成した。

ABSTRACT

In the paradigm of object detection, the decision head is an important part, which affects detection performance significantly. Yet how to design a high-performance decision head remains to be an open issue. In this paper, we propose a novel approach to combine decision trees and deep neural networks in an end-to-end learning manner for object detection. First, we disentangle the decision choices and prediction values by plugging soft decision trees into neural networks. To facilitate effective learning, we propose randomized decision routing with node selective and associative losses, which can boost the feature representative learning and network decision simultaneously. Second, we develop the decision head for object detection with narrow branches to generate the routing probabilities and masks, for the purpose of obtaining divergent decisions from different nodes. We name this approach as the randomized decision routing for object detection, abbreviated as R(Det)$^2$. Experiments on MS-COCO dataset demonstrate that R(Det)$^2$ is effective to improve the detection performance. Equipped with existing detectors, it achieves $1.4\sim 3.6$\% AP improvement.

研究の動機と目的

  • 深層オブジェクト検出器における単一ノード意思決定ヘッドの制限を解消し、特徴探索と性能の制限を緩和すること。
  • 一般化性能を向上させるために、ルーティング意思決定と予測値を分離する学習可能な木構造ベースの意思決定メカニズムを設計すること。
  • エンドツーエンド学習により、ソフト意思決定木を用いて複数ノードの分離的意思決定を実現すること。
  • 特徴表現と意思決定の多様性を向上させることで、特に大規模オブジェクトの検出精度を向上させること。

提案手法

  • オブジェクト検出器の意思決定ヘッドにソフト意思決定木を統合し、ルーティング意思決定と予測値を分離する。
  • 細い分岐を用いてルーティング確率を生成し、太い分岐を用いてノードレベルのルーティングマスクを出力することで、ランダム化された意思決定ルーティングを提案する。
  • ノード選択型損失を導入してノード間での多様な特徴探索を促進し、関連性損失を導入して予測値を正例ターゲットと一致させる。
  • 深層ニューラルネットワークとソフト意思決定木の両方を同時に最適化するエンドツーエンド学習を採用する。
  • 最終的な予測がルーティング確率に基づくノード出力の重み付き和として得られる木構造アーキテクチャを採用する。
  • Faster R-CNN や Cascade R-CNN などの1段階および2段階検出器に適用可能であり、アーキテクチャの変更を最小限に抑える。

実験結果

リサーチクエスチョン

  • RQ1複数ノードのルーティングを備えた木構造ベースの意思決定ヘッドは、標準的な単一ノードヘッドと比較してオブジェクト検出性能を向上させることができるか?
  • RQ2ソフト意思決定木をどのように深層ニューラルネットワークに効果的に統合し、オブジェクト検出におけるエンドツーエンド学習を可能にするか?
  • RQ3ノード選択型損失と関連性損失を用いたランダム化された意思決定ルーティングは、特徴表現と意思決定の多様性を向上させるか?
  • RQ4R(Det)²は、異なるオブジェクトサイズやバックボーンアーキテクチャにおいて、どの程度検出精度を向上させるか?

主な発見

  • Faster R-CNN や Cascade R-CNN などの既存検出器に統合した場合、MS-COCOで1.4–3.6%のAP向上を達成した。
  • 12エポックの学習で、ResNeXt-101-DCNを用いてCOCOで50.0%のAPを達成し、Faster R-CNN や Cascade R-CNN を上回った。
  • 同じバックボーンを用いた場合、24エポックとテスト時増幅を適用した結果、54.1%のAPと72.4%のAP₅₀を達成し、DyHeadよりもAP₅₀で0.3%、APₗで1.0%高い性能を示した。
  • Swin-Lをバックボーンとして用いた場合、マルチスケールテストと12エポックの学習で57.4%のAPを達成し、アーキテクチャを越えて強い一般化性能を示した。
  • 大規模オブジェクトの検出精度が顕著に向上しており、意思決定ヘッドにおける特徴の有効活用が図られていることが示された。
  • アブレーションスタディの結果、ノード選択型損失と関連性損失を併用したランダム化ルーティングが性能向上に不可欠であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。