Skip to main content
QUICK REVIEW

[論文レビュー] Hashing-based Non-Maximum Suppression for Crowded Object Detection

Jianfeng Wang, Xi Yin|arXiv (Cornell University)|May 22, 2020
Video Surveillance and Tracking Methods参考文献 20被引用数 7
ひとこと要約

本稿では、オブジェクト検出の高速化を図る新たなO(N)アルゴリズムであるハッシングベース非最大抑制(HNMS)を提案する。この手法は、IoUに配慮したハッシュ関数(IoUHash)を用いて境界ボックスを離散的なセルにハッシュ化し、同じセル内に属するボックス同士が保証されたIoU閾値内に収まるようにする。HNMSは、CPUで最大7.4倍、GPUで最大6.8倍の高速化を達成し、mAPは同等または向上する。特に混雑したシーンにおいて顕著な効果を示す。

ABSTRACT

In this paper, we propose an algorithm, named hashing-based non-maximum suppression (HNMS) to efficiently suppress the non-maximum boxes for object detection. Non-maximum suppression (NMS) is an essential component to suppress the boxes at closely located locations with similar shapes. The time cost tends to be huge when the number of boxes becomes large, especially for crowded scenes. The basic idea of HNMS is to firstly map each box to a discrete code (hash cell) and then remove the boxes with lower confidences if they are in the same cell. Considering the intersection-over-union (IoU) as the metric, we propose a simple yet effective hashing algorithm, named IoUHash, which guarantees that the boxes within the same cell are close enough by a lower IoU bound. For two-stage detectors, we replace NMS in region proposal network with HNMS, and observe significant speed-up with comparable accuracy. For one-stage detectors, HNMS is used as a pre-filter to speed up the suppression with a large margin. Extensive experiments are conducted on CARPK, SKU-110K, CrowdHuman datasets to demonstrate the efficiency and effectiveness of HNMS. Code is released at \url{https://github.com/microsoft/hnms.git}.

研究の動機と目的

  • 数千個の候補ボックスが存在する混雑したオブジェクト検出において、O(N²)の計算量が問題となる従来のNMSの高コストを軽減すること。
  • アンカーの近接性や回帰の一貫性に関する未検証の仮定に依存する既存のNMS高速化手法(例:MaxPoolNMS)の限界を克服すること。
  • 同じハッシュセル内に属するボックス同士がIoUに基づいた近接性を満たすように、ハッシング方式を設計し、精度を損なわずに抑制の品質を保証すること。
  • 二段階検出器および一貫検出器の両方において、効率的かつスケーラブルなNMSを実現するために、HNMSを置換処理または事前フィルタリング処理として統合すること。
  • 推論時の高速化を実現しつつ、特に高密度な状況下で検出mAPを維持またはわずかに向上させること。

提案手法

  • ボックスのサイズ(対数スケール)とオフセット(ノーマルスケール)に基づき、境界ボックスを離散的なハッシュセルにマップする新しいハッシュ関数であるIoUHashを提案し、同じセル内に属するボックス同士がIoUの近接性を満たすようにする。
  • 同じハッシュセル内に属する任意の2つのボックス間のIoUの理論的下限を導出することで、類似度が十分に高いボックスのみがグループ化されることを保証する。
  • 境界効果を軽減するため、異なるハッシュパラメータを用いてHNMSを複数回適用する。
  • 二段階検出器では、RPNのNMSを直接HNMSに置き換えることで、精度に損なわれることなく高速化を達成する。
  • 一貫検出器では、HNMSを事前フィルタリングとして用い、標準NMSに渡されるボックス数を著しく削減することで、全体のパイプラインを高速化する。
  • 正例ボックスを保持するため、事前フィルタリングでは高いIoU閾値(α = 0.73)を用い、導出された下限は0.502に達し、標準NMSの閾値(0.5)をわずかに上回る。

実験結果

リサーチクエスチョン

  • RQ1ハッシングベースのアプローチにより、混雑したシーンにおける検出精度を維持したまま、NMSの時間計算量をO(N²)からO(N)に低減できるか?
  • RQ2特定のハッシュ関数を設計することで、同じハッシュセル内に属するボックス同士がIoUに基づいた近接性を満たすようにできるか?これにより安全な抑制が可能になるか?
  • RQ3二段階検出器(例:RPN)においてHNMSをNMSの置換として用いる場合、速度と精度の両面でどの程度有効か?
  • RQ4一貫検出器においてHNMSを事前フィルタリングとして用いる場合、mAPの低下を最小限に抑えつつNMSの高速化にどの程度寄与できるか?
  • RQ5実世界の検出ベンチマークにおいて、候補ボックス数の変動やハードウェア(CPU対GPU)の違いに応じて、HNMSはどの程度の性能を示すか?

主な発見

  • CARPKデータセットでは、CPUモードで7.4倍の高速化を達成し、精度に損なわれることなく、mAPはNMSの95.4%からHNMSの96.4%に向上。推論時間は10ms未満に削減された。
  • GPUモードでは、HNMSをK=4の事前フィルタリングとして用いることで、CARPKで最大6.8倍、SKU-110Kで最大9.1倍の高速化を達成。mAPは0.1ポイントの低下を伴うが、事前フィルタリング時間の増加を考慮しても妥当な妥協である。
  • GPU上での入力サイズに対する感度が低く、ボックス数が1,000から9,000に増加しても実行時間は2.4msから2.9msに僅かに増加する。これは並列処理効率が非常に高いことを示している。
  • すべてのデータセット(CARPK、SKU-110K、CrowdHuman)において、標準NMSと同等またはわずかに優れたmAPを維持しており、CPUおよびGPU両方の環境で一貫した高速化効果を示した。
  • IoUHash関数は、α=0.73のとき、同じセル内に属するボックス同士のIoUに理論的下限0.502を保証しており、抑制品質に対する明確な保証を提供する。
  • RetinaNetにおける事前フィルタリングとしてHNMSを用いることで、SKU-110K(GPU)で合計NMS時間に最大9.1倍の高速化を達成。mAPの低下は最小限に抑えられ、一貫検出パイプラインにおける強力なスケーラビリティを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。