Skip to main content
QUICK REVIEW

[論文レビュー] Over-sampling De-occlusion Attention Network for Prohibited Items Detection in Noisy X-ray Images

Renshuai Tao, Yanlu Wei|arXiv (Cornell University)|Mar 1, 2021
Advanced Neural Network Applications参考文献 43被引用数 15
ひとこと要約

本論文では、空港のセキュリティスクリーニングで一般的に見られるノイズが多く、重度に隠蔽されたX線画像における禁止物品の検出を目的として、DOAM-Oと呼ばれる新しい過剰サンプリングによる脱隠蔽注意ネットワークを提案する。エッジおよび物質に敏感な特徴を活用する脱隠蔽注意モジュール(DOAM)と、難易度の高い隠蔽サンプルに特化した過剰サンプリング戦略を統合することで、新たに導入されたOPIXrayデータセットにおいて、SSD、YOLOv3、FCOSといった最先端の検出器を上回る顕著な性能向上を達成した。

ABSTRACT

Security inspection is X-ray scanning for personal belongings in suitcases, which is significantly important for the public security but highly time-consuming for human inspectors. Fortunately, deep learning has greatly promoted the development of computer vision, offering a possible way of automatic security inspection. However, items within a luggage are randomly overlapped resulting in noisy X-ray images with heavy occlusions. Thus, traditional CNN-based models trained through common image recognition datasets fail to achieve satisfactory performance in this scenario. To address these problems, we contribute the first high-quality prohibited X-ray object detection dataset named OPIXray, which contains 8885 X-ray images from 5 categories of the widely-occurred prohibited item ``cutters''. The images are gathered from an airport and these prohibited items are annotated manually by professional inspectors, which can be used as a benchmark for model training and further facilitate future research. To better improve occluded X-ray object detection, we further propose an over-sampling de-occlusion attention network (DOAM-O), which consists of a novel de-occlusion attention module and a new over-sampling training strategy. Specifically, our de-occlusion module, namely DOAM, simultaneously leverages the different appearance information of the prohibited items; the over-sampling training strategy forces the model to put more emphasis on these hard samples consisting these items of high occlusion levels, which is more suitable for this scenario. We comprehensively evaluated DOAM-O on the OPIXray dataset, which proves that our model can stably improve the performance of the famous detection models such as SSD, YOLOv3, and FCOS, and outperform many extensively-used attention mechanisms.

研究の動機と目的

  • 空港のセキュリティスクリーニングで一般的に見られるノイズが多く、重度に隠蔽されたX線画像における禁止物品検出の課題に対処すること。
  • 標準データセットで訓練された従来のCNNベースのモデルが、高い隠蔽度条件下で失敗するという限界を克服すること。
  • 遮蔽された禁止物品検出のための高品質で現実的であるデータセットを構築すること。
  • 注意メカニズムとハードサンプルの再トレーニングを活用して、遮蔽された物体の特徴表現を強化する新しいディープラーニングモデルを開発すること。
  • 低品質で現実世界の画像環境における遮蔽に強い物体検出の新しいパラダイムを確立すること。

提案手法

  • 入力特徴から得られるエッジと領域情報を統合することで特徴マップを精緻化する、プラグアンドプレイ式の脱隠蔽注意モジュール(DOAM)を提案する。
  • エッジ特徴を強調することでオブジェクト境界への注意を向上させるため、損失関数を最適化するエッジガイダンス(EG)モジュールを導入する。
  • プーリングサイズに応じて領域特徴を適応的に選択するゲート付き畳み込みネットワークを用いて、物質に特化した表現を強化する物質認識(MA)モジュールを採用する。
  • 高遮蔽度のハードサンプルに特化した過剰サンプリングトレーニング戦略を適用し、モデルの一般化性能を向上させる。
  • Grad-CAMと注意マップの可視化を用いて、注意メカニズムの有効性を解釈・検証する。
  • 空港のプロフェッショナルな検査官が手作業でアノテートした、5種類のカッターを含む8,885枚の実世界のX線画像からなるOPIXrayデータセットを構築した。

実験結果

リサーチクエスチョン

  • RQ1深層学習モデルは、深刻な遮蔽とノイズを伴うX線画像における禁止物品検出をどのように改善できるか?
  • RQ2エッジおよび物質に敏感な特徴は、遮蔽された物体検出における特徴表現の向上にどのような役割を果たすか?
  • RQ3高遮蔽度の物品(ハードサンプル)の過剰サンプリングは、低品質なX線画像における検出性能を向上させることができるか?
  • RQ4提案されたDOAMモジュールは、既存の注意メカニズムと比較して、特徴精錬および局在化精度の面でどのように優れているか?
  • RQ5OPIXrayデータセットは、遮蔽された禁止物品検出モデルの評価に信頼できるベンチマークとしてどの程度の役割を果たすか?

主な発見

  • DOAM-Oモデルは、SSD、YOLOv3、FCOSのすべての指標において一貫して優れた性能を示し、MAモジュールにゲート付き畳み込みネットワークを適用した場合、最大0.9%の向上を達成した。
  • エッジガイダンス(EG)モジュールは、エッジ特徴と入力特徴を単純に連結する手法と比較して、0.43%の性能向上を示し、構造的詳細の強調効果を実証した。
  • EG単体よりも物質認識(MA)モジュールを追加することで、さらに0.37%の性能向上が得られ、物質に特化した特徴集約が検出精度を向上させることを確認した。
  • Grad-CAMの可視化結果から、DOAMを統合したネットワークは、ベースラインのVGG16ネットワークよりも、ターゲットオブジェクトに対してより集中的かつ完全な注意マスクを生成していることが示された。
  • 注意マップの可視化により、DOAMが遮蔽されたカッターに対しても、特にオブジェクトの境界と領域を正確に強調していることが確認され、脱隠蔽能力が妥当であることが検証された。
  • 5種類のカッターを含む8,885枚の実世界のX線画像からなるOPIXrayデータセットは、今後の遮蔽された禁止物品検出分野の研究における高品質なベンチマークを提供している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。