Skip to main content
QUICK REVIEW

[論文レビュー] CPPE-5: Medical Personal Protective Equipment Dataset

Rishit Dagli, Ali Mustufa Shaikh|arXiv (Cornell University)|Dec 15, 2021
Advanced Neural Network Applications被引用数 4
ひとこと要約

本論文は、マスク、手袋、ゴーグル、フェイスシールド、カバーオールなどの医療用個人用防護具(PPE)の下位分類を焦点とした、CPPE-5と呼ばれる新しい物体検出データセットを紹介する。実際の状況から収集された非インフォーマルで複雑な視点の画像から構成され、5,000枚以上の画像に密な複数インスタンスのボクシングボックスアノテーションが付与されている。主な貢献は、複雑でごった返した環境におけるPPE検出のベンチマークを確立することであり、最先端のモデルはこのデータセットで52.9%のボックスAPを達成した。

ABSTRACT

We present a new challenging dataset, CPPE - 5 (Medical Personal Protective Equipment), with the goal to allow the study of subordinate categorization of medical personal protective equipments, which is not possible with other popular data sets that focus on broad-level categories (such as PASCAL VOC, ImageNet, Microsoft COCO, OpenImages, etc). To make it easy for models trained on this dataset to be used in practical scenarios in complex scenes, our dataset mainly contains images that show complex scenes with several objects in each scene in their natural context. The image collection for this dataset focuses on: obtaining as many non-iconic images as possible and making sure all the images are real-life images, unlike other existing datasets in this area. Our dataset includes 5 object categories (coveralls, face shields, gloves, masks, and goggles), and each image is annotated with a set of bounding boxes and positive labels. We present a detailed analysis of the dataset in comparison to other popular broad category datasets as well as datasets focusing on personal protective equipments, we also find that at present there exist no such publicly available datasets. Finally, we also analyze performance and compare model complexities on baseline and state-of-the-art models for bounding box results. Our code, data, and trained models are available at https://git.io/cppe5-dataset.

研究の動機と目的

  • 医療用PPEの下位分類に焦点を当てた公開可能なデータセットの不足に対処すること。
  • 複数のPPEアイテムが1枚の画像に重なっているような複雑で自然なシーンにおける物体検出の現実的でリアルなベンチマークを提供すること。
  • パンデミック対応などの重要な現実世界の応用分野における頑健なコンピュータビジョンモデルの開発を支援すること。
  • 非標準的で挑戦的な視点や遮蔽状態におけるPPE検出に関する研究を促進すること。

提案手法

  • 画像は主にFlickrと、一部はGoogle Imagesから収集され、多様性と現実性を最大化する。
  • 品質管理のため複数のレビュアーによるクラウドソーシングを用いて、方向付きのボクシングボックスとクラスラベルをアノテーションした。
  • データセットには、カバーオール、フェイスシールド、手袋、マスク、ゴーグルの5つのPPEカテゴリが含まれ、1枚の画像に複数の物体のアノテーションが付与されている。
  • 分類にはファーカスロス、局所化にはスムーズL1損失を用い、コサインスケジュールを用いた学習率スケジューリングでベースラインYOLOv3モデルを訓練した。
  • Deformable DETR、FCOS、Double Headsといった最先端のモデルを標準的なCOCOスタイルの指標を用いて微調整し、評価した。
  • 学習は2000イテレーションのウォームアップ段階を経て、初期ベース学習率を4/300、重み減衰を0.04として行った。

実験結果

リサーチクエスチョン

  • RQ1既存の物体検出モデルは、複数の重なったアイテムを含む複雑で現実的なシーンにおける医療用PPEの検出に一般化できるか?
  • RQ2標準的なベンチマークとは対照的に、非インフォーマルで現実的なPPE画像に焦点を当てたデータセットにおいて、最先端のモデルの性能はどのように変化するか?
  • RQ3多様で非標準的な視点と遮蔽状態を含めることで、医療用PPE検出の精度にどの程度の影響が生じるか?
  • RQ4汎用データセットで学習したモデルとCPPE-5で微調整したモデルとの間には、医療用PPE検出において顕著な性能差があるか?

主な発見

  • CPPE-5データセットは、医療用PPEの下位分類に特化した最初の公開可能なベンチマークであり、既存のデータセットにおける重要な空白を埋めた。
  • 5,000枚以上の実世界の画像を含み、1枚あたり1つ以上のPPEオブジェクトが平均して存在するため、複雑でごった返したシーンに重点を置いている。
  • 最も優れた性能を示したモデル、TridentNetは、ボックスAP 52.9%を達成し、ベースラインモデルを大きく上回り、このデータセットの難易度を示している。
  • Empirical Attention や Double Heads といったモデルは、CPPE-5で高い性能(AP > 50%)を示しており、非インフォーマルな視点への一般化能力が強いことが示された。
  • 非インフォーマルな画像と自然な文脈に重点を置いているため、COCO や VOC といった標準データセットよりも、現実世界の展開により適した代表的データセットである。
  • 結果から、CPPE-5は複雑なシーン、多様な視点、遮蔽状態の影響により、OpenImages や COCO よりもさらに困難であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。