Skip to main content
QUICK REVIEW

[논문 리뷰] ObjectLab: Automated Diagnosis of Mislabeled Images in Object Detection Data

Ulyana Tkachenko, Aditya Thyagarajan|arXiv (Cornell University)|2023. 09. 02.
Advanced Neural Network ApplicationsComputer Science인용 수 3
한 줄 요약

ObjectLab는 어떤 훈련된 검출기에서든 샘플 외 예측을 활용하여 객체 검출 데이터셋 내 오분류된 이미지를 자동으로 탐지하고 우선순위를 매기는 데이터 중심 접근법을 제안한다. 유사도 지표와 신뢰도 점수를 사용해 세 가지 유형의 오류—간과된, 잘못된 위치에 있는, 교환된 레이블—을 식별하며, 다양한 데이터셋과 모델에서 기존의 레이블 품질 평가 방법에 비해 뛰어난 정밀도와 재현율을 달성한다.

ABSTRACT

Despite powering sensitive systems like autonomous vehicles, object detection remains fairly brittle in part due to annotation errors that plague most real-world training datasets. We propose ObjectLab, a straightforward algorithm to detect diverse errors in object detection labels, including: overlooked bounding boxes, badly located boxes, and incorrect class label assignments. ObjectLab utilizes any trained object detection model to score the label quality of each image, such that mislabeled images can be automatically prioritized for label review/correction. Properly handling erroneous data enables training a better version of the same object detection model, without any change in existing modeling code. Across different object detection datasets (including COCO) and different models (including Detectron-X101 and Faster-RCNN), ObjectLab consistently detects annotation errors with much better precision/recall compared to other label quality scores.

연구 동기 및 목표

  • 실세계 객체 검출 데이터셋에서 퍼지게 발생하는 레이블 오류 문제를 해결하여 모델 성능 저하를 방지하기 위해.
  • 세 가지 유형의 레이블 오류—간과된, 잘못된 위치에 있는, 교환된 바운딩 박스—를 식별할 수 있는 일반적이고 모델 독립적인 방법을 개발하기 위해.
  • 모델 예측 기반으로 레이블 품질 점수를 할당하여 이미지의 레이블 검토 우선순위를 자동으로 설정하기 위해.
  • 모델 아키텍처나 훈련 코드를 수정하지 않고도 데이터 수정을 통해 객체 검출 성능을 향상시키기 위해.
  • 모델 아키텍처나 훈련 전략의 변화에 관계없이 효과적으로 작동하는 확장성 있고 재사용 가능한 솔루션을 제공하여 데이터 중심 AI를 실현하기 위해.

제안 방법

  • ObjectLab는 어떤 훈련된 객체 검출기에서든 샘플 외 예측을 사용하여 각 이미지의 레이블 품질을 평가함으로써 훈련 데이터 유출을 방지한다.
  • 이미지당 세 가지 별도의 레이블 품질 점수를 계산한다: 간과된(누락된 객체), 잘못된 위치에 있는(정확하지 않은 바운딩 박스), 교환된(틀린 클래스 레이블).
  • 잘못된 위치에 있는 점수의 경우, 동일한 클래스의 참조 박스와 예측 박스 간의 IoU 유사도를 측정하며, 해당 예측이 존재하지 않을 경우 최고 점수를 부여한다.
  • 교환된 점수의 경우, 다른 클래스에 대해 높은 신뢰도(≥0.95)로 예측된 결과 중 참조 박상과 유사도가 높은 경우를 식별하고, 이러한 매칭이 존재할수록 낮은 점수를 할당한다.
  • 간과된 오류의 경우, 겹치는 참조 박스가 없고 높은 신뢰도(≥0.95)로 예측된 결과를 평가하며, 유사도와 신뢰도를 기반으로 누락된 레이블의 가능성을 추정한다.
  • 유사도 점수의 동점 방지를 위해 고정된 초모수 α=σ=0.1을 사용하는 가우시안 커널을 적용하여 미세한 IoU 변동에 대해 안정성을 확보한다.

실험 결과

연구 질문

  • RQ1모델 독립적이고 데이터 중심적인 방법이 모델 훈련을 수정하지 않고도 다양한 레이블 오류를 효과적으로 탐지할 수 있는가?
  • RQ2ObjectLab의 레이블 품질 점수 평가 방법이 기존 방법에 비해 간과된, 잘못된 위치에 있는, 교환된 오류 탐지에서 정밀도와 재현율 측면에서 어떻게 비교되는가?
  • RQ3ObjectLab를 사용해 레이블 검토의 우선순위를 매길 경우, 모델 아키텍처나 훈련 절차를 변경하지 않고도 동일한 객체 검출 모델의 성능 향상은 어느 정도 이루어지는가?
  • RQ4ObjectLab는 COCO와 같은 다양한 데이터셋과 Faster R-CNN, Detectron-X101과 같은 다양한 모델에서 높은 성능을 유지하는가?
  • RQ5ObjectLab의 접근법은 모델 특화의 노이즈 내성 훈련 기법들과 달리 향후 모델과 훈련 전략에 일반화 가능한가?

주요 결과

  • ObjectLab는 COCO를 포함한 다양한 객체 검출 데이터셋에서 기존의 레이블 품질 평가 방법에 비해 정밀도와 재현율 모두에서 일관되게 뛰어난 성능을 보였다.
  • 고정밀도 예측(99.8%)을 통해 COCO 이미지에서 간과된 소화전을 성공적으로 식별하여, 간과된 객체 탐지에 높은 신뢰도를 가짐을 입증했다.
  • 교환 오류의 경우, ObjectLab는 잘못된 레이블로 지정된 유리잔을 '컵'으로 96.2%의 높은 신뢰도로 예측하여 클래스 레이블 불일치에 민감하게 반응함을 보였다.
  • 잘못된 위치에 있는 박스의 경우, 부분적으로만 표기된 테이블에 대해 더 정확한 위치 예측을 96.4%의 높은 신뢰도로 식별하여 공간적 정확도 부족을 효과적으로 탐지할 수 있음을 확인했다.
  • 샘플 외 예측과 유사도 기반 점수화를 통해 모델 및 데이터셋 간의 일반화 능력과 안정성을 확보하였으며, 아키텍처나 훈련 코드 변경 없이도 효과를 발휘했다.
  • ObjectLab의 접근법은 직접적인 데이터 개선을 가능하게 하여, 오분류된 이미지를 수정함으로써 모델 성능 향상을 이끌 수 있었으며, 이는 모델 훈련 절차를 변경하지 않아도 가능했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.