Skip to main content
QUICK REVIEW

[논문 리뷰] One Metric to Measure them All: Localisation Recall Precision (LRP) for Evaluating Visual Detection Tasks

Kemal Öksüz, Barış Can Çam|arXiv (Cornell University)|2020. 11. 21.
Advanced Neural Network Applications인용 수 4
한 줄 요약

이 논문은 시각적 탐지 작업을 평가하기 위한 통합적이고 완전하며 해석 가능한 메트릭으로 국소화 재현율 정밀도(LRP) 오차를 도입한다. 이는 평균 정밀도(AP)와 패노프틱 퀄리티(PQ)의 핵심 한계를 해결한다. LRP 오차는 국소화 정확도, 재현율, 정밀도를 하나의 오차 점수로 통합하여 탐지 성능을 수량화하며, 최적의 LRP(oLRP)는 각 검출기의 최적 신뢰도 임계값을 식별하여 7개의 탐지 작업과 10개의 데이터셋에서 AP를 초월하는 분류 능력을 보인다.

ABSTRACT

Despite being widely used as a performance measure for visual detection tasks, Average Precision (AP) is limited in (i) reflecting localisation quality, (ii) interpretability and (iii) robustness to the design choices regarding its computation, and its applicability to outputs without confidence scores. Panoptic Quality (PQ), a measure proposed for evaluating panoptic segmentation (Kirillov et al., 2019), does not suffer from these limitations but is limited to panoptic segmentation. In this paper, we propose Localisation Recall Precision (LRP) Error as the average matching error of a visual detector computed based on both its localisation and classification qualities for a given confidence score threshold. LRP Error, initially proposed only for object detection by Oksuz et al. (2018), does not suffer from the aforementioned limitations and is applicable to all visual detection tasks. We also introduce Optimal LRP (oLRP) Error as the minimum LRP Error obtained over confidence scores to evaluate visual detectors and obtain optimal thresholds for deployment. We provide a detailed comparative analysis of LRP Error with AP and PQ, and use nearly 100 state-of-the-art visual detectors from seven visual detection tasks (i.e. object detection, keypoint detection, instance segmentation, panoptic segmentation, visual relationship detection, zero-shot detection and generalised zero-shot detection) using ten datasets to empirically show that LRP Error provides richer and more discriminative information than its counterparts. Code available at: https://github.com/kemaloksuz/LRP-Error

연구 동기 및 목표

  • 시각적 탐지 작업에서 국소화 품질, 해석 가능성, 임계값 설정에 대한 강건성을 반영하지 못하는 평균 정밀도(AP)의 한계를 해결하기 위해.
  • 신뢰도 점수를 필요로 하지 않고도 모든 시각적 탐지 작업—객체 탐지, 키포인트 탐지, 인스턴스 세그멘테이션, 패노프틱 세그멘테이션, 시각적 관계 탐지, 제로샷 탐지—에 적용 가능한 통합 평가 메트릭을 제안하기 위해.
  • 배포를 위한 최적의 신뢰도 임계값을 식별하는 임계값 최적화된 성능 측정 기준인 최적 LRP(oLRP) 오차를 도입하기 위해.
  • 다양한 탐지 작업과 데이터셋에서 AP와 PQ보다 더 풍부하고 분류 능력이 뛰어난 성능 통찰을 제공함을 경험적으로 입증하기 위해.

제안 방법

  • LRP 오차는 신뢰도 점수 임계값을 사용하여 국소화 오차, 위양성 비율, 위음성 비율의 평균 매칭 오차로 계산된다.
  • 이 메트릭은 IoU 기반 국소화 품질, 재현율(TP/(TP+FN)), 정밀도(TP/(TP+FP))를 하나의 오차 점수로 통합하며, 낮은 값일수록 성능이 뛰어남을 의미한다.
  • 최적 LRP(oLRP) 오차는 모든 신뢰도 점수 임계값에서의 LRP 오차 중 최소값으로 계산되며, 배포에 가장 적합한 임계값을 식별한다.
  • 이 방법은 객체 탐지, 인스턴스 세그멘테이션, 패노프틱 세그멘테이션, 제로샷 탐지 등을 포함한 7개의 시각적 탐지 작업과 10개의 데이터셋에서 98개의 최첨단 검출기에 적용되었다.
  • 경계 상자와 마스크에 대해 IoU 기반 매칭을 사용하며, 신뢰도 점수가 없는 검출기의 경우 임계값에 의존하지 않는 수식으로 처리한다.
  • AP와 PQ와의 비교 분석, 임계값 민감도에 대한 분석 및 클래스별 임계값 설정에 대한 아블레이션을 통해 프레임워크를 검증하였다.
Figure 1 : Three different object detection results (for an image from COCO [ 1 ] ) with very different PR curves but the same AP. First Row : Blue, white and orange colors denote ground-truth, TPs and FPs respectively. Numbers are confidence scores, $s$ , of the detections. Second row : PR curves f
Figure 1 : Three different object detection results (for an image from COCO [ 1 ] ) with very different PR curves but the same AP. First Row : Blue, white and orange colors denote ground-truth, TPs and FPs respectively. Numbers are confidence scores, $s$ , of the detections. Second row : PR curves f

실험 결과

연구 질문

  • RQ1다양한 시각적 탐지 작업에서 국소화, 분류, 탐지 품질을 효과적으로 평가할 수 있는 단일 메트릭이 존재하는가?
  • RQ2LRP 오차는 완전성, 해석 가능성, 임계값 선택에 대한 강건성 측면에서 AP와 PQ보다 어떻게 비교되는가?
  • RQ3oLRP 오차는 다양한 검출기와 데이터셋에서 일관되게 최적의 신뢰도 임계값을 식별하는가?
  • RQ4AP가 포착하지 못하는 성능 차이, 특히 국소화 품질 측면에서 LRP 오차는 어느 정도의 성능 차이를 드러내는가?
  • RQ5클래스별 LRP-최적 임계값은 장수 분포 및 제로샷 탐지 시나리오에서 검출기 성능을 향상시킬 수 있는가?

주요 결과

  • LRP 오차는 AP를 능가하는 분류 능력을 보였다: COCO에서 세 가지 탐지 결과에 대한 사례 연구에서 AP는 국소화 품질의 상당한 차이가 있음에도 불구하고 모두 동일한 값을 부여했으나, oLRP 오차는 잘못 국소화된 탐지에 대해 정확히 징벌하였다.
  • oLRP 오차는 최적의 신뢰도 임계값을 식별하여 성능을 크게 향상시켰다: 영상 객체 탐지 사례에서 클래스별 oLRP 임계값은 고정 임계값 대비 AP50를 최대 9포인트 향상시키고 oLRP 오차를 4포인트 향상시켰다.
  • LRP-최적 임계값 분포가 클래스 간으로 크게 달라졌다: LVIS의 희귀 클래스 70%에서 oLRP 임계값이 0.0이었으며, 이는 장수 분포 데이터셋에서 고정 임계값이 비최적임을 시사한다.
  • 제로샷 및 일반화된 제로샷 탐지에서는 볼 수 없는 클래스에 대해 oLRP 임계값이 일관되게 낮게 나타났으며, 이는 클래스별 임계값 설정의 필요성을 확인한다.
  • 평균적으로 oLRP 오차는 AP보다 더 유의미한 성능 통찰을 제공했다: 국소화가 열악하거나 위양성 비율이 높은 검출기들은 명확히 징벌받았고, AP는 이러한 문제를 가림으로써 마스킹했다.
  • 이 방법은 다양한 작업에 강건하다: LRP 오차는 패노프틱 세그멘테이션 포함 7개의 시각적 탐지 작업에 성공적으로 적용되었으며, 일관되고 의미 있는 성능 순위를 제공했다.
(a) Object Detection
(a) Object Detection

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.