Skip to main content
QUICK REVIEW

[논문 리뷰] MPDIoU: A Loss for Efficient and Accurate Bounding Box Regression

Siliang Ma, Yong Xu|arXiv (Cornell University)|2023. 07. 14.
Advanced Neural Network Applications인용 수 217
한 줄 요약

논문은 새로운 IoU 기반 손실인 MPDIoU를 제시합니다. 이는 최솟점 거리(minimum point distance)를 포함해 수렴 속도와 정확도를 향상시키고, 물체 검출, 장면 텍스트 인식, 인스턴스 세분화 벤치마크에서 우수성을 입증합니다.

ABSTRACT

Bounding box regression (BBR) has been widely used in object detection and instance segmentation, which is an important step in object localization. However, most of the existing loss functions for bounding box regression cannot be optimized when the predicted box has the same aspect ratio as the groundtruth box, but the width and height values are exactly different. In order to tackle the issues mentioned above, we fully explore the geometric features of horizontal rectangle and propose a novel bounding box similarity comparison metric MPDIoU based on minimum point distance, which contains all of the relevant factors considered in the existing loss functions, namely overlapping or non-overlapping area, central points distance, and deviation of width and height, while simplifying the calculation process. On this basis, we propose a bounding box regression loss function based on MPDIoU, called LMPDIoU . Experimental results show that the MPDIoU loss function is applied to state-of-the-art instance segmentation (e.g., YOLACT) and object detection (e.g., YOLOv7) model trained on PASCAL VOC, MS COCO, and IIIT5k outperforms existing loss functions.

연구 동기 및 목표

  • 전통적인 IoU 및 L-노름 손실을 넘어 더 정보를 제공하는 경계 상자 회귀 손실의 필요성에 대한 동기 부여.
  • 최소 포인트 거리 페널티를 포함하는 IoU 기반 유사도 지표로 MPDIoU를 제안.
  • 실용적이고 계산이 쉬운 MPDIoU 기반 회귀 손실을 개발하고 기존 모델에의 통합을 보여줌.
  • 다양한 2D 시각 인식 과제와 표준 데이터셋에서 MPDIoU의 경험적 이점을 입증합니다.

제안 방법

  • MPDIoU를 예측 벡터와 실제 경계 상자의 좌상단/우하단 모서리 간의 제곱 거리의 페널티를 이미지 크기로 정규화하여 IoU에서 차감하는 형태로 정의합니다.
  • 축 정렬된 직사각형 간 MPDIoU를 계산하는 알고리즘을 제공하고, 경계 상자 회귀를 위한 MPDIoU 손실 L_MPDIoU = 1 - MPDIoU를 도출합니다.
  • 두 상자가 IoU가 같더라도 모서리 정렬이 다르면 MPDIoU가 구분할 수 있음을 보이고 회귀 가이던스를 개선합니다.
  • YOLOv7과 YOLACT에서 기본 회귀 손실을 L_MPDIoU로 교체하여 성능 향상을 평가합니다.
  • 모서리 좌표로부터 MPDIoU 구성 요소를 계산하기 위한 면적, 중심, 너비, 높이 등의 변환 공식과 계수를 확립합니다.

실험 결과

연구 질문

  • RQ1MPDIoU가 너비/높이가 다르고 종횡비가 같은 경계 상자들 사이에서 기존 IoU 기반 손실보다 더 정보에 풍부한 그래디언트를 제공할 수 있는가?
  • RQ2최첨단 검출기에서 MPDIoU를 통합하면 객체 검출, 인스턴스 세분화, 장면 텍스트 인식 벤치마크 전반의 위치 정확도와 수렴 속도가 향상되는가?
  • RQ3PASCAL VOC, MS COCO, IIIT5k, MTHv2와 같은 표준 데이터셋에서 MPDIoU의 성능은 GIoU, DIoU, CIoU, EIoU 대비 어떤가?
  • RQ4박스가 겹치지 않을 때 MPDIoU가 견고하며 더 촘촘하고 중복이 적은 예측을 유도하는가?

주요 결과

  • MPDIoU 기반 회귀가 VOC와 COCO의 YOLOv7 및 YOLACT에서 여러 IoU 기반 손실보다 정확도를 향상시켰습니다.
  • MPDIoU는 물체 검출, 문자 단위의 장면 텍스트 인식, 인스턴스 세분화에서 더 빠른 수렴과 더 높은 성능을 보여줍니다.
  • VOC, COCO, IIIT5k 및 MTHv2에 대한 실험에서 MPDIoU가 GIoU, DIoU, CIoU, EIoU 손실과 비교하여 유리한 결과를 제공합니다.
  • IoU가 0일 때에도 모서리 거리 페널티로 인해 MPDIoU 손실은 한정되고 정보성 그래디언트를 제공합니다.
  • 정리 정리 3.1에 따르면 종횡비가 일치할 때 Groundtruth 내부의 예측 박스는 외부의 박스보다 더 낮은 L_MPDIoU를 가지며 더 촘촘한 위치화를 선호합니다.
  • 경험적 결과는 MPDIoU가 평가된 작업들에서 AP75 및 관련 지표에 유의한 향상을 제공함을 시사합니다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.