Skip to main content
QUICK REVIEW

[논문 리뷰] LLA: Loss-aware Label Assignment for Dense Pedestrian Detection

Zheng Ge, Jianfeng Wang|arXiv (Cornell University)|2021. 01. 12.
Advanced Neural Network Applications참고 문헌 39인용 수 9
한 줄 요약

이 논문은 밀도 높은 보행자 검출을 위한 새로운 레이블 할당 전략인 LLA(Loss-aware Label Assignment)를 제안한다. LLA는 앵커와 진짜 박스 간의 분류 및 회귀 손실을 종합적으로 고려하여 양성 앵커를 할당한다. 각 GT에 대해 가장 낮은 종합 손실을 가진 앵커를 선택함으로써, 수작업으로 설정한 사전 지식에 의존하지 않고도 검출기 성능을 햖थ하다. RetinaNet과 FCOS를 사용하여 각각 CrowdHuman과 CityPersons에서 MR(평균 재현율)를 9.53%와 5.47% 향상시켰다.

ABSTRACT

Label assignment has been widely studied in general object detection because of its great impact on detectors' performance. However, none of these works focus on label assignment in dense pedestrian detection. In this paper, we propose a simple yet effective assigning strategy called Loss-aware Label Assignment (LLA) to boost the performance of pedestrian detectors in crowd scenarios. LLA first calculates classification (cls) and regression (reg) losses between each anchor and ground-truth (GT) pair. A joint loss is then defined as the weighted summation of cls and reg losses as the assigning indicator. Finally, anchors with top K minimum joint losses for a certain GT box are assigned as its positive anchors. Anchors that are not assigned to any GT box are considered negative. Loss-aware label assignment is based on an observation that anchors with lower joint loss usually contain richer semantic information and thus can better represent their corresponding GT boxes. Experiments on CrowdHuman and CityPersons show that such a simple label assigning strategy can boost MR by 9.53% and 5.47% on two famous one-stage detectors - RetinaNet and FCOS, respectively, demonstrating the effectiveness of LLA.

연구 동기 및 목표

  • 높은 음영과 밀도 높은 객체 배치로 인해 기존 방법이 어려움을 겪는 밀도 높은 보행자 검출(DPD)에 특화된 레이블 할당 전략의 부재를 해결한다.
  • 기존의 IoU 또는 기하학적 중심 기반 레이블 할당이 음영 지역에서 특징이 정렬되지 않아 군중 상황에서 실패함을 규명한다.
  • 고정된 공간적 또는 척도 사전 지식(예: FPN, ATSS, FCOS)에 의존하지 않고, 모델 예측에 동적으로 적응하는 레이블 할당 메커니즘을 제안한다.
  • 앵커와 진짜 박스 간의 종합 손실을 최소화하는 것을 주요 할당 기준으로 삼아, 밀도 높은 보행자 데이터셋에서 검출기 성능을 향상시킨다.

제안 방법

  • 학습 중 각 앵커-GT 쌍에 대해 분류(cls) 및 회귀(reg) 손실을 계산한다.
  • 앵커가 GT 박스를 얼마나 잘 표현하는지 측정하기 위해 cls 및 reg 손실의 가중 합으로 종합 손실을 정의한다.
  • 앵커 중심이 어느 GT 박스 내부에 포함되지 않을 경우 이를 처벌하는 '박스 내부' 제약 조건 $C^{inbox}$ 을 도입하여 최소한의 공간 일致성을 확보한다.
  • 각 GT에 대해 종합 손실이 가장 낮은 상위 $K$개의 앵커를 양성으로 할당하고, 할당되지 않은 앵커는 음성으로 레이블링한다.
  • 모든 수작업으로 설정한 사전 지식(예: 중심 또는 척도 제약 조건)을 폐기하여 모델 예측에 완전히 적응하는 방법을 확보한다.
  • 아키텍처 수정 없이 앵커 기반(예: RetinaNet) 및 앵커 없는(예: FCOS) 검출기 모두에 적용 가능하다.

실험 결과

연구 질문

  • RQ1모델 예측 손실 기반 레이블 할당 전략이 기존 IoU 또는 중심 기반 할당 전략보다 밀도 높은 보행자 검출에서 더 우수한 성능을 낼 수 있는가?
  • RQ2손실 인지 할당 전략이 음영 처리된 보행자 검출에서 잘못된 분류 및 잘못된 위치 할당 오류를 줄일 수 있는가?
  • RQ3LLA는 추가 구성 요소 없이도 CrowdHuman 및 CityPersons와 같은 벤치마크 데이터셋에서 얼마나 높은 성능 향상을 이룰 수 있는가?
  • RQ4LLA는 ATSS나 FreeAnchor과 같은 최신 레이블 할당 방법에 비해 음영에 대한 강건성에서 뛰어난가?
  • RQ5중심 기반 감독(예: Centerness)을 사용하지 않을 경우에도 LLA는 높은 성능을 유지할 수 있는가?

주요 결과

  • RetinaNet에 적용했을 때 LLA는 CrowdHuman에서 MR를 9.53% 향상시켜 모든 기준 레이블 할당 전략을 초월한다.
  • FCOS에 적용했을 때 LLA는 CrowdHuman에서 MR를 5.47% 향상시켜 다양한 검출기 아키텍처 간의 우수한 일반화 능력을 입증한다.
  • CityPersons에서 LLA는 Reasonable 서브셋에서 기존 방법 대비 MR을 2.22% 감소시키고, Heavy Occlusion 서브셋에서는 3.10% 감소시켰다.
  • ATSS가 Centerness 브랜치를 사용하더라도 LLA는 그 성능을 뛰어넘으며, 보조 감독 없이도 동일한 우월성을 유지한다.
  • 시각화 결과, LLA에서 양성 앵커가 훈련 과정에서 GT 박스의 전경 쪽으로 이동하는 경향을 보이며, 더 나은 특징 정렬을 의미한다.
  • IoU 브랜치나 GroupNorm과 같은 추가 구성 요소 없이도 LLA는 최신 기술 수준의 성능을 달성하여 단순성에 기반한 효과성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.