[논문 리뷰] ACFD: Asymmetric Cartoon Face Detector
ACFD는 만화 얼굴 검출을 위한 새로운 일단계형 앵커 기반 검출기로, 극단적인 자세, 큰 종횡비 변동성, 높은 분류 난이도를 다루기 위해 고유한 백본(VoVNetV3), 비대칭 이중방향 특징 피라미드 네트워크(ABi-FPN), 동적 앵커 매칭(DAM), 마진 이진 분류(MBC)를 도입하였다. 2020년 iCartoon Face 챌린지에서 200MB 모델 크기 및 50ms 추론 시간 제약 조건 하에 92.91% mAP를 기록하여 1등을 차지하였다.
Cartoon face detection is a more challenging task than human face detection due to many difficult scenarios is involved. Aiming at the characteristics of cartoon faces, such as huge differences within the intra-faces, in this paper, we propose an asymmetric cartoon face detector, named ACFD. Specifically, it consists of the following modules: a novel backbone VoVNetV3 comprised of several asymmetric one-shot aggregation modules (AOSA), asymmetric bi-directional feature pyramid network (ABi-FPN), dynamic anchor match strategy (DAM) and the corresponding margin binary classification loss (MBC). In particular, to generate features with diverse receptive fields, multi-scale pyramid features are extracted by VoVNetV3, and then fused and enhanced simultaneously by ABi-FPN for handling the faces in some extreme poses and have disparate aspect ratios. Besides, DAM is used to match enough high-quality anchors for each face, and MBC is for the strong power of discrimination. With the effectiveness of these modules, our ACFD achieves the 1st place on the detection track of 2020 iCartoon Face Challenge under the constraints of model size 200MB, inference time 50ms per image, and without any pretrained models.
연구 동기 및 목표
- 극단적인 자세, 큰 종횡비 변동성(3 이상 또는 1/3 이하), 배경 또는 신체 부위와의 높은 유사성 등 만화 얼굴 검출의 고유한 과제를 해결한다.
- 실제 인간 얼굴보다 더 복잡한 만화 얼굴의 내부 클래스 변동성과 클래스 간 혼동에 강건한 검출기를 개발한다.
- 200MB 모델 크기 및 이미지당 50ms 이내 추론 시간 제약 조건을 충족하는 경량이고 효율적인 아키텍처를 설계한다.
- 만화 특성에 맞는 새로운 신경망 구성 요소를 통해 특징 표현, 회귀 및 분류 능력을 향상시킨다.
- 실제 배포 환경 조건 하에서 iCartoon Face 챌린지 검출 트랙에서 최고 성능(SOTA)을 달성한다.
제안 방법
- 다양한 수신장과 함께 다중 척도 특징을 추출하기 위해 비대칭 단일 스포트 집합 모듈(AOSA) 기반의 새로운 백본 네트워크인 VoVNetV3를 제안한다.
- 더 나은 의미 이해를 위해 다중 척도 특징을 융합하고 향상시키기 위해 비대칭 이중방향 특징 피라미드 네트워크(ABi-FPN)를 도입한다.
- 회귀된 바운딩 박스를 활용해 고품질 앵커를 동적으로 할당하는 동적 앵커 매칭(DAM) 전략을 설계하여 회귀 초기화를 향상시킨다.
- 최적의 마진(m=0.2)을 가진 마진 이진 분류(MBC) 손실을 적용하여 양성 얼굴와 부정 샘플 간의 분류 간극을 강화한다.
- 레이어 병합 및 TensorRT 변환을 포함한 모델 최적화 기법을 적용하여 추론 시간을 50ms 이내로 감소시킨다.
- 스트라이드 4에서 128까지의 특징 맵을 ABi-FPN에 입력하여 최종 예측을 수행하는 일단계 검출기 파이프라인을 사용한다.
실험 결과
연구 질문
- RQ1비대칭 컨볼루션 블록을 갖춘 맞춤형 백본이 만화 얼굴 검출의 특징 다양성과 표현 능력을 크게 향상시킬 수 있는가?
- RQ2비대칭 이중방향 특징 피라미드 네트워크(ABi-FPN)는 극단적인 자세와 종횡비를 가진 얼굴의 다중 척도 특징을 융합하고 향상시키는 데 얼마나 효과적인가?
- RQ3회귀된 박스를 활용한 동적 앵커 매칭 전략은 기존 IoU 기반 매칭 대비 회귀 성능 향상과 거짓 양성 감소에 기여하는가?
- RQ4마진 기반 분류 손실(MBC)은 음성 샘플이 풍부한 고밀도 예측 환경에서 분류 성능 향상에 기여하는가?
- RQ5아키텍처 혁신과 추론 최적화를 통해 200MB 모델 크기 및 50ms 추론 시간 제약 조건 하에서 얼마나 높은 SOTA 성능을 달성할 수 있는가?
주요 결과
- ACFD는 iCartoon Face 챌린지 랭킹에서 200MB 모델 크기 및 50ms 추론 시간 제약 조건 하에 92.91% mAP를 기록하여 1등을 차지하였다.
- 제거 실험 결과, ResNet50 기반 모델에 VoVNetV3, ABi-FPN, DAM, MBC를 모두 추가한 결과 다중 척도 테스트 시 mAP가 87.13%에서 90.94%로 상승하였다.
- 동적 앵커 매칭(DAM) 전략은 기준 앵커 할당 방식 대비 mAP를 1.3%p 향상시켜 87.65%에서 88.90%로 개선했다.
- m=0.2로 설정된 마진 이진 분류(MBC)가 가장 높은 mAP 90.73%를 기록하여 다른 마진 값과 표준 크로스 엔트로피 손실을 초월하였다.
- 레이어 병합 및 TensorRT 변환을 포함한 모델 최적화를 통해 추론 시간을 50ms 이내로 감소시켜 실시간 배포를 가능하게 하였다.
- 품질적인 예시(Fig. 4)에서 볼 수 있듯이, 종횡비가 3 이상 또는 1/3 이하인 어려운 케이스에서도 모델은 강력한 일반화 성능을 유지하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.