[논문 리뷰] Enhancing Convolutional Neural Networks for Face Recognition with Occlusion Maps and Batch Triplet Loss
논문은 (1) 부분 가림에서 강인하게 작동하는 CNN을 학습시키기 위한 가림 지도 기반 데이터 증강과 (2) 평균 분리와 점수 분산을 모두 최소화하는 배치 트리플릿 손실을 제시하여 검증 성능을 향상시키고 LFW 및 가림 얼굴 데이터셋에서 이득을 보임을 보여준다.
Despite the recent success of convolutional neural networks for computer vision applications, unconstrained face recognition remains a challenge. In this work, we make two contributions to the field. Firstly, we consider the problem of face recognition with partial occlusions and show how current approaches might suffer significant performance degradation when dealing with this kind of face images. We propose a simple method to find out which parts of the human face are more important to achieve a high recognition rate, and use that information during training to force a convolutional neural network to learn discriminative features from all the face regions more equally, including those that typical approaches tend to pay less attention to. We test the accuracy of the proposed method when dealing with real-life occlusions using the AR face database. Secondly, we propose a novel loss function called batch triplet loss that improves the performance of the triplet loss by adding an extra term to the loss function to cause minimisation of the standard deviation of both positive and negative scores. We show consistent improvement in the Labeled Faces in the Wild (LFW) benchmark by applying both proposed adjustments to the convolutional neural network training.
연구 동기 및 목표
- 실생활 가림에서 견고한 얼굴 인식을 동기 부여하고 어떤 얼굴 부위가 CNN의 결정을 이끄는지 식별한다.
- 가림 민감도 맵으로 안내되는 가림 기반 데이터 증강을 도입하여 얼굴 부위 간 특성 학습의 균형을 맞춘다.
- 새로운 배치 트리플릿 손실을 제안하여 점수 분포의 차이와 분산을 제어함으로써 보지 못한 신원에 대한 일반화를 향상시킨다.
제안 방법
- 10개의 컨볼루션 레이어와 하나의 완전 연결 계층을 가진 CNN 구조를 분류기로 학습시켜 검증용 병목 특징을 얻는다.
- 가림 맵을 생성하기 위해 이미지 영역을 가리고 평균화하여 고 영향 얼굴 부위와 저 영향 부위를 식별한다.
- 가림 맵에서 도출된 확률 분포에 따라 가림기를 배치하여 고영향 부위를 강조하는 방식으로 학습을 증강한다.
- 병목 특징을 미세 조정하기 위해 평균 분리(트리플릿 손실 항)와 양성/음성 점수의 분산 항을 결합한 새로운 배치 트리플릿 손실을 적용한다(식 9).
- 훈련 중 정보를 제공하는 삼중 샘플(anchor, positive, negative)을 선택하는 온라인 트리플릿 샘플링을 도입한다.
실험 결과
연구 질문
- RQ1가림 인지 데이터 증강이 제약되지 않은 설정에서 CNN의 부분 얼굴 가림에 대한 강건성을 향상시킬 수 있는가?
- RQ2양성/음성 분포 간의 여백과 분산을 모두 최소화하는 배치 트리플릿 손실이 표준 벤치마크에서 검증 성능을 향상시키는가?
- RQ3가림 인지 학습 방식이 무작위 가림 증강과 비교해 실제 가림에 대한 일반화에 어떤 차이가 있는가?
주요 결과
- 가림 인지 학습은 전략적으로 배치된 가림기를 사용했을 때 평균 정확도를 향상시키고 가림 위치 간 변동성을 줄이는 데 기여한다(베이스라인 및 무작위 가림 방식 대비).
- 가림 맵은 얼굴 중앙 부위가 높은 영향 영역임을 나타내며, 표적 증강은 모델이 외곽 얼굴 부위에서도 구별 가능한 특징을 학습하게 한다.
- AR 얼굴 데이터베이스에서 가림 데이터로 학습한 모델은 베이스라인보다 우수하며, 특히 낮은 허용오류율에서 더 큰 이점을 보이고, 중간 가림기가 최상의 전반 성능을 제공하는 경우가 많다.
- LFW에서 배치 트리플릿 손실로 미세 조정된 모델(C)은 표준 트리플릿 손실로 학습된 모델(B)보다 일관되게 우수한 성능을 보인다.
- 가림 인지 미세 조정과 배치 트리플릿 손실의 결합은 가림 여부에 상관없이 베이스라인 대비 향상을 이끈다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.