[논문 리뷰] Killing Two Birds with One Stone:Efficient and Robust Training of Face Recognition CNNs by Partial FC
이 논문은 표면 기반 소프트맥스 손실을 계산하기 위해 각 훈련 반복에서 음성 클래스 중심점의 부분 집합과 양성 중심점만 선택하는 희소 업데이트가 이루어지는 부분 완전 연결(FC)인 PFC를 제안한다. 계산 비용을 크게 줄임으로써 상호 클래스 갈등과 꼬리 클래스에 대한 수동 업데이트를 감소시켜, WebFace42M와 같은 대규모 데이터셋에서 얼굴 인식 모델의 효율적이고 견고하며 정확한 훈련을 가능하게 한다. 이로써 훈련 속도가 최대 5배 빨라지고 GPU 메모리 사용량이 50% 감소하면서도 IJB-C에서 최고 성능(98.00%)을 달성한다.
Learning discriminative deep feature embeddings by using million-scale in-the-wild datasets and margin-based softmax loss is the current state-of-the-art approach for face recognition. However, the memory and computing cost of the Fully Connected (FC) layer linearly scales up to the number of identities in the training set. Besides, the large-scale training data inevitably suffers from inter-class conflict and long-tailed distribution. In this paper, we propose a sparsely updating variant of the FC layer, named Partial FC (PFC). In each iteration, positive class centers and a random subset of negative class centers are selected to compute the margin-based softmax loss. All class centers are still maintained throughout the whole training process, but only a subset is selected and updated in each iteration. Therefore, the computing requirement, the probability of inter-class conflict, and the frequency of passive update on tail class centers, are dramatically reduced. Extensive experiments across different training data and backbones (e.g. CNN and ViT) confirm the effectiveness, robustness and efficiency of the proposed PFC. The source code is available at \https://github.com/deepinsight/insightface/tree/master/recognition.
연구 동기 및 목표
- 표준 완전 연결(FC) 레이어를 사용해 수백만 개의 신원을 가진 깊은 얼굴 인식 모델을 훈련시킬 때 발생하는 높은 메모리 및 계산 비용 문제를 해결하기 위해.
- 자동으로 수집된 대규모 데이터셋인 WebFace42M와 같이 레이블 노이즈와 상호 클래스 갈등이 발생하여 모델 성능이 떨어지는 문제를 완화하기 위해.
- 긴 꼬리 분포에서 부족한 클래스 중심점에 대한 수동 업데이트 빈도를 줄이기 위해.
- 모델 정확도를 희생시키지 않고 단일 GPU 환경에서도 효율적인 훈련을 가능하게 하기 위해.
- 주요 벤치마크에서 훈련 비용을 크게 낮추면서도 최고 성능을 달성하기 위해.
제안 방법
- PFC는 훈련 전반에 걸쳐 전체 클래스 중심점을 유지하지만, 각 반복에서 샘플링된 부분 집합만 업데이트한다.
- 각 순전파에서 진짜 레이블에 기반해 양성 클래스 중심점을 선택하고, 손실 계산을 위해 음성 클래스 중심점의 무작위 부분 집합을 선택한다.
- 마진 기반 소프트맥스 손실은 선택된 양성 및 음성 중심점에 대해서만 계산되며, 이로 인해 계산 복잡도가 O(N)에서 rN으로 감소한다. 여기서 r은 샘플링 비율이다.
- 전체 클래스 중심점은 유지되며, 샘플링된 부분 집합에 대해서만 업데이트되어 모델의 안정성과 수렴성을 보장한다.
- 레이블 노이즈 상황에서도 추가로 강화된 견고성을 확보하기 위해 단순한 온라인 이상 상호 클래스 필터링 메커니즘이 적용된다.
- 이 방법은 CNN 및 비전 트랜스포머(ViT)를 포함한 다양한 백본 아키텍처와 호환된다.
실험 결과
연구 질문
- RQ1희소 업데이트가 이루어지는 완전 연결 레이어는 성능 저하 없이 대규모 얼굴 인식 훈련의 비용을 줄일 수 있는가?
- RQ2음성 클래스 중심점의 부분 샘플링은 레이블 노이즈와 상호 클래스 갈등에 대한 모델의 견고성에 어떤 영향을 미치는가?
- RQ3PFC는 WebFace42M와 같은 대규모 데이터셋에서 GPU 메모리 사용량과 훈련 시간을 얼마나 줄일 수 있는가?
- RQ4기존의 샘플링 기반 또는 FC 없는 방법과 비교해 PFC는 긴 꼬리 분포 데이터에서 어떻게 성능을 내는가?
- RQ5PFC는 IJB-C와 CFP-FP와 같은 주요 벤치마크에서 최고 성능을 달성하면서도 단일 노드 훈련을 가능하게 할 수 있는가?
주요 결과
- ResNet100을 사용해 WebFace42M에서 훈련한 PFC-0.1은 MFR-All에서 96.19%의 검증 정확도를 기록하며, FC 기준선 및 다른 샘플링 방법을 초월한다.
- ResNet100을 사용한 PFC-0.008는 IJB-C에서 거의 무시할 수 없는 FC 계산 비용으로 97.51%의 정확도를 달성하여 극도로 효율적임을 입증한다.
- 1000만 개의 신원을 가진 합성 데이터셋에서 PFC-0.1은 FC 기준선 대비 5배 빠른 훈련 속도를 기록했으며, GPU 메모리 사용량도 절반 이하로 줄였다.
- PFC-0.2는 긴 꼬리 분포 하에서 MFR-All에서 91.96%의 정확도를 기록했으며, FC 기준선보다 4.52% 높고 DCQ보다 2.59% 높다.
- PFC-0.3은 IJB-C에서 98.00%의 정확도와 CFP-FP에서 99.51%의 정확도를 기록하여 여러 벤치마크에서 새로운 최고 성능을 수립했다.
- r=0.04로 WebFace4M에서 훈련한 PFC 모델은 Virtual FC보다 IJB-B에서 27.47% 높고 IJB-C에서 25.33% 높은 성능을 기록했으며, Virtual FC는 파라미터를 100배 이상 줄였음에도 불구하고.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.