[논문 리뷰] Producing augmentation-invariant embeddings from real-life imagery
이 논문은 CNN을 사용하여 ArcFace 학습, 앙상블 학습, 그리고 두 가지 쿼리 정규화 기법을 활용해 증강에 강인한 이미지 임베딩을 생성하는 새로운 방법을 제안한다. 합성 증강, 다중 스케일 백본, 점진적 학습 전략을 활용함으로써, 이 방법은 페이스북 AI 이미지 유사도 챌린지에서 2차 시험에서 0.59의 마이크로-평균 정밀도를 기록하여 2위를 차지했다.
This article presents an efficient way to produce feature-rich, high-dimensionality embedding spaces from real-life images. The features produced are designed to be independent from augmentations used in real-life cases which appear on social media. Our approach uses convolutional neural networks (CNN) to produce an embedding space. An ArcFace head was used to train the model by employing automatically produced augmentations. Additionally, we present a way to make an ensemble out of different embeddings containing the same semantic information, a way to normalize the resulting embedding using an external dataset, and a novel way to perform quick training of these models with a high number of classes in the ArcFace head. Using this approach we achieved the 2nd place in the 2021 Facebook AI Image Similarity Challenge: Descriptor Track.
연구 동기 및 목표
- 소셜 미디어에서 흔히 볼 수 있는 실생활 이미지 증강에 강인한 임베딩 공간을 개발하는 것.
- 대규모 이미지 유사도 벤치마크에서 클래스 불균형과 참조 데이터 접근성 제한 문제를 해결하는 것.
- 실제 이미지에서 파생된 합성 증강을 활용해 학습함으로써 모델의 일반화 능력을 향상시키는 것.
- 외부 학습 데이터를 사용해 쿼리 임베딩을 정규화하여 유사도 점수 일관성을 향상시키는 것.
- 2021년 페이스북 AI 이미지 유사도 챌린지 디스크립터 트랙에서 최고 성능을 달성하는 것.
제안 방법
- 실제 이미지에서 유도된 합성 증강을 사용해, 다양한 백본(효율넷V2, NFNet)을 ArcFace 헤드와 함께 학습시켜 훈련 다양성을 높였다.
- 학습 가능한 p 파라미터를 가진 일반화된 평균 풀링(GeM)을 적용한 후, 편향이 없는 선형층을 거쳐 256D 임베딩을 생성했다.
- 최종 임베딩에 L2 정규화를 적용하여 단위 벡터 표현을 확보하고, 유사도 계산을 향상시켰다.
- ArcFace 헤드의 클래스 수를 점진적으로 증가시키는 점진적 학습 전략을 적용해 수렴 속도를 높이고 일반화 성능을 향상시켰다.
- 두 가지 쿼리 정규화 방법을 제안했다: (1) 가장 가까운 훈련 샘플들로부터 임베딩을 단위 구면에서 멀어지게 스케일링하고, (2) 100개 이내의 가장 가까운 훈련 임베딩들로부터 평균 방향으로 이동시켜 임베딩을 이격시키는 방식이다.
- 다양한 백본과 입력 크기를 가진 모델들을 앙상블 평균화하여 통합했으며, 외부 데이터셋(ImageNet, Deepfake Detection)을 활용해 훈련 데이터를 풍부화시켰다. 다만 후자는 중복성과 훈련 불안정성으로 인해 후에 기각되었다.
실험 결과
연구 질문
- RQ1딥 러닝 모델이 다양한 실생활 이미지 증강에 강인한 이미지 임베딩을 생성할 수 있는가?
- RQ2심각한 클래스 불균형과 참조 데이터 접근 제한 조건 하에서 모델의 일반화 능력을 어떻게 향상시킬 수 있는가?
- RQ3유사도 점수가 다양한 증강에 걸쳐 일관성을 유지하기 위해 쿼리 임베딩을 최적의 방식으로 정규화하는 방법은 무엇인가?
- RQ4앙상블 학습과 대규모 ArcFace 헤드를 활용한 점진적 학습 전략이 대규모 이미지 유사도 작업에서 성능을 크게 향상시킬 수 있는가?
- RQ5얼굴 콘텐츠를 포함한 외부 데이터셋을 사용하면 얼굴 관련 이미지 증강에 대해 임베딩 품질이 향상되는가?
주요 결과
- 제안된 방법은 페이스북 AI 이미지 유사도 챌린지 2차 시험에서 0.59의 마이크로-평균 정밀도(μAP)를 기록하여 2위를 달성했다.
- 쿼리 정규화 방법 2번—100개 이내의 가장 가까운 훈련 임베딩들로부터 평균 방향으로 이동시키는 방식—을 적용함으로써, 2차 시험에서 μAP가 0.53에서 0.59로 향상되었다.
- 클래스 수를 점진적으로 증가시키는 점진적 학습 전략을 통해 고정밀도 작업에서 수렴 속도가 빨라지고 일반화 성능이 향상되었다.
- 다양한 백본과 입력 크기를 가진 다수의 모델을 앙상블한 결과, 개별 모델보다 뛰어난 성능을 기록하여 모델 다양성의 효과를 입증했다.
- ImageNet과 같은 외부 데이터셋은 훈련 데이터 다양성을 향상시켰지만, Deepfake Detection 데이터셋은 높은 중복성과 훈련 안정성 악화로 인해 결국 기각되었다.
- 최종 모델는 훈련 중 参고 데이터셋을 사용할 수 없음에도 불구하고, 예상치 못한 증강에 대해 강력한 일반화 능력을 보여주어 높은 성능을 달성했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.