Skip to main content
QUICK REVIEW

[논문 리뷰] Attention Control with Metric Learning Alignment for Image Set-based Recognition

Xiaofeng Liu, Zhenhua Guo|arXiv (Cornell University)|2019. 08. 05.
Face recognition and analysis참고 문헌 62인용 수 9
한 줄 요약

이 논문은 이미지 세트 기반 얼굴 인식을 위한 강화학습 기반의 주의 제어 프레임워크인 DAC를 제안하며, 마르코프 결정 과정(MDP)을 통해 이미지 간 상호의존성을 모델링하고, 액터-크리틱 학습을 이용해 동적으로 주의 가중치를 할당한다. 이는 IJB-A/B/C 및 YTF 데이터셋에서 최신 기준 성능을 달성하며, 冗餘를 줄이고 다양한 고품질 이미지를 활용하여 식별 작업에서 최대 8.68% 높은 Rank-1 정확도를 기록한다.

ABSTRACT

This paper considers the problem of image set-based face verification and identification. Unlike traditional single sample (an image or a video) setting, this situation assumes the availability of a set of heterogeneous collection of orderless images and videos. The samples can be taken at different check points, different identity documents $etc$. The importance of each image is usually considered either equal or based on a quality assessment of that image independent of other images and/or videos in that image set. How to model the relationship of orderless images within a set remains a challenge. We address this problem by formulating it as a Markov Decision Process (MDP) in a latent space. Specifically, we first propose a dependency-aware attention control (DAC) network, which uses actor-critic reinforcement learning for attention decision of each image to exploit the correlations among the unordered images. An off-policy experience replay is introduced to speed up the learning process. Moreover, the DAC is combined with a temporal model for videos using divide and conquer strategies. We also introduce a pose-guided representation (PGR) scheme that can further boost the performance at extreme poses. We propose a parameter-free PGR without the need for training as well as a novel metric learning-based PGR for pose alignment without the need for pose detection in testing stage. Extensive evaluations on IJB-A/B/C, YTF, Celebrity-1000 datasets demonstrate that our method outperforms many state-of-art approaches on the set-based as well as video-based face recognition databases.

연구 동기 및 목표

  • 순서가 지정되지 않은 이질적인 이미지 및 영상 세트에서 얼굴 인식의 관계를 모델링하는 데 도전하는 것.
  • 기존 주의 메커니즘은 세트의 맥락을 고려하지 않고 이미지 중요도를 독립적으로 처리함으로써 발생하는 중복성과 비효율성을 해결하는 것.
  • 세트 기반 얼굴 검증 및 식별을 위한 확장 가능하고 종단 간(end-to-end) 방법을 개발하여 내부 세트 및 세트 간 관계를 모두 포착하는 것.
  • 추론 시 자세 검출이 필요 없이 극단적인 자세에서도 성능을 향상시키는 자세 유도 표현 기법을 도입하는 것.
  • IJB-A, IJB-B, IJB-C 및 YTF를 포함한 벤치마크 데이터셋에서 최신 기준 성능을 달성하는 것.

제안 방법

  • 잠재 공간에서 이미지 세트 주의 제어를 마르코프 결정 과정(MDP)으로 공식화하여, 세트 내 이미지에 대한 순차적 의사결정을 가능하게 한다.
  • 이미지 간 상관관계를 바탕으로 동적 주의 가중치를 할당하기 위해, 액터-크리틱 딥 강화학습을 활용한 의존성 인식 주의 제어(DAC) 네트워크를 제안한다.
  • 강화학습 프레임워크 내에서 학습을 가속화하고 샘플 효율성을 향상시키기 위해 오프-폴리시 경험 재생을 활용한다.
  • 영상 입력을 위해 RNN 또는 TempConv를 통한 시간적 모델링을 통합하고, 프레임 수준 주의와 시퀀스 수준 표현을 결합하기 위한 분할-통합 전략을 사용한다.
  • 파라미터가 없는 자세 유도 표현(PGR)과 메트릭 학습 기반 PGR을 도입하여, 자세 추정 없이 극단적인 자세에서 특징을 정렬한다.
  • 메트릭 학습을 통해 다양한 자세 간 특징를 정렬하여, 추가 학습이나 검출 없이도 자세 변화에 대한 강건성을 향상시킨다.

실험 결과

연구 질문

  • RQ1강화학습이 순서가 지정되지 않은 이미지 세트에서 얼굴 인식을 위한 이미지 간 상호의존성을 효과적으로 모델링하는 데 적용될 수 있는가?
  • RQ2독립적인 품질 기반 가중치 할당과 비교해, 맥락적 이미지 관계 기반 주의 제어가 정확도 향상에 어떻게 기여하는가?
  • RQ3파라미터가 없고 메트릭 학습 기반의 PGR 기법이 자세 검출 없이 극단적인 자세에서도 성능 향상에 기여할 수 있는가?
  • RQ4DAC 프레임워크는 검증 및 대규모 식별과 같은 다양한 인식 작업에 일반화되는가?
  • RQ5오프-폴리시 학습과 시간적 모델링은 주의 메커니즘의 성능과 수렴에 어떤 영향을 미치는가?

주요 결과

  • IJB-C 데이터셋에서 DAC(off)/TempConv&ML-PGR 방법은 이전 최신 기준 방법 [70] 대비 FAR=1e-5에서 진짜 수락률(TAR)이 6.4% 향상되었다.
  • IJB-B 데이터셋에서, 이 방법은 양방향 LSTM 기반 방법 [55] 대비 4% 향상된 Rank-1 식별 정확도를 기록했으며, Rank-1 정확도는 94.0%였다.
  • 폐쇄 세트 식별에서, DAC 방법은 기준 방법 대비 1000개의 아이덴티티 설정에서 Rank-1 정확도를 8.68% 향상시켰다.
  • DAC의 연속적 행동 공간은 모든 데이터셋에서 이산적(제거/유지) 기반 베이스라인 대비 큰 격차를 보이며, 세밀한 주의 제어의 이점을 입증한다.
  • 오프-폴리시 학습은 더 빠른 수렴과 더 안정적인 학습을 이끌었으며, 모든 벤치마크 데이터셋에서 일관된 성능 향상을 보였다.
  • 제안된 메트릭 학습 기반 PGR은 자세 검출 없이도 뛰어난 성능을 달성했으며, 극단적인 자세 변화를 효과적으로 다루는 데에 유용함을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.