[논문 리뷰] Facial Action Unit Detection via Adaptive Attention and Relation
이 논문은 얼굴 동작 단위(AU) 검출을 위한 적응형 주의 및 관계(AAR) 프레임워크를 제안한다. 이 프레임워크는 적응형 주의 회귀 네트워크를 통해 랜드마크 유도 국소 주의와 학습 가능한 전역 주의를 융합하며, 적응형 그래프 컨볼루션 네트워크를 통해 AU별 공간-시간적 의존성을 모델링한다. 이 방법은 제약 조건이 있는(BP4D, DISFA, GFT) 및 없는(Aff-Wild2) 벤치마크에서 정확한 지역 상관관계 학습과 AU 동적 특성 처리를 통해 최신 기술 수준(SOTA) 성능을 달성한다.
Facial action unit (AU) detection is challenging due to the difficulty in capturing correlated information from subtle and dynamic AUs. Existing methods often resort to the localization of correlated regions of AUs, in which predefining local AU attentions by correlated facial landmarks often discards essential parts, or learning global attention maps often contains irrelevant areas. Furthermore, existing relational reasoning methods often employ common patterns for all AUs while ignoring the specific way of each AU. To tackle these limitations, we propose a novel adaptive attention and relation (AAR) framework for facial AU detection. Specifically, we propose an adaptive attention regression network to regress the global attention map of each AU under the constraint of attention predefinition and the guidance of AU detection, which is beneficial for capturing both specified dependencies by landmarks in strongly correlated regions and facial globally distributed dependencies in weakly correlated regions. Moreover, considering the diversity and dynamics of AUs, we propose an adaptive spatio-temporal graph convolutional network to simultaneously reason the independent pattern of each AU, the inter-dependencies among AUs, as well as the temporal dependencies. Extensive experiments show that our approach (i) achieves competitive performance on challenging benchmarks including BP4D, DISFA, and GFT in constrained scenarios and Aff-Wild2 in unconstrained scenarios, and (ii) can precisely learn the regional correlation distribution of each AU.
연구 동기 및 목표
- 고정된 국소 주의 맵과 노이즈가 많은 전역 주의의 한계를 해결하기 위해.
- 공유되는 관계 패턴을 넘어서 동적이고 AU별로 특화된 공간적 및 시간적 의존성을 모델링하기 위해.
- 실세계의 표정에서 정렬 불량과 가림 현상에 대한 강건성을 향상시키기 위해.
- 엄격한 사전 지식에 의존하지 않고 각 AU에 대해 정밀한 지역 상관관계 분포를 학습하기 위해.
- 통합적이고 적응형 주의 학습 메커니즘 내에서 국소적 및 전역적 의존성을 통합하기 위해.
제안 방법
- 적응형 주의 회귀 네트워크는 랜드마크 기반 사전 정의 주의와 특징 기반 정밀 조정을 조합하여 각 AU에 대한 주의 맵을 학습함으로써 국소적 및 전역적 의존성을 모두 포괄한다.
- 네트워크는 AU 검출에 대한 지도 하에 주의 맵을 예측하는 회귀 헤드를 사용하여 샘플별로 동적으로 적응할 수 있도록 한다.
- 적응형 공간-시간 그래프 컨볼루션 네트워크는 학습 가능한, AU 인식 그래프 구조를 사용하여 AU별 패턴, 상호-AU 의존성, 시간적 동적 특성을 모델링한다.
- 그래프 구조는 각 AU별로 동적으로 업데이트되며, 공유 파rameter 대신 서로 다른 추론 패턴을 허용한다.
- AU 검출과 주의 학습을 동시에 최적화하며, 주의 사전 정의가 불필요한 영역을 억제하는 정규화 역할을 한다.
- 이 방법은 제약 조건이 있는 및 없는 데이터셋에서 엔드 투 엔드로 훈련되며, 구성 요소 기여도를 검증하기 위한 추론 실험을 수행한다.
실험 결과
연구 질문
- RQ1랜드마크 사전 지식과 특징 기반 정밀 조정을 융합한 적응형 주의 학습이 AU 검출 정확도를 향상시킬 수 있는가?
- RQ2그래프 네트워크 내에서 AU별로 특화된 관계 추론이 공유 파rameter 기반 관계 모델보다 AU 검출에서 더 우수한 성능을 낼 수 있는가?
- RQ3국소적 및 전역적 주의의 통합이 각 AU에 대해 더 정밀한 지역 상관관계 학습을 이끌 수 있는가?
- RQ4실세계 설정에서 얼굴 정렬 불량과 가림 현상에 대해 제안된 방법이 얼마나 강건한가?
- RQ5적응형 그래프 네트워크가 순차적 얼굴 표정에서 상호-AU 의존성과 시간적 동적 특성을 효과적으로 모델링할 수 있는가?
주요 결과
- AAR 프레임워크는 제약 조건이 있는 및 없는 상황에서 BP4D, DISFA, GFT, Aff-Wild2 벤치마크에서 최신 기술 수준의 성능을 달성한다.
- 이 방법은 각 AU의 지역 상관관계 분포를 정밀하게 학습하여 주의 맵에서 관련 없는 영역을 효과적으로 억제한다.
- 추론 실험 결과, 적응형 주의 회귀 및 적응형 그래프 구성 요소가 모두 AU 검출 성능 향상에 크게 기여함을 확인한다.
- 시각화 결과, 학습된 주의 맵이 가림 또는 정렬 불량 조건에서도 AU 관련 영역를 정확히 국소화함을 보여주며, 이전의 적응형 방법보다 우수한 성능을 보인다.
- 사전 정의된 또는 완전히 학습된 주의에 의존하는 방법과 비교해 본 프레임워크는 랜드마크 정렬 불량과 부분적 가림에 대해 훨씬 뛰어난 강건성을 보인다.
- 적응형 그래프 네트워크는 AU별 패턴과 시간적 의존성을 성공적으로 포착하여 공유 파rameter 기반 관계 모델보다 성능 향상을 이룬다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.