[논문 리뷰] Optimizing Filter Size in Convolutional Neural Networks for Facial Action Unit Recognition
이 논문은 백프로파게이션 중 미분 가능 최적화를 통해 최적의 컨볼루션 필터 크기와 가중치를 동시에 학습하는 새로운 CNN 프레임워크인 최적화된 필터 크기 CNN(OFS-CNN)을 제안한다. 필터 크기를 연속 변수로 간주하고 상한/하한 경계 필터를 사용하여 보간함으로써, 고정된 다수의 필터 크기를 사용하는 모델보다 훨씬 빠른 추론 속도를 확보하면서도 상태최저 수준의 AU 인식 성능을 달성하며, 다양한 이미지 해상도에 적응할 수 있다.
Recognizing facial action units (AUs) during spontaneous facial displays is a challenging problem. Most recently, Convolutional Neural Networks (CNNs) have shown promise for facial AU recognition, where predefined and fixed convolution filter sizes are employed. In order to achieve the best performance, the optimal filter size is often empirically found by conducting extensive experimental validation. Such a training process suffers from expensive training cost, especially as the network becomes deeper. This paper proposes a novel Optimized Filter Size CNN (OFS-CNN), where the filter sizes and weights of all convolutional layers are learned simultaneously from the training data along with learning convolution filters. Specifically, the filter size is defined as a continuous variable, which is optimized by minimizing the training loss. Experimental results on two AU-coded spontaneous databases have shown that the proposed OFS-CNN is capable of estimating optimal filter size for varying image resolution and outperforms traditional CNNs with the best filter size obtained by exhaustive search. The OFS-CNN also beats the CNN using multiple filter sizes and more importantly, is much more efficient during testing with the proposed forward-backward propagation algorithm.
연구 동기 및 목표
- 자연스러운 얼굴 동작 단위(AU) 인식을 위한 기존 CNN에서의 최적화되지 않은 고정된 필터 크기 문제를 해결하기 위해.
- 다양한 이미지 해상도에 걸쳐 최적의 필터 크기를 찾기 위한 비용이 많이 드는 체계적 초모수 검색이 필요 없도록 하기 위해.
- 백프로파게이션 중 필터 크기와 컨볼루션 가중치를 동시에 최적화할 수 있는 미분 가능하고 종단 간 훈련이 가능한 방법을 개발하기 위해.
- 기존의 고정 또는 다수의 고정된 필터 크기를 사용하는 CNN보다 인식 정확도와 추론 효율성을 향상시키기 위해.
제안 방법
- 필터 크기를 이산 초모수가 아닌 연속적이고 미분 가능한 변수로 간주한다.
- 보간을 통해 연속적인 필터 크기로 컨볼루션을 근사하기 위해 상한 및 하한 정수 크기의 필터를 사용한다.
- 상한 및 하한 경계 필터의 출력값 간 가중치 보간을 통해 활성화를 계산하는 전방 전파를 적용한다.
- 백프로파게이션을 통해 손실 함수에 대한 필터 크기의 기울기를 유도함으로써, 확률적 경사 하강법을 통한 필터 크기의 반복 최적화를 가능하게 한다.
- 최적의 연속적 필터 크기가 변화할 경우 상한 및 하한 필터의 크기를 갱신하기 위한 변환 연산을 도입한다.
- 필터 가중치와 필터 크기를 동시에 갱신하는 공동 전방-역전파 알고리즘을 구현한다.
실험 결과
연구 질문
- RQ1종단 간 CNN 훈련 중에 필터 크기를 연속적이고 미분 가능한 변수로 효과적으로 최적화할 수 있는가?
- RQ2각 레이어에서 최적의 필터 크기를 학습하는 것이 고정 또는 다수의 고정된 필터 크기 대비 AU 인식 성능을 향상시키는가?
- RQ3제안된 방법이 자연스러운 AU 데이터베이스에서 최신 기술 수준의 CNN보다 더 높은 정확도와 빠른 추론 속도를 달성할 수 있는가?
- RQ4OFS-CNN은 다양한 입력 이미지 해상도 간에 얼마나 잘 일반화되는가?
- RQ5모델은 다양한 공간 척도의 AU 관련 얼굴 자극에 적합한 필터 크기를 자동으로 적응할 수 있는가?
주요 결과
- 256×192 해상도에서 BP4D 데이터베이스에서 OFS-CNN은 기준 CNN보다 평균 F1 스코어를 6% 높게 기록했으며, 체계적 검색을 통해 확보한 최적의 고정 필터 크기보다도 뛰어난 성능을 보였다.
- BP4D 데이터베이스에서 OFS-CNN은 평균 F1 스코어 53.7%를 기록했으며, 6.7배 더 많은 훈련 반복을 사용한 GoogLeNet(100층)의 53.1%를 초월했다.
- 128×96 이미지에서 OFS-CNN은 GoogLeNet보다 8배 이상 빠른 추론 속도를 보였고, 256×192 이미지에서는 6배 이상의 빠른 속도를 기록하여 뛰어난 효율성을 입증했다.
- DISFA 데이터베이스에서 OFS-CNN은 평균 F1 스코어 55.3%를 기록했으며, 기준 CNN(51.5%)을 뛰어나고, 최신 기술 수준의 방법들과 동등하거나 슈퍼어리어를 기록했다.
- OFS-CNN은 다양한 이미지 해상도에 대해 강건하게 작동하여 재학습 없이도 다양한 입력 척도에 적합한 필터 크기를 자동으로 학습함을 입증했다.
- OFS-CNN은 PL-CNN 및 ML-CNN을 포함한 이전의 CNN 기반 방법들을 모두 능가하는 최신 기술 수준의 성능을 달성했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.