[논문 리뷰] HIH: Towards More Accurate Face Alignment via Heatmap in Heatmap
이 논문은 얼굴 정렬에서 양자화 오차를 줄이기 위해 정수 좌표와 부분픽셀 좌표를 동시에 모델링하는 새로운 히트맵 인 히트맵(HIH) 표현을 제안한다. 이는 두 개의 중첩된 히트맵—정수 히트맵과 소수점 히트맵—을 통해 이루어지며, 부분픽셀 회귀를 분포 인식 소프트 손실을 사용한 간격 분류로 재구성함으로써 최신 기술 수준의 성능을 달성한다. WFLW에서 4.08 NME, COFW에서 3.21 NME의 성능을 기록한다.
Heatmap-based regression overcomes the lack of spatial and contextual information of direct coordinate regression, and has revolutionized the task of face alignment. Yet it suffers from quantization errors caused by neglecting subpixel coordinates in image resizing and network downsampling. In this paper, we first quantitatively analyze the quantization error on benchmarks, which accounts for more than 1/3 of the whole prediction errors for state-of-the-art methods. To tackle this problem, we propose a novel Heatmap In Heatmap(HIH) representation and a coordinate soft-classification (CSC) method, which are seamlessly integrated into the classic hourglass network. The HIH representation utilizes nested heatmaps to jointly represent the coordinate label: one heatmap called integer heatmap stands for the integer coordinate, and the other heatmap named decimal heatmap represents the subpixel coordinate. The range of a decimal heatmap makes up one pixel in the corresponding integer heatmap. Besides, we transfer the offset regression problem to an interval classification task, and CSC regards the confidence of the pixel as the probability of the interval. Meanwhile, CSC applying the distribution loss leverage the soft labels generated from the Gaussian distribution function to guide the offset heatmap training, which makes it easier to learn the distribution of coordinate offsets. Extensive experiments on challenging benchmark datasets demonstrate that our HIH can achieve state-of-the-art results. In particular, our HIH reaches 4.08 NME (Normalized Mean Error) on WFLW, and 3.21 on COFW, which exceeds previous methods by a significant margin.
연구 동기 및 목표
- 최신 기술 수준의 얼굴 정렬 방법에서 양자화 오차가 미치는 영향을 정량화하는 것.
- 네트워크의 다운샘플링 과정에서 부분픽셀 좌표가 손실되는 정밀도 손실을 해결하는 것.
- 정수 좌표와 부분픽셀 좌표를 동시에 모델링하는 학습 가능한 엔드 투 엔드 솔루션을 제안하는 것.
- 부분픽셀 추정을 회귀에서 간격 분류로 전환하고 소프트 레이블을 사용함으로써 정밀도를 향상시키는 것.
- 후처리나 수동 설계에 의존하지 않고도 최신 기술 수준의 정확도를 달성하는 것.
제안 방법
- HIH는 정수 히트맵(가장 가까운 픽셀을 위한)과 소수점 히트맵(해당 픽셀 내의 부분픽셀 오프셋을 위한)이라는 이중 히트맵 표현을 사용한다.
- 소수점 히트맵은 정수 히트맵의 한 픽셀에 공간적으로 정렬되어 있으며, 해당 픽셀 내 상대적 위치를 확률 분포로 표현한다.
- 좌표 소프트 분류(CSC)는 소수점 히트맵의 각 격자를 이산적인 간격 카테고리로 간주하고, 해당 간격의 확률을 신뢰도로 표현한다.
- 소프트 레이블은 가우시안 함수로부터 유도되며, 부분픽셀 오프셋 예측의 최적화를 향상시킨다.
- 이 방법은 아워글래스 네트워크 아키텍처에 원활하게 통합되어 표준 히트맵 기반 학습과의 호환성을 유지한다.
- 최종 랜드마크 예측은 정수 히트맵의 최고점에서 유도된 정수 좌표와 소수점 히트맵의 확률 분포에서 유도된 부분픽셀 오프셋을 조합함으로써 이루어진다.
실험 결과
연구 질문
- RQ1최신 기술 수준의 얼굴 정렬 모델에서 다운샘플링으로 인해 발생하는 양자화 오차는 얼마나 심각한가?
- RQ2중첩된 히트맵 표현이 표준 히트맵 회귀를 초월해 부분픽셀 정확도를 향상시킬 수 있는가?
- RQ3부분픽셀 회귀를 소프트 레이블이 있는 간격 분류로 전환하면 일반화 능력과 정밀도가 향상되는가?
- RQ4제안된 HIH 방법은 기존의 오프셋 기반 또는 소프트 아르맥스 접근법과 비교해 정확도와 엔드 투 엔드 학습 가능성 측면에서 어떻게 다른가?
- RQ5제안된 방법은 후처리나 수동 설계에 의존하지 않고도 최신 기술 수준의 성능을 달성할 수 있는가?
주요 결과
- 최신 기술 수준의 얼굴 정렬 방법에서 양자화 오차는 총 예측 오차의 1/3 이상을 차지하며, 표준 256×256에서 64×64로의 다운샘플링 조건에서 WFLW에서 1.285, 300W에서 1.111의 NME 기여도를 보였다.
- HIH는 WFLW 벤치마크에서 4.08 NME를 기록하며 새로운 최신 기술 수준의 결과를 달성했다.
- COFW 데이터셋에서는 3.21 NME를 기록하여 이전 방법들에 비해 상당한 향상을 이룬다.
- 절단 분석 결과, HIH 표현과 좌표 소프트 분류 손실의 조합이 가장 뚜렷한 정확도 향상을 이끌어냈다.
- 특히 양자화 효과가 가장 심각한 저해상도 히트맵 환경에서, DARK, HRNet, SLPT와 같은 기존 기준 모델들보다 HIH가 뛰어난 성능을 보였다.
- WFLW, COFW, 300W를 포함한 다양한 벤치마크에서의 강건성은 이 방법의 일반화 능력을 확인한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.