[논문 리뷰] When Human Pose Estimation Meets Robustness: Adversarial Algorithms and Benchmarks
이 논문은 정제된 데이터 정확도를 훼손하지 않으면서 이미지 손상에 대한 인간 자세 추정기의 강건성을 향상시키는 모델에 종속되지 않는 적대적 데이터 증강 방법인 AdvMix를 소개한다. 손상된 이미지의 적대적 혼합을 생성하는 생성기와 이를 학습하는 자세 추정기를 함께 훈련시키고, 교사 모델로부터 지식 정복을 적용함으로써, AdvMix는 COCO-C, MPII-C, OCHuman-C와 같은 손상된 벤치마크에서 성능을 크게 향상시키지만 추론 오버헤드가 발생하지 않는다.
Human pose estimation is a fundamental yet challenging task in computer vision, which aims at localizing human anatomical keypoints. However, unlike human vision that is robust to various data corruptions such as blur and pixelation, current pose estimators are easily confused by these corruptions. This work comprehensively studies and addresses this problem by building rigorous robust benchmarks, termed COCO-C, MPII-C, and OCHuman-C, to evaluate the weaknesses of current advanced pose estimators, and a new algorithm termed AdvMix is proposed to improve their robustness in different corruptions. Our work has several unique benefits. (1) AdvMix is model-agnostic and capable in a wide-spectrum of pose estimation models. (2) AdvMix consists of adversarial augmentation and knowledge distillation. Adversarial augmentation contains two neural network modules that are trained jointly and competitively in an adversarial manner, where a generator network mixes different corrupted images to confuse a pose estimator, improving the robustness of the pose estimator by learning from harder samples. To compensate for the noise patterns by adversarial augmentation, knowledge distillation is applied to transfer clean pose structure knowledge to the target pose estimator. (3) Extensive experiments show that AdvMix significantly increases the robustness of pose estimations across a wide range of corruptions, while maintaining accuracy on clean data in various challenging benchmark datasets.
연구 동기 및 목표
- 실제 세계의 이미지 손상 상황에서 인간 자세 추정기의 강건성을 평가하기 위한 철저한 벤치마크 부족 문제를 해결하기 위해.
- 최신 자세 추정기에서 훈련 중에 볼 수 없었던 새로운 손상에 대한 정제된 데이터 정확도와 강건성 사이의 상충 관계를 조사하기 위해.
- 다양한 손상 유형에 걸쳐 강건성을 향상시키면서도 정제된 데이터에서의 성능를 유지하는 모델에 종속되지 않는 방법을 개발하기 위해.
- 더 나은 일반화를 위해 데이터 증강 기법을 효과적으로 조합하는 방법을 탐색하기 위해.
제안 방법
- 원본 데이터셋에 다양한, 볼 수 없는 손상을 적용하여 구성된 새로운 세 가지 강건성 벤치마크(COCO-C, MPII-C, OCHuman-C)를 제안한다.
- 손상된 이미지의 혼합 샘플을 생성하기 위해 생성기와 자세 추정기를 적대적으로 함께 훈련시키는 적대적 데이터 증강 프레임워크인 AdvMix를 도입한다.
- 생성기는 다수의 손상된 이미지를 조합하기 위해 픽셀 단위의 혼합 가중치를 학습하여, 자세 추정기를 도전하는 복잡하고 현실적인 노이즈 패턴을 생성한다.
- 학생 모델와 동일한 아키텍처를 가진 사전 훈련된 교사 모델을 사용하여 지식 정복을 적용함으로써, 정제된 자세 구조 지식을 전이하고 적대적 노이즈에 대한 과적합을 완화한다.
- 추론 단계에서는 증강 생성기와 교사 모델을 버리므로 계산 오버헤드가 발생하지 않는다.
- 이중 스트림 훈련 프로세스를 활용하여 생성기는 자세 추정기를 혼란스럽게 하려고 하고, 자세 추정기는 점점 더 어려운 샘플들로부터 강건한 표현을 학습한다.
실험 결과
연구 질문
- RQ1최신의 상위 수준 자세 추정기는 훈련 중에 볼 수 없었던 다양한 실제 세계의 이미지 손상 상황에서 어떻게 성능을 발휘하는가?
- RQ2현재 자세 추정 모델에서 정제된 데이터 정확도와 이미지 손상에 대한 강건성 사이의 상충 관계는 어떠한가?
- RQ3적대적 데이터 증강이 정제된 데이터 성능를 유지하면서도 예상치 못한 손상에 대한 일반화를 효과적으로 향상시킬 수 있는가?
- RQ4동일한 아키텍처를 가진 교사 모델로부터의 지식 정복은 적대적 증강을 사용할 때 정제된 데이터 정확도를 유지하는 데 어떻게 기여하는가?
- RQ5AdvMix는 스타일화와 같은 다른 데이터 증강 기법과 조합하여 더 높은 수준의 강건성을 달성할 수 있는가?
주요 결과
- 최신의 탑다운 및 본다운 자세 추정기는 특히 운동 블러와 줌 블러와 같은 손상 상황에서 심각한 성능 저하를 겪는다.
- AdvMix는 COCO-C, MPII-C, OCHuman-C에서 손상된 이미지에 대한 평균 성능(mPC)을 크게 향상시키며, 표준 훈련 및 다른 증강 기반 방법보다 뛰어난 성능을 보인다.
- 지식 정복만을 사용할 경우 정제된 데이터 정확도 향상에 실패하는 것과 달리, AdvMix는 정제된 데이터에서 성능을 유지하거나 약간 향상시킨다.
- 픽셀 단위의 혼합 가중치 학습은 이미지 단위 혼합보다 더 정교하고 영역 인식적인 데이터 조합을 가능하게 하여 더 뛰어난 강건성을 달성한다.
- AdvMix에 데이터 스타일화를 조합하면 모든 손상 유형에서 가장 뛰어난 종합적 강건성을 달성하며, 항상 mPC를 향상시키고 정제된 데이터 성능를 유지한다.
- 테스트 시점의 손상 유형을 훈련에 포함시키면 특정 손상에 대해 강건성이 향상되지만, 정제된 데이터 정확도는 떨어지고, 예상치 못한 손상에 대해 일반화가 잘 되지 않아, 더 일반화 가능한 증강 전략의 필요성을 드러낸다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.