Skip to main content
QUICK REVIEW

[논문 리뷰] From Synthetic to Real: Unsupervised Domain Adaptation for Animal Pose Estimation

Chen Li, Gim Hee Lee|arXiv (Cornell University)|2021. 03. 27.
Human Pose and Action Recognition참고 문헌 50인용 수 8
한 줄 요약

이 논문은 다중 척도 도메인 적응 모듈(MDAM)을 사용하여 합성 데이터와 실재 데이터 간의 도메인 갭을 줄이는 새로운 비지도 도메인 적응 프레임워크를 제안한다. 또한 자기 정규화(self-distillation)와 메인티처(mean-teacher) 네트워크를 활용한 온라인 코arse-to-fine 가짜 레이블 업데이트 전략을 도입하여 노이즈가 있는 초기 가짜 레이블을 점진적으로 교체함으로써, TigDog와 VisDA2019 데이터셋에서 최신 기술(SOTA) 성능을 달성하면서도 예측 불가능한 동물 종류와 도메인으로의 일반화 능력이 뛰어나다.

ABSTRACT

Animal pose estimation is an important field that has received increasing attention in the recent years. The main challenge for this task is the lack of labeled data. Existing works circumvent this problem with pseudo labels generated from data of other easily accessible domains such as synthetic data. However, these pseudo labels are noisy even with consistency check or confidence-based filtering due to the domain shift in the data. To solve this problem, we design a multi-scale domain adaptation module (MDAM) to reduce the domain gap between the synthetic and real data. We further introduce an online coarse-to-fine pseudo label updating strategy. Specifically, we propose a self-distillation module in an inner coarse-update loop and a mean-teacher in an outer fine-update loop to generate new pseudo labels that gradually replace the old ones. Consequently, our model is able to learn from the old pseudo labels at the early stage, and gradually switch to the new pseudo labels to prevent overfitting in the later stage. We evaluate our approach on the TigDog and VisDA 2019 datasets, where we outperform existing approaches by a large margin. We also demonstrate the generalization ability of our model by testing extensively on both unseen domains and unseen animal categories. Our code is available at the project website.

연구 동기 및 목표

  • 도메인 이탈이 발생하는 합성 데이터를 활용하여 실세계 레이블이 제한된 동물 자세 데이터 문제를 해결한다.
  • 합성 데이터에서 실재 데이터로의 전이 과정에서 생성된 노이즈가 많은 가짜 레이블의 한계를 극복하며, 신뢰도 필터링에도 불구하고 성능 저하 문제를 해결한다.
  • 명시적인 특징 수준의 도메인 적응을 통해 합성 데이터와 실재 동물 데이터 간의 도메인 이탈을 줄인다.
  • 노이즈가 많은 레이블에 과적합되지 않으면서도 초기 학습 안정성을 유지하는 점진적인 가짜 레이블 업데이트 메커니즘을 개발한다.
  • 微조정(fine-tuning) 없이도 예측 불가능한 동물 종류와 도메인으로의 강력한 일반화 성능을 달성한다.

제안 방법

  • 자세 추정과 도메인 분류를 동시에 최적화하여 도메인 불변 특징을 학습하는 다중 척도 도메인 적응 모듈(MDAM)을 설계한다.
  • 노이즈가 많은 예측에서 초기로 신뢰할 수 있는 가짜 레이블을 생성하기 위해 자기 정규화 모듈을 활용한 내부 코어스 업데이트 루프를 구현한다.
  • 초기 가짜 레이블을 점진적으로 정밀화하고 더 정확한 것으로 교체하기 위해 메인티처 네트워크를 활용한 외부 파인 업데이트 루프를 도입한다.
  • 딥 네트워크의 기억 효과를 기반으로 한 점진적인 레이블 업데이트 전략을 적용하여 초기에는 초기 레이블을 우선시하고, 후반에는 메인티처가 생성한 레이블로 전환한다.
  • 학습 중 일반화 및 내구성을 향상시키기 위해 MixUp 정규화 기법을 적용한다.
  • 합성 데이터로의 감독 신호와 실재 데이터로의 도메인 적응을 동시에 사용하여 엔드 투 엔드로 모델을 훈련하며, 반복적으로 생성된 가짜 레이블을 활용한다.

실험 결과

연구 질문

  • RQ1다중 척도 도메인 적응 모듈(MDAM)은 자세 추정에서 합성 데이터와 실재 데이터 간의 도메인 갭을 효과적으로 줄일 수 있는가?
  • RQ2코어스-투-파인 가짜 레이블 업데이트 전략은 비지도 도메인 적응 과정에서 노이즈가 많은 가짜 레이블의 부정적 영향을 완화하는가?
  • RQ3제안된 방법은 미리 학습되지 않은 동물 종류와 도메인으로 얼마나 잘 일반화되는가?
  • RQ4정적 또는 신뢰도 기반의 레이블 선택 방식과 비교해 볼 때, 점진적인 가짜 레이블 사용 방식은 성능과 내구성 측면에서 어떤가?
  • RQ5각 구성 요소(자기 정규화, 메인티처, MDAM, MixUp)가 최종 성능에 기여하는 정도는 어느 정도인가?

주요 결과

  • TigDog 데이터셋에서 말에 대해 PCK@0.05 정확도가 79.50%로 CC-SSL 대비 8.73% 향상되었고, 호랑이에 대해서는 67.76%로 3.62% 향상되었다.
  • VisDA2019 데이터셋에서 CC-SSL 대비 14.3% 향상되어, 예측 불가능한 도메인으로의 강력한 제로샷 일반화 능력을 입증했다.
  • 훈련 데이터에 포함되지 않은 양과 염소에 대해서도 모델이 잘 일반화되어, Animal-Pose 데이터셋에서 각각 59.51%와 71.31%의 정확도를 달성했다.
  • 제거 분석 결과, 외부 파인 업데이트 루프는 성능을 4.03% 향상시켰다(72.70%에서 73.25% 평균), 내부 코어스 업데이트 루프는 추가로 73.66%로 향상시켰다.
  • MixUp 정규화 기법을 포함한 전체 모델는 최고의 평균 정확도 73.66%를 기록하여 전체 파이프라인의 효과성을 확인했다.
  • 정성적 결과는 다양한 종에서 점프, 달리기, 누운 자세와 같은 도전적인 자세를 성공적으로 추정한 것을 보여주었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.