Skip to main content
QUICK REVIEW

[논문 리뷰] Adversarial Unsupervised Domain Adaptation For Acoustic Scene Classification

Shayan Gharib, Konstantinos Drossos|arXiv (Cornell University)|2018. 08. 17.
Music and Audio Processing참고 문헌 1인용 수 44
한 줄 요약

본 논문은 음향 현장 분류 ASC를 위한 비지도 적대적 도메인 적응 방법을 도입하여, 대상 도메인 라벨 없이도 소스 도메인 모델을 대상 도메인 데이터에 적응시키고 unseen-target 정확도를 약 10% 향상시킨다.

ABSTRACT

A general problem in acoustic scene classification task is the mismatched conditions between training and testing data, which significantly reduces the performance of the developed methods on classification accuracy. As a countermeasure, we present the first method of unsupervised adversarial domain adaptation for acoustic scene classification. We employ a model pre-trained on data from one set of conditions and by using data from other set of conditions, we adapt the model in order that its output cannot be used for classifying the set of conditions that input data belong to. We use a freely available dataset from the DCASE 2018 challenge Task 1, subtask B, that contains data from mismatched recording devices. We consider the scenario where the annotations are available for the data recorded from one device, but not for the rest. Our results show that with our model agnostic method we can achieve $\sim 10\%$ increase at the accuracy on an unseen and unlabeled dataset, while keeping almost the same performance on the labeled dataset.

연구 동기 및 목표

  • 음향 현장 분류(ASC)에서 학습과 테스트 간의 도메인 시프트를 해결한다.
  • ASC를 위한 모델-무관 프레임워크의 비지도 적대적 도메인 적응 프레임워크를 제안한다.
  • 라벨이 없는 대상 도메인 데이터를 활용하여 unseen 도메인 정확도를 향상시키면서 소스 도메인 성능을 보존함을 보인다.

제안 방법

  • 레이블이 부여된 소스 데이터 X^S에서 소스 도메인 모델 M_S과 라벨 분류기 C를 사전 학습한다.
  • 대상 도메인 모델 M_T와 도메인 판별기 D를 활용한 적대적 단계로 M_S(X^S)와 M_T(X^T)의 분포를 정렬(일치)시킨다.
  • M_S와 M_T를 공유하지 않으며(가중치 연결 없이) 초기화한다. M_T를 M_S의 파라미터로 초기화한다.
  • 도메인 정렬 중 감독 학습 신호를 제공하기 위해 적응 단계에 라벨 분류기 C를 포함시킨다.
  • L_D를 최적화하여 D가 소스 vs. 타깃을 구분하도록 학습하고, L_M_T를 최적화하여 M_T가 D를 속이면서 C를 사용해 소스-유사 타깃을 분류하도록 학습한다.
  • 타깃 도메인 데이터 X^T에 대해 C와 함께 M_T를 테스트하여 타깃 도메인 예측을 얻는다.

실험 결과

연구 질문

  • RQ1타깃 라벨 없이 불일치하는 음향 도메인 간에 잠재 표현을 정렬할 수 있는가?
  • RQ2적응 도중 라벨 분류기 C를 포함시키면 소스 도메인 성능을 심각하게 해하지 않으면서 타깃 도메인 정확도를 향상시킬 수 있는가?
  • RQ3해당 메서드가 아키텍처에 독립적이고 서로 다른 ASC 모델에서도 효과적인가?
  • RQ4적응 전후로 보지 않은 타깃 데이터에 대한 성능 차이는 어떠한가?

주요 결과

  • 두 개의 ASC 모델(Kaggle 및 DCASE 기준선)에서 적응 후 타깃 도메인 정확도가 각각 20.28%에서 31.67%로, 19.17%에서 25.28%로 향상되었다.
  • 소스 도메인 정확도는 본질적으로 안정적이며 Kaggle 모델은 약간 증가(65.25%에서 65.37%), DCASE 모델은 소폭 감소(61.71%에서 61.23%).
  • 적응은 모델 전반에 걸쳐 미확인 타깃 도메인 정확도에서 대략 10% 포인트의 절대 이득을 달성했다.
  • 적응 후 타깃 도메인 라벨에 대한 올바른 분류가 크게 개선된 혼동 행렬이 나타난다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.