Skip to main content
QUICK REVIEW

[논문 리뷰] Neural Model Reprogramming with Similarity Based Mapping for Low-Resource Spoken Command Recognition

Hao Yen, Pin-Jui Ku|arXiv (Cornell University)|2021. 10. 08.
Speech Recognition and Synthesis참고 문헌 48인용 수 5
한 줄 요약

이 논문은 라이트베르니아어, 아랍어, 불리우스 모드의 중국어와 같은 저자원 언어로의 저자원 말하기 명령 인식(SCR)을 위한 새로운 적대적 재프로그래밍(AR) 프레임워크를 제안한다. 이는 유사도 기반 레이블 매핑과 전이 학습을 활용하여 대규모 영어 음성 모델을 저자원 언어에 적응시키는 방식이다. 최소한의 레이블 데이터로도 최신 기술 수준의 성능을 달성하며, 불리우스 모드의 중국어에서는 최대 28.59%의 정확도 향상을 기록하고 아랍어에서는 98.9%의 정확도를 달성했으며, 높은 안정성을 유지한다.

ABSTRACT

In this study, we propose a novel adversarial reprogramming (AR) approach for low-resource spoken command recognition (SCR), and build an AR-SCR system. The AR procedure aims to modify the acoustic signals (from the target domain) to repurpose a pretrained SCR model (from the source domain). To solve the label mismatches between source and target domains, and further improve the stability of AR, we propose a novel similarity-based label mapping technique to align classes. In addition, the transfer learning (TL) technique is combined with the original AR process to improve the model adaptation capability. We evaluate the proposed AR-SCR system on three low-resource SCR datasets, including Arabic, Lithuanian, and dysarthric Mandarin speech. Experimental results show that with a pretrained AM trained on a large-scale English dataset, the proposed AR-SCR system outperforms the current state-of-the-art results on Arabic and Lithuanian speech commands datasets, with only a limited amount of training data.

연구 동기 및 목표

  • 레이블이 부족한 저자원 말하기 명령 인식 문제를 해결하기 위해.
  • 완전한 재학습 없이 사전학습된 영어 음성 모델을 저자원 대상 언어에 효과적으로 적응시키기 위해.
  • 새로운 레이블 정렬 및 전이 학습 통합을 통해 저자원 환경에서의 모델 안정성과 성능을 향상시키기 위해.
  • 컴퓨터 시각을 초월해 적대적 재프로그래밍이 음성 인식 분야에 효과적으로 적용 가능한지 탐구하기 위해.
  • AR를 데이터 증강 및 전이 학습과 융합함으로써 그 유연성을 입증하기 위해.

제안 방법

  • 입력 오디오 신호에 학습 가능한 노이즈를 추가하여 타겟 도메인 인식에 적합하도록 수정하는 재프로그래밍 레이어를 도입한다.
  • 원천(영어)과 타겟(예: 라이트베르니아어, 아랍어) 클래스 분포를 정렬하기 위해 유사도 기반 레이블 매핑 기법을 활용하여 레이블 일관성을 향상시킨다.
  • 사전학습된 음성 모델을 AR가 생성한 신호로 미세조정함으로써 적대적 재프로그래밍과 전이 학습을 통합한다.
  • 이중 단계 학습 과정을 사용한다: 첫 번째 단계에서는 재프로그래밍 레이어를 학습시켜 정확한 타겟 예측을 유도하는 노이즈를 생성하고, 두 번째 단계에서는 재프로그래밍된 데이터를 사용해 음성 모델을 미세조정한다.
  • 학습 중에 SpecAugment를 데이터 증강 수단으로 적용하여 더 높은 내구성과 성능을 향상시킨다.
  • 정의된 의미적 유사성 기반 소스 레이블을 집계하여 소스 모델의 예측 클래스 확률을 타겟 클래스로 매핑한다.

실험 결과

연구 질문

  • RQ1적대적 재프로그래밍은 저자원 말하기 명령 인식 작업에 효과적으로 적용될 수 있는가?
  • RQ2유사도 기반 레이블 매핑은 저자원 SCR에서 원천과 타겟 클래스 공간 간의 정렬을 어떻게 향상시키는가?
  • RQ3적대적 재프로그래밍과 전이 학습을 융합하면 단독으로 사용하는 방법보다 더 높은 성능과 안정성을 달성하는가?
  • RQ4적대적 재프로그래밍은 데이터 증강과 융합되어 저자원 환경에서의 모델 성능을 추가로 향상시킬 수 있는가?
  • RQ5제안된 AR-SCR 시스템은 저자원 음성 명령 데이터셋에서 최신 기술 수준의 방법들과 비교해 어떻게 성능을 내는가?

주요 결과

  • 라이트베르니아어 음성 명령 데이터셋에서 AR+TL 시스템은 키워드당 3개의 학습 샘플로 70.2%의 정확도를 기록했으며, Baseline+Aug(39.5%)와 TL+Aug(65.9%)를 모두 능가했고, 표준편차 ±2.72로 높은 안정성을 확보했다.
  • 불리우스 모드의 중국어 데이터셋에서 AR+TL은 82.3%의 정확도를 기록했으며, 베이스라인 대비 28.59%의 상대적 향상을 보였고, 표준편차 ±2.56로 높은 안정성을 유지했다.
  • 아랍어 데이터셋에서 AR+TL은 98.9%의 정확도를 달성했으며, 최신 기술 수준의 방법(98.13%)을 초월했고, 개별 AR(94.8%)와 TL(98.6%) 구성 요소보다도 뛰어난 성능을 보였다.
  • 유사도 기반 레이블 매핑은 도메인 간 의미적으로 유사한 클래스를 정렬함으로써 성능 향상에 크게 기여했으며, 특히 저자원 환경에서 두드러진 효과를 보였다.
  • AR와 데이터 증강(SpecAugment)의 융합은 모델의 내구성 향상과 분산 감소를 더욱 강화하여, 이 방법의 유연성과 확장성의 가능성을 입증했다.
  • AR-SCR 시스템은 아랍어, 라이트베르니아어, 불리우스 모드의 중국어를 포함한 세 가지 저자원 데이터셋에서 최신 기술 수준의 성능을 달성했으며, 재프로그래밍 레이어에 단지 16k개의 학습 가능한 파라미터만을 사용했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.