[논문 리뷰] Atss-Net: Target Speaker Separation via Attention-based Neural Network
이 논문은 자기주의 주의 메커니즘을 활용하여 장거리 의존성을 모델링하고 병렬 계산을 가능하게 함으로써 스펙트로그램 도메인에서 타겟 화자 분리를 수행하는 주의 기반 신경망인 Atss-Net을 제안한다. 이 모델은 LibriSpeech에서 9.30 dB의 SDR를 기록하며 최신 기술 수준을 달성하였으며, 파arameter 수를 50% 줄인 4.68M(비교 대상인 VoiceFilter의 9.45M 대비)으로 사용하면서도 VoiceFilter를 능가했고, 음악 및 화자 배경 소음을 포함한 복잡한 노이즈 조건에서도 강력한 일반화 성능을 보였다.
Recently, Convolutional Neural Network (CNN) and Long short-term memory (LSTM) based models have been introduced to deep learning-based target speaker separation. In this paper, we propose an Attention-based neural network (Atss-Net) in the spectrogram domain for the task. It allows the network to compute the correlation between each feature parallelly, and using shallower layers to extract more features, compared with the CNN-LSTM architecture. Experimental results show that our Atss-Net yields better performance than the VoiceFilter, although it only contains half of the parameters. Furthermore, our proposed model also demonstrates promising performance in speech enhancement.
연구 동기 및 목표
- 단일 타겟 화자 참조 문장만 제공된 복잡한 다중 화자 환경에서의 타겟 화자 분리 문제를 해결하기 위해.
- 기존의 CNN-LSTM 아키텍처의 한계인 순차적 계산 및 높은 파arameter 수를 극복하기 위해 주의 메커니즘을 활용하여 병렬 처리를 가능하게 하고 모델 복잡도를 감소시키기 위해.
- 보조 입력으로 화자 임베딩을 통합할 경우 타겟 분리 성능 뿐 아니라 다양한 노이즈 조건에서의 일반 음성 향상 성능 향상 여부를 탐색하기 위해.
- 자기주의 주의 모듈이 스펙트로그램에서 장거리 의존성을 어떻게 모델링하여 분리 품질을 향상시키는지 평가하기 위해.
제안 방법
- 모델은 스펙트로그램 도메인에서 작동하며, 혼합 음성의 크기 스펙트로그램에서 초기 특징을 추출하기 위해 2차원 컨볼루션 인코더를 사용한다.
- 타겟 화자 임베딩은 텍스트 독립적 화자 확인 시스템을 통해 추출되며, 시간 프레임 전역으로 복제되어 인코딩된 스펙트로그램 특징과 연결된다.
- 시간적 자기주의 주의 모듈 3개의 스택이 적용되며, 각 모듈은 다중 헤드 주의(2개 헤드)와 64차원 특징 투영을 포함하여 프레임 간 의존성을 모델링하고 표현을 개선한다.
- 주의 메커니즘은 시간 프레임 전역에서 동적 가중치를 계산하여, 간섭을 억제하면서 타겟 화자 음성의 관련 세그먼트에 집중할 수 있도록 한다.
- 최종 출력은 타겟 화자의 재구성된 크기 스펙트로그램이며, 원본 단계를 사용하여 시간 도메인으로 변환된다.
- 모델은 고정된 초기 학습률 0.0001을 사용하는 Adam 옵timizer로 훈련되며, 검증 손실이 10 에포크 동안 향상되지 않으면 조기 정지된다.

실험 결과
연구 질문
- RQ1주목적 기반 아키텍처가 파arameter 수를 줄이며 CNN-LSTM 모델보다 우수한 성능을 내는가?
- RQ2보조 입력으로 화자 임베딩을 통합할 경우 타겟 분리 및 일반 음성 향상 성능 향상에 기여하는가?
- RQ3자기주의 주의 메커니즘이 순환 신경망에 비해 스펙트로그램에서 장거리 의존성을 얼마나 잘 모델링하는가?
- RQ4타겟 화자가 배경에 존재하는 경우, 예를 들어 음악이나 노래 배경에서 음성 향상 작업에서 모델의 성능은 어떠한가?
주요 결과
- 훈련 후 Atss-Net은 평균 SDR 10.56 dB를 기록하여 초깃값인 1.26 dB에서 9.30 dB 향상된 성과를 기록했으며, 기준 모델인 VoiceFilter의 7.78 dB 향상 수준을 초월했다.
- 파arameter 수가 단지 4.68M(비교 대상인 VoiceFilter의 9.45M 대비 약 50%)에 불과함에도 불구하고, 제안된 모델은 뛰어난 분리 성능을 달성했다.
- 제거 실험 결과, 주의 모듈을 제거할 경우 SDR 향상 수치가 단지 3.88 dB로 감소하여 주의 메커니즘이 성능 향상에 결정적인 역할을 한다는 것을 확인했다.
- 유사한 아키텍처를 사용하여 순열 불변 훈련(PIT) 손실을 적용한 모델은 8.57 dB의 SDR를 기록했으며, Atss-Net의 9.30 dB보다 낮아, 이 작업에 있어서 화자 임베딩 가이던스가 PIT보다 더 효과적임을 시사한다.
- AISHELL-2에서의 음성 향상 실험 결과, Atss-Net은 20 dB SNR에서 PESQ 3.22를 기록하여 VoiceFilter의 2.62를 능가했으며, 화자 및 음악적 노이즈에 대한 강건성을 입증했다.
- 청취 샘플 분석 결과, Atss-Net은 노래나 음악 등 복잡한 배경에서도 타겟 화자를 효과적으로 분리함으로써 일반화 능력이 뛰어남을 확인했다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.