[논문 리뷰] CycleGAN-based Non-parallel Speech Enhancement with an Adaptive Attention-in-attention Mechanism
이 논문은 비병렬 훈련 과제를 해결하기 위해 적응형 주파수-시간 주의(Adaptive Time-Frequency Attention, ATFA)와 적응형 계층적 주의(Adaptive Hierarchical Attention, AHA)를 통합한 적응형 주의-내주의(Adaptive Attention-in-Attention, AIA) 메커니즘을 갖춘 새로운 CycleGAN 기반 음성 강화 프레임워크인 AIA-CycleGAN을 제안한다. 이 모델은 특징 표현 및 매핑 능력을 향상시켜 비병렬 및 병렬 훈련 설정 모두에서 최신 기술 수준의 성능을 달성하며, 이전의 GAN 기반 및 비-GAN 방법에 비해 PESQ, STOI, CSIG 점수에서 뚜렷한 향상을 보인다.
Non-parallel training is a difficult but essential task for DNN-based speech enhancement methods, for the lack of adequate noisy and paired clean speech corpus in many real scenarios. In this paper, we propose a novel adaptive attention-in-attention CycleGAN (AIA-CycleGAN) for non-parallel speech enhancement. In previous CycleGAN-based non-parallel speech enhancement methods, the limited mapping ability of the generator may cause performance degradation and insufficient feature learning. To alleviate this degradation, we propose an integration of adaptive time-frequency attention (ATFA) and adaptive hierarchical attention (AHA) to form an attention-in-attention (AIA) module for more flexible feature learning during the mapping procedure. More specifically, ATFA can capture the long-range temporal-spectral contextual information for more effective feature representations, while AHA can flexibly aggregate different AFTA's intermediate output feature maps by adaptive attention weights depending on the global context. Numerous experimental results demonstrate that the proposed approach achieves consistently more superior performance over previous GAN-based and CycleGAN-based methods in non-parallel training. Moreover, experiments in parallel training verify that the proposed AIA-CycleGAN also outperforms most advanced GAN-based and Non-GAN based speech enhancement approaches, especially in maintaining speech integrity and reducing speech distortion.
연구 동기 및 목표
- 쌍체의 청소된-노이즈 데이터 세트를 확보할 수 없거나 실용적이지 않은 비병렬 음성 강화 과제를 해결하기 위해.
- 비병렬 훈련에서 성능 저하를 초래하는 표준 CycleGAN 생성기의 제한된 매핑 능력을 극복하기 위해.
- 시간-주파수 도메인에서 장거리 시간-주파수적 및 계층적 맥락적 의존성을 캡처하여 특징 학습을 향상시키기 위해.
- 생성기 아키텍처에 적응형 주의 메커니즘을 통합하여 음성의 완전성과 왜곡을 감소시키기 위해.
- 제안된 AIA-CycleGAN의 효과성을 비병렬 및 병렬 훈련 시나리오 모두에서 검증하기 위해.
제안 방법
- 프레임워크는 상대적 적대적 손실, 사이클 일致성 손실, 신원 손실을 사용하여 훈련되는 두 개의 생성기($G_{X\rightarrow Y}$ 및 $F_{Y\rightarrow X}$)와 두 개의 판별기($D_X$ 및 $D_Y$)를 활용한다.
- 핵심 혁신은 적응형 주의-내주의(AIA) 모듈이며, 장거리 시간-주파수적 맥락을 위한 적응형 시간-주파수 주의(ATFA)와 동적 특징 맵 집합을 위한 적응형 계층적 주의(AHA)를 결합한다.
- ATFA는 국소적 및 전역적 주파수-시간 패턴에 대해 주의 가중치를 학습하여 시간-주파수 표현에서 장거리 의존성을 캡처한다.
- AHA는 맥락 인식 주의 가중치를 사용하여 ATFA의 중간 특징 맵을 적응적으로 융합함으로써 민첩하고 동적 특징 융합을 가능하게 한다.
- 강화된 음성에서 세밀한 디테일 학습을 강화하기 위해 다중 척도 판별기를 사용한다.
- 배경 노이즈를 더 효과적으로 억제하기 위해 압축 계수 0.5를 사용한 파wr 압축된 크기 스펙트로그램을 입력 특징으로 사용한다.
실험 결과
연구 질문
- RQ1적응형 주의-내주의 메커니즘을 갖춘 CycleGAN 기반 프레임워크가 비병렬 훈련에서 기존의 GAN 기반 및 비-GAN 기반 음성 강화 방법을 능가할 수 있는가?
- RQ2적응형 시간-주파수 주의(ATFA)와 적응형 계층적 주의(AHA)의 통합이 비병렬 음성 강화에서 특징 표현 및 매핑 능력을 어떻게 향상시키는가?
- RQ3기본 모델에 비해 AIA-CycleGAN은 음성의 완전성과 왜곡을 어느 정도 개선하는가?
- RQ4제안된 방법은 비병렬 및 병렬 훈련 환경 모두에서 강력한 성능을 유지하는가?
- RQ5파워 압축 스펙트로그램의 사용은 모델의 노이즈 억제 및 음성 품질에 어떤 영향을 미치는가?
주요 결과
- 비병렬 훈련에서 AIA-CycleGAN은 PESQ 2.67, STOI 0.932, CSIG 3.86을 기록하여 CycleGAN(PESQ: 2.56, STOI: 0.927, CSIG: 3.78)을 뚜렷이 능가한다.
- 병렬 훈련에서 AIA-CycleGAN은 PESQ 2.74, STOI 0.936, CSIG 3.96을 기록하여 비교된 모든 GAN 기반 및 비-GAN 기반 방법을 초월한다.
- SEGAN에 비해 PESQ는 0.58, CSIG는 0.48, COVL은 0.49 향상되어 더 뛰어난 음성 품질과 감소된 왜곡을 나타낸다.
- AIA-CycleGAN은 SEGAN 대비 CBAK을 0.31 감소시켜 더 나은 음성 이해 가능성과 자연스러움을 유지함을 시사한다.
- 시각적 분석 결과 AIA-CycleGAN은 특히 고에너지 노이즈 영역에서 잔여 노이즈 억제를 CycleGAN보다 더 효과적으로 수행함을 확인하였다.
- STOI와 CBAK에서는 경쟁적인 성능를 유지하면서도 PESQ와 CSIG는 뚜렷이 향상되어 품질과 이해 가능성의 균형 잡힌 향상이 이루어졌음을 나타낸다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.