[논문 리뷰] ICASSP 2021 Acoustic Echo Cancellation Challenge: Datasets and Testing Framework.
이 논문은 ICASSP 2021 음향 에코 제거 챌린지를 소개하며, 단일 및 이중 대화 상황에서 AEC 모델을 훈련하기 위해 다양한 환경에서 실장치 2,500건 이상의 실제 기록을 공개한다. 주관적 평가를 위한 ITU-T P.808 기반의 오픈소스 온라인 테스트 프레임워크를 제공하며, 수상자는 모든 조건에서의 평균 평균의견점수(MOS)로 선정된다.
The ICASSP 2021 Acoustic Echo Cancellation Challenge is intended to stimulate research in the area of acoustic echo cancellation (AEC), which is an important part of speech enhancement and still a top issue in audio communication and conferencing systems. Many recent AEC studies report reasonable performance on synthetic datasets where the train and test samples come from the same underlying distribution. However, the AEC performance often degrades significantly on real recordings. Also, most of the conventional objective metrics such as echo return loss enhancement (ERLE) and perceptual evaluation of speech quality (PESQ) do not correlate well with subjective speech quality tests in the presence of background noise and reverberation found in realistic environments. In this challenge, we open source two large datasets to train AEC models under both single talk and double talk scenarios. These datasets consist of recordings from more than 2,500 real audio devices and human speakers in real environments, as well as a synthetic dataset. We open source an online subjective test framework based on ITU-T P.808 for researchers to quickly test their results. The winners of this challenge will be selected based on the average P.808 Mean Opinion Score (MOS) achieved across all different single talk and double talk scenarios.
연구 동기 및 목표
- 합성 데이터셋과 실제 기록 간의 AEC 성능 격차를 해소하여, 모델이 일반적으로 크게 떨어지는 실제 환경에서의 성능 향상.
- 기존의 ERLE 및 PESQ와 같은 객관적 지표를 주관적 평가로 대체하여, 소음과 반향이 있는 환경에서 실제 음성 품질을 더 잘 반영하는 평가 신뢰도 향상.
- 실제 환경에서 실장치 2,500대 이상과 인간 화자로부터 확보한 대규모 실생활 훈련 데이터 제공.
- 공개된 온라인 주관적 평가 프레임워크를 활용해 단일 대화 및 이중 대화 상황에서 표준화된 벤치마킹을 가능하게 함.
- ITU-T P.808를 통한 주관적 품질을 주요 평가 지표로 삼아, 강인한 AEC 연구 촉진
제안 방법
- 실제 환경에서 실장치 2,500대 이상과 인간 화자로부터 촬영한 실제 기록 데이터셋과, 훈련을 위한 합성 데이터셋 두 개를 공개.
- ITU-T P.808 준수 온라인 테스트 프레임워크를 설계하여 AEC 성능에 대한 주관적 평가 테스트를 수행.
- 다양한 단일 대화 및 이중 대화 상황에서 인간 청취자로부터 평균의견점수(MOS)를 수집하여 청각적 품질을 평가.
- 모든 테스트 조건에서의 평균 MOS를 사용하여 수상자 순위 매기기 및 선정의 주요 지표로 활용.
- 테스트 인프라와 데이터셋을 공개함으로써 재현성과 공정성 확보.
- 실제 구현 도전 과제를 반영하기 위해 배경 소음과 실내 반향을 포함한 실제 환경 조건을 평가 중심으로 집중.
실험 결과
연구 질문
- RQ1동일한 분포를 가진 합성 데이터셋에서의 AEC 모델 성능과 실제 기록에서의 성능는 어떻게 비교되는가?
- RQ2소음과 반향이 있는 환경에서 기존의 객관적 지표인 ERLE 및 PESQ는 주관적 음성 품질과 얼마나 상관이 있는가?
- RQ3대규모 실생활 데이터셋이 도전적인 음향 조건에서 AEC 모델의 강인성을 향상시키는 데 얼마나 효과적인가?
- RQ4ITU-T P.808 기반의 온라인 주관적 평가 프레임워크는 다양한 상황에서 AEC 시스템의 벤치마킹에 얼마나 효과적인가?
- RQ5주관적 품질 점수로 평가했을 때, 이중 대화 상황은 AEC 성능에 어떤 영향을 미치는가?
주요 결과
- 챌린지 데이터셋은 실제 환경에서 촬영한 실장치 2,500대 이상과 인간 화자로부터 구성되어 있어 현실적인 AEC 훈련을 가능하게 한다.
- ITU-T P.808 기반의 오픈소스 온라인 테스트 프레임워크는 연구자들이 AEC 성능에 대해 표준화되고 확장 가능한 주관적 평가를 수행할 수 있도록 한다.
- 챌린지 수상자는 모든 단일 대화 및 이중 대화 상황에서의 평균 평균의견점수(MOS)에 기반하여 선정된다.
- 주관적 MOS 점수가 실생활 조건에서 청각적 품질을 반영하는 데 더 신뢰할 수 있음을 입증하였다. ERLE 및 PESQ와 같은 기존 객관적 지표보다도.
- 실제 및 합성 데이터셋을 모두 포함함으로써 다양한 음향 조건에서의 훈련 및 평가 지원.
- 프레임워크를 통해 소음과 반향을 포함한 실제 복잡한 음향 환경에서 AEC 모델 간 직접 비교가 가능해졌다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.