[논문 리뷰] DeepFilterNet2: Towards Real-Time Speech Enhancement on Embedded Devices for Full-Band Audio
DeepFilterNet2는 청각 모델링을 활용하고 최적화된 훈련을 통해 실시간 추론이 가능한 경량이며 이중 단계로 구성된 음성 향상 프레임워크로, 48kHz의 전체 대역 음성에서 최신 기술 수준의 성능을 달성한다. Core-i5 CPU에서 실시간 요인을 0.04로 낮추며, Raspberry Pi 4와 같은 임베디드 장치에의 배포를 가능하게 한다.
Deep learning-based speech enhancement has seen huge improvements and recently also expanded to full band audio (48 kHz). However, many approaches have a rather high computational complexity and require big temporal buffers for real time usage e.g. due to temporal convolutions or attention. Both make those approaches not feasible on embedded devices. This work further extends DeepFilterNet, which exploits harmonic structure of speech allowing for efficient speech enhancement (SE). Several optimizations in the training procedure, data augmentation, and network structure result in state-of-the-art SE performance while reducing the real-time factor to 0.04 on a notebook Core-i5 CPU. This makes the algorithm applicable to run on embedded devices in real-time. The DeepFilterNet framework can be obtained under an open source license.
연구 동기 및 목표
- 기존의 딥러닝 기반 음성 향상 방법에서 높은 계산 복잡도와 큰 시간 버퍼 문제를 해결함. 특히 전체 대역 음성에 대해.
- Raspberry Pi 4와 같은 자원 제한된 임베디드 장치에서 실시간 추론을 가능하게 함.
- 낮은 모델 복잡도와 추론 지연 시간을 유지하면서도 음성 향상 성능을 향상함.
- 모델 크기를 크게 늘리지 않고도 수렴성과 강건성을 향상시키기 위해 훈련 절차와 데이터 증강을 최적화함.
- 효율적이고 청각적으로 유의미한 신호 처리를 통한 DeepFilterNet 프레임워크의 확장으로 음성 품질과 이해도 향상
제안 방법
- 이중 단계 아키텍처를 사용: 첫 번째 단계는 실수값 가중치를 사용해 압축된 ERB(청각적) 주파수 도메인에서 음성 에너지의 향상을 수행함.
- 두 번째 단계는 복소수 스펙트럼 도메인에서 심층 필터링(DF)을 적용하여 5kHz 이하의 주기적 음성 성분을 재구성함.
- 두 단계 모두를 위한 공동 임베딩을 생성하기 위해 ERB 및 복소수 스펙트럼 특징을 융합하기 위해 공유 인코더를 사용함.
- 청각적 품질 향상과 일반화 능력 향상을 위해 시간 도메인 재구성과 함께 다중 해상도 스펙트로그램 손실을 적용함.
- 반복적 훈련 최적화를 구현: 학습률 웜업과 코스인 감쇠, 적응형 가중치 감쇠, 배치 크기 8에서 96으로의 스케줄링.
- 최종 향상된 신호를 정밀하게 다듬기 위해 후처리 필터를 도입함으로써 객관적 및 주관적 지표 향상

실험 결과
연구 질문
- RQ1이중 단계 음성 향상 프레임워크는 실시간 임베디드 배포에 적합한 계산 효율성을 유지하면서도 전체 대역 음성에서 최신 기술 수준의 성능를 달성할 수 있는가?
- RQ2학습률 웜업, 코스인 감쇠, 배치 스케줄링과 같은 최적화된 훈련 절차는 수렴성과 모델 성능에 어떤 영향을 미치는가?
- RQ3다중 해상도 스펙트로그램 손실은 음성 향상에서 청각적 품질과 강건성 향상에 어느 정도 기여하는가?
- RQ4심층 필터링은 최소한의 계산 오버헤드로도 기존의 복소수 비율 마스크보다 매우 노이즈가 많은 조건에서 우수한 성능를 보일 수 있는가?
- RQ5Raspberry Pi 4와 같은 저전력 하드웨어에서 달성 가능한 실시간 요인은 얼마이며, 이는 이전의 최신 기술 수준 방법들과 비교해 어떻게 되는가?
주요 결과
- DeepFilterNet2는 Voicebank+Demand 테스트 세트에서 PESQ 점수 3.08을 기록하여, FRCRN 및 GaGNet과 같은 이전 최신 기술 수준 방법들을 뛰어넘으며, 단지 230만 파라미터를 사용함.
- Core-i5 CPU에서 실시간 요인을 0.04로 낮춰 표준 노트북에서 효율적인 실시간 추론이 가능함.
- DNS4 블라인드 테스트 세트에서 DeepFilterNet2는 DNSMOS 점수로 SIGMOS 4.196, BAKMOS 4.427, OVLMOS 3.882를 기록하여 청소화된 기준 세트의 품질에 근접함.
- Raspberry Pi 4에서 실시간 요인 0.42로 실행되어 임베디드 배포의 가능성을 입증함.
- 후처리 필터 추가로 MOS 점수는 약간 향상되었으며, OVLMOS는 3.896에 도달하여 전반적인 음성 품질 향상이 확인됨.
- 파라미터 수가 약간 증가(2.306M)했음에도 불구하고, MACS는 0.356G를 유지하며, 훈련 및 아키텍처 최적화를 통해 DeepFilterNet(실시간 요인 0.11 → 0.04)에 비해 뚜렷한 성능 향상을 보임.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.