Skip to main content
QUICK REVIEW

[論文レビュー] Cascaded Cross-Module Residual Learning towards Lightweight End-to-End Speech Coding

Kai Zhen, Jongmo Sung|arXiv (Cornell University)|Jun 18, 2019
Speech and Audio Processing参考文献 31被引用数 13
ひとこと要約

本稿では、2つの小型で専用のDNNを段階的に接続する構造を用いて、音声残差を再構築することで、低ビットレートでも最先端の知覚的品質を達成する、軽量でエンドツーエンドの音声コーデックであるCascaded Cross-Module Residual Learning (CMRL)を提案する。モデルのパラメータ数はたった0.9百万で、従来のDNNベースのコーデックと比べて顕著にモデルの複雑さを低減している。

ABSTRACT

Speech codecs learn compact representations of speech signals to facilitate data transmission. Many recent deep neural network (DNN) based end-to-end speech codecs achieve low bitrates and high perceptual quality at the cost of model complexity. We propose a cross-module residual learning (CMRL) pipeline as a module carrier with each module reconstructing the residual from its preceding modules. CMRL differs from other DNN-based speech codecs, in that rather than modeling speech compression problem in a single large neural network, it optimizes a series of less-complicated modules in a two-phase training scheme. The proposed method shows better objective performance than AMR-WB and the state-of-the-art DNN-based speech codec with a similar network architecture. As an end-to-end model, it takes raw PCM signals as an input, but is also compatible with linear predictive coding (LPC), showing better subjective quality at high bitrates than AMR-WB and OPUS. The gain is achieved by using only 0.9 million trainable parameters, a significantly less complex architecture than the other DNN-based codecs in the literature.

研究の動機と目的

  • 深層畳み込みニューラルネットワーク(DNN)ベースのエンドツーエンド音声コーデックのモデル複雑度を低減しつつ、高い知覚的品質を維持すること。
  • WaveNetベースのモデルのように最大2000万パラメータを要するような、既存のDNNコーデックの高い計算コストを是正すること。
  • 逐次的なモジュール間で残差を学習することで再構築精度を向上させる、モジュラーで段階的なアーキテクチャの開発。
  • 高ビットレートでの性能向上を図るため、線形予測符号化(LPC)との互換性を確保すること。
  • 標準コーデック(AMR-WB や OPUS)と同等の性能を、極めて少ないパラメータ数で達成すること。

提案手法

  • CMRLは2段階の訓練スキームを採用している:まず個々のモジュールを別々に訓練し、その後に全体のカスケードを微調整する。
  • カスケード内の各モジュールは、直前のモジュールが残した残差信号を再構築することを学習し、段階的な精緻化を実現する。
  • ボトルネック残差ブロックを用い、拡張率を1および2に設定することで、パラメータ数を削減しながら表現力は維持している。
  • 1次元畳み込みを用い、カーネルサイズ9、Leaky ReLU活性化関数を採用し、アップサンプリングにはサブピクセル畳み込みを適用している。
  • モデルは生のPCM信号またはLPC残差を直接処理でき、LPC係数は2.4 kbpsで送信され、互換性が確保されている。
  • 量子化された残差信号に対してエントロピー符号化を適用し、8.85、15.85、19.85、23.85 kbpsのターゲットビットレートを達成している。

実験結果

リサーチクエスチョン

  • RQ1段階的かつモジュラーなDNNアーキテクチャは、単一の大規模ネットワークに比べて、より低いモデル複雑度で優れた知覚的品質を達成できるか?
  • RQ2高ビットレートにおいて、CMRLはAMR-WB や OPUS と比較して、主観的聴取テストでどの程度の性能を示すか?
  • RQ3PESQ や SNR といった客観的指標において、Kankanahalli-Net といった最先端のDNNコーデックをどの程度上回るか?
  • RQ4LPC を前処理モジュールとして統合することで、特に高ビットレートでの性能が向上するか?
  • RQ5たった0.9百万パラメータの軽量モデルが、複数のビットレート領域で競争力のある性能を達成できるか?

主な発見

  • 生のPCM入力で23.85 kbpsの条件下でCMRLはPESQ 4.42を達成し、23.85 kbpsのAMR-WB(PESQ 4.13)およびKankanahalli-Net(PESQ 4.30)を上回った。
  • 8.85 kbpsの条件下でCMRLのSNR(13.45 dB)は、23.85 kbpsのAMR-WBのSNR(9.82 dB)を上回り、優れた圧縮効率を示した。
  • LPC残差入力の条件下では、CMRLはMUSHRA主観テストにおいて19.85 kbpsおよび23.85 kbpsのAMR-WBを上回り、23.85 kbpsではOPUSをわずかに上回った。
  • モデルの複雑度はたった0.9百万パラメータであり、WaveNetベースのVAEコーデック(2000万パラメータ)の5%未満であり、Kankanahalli-Netよりも40%少ない。
  • 2番目のモジュールの追加と微調整により、SNRおよびPESQの両方で顕著な性能向上が確認され、段階的残差設計の有効性が裏付けられた。
  • 2モジュールのCMRLシステムは、15.85 kbpsの条件下でAMR-WBの23.85 kbpsよりも高いPESQを達成し、低ビットレートでの優れた性能を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。