Skip to main content
QUICK REVIEW

[論文レビュー] Neural Pitch-Shifting and Time-Stretching with Controllable LPCNet

Max Morrison, Zeyu Jin|arXiv (Cornell University)|Oct 5, 2021
Speech and Audio Processing参考文献 26被引用数 14
ひとこと要約

本稿では、LPCNetのピッチ表現を強化し、ピッチを音響特徴から分離するとともに、極端なピッチ範囲を含む拡張された訓練データを用いることで、高精細で制御可能なピッチシフトおよびタイムストレッチが可能な、改良型の神経音声生成器であるControllable LPCNet (CLPCNet) を提案する。CLPCNetは、従来の神経的およびDSPベースの手法に比べ、客観的および主観的な性能が優れており、ピッチシフトおよびタイムストレッチの品質を維持または上回るとともに、同時に音声符号化と操作を可能にする。

ABSTRACT

Modifying the pitch and timing of an audio signal are fundamental audio editing operations with applications in speech manipulation, audio-visual synchronization, and singing voice editing and synthesis. Thus far, methods for pitch-shifting and time-stretching that use digital signal processing (DSP) have been favored over deep learning approaches due to their speed and relatively higher quality. However, even existing DSP-based methods for pitch-shifting and time-stretching induce artifacts that degrade audio quality. In this paper, we propose Controllable LPCNet (CLPCNet), an improved LPCNet vocoder capable of pitch-shifting and time-stretching of speech. For objective evaluation, we show that CLPCNet performs pitch-shifting of speech on unseen datasets with high accuracy relative to prior neural methods. For subjective evaluation, we demonstrate that the quality and naturalness of pitch-shifting and time-stretching with CLPCNet on unseen datasets meets or exceeds competitive neural- or DSP-based approaches.

研究の動機と目的

  • 既存の神経的およびDSPベースの手法が、しばしばアーティファクトを生じさせたりトーンを損なったりするピッチシフトおよびタイムストレッチにおける限界を解消すること。
  • LPCNetのピッチシフト性能を向上させることを目的とし、3つの核心的問題を解決する:不十分なピッチ表現、ピッチと音響特徴の不十分な分離、極端なピッチ範囲における訓練データの不足。
  • 未学習の話者およびデータセットに対しても、一定比および可変比のピッチシフトおよびタイムストレッチを高精細で実現すること。
  • 1つの統合フレームワーク内で高品質な音声合成と操作を同時に実現し、リアルタイムでのインタラクティブ編集を可能にすること。
  • 神経的アプローチが、TD-PSOLA や WORLD といった確立されたDSPツールと同等またはそれを上回る知覚的品質を達成できることを示すこと。

提案手法

  • ピッチ表現を強化し、スペクトル特徴からピッチを明示的に分離することで、制御性を向上させ、アーティファクトを低減する。
  • 極端なピッチ範囲(非常に高い・低い)を含む訓練データを拡張することで、話者およびピッチ変動にわたる一般化性能を向上させる。
  • 自己回帰的生成における励起信号モデリングを改善するため、サンプリングレートネットワークのGRU層にスパarsity制約を削除する。
  • 性能を低下させるデータオーグメンテーション手法を回避する修正されたトレーニングパイプラインを導入することで、安定性と正確性を向上させる。
  • 2本のブランチを持つネットワークアーキテクチャを採用:フレームレートネットワークはピッチ、周期性、BFCCを処理し、サンプリングレートネットワークは自己回帰的にmu-law符号化された励起サンプルを生成する。
  • ソース・フィルタ分解を適用し、残差(ピッチおよびノイズ)成分とスペクトル(トーン)成分を別々にモデリングすることで、ピッチおよび期間の正確な操作を可能にする。

実験結果

リサーチクエスチョン

  • RQ1LPCNetのような神経音声生成器は、合成品質を損なわずに、正確で自然な響きのピッチシフトおよびタイムストレッチに効果的に適応可能か?
  • RQ2ピッチ表現、特徴の分離、および訓練データの分布が、神経音声操作の性能にどのように影響するか?
  • RQ3CLPCNetは、TD-PSOLA や WORLD といった確立されたDSPベースの手法を、ピッチシフトおよびタイムストレッチの両方の客観的指標および主観的聴取テストで上回るか?
  • RQ4CLPCNetは、未学習の話者およびデータセットに対しても、可変比音声操作タスクにおいて高精細を維持して一般化可能か?
  • RQ51つの神経音声生成器が、高品質な音声符号化と制御可能な音声操作を同時にどの程度実現できるか?

主な発見

  • CLPCNetは、Ravdessデータセットにおける未学習話者に対する一定比ピッチシフト(比1.00)で平均F1スコア0.945を達成し、LPCNet(F1 = 0.791)を著しく上回り、既存の神経的手法と同等またはそれを上回る。
  • 客観的指標において、CLPCNetは1.00ピッチ比でRMS誤差21.6、GPE 0.040に低下させたのに対し、LPCNetは79.5および0.101であった。ピッチ精度の大幅な向上を示している。
  • 主観的MOSテストでは、CLPCNetはすべての条件下でLPCNetを上回り、ほとんどのピッチシフトおよびタイムストレッチ比においてWORLDおよびTD-PSOLAと同等またはそれ以上の自然さと品質を達成した。
  • 可変比ピッチシフトにおいて、CLPCNetはMOS 4.25を達成し、既存の神経的手法を著しく上回り、オリジナル録音に近い品質に近づいた。
  • アブレーションスタディでは、スパarsity制約の削除およびデータオーグメンテーションの排除により、DAPSでF1が0.779から0.945に上昇した。すべての改善を適用した場合の性能向上が明確に示された。
  • CLPCNetは、未学習話者およびデータセットへの一般化性能が優れており、VCTK(学習済みおよび未学習)およびRAVDESSの両方で一貫した性能を示した。未学習データにおいて1.00比でRMS誤差が20.0未満を維持した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。