Skip to main content
QUICK REVIEW

[論文レビュー] Diet deep generative audio models with structured lottery

Philippe Esling, Ninon Devis|arXiv (Cornell University)|Jul 31, 2020
Music and Audio Processing参考文献 22被引用数 4
ひとこと要約

本稿では、高精度を維持するスパースで構造化されたサブネットワークを同定・訓練することで、超軽量な深層生成音声モデルを構築するための構造的ロットリーサーチプルーニングを提案する。構造化プルーニングにグローバル相互情報量基準を用いることで、モデルサイズを最大95%まで削減しつつ精度の低下を最小限に抑え、CPU上でリアルタイム推論が可能となり、Raspberry Pi や Arduino といったプラットフォームへの埋め込みも可能となる。

ABSTRACT

Deep learning models have provided extremely successful solutions in most audio application fields. However, the high accuracy of these models comes at the expense of a tremendous computation cost. This aspect is almost always overlooked in evaluating the quality of proposed models. However, models should not be evaluated without taking into account their complexity. This aspect is especially critical in audio applications, which heavily relies on specialized embedded hardware with real-time constraints. In this paper, we build on recent observations that deep models are highly overparameterized, by studying the lottery ticket hypothesis on deep generative audio models. This hypothesis states that extremely efficient small sub-networks exist in deep models and would provide higher accuracy than larger models if trained in isolation. However, lottery tickets are found by relying on unstructured masking, which means that resulting models do not provide any gain in either disk size or inference time. Instead, we develop here a method aimed at performing structured trimming. We show that this requires to rely on global selection and introduce a specific criterion based on mutual information. First, we confirm the surprising result that smaller models provide higher accuracy than their large counterparts. We further show that we can remove up to 95% of the model weights without significant degradation in accuracy. Hence, we can obtain very light models for generative audio across popular methods such as Wavenet, SING or DDSP, that are up to 100 times smaller with commensurate accuracy. We study the theoretical bounds for embedding these models on Raspberry Pi and Arduino, and show that we can obtain generative models on CPU with equivalent quality as large GPU models. Finally, we discuss the possibility of implementing deep generative audio models on embedded platforms.

研究の動機と目的

  • リアルタイムおよび組み込みシステムへの展開を制限する、深層生成音声モデルの高い計算コストとメモリ使用量に対処すること。
  • スパースなサブネットワークを初期化することで高い性能を達成するというロットリーサーチ仮説が、生成音声モデルに対しても適用可能かどうかを調査すること。
  • 個々の重みの削除にとどまらない非構造的プルーニングの非効率性を克服し、畳み込みチャネルなどの完全な計算ユニットを削除する構造的プルーニングを考案することで、モデルサイズと推論時間の真正な削減を実現すること。
  • FLOPs、ディスクサイズ、メモリ使用量の最適化を通じて、Arduino や Raspberry Pi といった低リソースプラットフォームへの高品質な生成音声モデルの展開を可能にすること。

提案手法

  • WaveNet や SING、DDSP などの深層生成音声モデルにロットリーサーチ仮説を適用し、初期化段階でスパースなサブネットワークを同定し、それらを独立して訓練することで高い精度を達成すること。
  • 個々の重みの削除ではなく、完全な畳み込みチャネルの削除により、モデルサイズと推論コストの真正な削減を実現する構造的プルーニングを導入すること。
  • 計算ユニットとターゲット出力との間の相互情報量に基づくグローバル選択基準を開発し、構造的プルーニングをガイドすることで、性能の維持を図ること。
  • 重みのリウィンドを伴う反復的プルーニングと再訓練を用いて、最も効果的なサブネットワークを同定・訓練し、堅牢性と精度を確保すること。
  • 推論速度(FLOPs)、ディスクサイズ(ストレージ)、読み書きメモリ(RAMアクセス)の3つの指標を用いて、リアルタイムおよび埋め込み可能性を評価するモデル効率評価を実施すること。
  • FLOPS推定値とハードウェア制約を用いて、組み込みプラットフォーム(Arduino、Raspberry Pi)上でプルーニングされたモデルをベンチマークし、埋め込み可能かどうかの閾値を特定すること。

実験結果

リサーチクエスチョン

  • RQ1ロットリーサーチ仮説は深層生成音声モデルに対しても成功裏に適用可能であり、より小型で高精度なモデルを生成することができるか?
  • RQ2個々の重みではなく完全なチャネルを削除する構造的プルーニングは、非構造的プルーニングと比較して、モデルサイズと推論時間に有意義な削減をもたらすか?
  • RQ3グローバルで情報理論的基準(相互情報量に基づく)が、過酷な圧縮下でも高い性能を維持するための構造的プルーニングを効果的にガイドできるか?
  • RQ4どの程度までプルーニングされた生成音声モデルを、Arduino や Raspberry Pi といった低消費電力プラットフォームに埋め込むことができるか?また、モデルサイズ、精度、ハードウェア制約の間にはどのようなトレードオフが存在するか?

主な発見

  • 構造的ロットリーサーチプルーニングによって得られた小型モデルは、それより大きなモデルよりも高い精度を達成しており、モデル圧縮の驚くべき利点を確認した。
  • モデル重みの最大95%を削除しても顕著な精度低下が生じず、生成音声モデルにおいて極めてスパースな構造が実現可能であることを示した。
  • 提案された相互情報量に基づく基準により、グローバルな構造的プルーニングが効果的に実施され、過酷な圧縮下でも精度を維持する点で、局所的プルーニングを上回った。
  • 軽量モデルは元のモデルと比較して最大100倍小さく、GPU同等の音声合成品質を維持しつつ、CPU上でリアルタイム推論が可能となった。
  • Raspberry Pi 1B では、モデルサイズとメモリ使用量は制約内に収まり、FLOPsはやや限界に近いが、より積極的なプルーニングにより、わずかな精度低下で埋め込みが可能となった。
  • Arduino プラットフォームでは、最小モデルですらFLOPSおよびメモリ制限を超え、埋め込み可能なモデルは元のモデルと比較して誤差率が2.5倍にまで上昇するなど、現在のハードウェア制約は依然として挑戦的であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。