Skip to main content
QUICK REVIEW

[論文レビュー] Continual Learning For On-Device Environmental Sound Classification

Xiao Yang, Xubo Liu|arXiv (Cornell University)|Jul 15, 2022
Music and Audio Processing被引用数 5
ひとこと要約

本稿では、分類器の埋め込み層に対する摂動を用いて各サンプルの分類不確実性を測定することにより、災難的忘却を軽減する計算効率の高いリプレイベースの継続的学習手法であるUncertainty++を提案する。DCASE 2019およびESC-50で評価した結果、ベースラインの不確実性手法と比較して推論時間を90%以上短縮し、58.1%の精度を達成した。これは、リソース制限のある環境下でも優れた精度と効率性を示している。

ABSTRACT

Continuously learning new classes without catastrophic forgetting is a challenging problem for on-device environmental sound classification given the restrictions on computation resources (e.g., model size, running memory). To address this issue, we propose a simple and efficient continual learning method. Our method selects the historical data for the training by measuring the per-sample classification uncertainty. Specifically, we measure the uncertainty by observing how the classification probability of data fluctuates against the parallel perturbations added to the classifier embedding. In this way, the computation cost can be significantly reduced compared with adding perturbation to the raw data. Experimental results on the DCASE 2019 Task 1 and ESC-50 dataset show that our proposed method outperforms baseline continual learning methods on classification accuracy and computational efficiency, indicating our method can efficiently and incrementally learn new classes without the catastrophic forgetting problem for on-device environmental sound classification.

研究の動機と目的

  • 限られたメモリと計算リソースのため、オンデバイスでの環境音分類において災難的忘却が生じる課題に対処すること。
  • 高い計算コストを伴わずに、有用な歴史的サンプルを効率的に選択するメモリ更新アルゴリズム(MUA)を開発すること。
  • 過去の全データを再トレーニングせずに、新しい音声クラスを段階的に学習する継続的学習の場面で、分類精度と計算効率を向上させること。
  • サイズとメモリ制限が厳しいモバイルおよび組み込みプラットフォームへのデプロイに適したモデルに依存しない手法を設計すること。
  • 生の音声ではなく、埋め込み層における不確実性抽出が、計算オーバーヘッドを低減するのに有効であることを実証すること。

提案手法

  • 分類器の埋め込み層に摂動を適用することで、生の音声入力ではなく各サンプルの分類不確実性を測定する、新規のメモリ更新アルゴリズム(MUA)であるUncertainty++を提案する。
  • 予測クラス確率の変動を用いて不確実性を推定するため、埋め込み層にAudio Shift、Audio PitchShift、Audio Colored Noiseの複数の摂動タイプを適用する。
  • 不確実性スコアに基づいて、曖昧または分類が難しいとされるサンプルを優先してリプレイ用の履歴サンプルを選択し、以前に学習したクラスの知識を保持する。
  • 段階的学習の過程で選択されたリプレイサンプルを訓練プロセスに統合し、災難的忘却を最小限に抑えつつ、計算オーバーヘッドを低く保つ。
  • 埋め込み上での不確実性推定を微分可能プロセスとして定式化し、推論時間およびメモリ使用量への影響を最小限に抑える効率的な計算を実現する。
  • BC-ResNet-Mod(約86kパラメータ)のような小型オンデバイスモデルと互換性がある、軽量でモデルに依存しないフレームワークを実装する。

実験結果

リサーチクエスチョン

  • RQ1分類器の埋め込み層における不確実性に基づくサンプリングが、オンデバイス環境音分類において災難的忘却を効果的に軽減できるか。
  • RQ2生の音声特徴と比較して、埋め込み層に不確実性推定を適用した際の計算コストはどの程度か。
  • RQ3Random、Reservoir、Prototype、Uncertaintyといった既存のMUA手法と比較して、Uncertainty++は分類精度と推論効率の両面で優れているか。
  • RQ4摂動タイプの数を変化させた場合、不確実性推定プロセスの性能と計算コストにどのような影響があるか。
  • RQ5限られたオンデバイスリソース下の継続的学習シナリオにおいて、本手法が著しく短縮された学習時間とメモリ使用量を維持しながら高い精度を達成できるか。

主な発見

  • Uncertainty++はESC-50データセットで58.1%の分類精度を達成し、最良のベースライン(Uncertainty)および他のすべてのMUA手法を上回った。
  • 6種類の摂動タイプを用いても、タスクごとの平均学習時間を60秒未満に抑えることができ、Uncertaintyベースラインと比較して90%以上の短縮が達成された。
  • 2種類の摂動手法のみで、Uncertainty手法の性能をすでに上回ったことから、優れたサンプル効率を示した。
  • Uncertainty++のBWT(後方転送)スコアは、ベースライン手法と比較して顕著に低く、災難的忘却が軽減されていることを確認した。
  • 不確実性推定の平均推論時間は、Uncertainty手法と比較して90%以上短縮され、オンデバイスデプロイに非常に適している。
  • 本手法はデータセットに依存せず、DCASE 2019 Task 1およびESC-50の両方で一貫した性能向上を示し、多様な環境音分類タスクへの汎用性を検証した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。