Skip to main content
QUICK REVIEW

[論文レビュー] Tiny Transformers for Environmental Sound Classification at the Edge

David Elliott, Carlos E. Otero|arXiv (Cornell University)|Mar 22, 2021
Music and Audio Processing参考文献 51被引用数 12
ひとこと要約

本稿では、エッジデバイス向けに高効率な、BERTベースのトランスフォーマーモデルを提案する。メルスペクトログ램と自己教師あり事前学習を用い、オフィスサウンドデータセットで訓練したモデルは、わずか6,642パラメータで、同等のCNNと比較して99.85%も小さいにもかかわらず、最先端の精度を達成し、モバイルおよびマイコンターゲット上でリアルタイム推論を可能にする。

ABSTRACT

With the growth of the Internet of Things and the rise of Big Data, data processing and machine learning applications are being moved to cheap and low size, weight, and power (SWaP) devices at the edge, often in the form of mobile phones, embedded systems, or microcontrollers. The field of Cyber-Physical Measurements and Signature Intelligence (MASINT) makes use of these devices to analyze and exploit data in ways not otherwise possible, which results in increased data quality, increased security, and decreased bandwidth. However, methods to train and deploy models at the edge are limited, and models with sufficient accuracy are often too large for the edge device. Therefore, there is a clear need for techniques to create efficient AI/ML at the edge. This work presents training techniques for audio models in the field of environmental sound classification at the edge. Specifically, we design and train Transformers to classify office sounds in audio clips. Results show that a BERT-based Transformer, trained on Mel spectrograms, can outperform a CNN using 99.85% fewer parameters. To achieve this result, we first tested several audio feature extraction techniques designed for Transformers, using ESC-50 for evaluation, along with various augmentations. Our final model outperforms the state-of-the-art MFCC-based CNN on the office sounds dataset, using just over 6,000 parameters -- small enough to run on a microcontroller.

研究の動機と目的

  • サイズ、重量、消費電力(SWaP)に制限のある低消費電力エッジデバイスに、正確で効率的な機械学習モデルを展開する課題に対処する。
  • 既存のCNNやトランスフォーマーの制限を克服し、マイコンやモバイルデバイスに適した、コンactでパラメータ効率の良いモデルを設計する。
  • 特定のESCデータセット(オフィスサウンド)において、小さな微調整済みトランスフォーマーが、標準ベンチマーク(ESC-50)では低い性能を示すにもかかわらず、より大きなCNNを上回ることを示す。
  • モデルサイズと計算コストを最小限に抑えることで、デバイス内推論および潜在的なデバイス内再訓練を可能にする。

提案手法

  • 自己注意機構とマスク予測目的を用いて、音声クリップのメルスペクトログ램上でBERTベースのトランスフォーマーを事前学習する。
  • マルチクラス分類のための標準的な交差エントロピー損失を用いて、オフィスサウンドデータセット上で事前学習済みモデルを微調整する。
  • 時間シフト、ノイズ注入、周波数マスキングなどのデータ拡張技術を用いて、耐障害性と一般化性能を向上させる。
  • 動的量子化を適用してモデルサイズと推論遅延を削減し、サムスンギャラクシーS9などのエッジデバイスへのデプロイを可能にする。
  • モバイルおよびマイコンターゲットプラットフォームでの推論遅延とバリデーション精度といった標準指標を用いて性能を評価する。
  • パラメータ数、FLOPs、推論時間を主な効率指標として用い、最先端のMFCCベースのCNNとモデルの性能と効率を比較する。

実験結果

リサーチクエスチョン

  • RQ1エッジデバイス向けに、非常に小さな効率的なトランスフォーマーモデルが、はるかに大きなCNNよりも優れた精度を達成できるか?
  • RQ2モデルサイズとパラメータ数は、モバイルおよびマイコンターゲットプラットフォームでの推論速度とエネルギー効率にどのように影響するか?
  • RQ3ESC-50データセットよりも大規模で多様性に富んだデータセットでは成績が芳しくないにもかかわらず、なぜトランスフォーマーがオフィスサウンドデータセットでCNNを上回るのか?
  • RQ4量子化やモデル圧縮技術をどれだけ活用すれば、精度を損なわずに遅延とメモリフットプリントを削減できるか?
  • RQ51回の順伝播あたりの計算コストが極めて低いことから、このような極小モデルに対してデバイス内再訓練は実現可能か?

主な発見

  • 提案された6,642パラメータのトランスフォーマーは、オフィスサウンドデータセットにおいて、447万パラメータのCNNを2%以上上回るバリデーション精度を達成した。
  • CNNと比較してパラメータ数が99.85%も削減されたにもかかわらず、高い精度を維持しており、顕著な効率性の向上を示している。
  • サムスンギャラクシーS9における推論遅延は、最小モデルで7msにまで短縮され、CNNよりも88%速く、100万パラメータのトランスフォーマーと比較しても93%速かった。
  • 動的量子化により推論遅延が21%削減されたことから、静的量子化を用いることでさらなる最適化の余地があることが示唆された。
  • 5秒の音声クリップでは95.2%の精度を達成したが、1秒の入力に短縮すると性能が著しく低下したため、速度と精度のトレードオフが生じていることが明らかになった。
  • 各クラスに200個以上のサンプルが存在するオフィスサウンドデータセットでのモデルの成功は、トランスフォーマーの一般化性能にとって、より大規模でバランスの取れたデータセットが重要である可能性を示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。