Skip to main content
QUICK REVIEW

[論文レビュー] Now Playing: Continuous low-power music recognition

Arcas, Blaise Agüera y, Beat Gfeller|arXiv (Cornell University)|Nov 29, 2017
Music and Audio Processing参考文献 11被引用数 21
ひとこと要約

この論文では、音楽が検出された場合にのみニューラルネットワークファーゲートマッチャーを起動する低消費電力のDSPベースの音楽検出器を用いることで、継続的でデバイス内での音楽認識システム「Now Playing」を提示する。これにより、モバイルデバイスで1日あたり1%未塔のバッテリー消費でリアルタイムかつプライバシーを守った楽曲特定が可能になる。

ABSTRACT

Existing music recognition applications require a connection to a server that performs the actual recognition. In this paper we present a low-power music recognizer that runs entirely on a mobile device and automatically recognizes music without user interaction. To reduce battery consumption, a small music detector runs continuously on the mobile device's DSP chip and wakes up the main application processor only when it is confident that music is present. Once woken, the recognizer on the application processor is provided with a few seconds of audio which is fingerprinted and compared to the stored fingerprints in the on-device fingerprint database of tens of thousands of songs. Our presented system, Now Playing, has a daily battery usage of less than 1% on average, respects user privacy by running entirely on-device and can passively recognize a wide range of music.

研究の動機と目的

  • ユーザーの操作やインターネット接続を必要とせずに、モバイルデバイス上で継続的かつ受動的な音楽認識を可能にすること。
  • 音楽検出を専用のDSPチップにオフロードすることで、音楽が検出された場合にのみメインプロセッサを起動することにより、バッテリー消費を最小限に抑えること。
  • すべての音声処理およびファーゲートマッチングを完全にデバイス内でするため、サーバーにデータを送信しないことでユーザーのプライバシーを保護すること。
  • コンactな96次元のニューラルネットワークファーゲートマッチャーと効率的なデバイス内ファーゲートマッチングを用いて、高い認識精度を達成すること。
  • モバイルデバイスの制約を考慮し、ファーゲートサイズとデータベースの圧縮を最適化することで、ストレージ効率と認識性能の最適なトレードオフを実現すること。

提案手法

  • ニューラルネットワークファーゲートマッチャー(NNFP)は、短い音声セグメントごとに1秒ごとに96次元の埋め込みを生成し、同じ楽曲の類似性を高めるために三重損失を用いてトレーニングされる。
  • 軽量な音楽検出器はDSPチップ上で継続的に実行され、音声ストリームを分析し、信頼性の高い音楽が検出された場合にのみメインプロセッサを起動する。
  • システムは数秒間の検出器予測のスライディングウインドウ平均を用い、しきい値を超える連続した高信頼度の検出がc回以上発生した場合にのみ認識をトリガーする。
  • ファーゲートマッチングには近似最近傍探索とその後の細かいスコアリングを用い、数万ものファーゲートのデバイス内データベースから楽曲を効率的に特定する。
  • 各楽曲が平均して3 KB未満のストレージを占めるように、ストレージを維持しながら認識精度を保つために、量子化戦略を用いたデータベース圧縮が行われる。
  • システム全体は、低精度のモバイルハードウェアに実装を想定して、量子化された活性化を用いてトレーニングされ、エネルギー効率を確保する。

実験結果

リサーチクエスチョン

  • RQ1サーバー側処理に依存せずに、完全にモバイルデバイス上で継続的かつ低消費電力の音楽認識システムを実装できるか?
  • RQ2モバイルデプロイメントにおいて、ファーゲートサイズ、認識精度、デバイス内ストレージ効率の最適なトレードオフは何か?
  • RQ3現実の音声環境における背景ノイズを考慮し、偽陽性を最小限に抑えつつ十分な再現率を達成できるように、音楽検出器をどのように設計できるか?
  • RQ4実用的な使用状況下で、完全にデバイス内での音楽認識システムの実現可能なバッテリー消費はどの程度か?
  • RQ5低消費電力のモバイルDSPおよびアプリケーションプロセッサ上で、ニューラルネットワークベースのファーゲートマッピングとマッチングをどの程度最適化できるか?

主な発見

  • システムは1日あたり23.5 mAh、つまりPixel 2の2700 mAhバッテリーの約0.9%のバッテリー消費を達成しており、1日平均100回の起動にとどまる。
  • 96次元のファーゲートモデルは128次元モデルと比較してわずかに性能が劣るが、ストレージを30%削減できる。
  • 音楽検出器は、多様な背景ノイズを含む450時間のテストセットで75.5%の再現率を達成し、非静音音声では約20分に1回の割合で偽陽性を発生させる。
  • ニューラルネットワークファーゲートマッチャーは1秒ごとに1つの96次元埋め込みを生成し、最小限の遅延でリアルタイム処理が可能になる。
  • ユーザーの操作を一切必要とせず、受動的かつ継続的に音楽を認識でき、すべての処理とデータストレージがデバイス内に限定される。
  • DSPベースのゲートキーパーの使用により、全体の消費電力が0.4 mA未塔のスタンバイ増加に抑えられ、起動時以外は追加消費電力は発生しない。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。