Skip to main content
QUICK REVIEW

[論文レビュー] SoundCam: A Dataset for Finding Humans Using Room Acoustics

Mason Wang, S.D. Clarke|arXiv (Cornell University)|Nov 6, 2023
Speech and Audio Processing被引用数 4
ひとこと要約

SoundCam は、実世界の環境から収集された、5,000 件の 10 チャネル RIR と 3 つの多様な部屋における 2,000 件の音楽録音を含む、現在最大の公開可能で現実世界の部屋インパルス応答(RIR)データセットを提供する。このデータセットを用いることで、マルチマイク RIR を用いて 30 cm 以内の精度で人の位置特定が可能となるが、マイク数が少ない場合や未知の音源信号が使用される場合には性能が低下する。

ABSTRACT

A room's acoustic properties are a product of the room's geometry, the objects within the room, and their specific positions. A room's acoustic properties can be characterized by its impulse response (RIR) between a source and listener location, or roughly inferred from recordings of natural signals present in the room. Variations in the positions of objects in a room can effect measurable changes in the room's acoustic properties, as characterized by the RIR. Existing datasets of RIRs either do not systematically vary positions of objects in an environment, or they consist of only simulated RIRs. We present SoundCam, the largest dataset of unique RIRs from in-the-wild rooms publicly released to date. It includes 5,000 10-channel real-world measurements of room impulse responses and 2,000 10-channel recordings of music in three different rooms, including a controlled acoustic lab, an in-the-wild living room, and a conference room, with different humans in positions throughout each room. We show that these measurements can be used for interesting tasks, such as detecting and identifying humans, and tracking their positions.

研究の動機と目的

  • 人間の位置とアイデンティティを系統立てて変化させながら音響的変化を測定する、実世界の屋外的環境における RIR データセットが不足している問題を解決すること。
  • 部屋インパルス応答を環境状態の代理指標として用いることで、音声ベースの人間検出、位置特定、識別に関する研究を可能にすること。
  • 遮蔽や未知の音源信号を含む現実的な条件下での音声ベース手法の耐性を評価するためのベンチマークを提供すること。
  • 視覚データ収集を避けることでプライバシー保護型インDoorセンシングの代替手段を提供すること。
  • 悪意のある使用リスクを軽減するため、公開データセットとベンチマークを提供することで防御技術の開発を促進すること。

提案手法

  • 3 つの異なる部屋(制御された音響実験室、本物のリビングルーム、会議室)で、10 マイクのマルチチャネル(10 マイク)RIR を 5,000 件収集すること。
  • 各部屋で 2~5 人の被験者を系統立てて位置とアイデンティティを変化させながら、固定されたスピーカーとマイクのペアから RIR を測定すること。
  • 同じ部屋と被験者位置を維持した状態で、追加の 2,000 件の 10 チャネル音楽信号を録音し、自然でインパulseでない音源信号でのテストを可能にする。
  • すべての RIR および音声録音に、音源、受信機、人間被験者の位置とアイデンティティに関する正確なメタデータをアノテートすること。
  • マルチマイクおよびシングルマイクの設定を用いて、深層学習モデルを訓練・評価し、人間の位置特定と識別を実行すること。
  • マイク数の削減や未知の音源信号を含むアブレーション設定でのモデル性能を評価し、現実世界への一般化能力を検証すること。

実験結果

リサーチクエスチョン

  • RQ1マルチマイク設定を用いた場合、実世界の RIR を用いて室内環境における人間の位置特定を 30 cm 以内の精度で行えるか?
  • RQ2単一マイクまたは音楽のような未知の音源信号を使用する場合、性能はどの程度低下するか?
  • RQ3音声ベースのモデルは、未観測の人物や部屋のレイアウトにどの程度一般化できるか?
  • RQ4音楽などの自然な音源からの RIR を用いて、部屋内に人が存在するかどうかを高精度で検出できるか?
  • RQ5音声特徴のみを用いて、グループ内の人物を識別する音声ベース手法はどの程度効果的か?

主な発見

  • 10 マイク RIR を用いた学習ベースのモデルは、マルチマイク条件下で 30 cm 以内の誤差で人間の位置特定を達成しており、高い精度を示している。
  • 単一マイクを使用する場合、空間的多様性が制限されるため、位置特定精度が著しく低下する。
  • 未知の音楽を音源信号として使用し、10 マイクすべてを用いた場合、最良のベースラインモデルでも人間の存在検出は 67% の精度にとどまる。
  • 5 人の人物の中での識別において、最良のモデルは 10 マイクすべてを用いて 82% の精度を達成しており、アイデンティティ認識の強力な可能性を示している。
  • マイク数を 4、2、1 に減らすと、位置特定および識別両方のタスクで一貫して性能が低下し、高密度なマイクアレイの重要性が浮き彫りになる。
  • このデータセットは、視覚データ収集を避ける音声のみのトラッキングを可能にすることで、プライバシー保護型インDoorセンシングシステムの開発を支援する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。