Skip to main content
QUICK REVIEW

[論文レビュー] Deep Sound Field Reconstruction in Real Rooms: Introducing the ISOBEL Sound Field Dataset

Miklas S. Kristoffersen, Martin Bo Møller|arXiv (Cornell University)|Feb 12, 2021
Speech and Audio Processing被引用数 11
ひとこと要約

本稿では、4つの異なる部屋における実空間のインパulse応答を収集した公開データセット「ISOBEL Sound Field Dataset」と、5マイクロホン以内の最小限の測定で複素数値音場を再構築する深層学習ベースの手法を提案する。この手法は150 Hz未満の周波数で位相応答の高精度再構築を達成し、最小限の測定でも理想的な部屋伝達関数と同等の対比比を実現する音ゾーン制御を可能にする。

ABSTRACT

Knowledge of loudspeaker responses are useful in a number of applications, where a sound system is located inside a room that alters the listening experience depending on position within the room. Acquisition of sound fields for sound sources located in reverberant rooms can be achieved through labor intensive measurements of impulse response functions covering the room, or alternatively by means of reconstruction methods which can potentially require significantly fewer measurements. This paper extends evaluations of sound field reconstruction at low frequencies by introducing a dataset with measurements from four real rooms. The ISOBEL Sound Field dataset is publicly available, and aims to bridge the gap between synthetic and real-world sound fields in rectangular rooms. Moreover, the paper advances on a recent deep learning-based method for sound field reconstruction using a very low number of microphones, and proposes an approach for modeling both magnitude and phase response in a U-Net-like neural network architecture. The complex-valued sound field reconstruction demonstrates that the estimated room transfer functions are of high enough accuracy to allow for personalized sound zones with contrast ratios comparable to ideal room transfer functions using 15 microphones below 150 Hz.

研究の動機と目的

  • 合成データと現実世界の音場再構築のギャップを埋めるために、実空間の測定データを公開する。
  • シミュレートされたデータで学習した深層学習ベースの位相再構築モデルが、実空間(特に低周波数帯)に一般化できるかを評価する。
  • U-Netに類似したアーキテクチャを用いて、位相と大きさの両方を含む複素数値入力を再構築することで、精度を向上させる。
  • 再構築された音場が、マイクロホン数を最小限に抑えた状態で、実用的な音ゾーン制御アプリケーションにどのように有効に使えるかを実証する。

提案手法

  • ISOBEL Sound Field Datasetは、4つの実空間の長方形部屋で15マイクロホンを用いて収集され、床から1 mの高さの3次元グリッド上でインパulse応答が記録された。
  • U-Netに類似した深層ニューラルネットワークを用い、スパarsely配置されたマイクロホンの測定値から複素数値音場を再構築する。このモデルは、位相応答と大きさ応答の両方を学習する。
  • モデルはまず、異なる部屋の寸法とリバーブ時間を想定した大規模なシミュレーションデータで訓練され、一般化性能を向上させる。
  • 推論時に絶対座標を必要としないため、マイクロホンの相対的位置を無次元のグリッド上に表現する。
  • 音ゾーン制御の目的で、再構築された部屋伝達関数(RTF)を用いて、ゾーン間の音響的対比を最大化するビームフォーミング重みを計算する。
  • 性能評価は、シミュレーションおよび実空間の両方で音響的対比比(ACR)を用い、既知のRTFを用いたスパース再構築と比較する。

実験結果

リサーチクエスチョン

  • RQ1シミュレーションデータで学習した深層学習ベースの音場再構築手法が、特に低周波数帯において、現実世界の部屋に一般化して効果的に機能するか?
  • RQ2再構築プロセスで位相と大きさの両方をモデル化することで、位相のみを扱うモデルと比較して性能がどのように向上するか?
  • RQ3極めて少ないマイクロホン数からの複素数値音場再構築が、実空間の実用的音ゾーン制御にどの程度有効に機能するか?
  • RQ4複素数値再構築において、シミュレーションデータと実データの間にはどの程度の性能差が生じるか。その要因は何か?

主な発見

  • 15マイクロホンの測定を4つの実空間部屋で収集したISOBEL Sound Field Datasetが、音場再構築手法のベンチマーク支援を目的として公開された。
  • シミュレーションデータで学習した深層学習ベースの位相再構築モデルは、150 Hz未満の周波数帯で実空間でも高い精度を達成し、5マイクロホンおよび15マイクロホンのスパース再構築を上回った。
  • 複素数値再構築に拡張することで、再構築の忠実度が著しく向上し、理想的なRTFと同等の対比比を実現する高精度な音ゾーン制御が可能になった。
  • 5マイクロホンのみで再構築された音場は、150 Hz未満で実用的な音響的対比比を達成し、音ゾーン制御に十分な精度を有していた。
  • 複素数値再構築において、シミュレーションデータと実データの間には性能ギャップが存在し、合成データから実環境への位相情報の転送に課題があることが示唆された。
  • マイクロホン位置の不確実性に対しても、実世界の評価においても、最大±1.0 mのずれがあっても性能が維持されるという、ロバストネスを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。