Skip to main content
QUICK REVIEW

[論文レビュー] Improving the Environmental Perception of Autonomous Vehicles using Deep Learning-based Audio Classification

Finley Walden, Sagar Dasgupta|arXiv (Cornell University)|Sep 9, 2022
Noise Effects and Management被引用数 6
ひとこと要約

本論文は、都市部の重要な音声、たとえばサイレン、銃声、車のブザーを検出することで、自律走行車両(AV)の環境認識を向上させるための深層学習ベースの音声分類フレームワークを提案している。UrbanSound8kデータセットで訓練されたモデルは、AV関連の音声クラスにおいて97.82%の正確性を達成し、視認不能な障害物を検出する面で、既存の手法を上回る優れた性能を示している。

ABSTRACT

Sense of hearing is crucial for autonomous vehicles (AVs) to better perceive its surrounding environment. Although visual sensors of an AV, such as camera, lidar, and radar, help to see its surrounding environment, an AV cannot see beyond those sensors line of sight. On the other hand, an AV s sense of hearing cannot be obstructed by line of sight. For example, an AV can identify an emergency vehicle s siren through audio classification even though the emergency vehicle is not within the line of sight of the AV. Thus, auditory perception is complementary to the camera, lidar, and radar-based perception systems. This paper presents a deep learning-based robust audio classification framework aiming to achieve improved environmental perception for AVs. The presented framework leverages a deep Convolution Neural Network (CNN) to classify different audio classes. UrbanSound8k, an urban environment dataset, is used to train and test the developed framework. Seven audio classes i.e., air conditioner, car horn, children playing, dog bark, engine idling, gunshot, and siren, are identified from the UrbanSound8k dataset because of their relevancy related to AVs. Our framework can classify different audio classes with 97.82% accuracy. Moreover, the audio classification accuracies with all ten classes are presented, which proves that our framework performed better in the case of AV-related sounds compared to the existing audio classification frameworks.

研究の動機と目的

  • カメラやライダーなどの視覚センサーと併せて聴覚センシングを統合することで、自律走行車両の環境認識を向上させること。
  • 現実世界の条件下で、重要な都市音声を分類できる堅牢な深層学習フレームワークを開発すること。
  • サイレン、銃声、車のブザーなどAV関連の音声クラスにおける音声分類の性能を評価すること。
  • 音声認識が視認不能な障害物を検出できることを示し、AVの安全性を向上させること。
  • 提案されたフレームワークの正確性を、AV関連の音声クラスについて、既存の音声分類システムと比較すること。

提案手法

  • 生の音声信号から特徴を抽出・分類するために、深層畳み込みニューラルネットワーク(CNN)が用いられている。
  • 訓練およびテストにUrbanSound8kデータセットが使用され、空調、車のブザー、子供の遊び、犬の鳴き声、エンジンのアイドル、銃声、サイレンの7つのAV関連音声クラスに焦点を当てている。
  • 音声データは、深層学習に適したスペクトル特徴を抽出するためにメル周波数 cepstral コEfficients(MFCCs)を用いて事前処理されている。
  • モデルはクロスエントロピー損失と確率的勾配降下法最適化を用いてエンドツーエンドで訓練されている。
  • すべてのクラスにおいて、正確性、適合率、再現率、F1スコアといった標準指標を用いて性能が評価されている。
  • 汎化能力と頑健性を評価するために、フレームワークはUrbanSound8kの全10クラスでテストされている。

実験結果

リサーチクエスチョン

  • RQ1深層学習ベースの音声分類システムは、視覚センサーの制限を超えて自律走行車両の環境認識を向上させることができるか?
  • RQ2CNNは現実世界の条件下で、サイレンや銃声といったAV関連の都市音声をどれほど正確に分類できるか?
  • RQ3提案されたフレームワークは、視認不能な障害物を検出する面で、既存の音声分類モデルを上回る性能を示すか?
  • RQ4視覚センサーが遮蔽されている場合、音声認識が救急車の検出に与える影響は何か?
  • RQ5モデルはAV固有のクラスと一般の都市音声クラスの両方で、どの程度の性能を示すか?

主な発見

  • 提案された深層学習フレームワークは、UrbanSound8kデータセットの7つのAV関連音声クラスにおいて97.82%の分類正確性を達成した。
  • 既存の音声分類フレームワークと比較して、サイレンや銃声といったAVに重要な音声に対して、本モデルは優れた性能を示した。
  • フレームワークはUrbanSound8kデータセットの全10クラスにおいても高い正確性を維持しており、優れた汎化能力を示している。
  • 音声ベースの検出により、視認不能な場所にいる救急車のような緊急車両の識別が可能になった。
  • CNNベースのアプローチは、都市音響のスペクトル的および時間的パターンを効果的に捉えており、現実のノイズ条件下でも頑健な分類を可能にした。
  • 結果から、聴覚認識が自律走行車両の環境認識能力を顕著に向上させることを確認した。特に、遮蔽されたり複雑な都市環境において顕著である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。