[論文レビュー] DeepSafety:Multi-level Audio-Text Feature Extraction and Fusion Approach for Violence Detection in Conversations
本稿では、BERT、LSTM、MFCC、および時間領域音声埋め込みを用いて、複数のレベルで音声とテキスト特徴を統合するマルチモーダル深層学習フレームワーク「DeepSafety」を提案する。異種の特徴を3層の全結合ネットワークと意思決定段階の統合により統合することで、F1スコア0.85を達成し、単一モダリティ手法よりも優れた性能を示した。
Natural Language Processing has recently made understanding human interaction easier, leading to improved sentimental analysis and behaviour prediction. However, the choice of words and vocal cues in conversations presents an underexplored rich source of natural language data for personal safety and crime prevention. When accompanied by audio analysis, it makes it possible to understand the context of a conversation, including the level of tension or rift between people. Building on existing work, we introduce a new information fusion approach that extracts and fuses multi-level features including verbal, vocal, and text as heterogeneous sources of information to detect the extent of violent behaviours in conversations. Our multilevel multimodel fusion framework integrates four types of information from raw audio signals including embeddings generated from both BERT and Bi-long short-term memory (LSTM) models along with the output of 2D CNN applied to Mel-frequency Cepstrum (MFCC) as well as the output of audio Time-Domain dense layer. The embeddings are then passed to three-layer FC networks, which serve as a concatenated step. Our experimental setup revealed that the combination of the multi-level features from different modalities achieves better performance than using a single one with F1 Score=0.85. We expect that the findings derived from our method provides new approaches for violence detection in conversations.
研究の動機と目的
- 実世界の会話からの音声とテキスト特徴を統合することで、会話内の暴力を検出するマルチモーダルシステムの開発を目的とする。
- テキストのみまたは音声のみの手法の限界を克服するため、異種のモダリティを統合し、より豊かな文脈理解を実現することを目的とする。
- エッジコンピューティングを活用したウェアラブルデバイスを用いて、個人の安全と犯罪防止を目的としたリアルタイムの暴力検出を実現することを目的とする。
- 物理的暴力検出の向上を図るため、動き検出や近接センシングなどの追加モダリティの統合を検討することを目的とする。
- デバイス内処理とマルチトラストレイヤーのデータ共有モデルにより、プライバシーを確保することを目的とする。
提案手法
- 音声会話の字幕化されたテキストから、BERTおよびBi-LSTMモデルを用いてテキスト埋め込みを抽出する。
- メル周波数ケプストラム(MFCC)とスペクトログラムに2次元畳み込みニューラルネットワーク(2D CNN)を適用し、音声特徴を生成するとともに、時間領域の全結合層出力を得る。
- テキストと音声モダリティからの複数レベルの特徴を、3層の全結合ネットワークを介して連結することで統合する。
- 異なるモダリティからの分類器を組み合わせることで意思決定段階の統合を実施し、検出のロバスト性を向上させる。
- エッジコンピューティングアーキテクチャを採用することで、デバイス内でのデータ処理とプライバシーリスクの低減を実現し、リアルタイム推論を可能にする。
- 遅延とストレージ要件の低減を図るため、フィルタープルーニングや量子化(例:バイナリニューラルネットワーク)などのモデル圧縮技術を計画的に適用する。
実験結果
リサーチクエスチョン
- RQ1音声とテキスト特徴の複数レベルの統合は、単一モダリティ手法と比較して、会話内の暴力検出を改善できるか?
- RQ2BERTベースのテキスト埋め込みと音声特徴(MFCC、時間領域)の統合は、暴力的意図を捉えるのにどの程度有効か?
- RQ3字幕化された会話からの心理的・言語的および文脈的特徴は、暴力分類の正確性をどの程度向上させるか?
- RQ4エッジコンピューティングとデバイス内処理は、ウェアラブルシステムにおけるリアルタイムでプライバシーを守る暴力検出をどのように支援できるか?
- RQ5動き検出や近接センシングなどの追加モダリティは、物理的暴力検出において果たす役割は何か?
主な発見
- 提案された複数レベルのマルチモーダル統合フレームワークは、F1スコア0.85を達成し、単一モダリティベースラインを上回った。
- テキスト特徴、特にBERT埋め込みが、音声のみの特徴よりも性能向上により顕著な寄与を示した。
- MFCCと時間領域音声特徴の統合により、感情的緊張や暴力関連の急激な変化の検出能力が向上した。
- 縦断的トピックモデリングを用いることで、皮肉やドメイン固有の言語を含む文脈依存の暴力検出において、システムのロバスト性が確認された。
- フィルタープルーニングや量子化といったモデル圧縮技術は、モデルサイズと遅延の低減に有効であり、エッジデバイスへのデプロイが可能であることが示された。
- デバイス内処理とマルチトラストレイヤーのデータ共有モデルによるプライバシー保護型デプロイが、実現可能かつ実世界での採用に不可欠であることが検証された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。