[논문 리뷰] DeepSafety:Multi-level Audio-Text Feature Extraction and Fusion Approach for Violence Detection in Conversations
이 논문은 BERT, LSTM, MFCC 및 시간 도메인 음성 임베딩을 사용하여 음성과 텍스트 특징을 다중 수준에서 융합하는 멀티모달 딥러닝 프레임워크인 DeepSafety를 제안한다. 이는 대화 중 폭력 행위를 탐지하기 위한 것이다. 이질적인 특징을 삼중층 완전 연결 네트워크와 결정 수준 융합을 통해 통합함으로써 F1 스코어 0.85를 달성하였으며, 단일 모odal 접근 방식보다 뛰어난 성능을 보였다.
Natural Language Processing has recently made understanding human interaction easier, leading to improved sentimental analysis and behaviour prediction. However, the choice of words and vocal cues in conversations presents an underexplored rich source of natural language data for personal safety and crime prevention. When accompanied by audio analysis, it makes it possible to understand the context of a conversation, including the level of tension or rift between people. Building on existing work, we introduce a new information fusion approach that extracts and fuses multi-level features including verbal, vocal, and text as heterogeneous sources of information to detect the extent of violent behaviours in conversations. Our multilevel multimodel fusion framework integrates four types of information from raw audio signals including embeddings generated from both BERT and Bi-long short-term memory (LSTM) models along with the output of 2D CNN applied to Mel-frequency Cepstrum (MFCC) as well as the output of audio Time-Domain dense layer. The embeddings are then passed to three-layer FC networks, which serve as a concatenated step. Our experimental setup revealed that the combination of the multi-level features from different modalities achieves better performance than using a single one with F1 Score=0.85. We expect that the findings derived from our method provides new approaches for violence detection in conversations.
연구 동기 및 목표
- 실생활에서의 구두 상호작용에서 유래한 음성과 텍스트 특징을 융합하여 대화 중 폭력 행위를 탐지하는 멀티모달 시스템을 개발하기 위해.
- 텍스트 중심 또는 음성 중심 접근 방식의 한계를 보완하기 위해 이질적인 모odal을 통합하여 더 풍부한 맥락 이해를 가능하게 하기 위해.
- 개인 안전 및 범죄 예방을 위해 엣지 컴퓨팅 기반의 웨어러블 기기에서 실시간 폭력 행위 탐지를 가능하게 하기 위해.
- 물리적 폭력 행위 탐지 향상을 위해 이동 감지 및 근접 감지와 같은 추가 모달의 통합을 탐색하기 위해.
- 현장 처리 및 다중 신뢰 레이어 데이터 공유 모델을 통해 기밀성을 확보하기 위해.
제안 방법
- 음성 대화의 음성 인식 결과에서 BERT 및 Bi-LSTM 모델을 사용해 텍스트 임베딩을 추출한다.
- 멜 주파수 푸리에 변환(MFCC)과 스펙트로그램에 적용된 2D CNN에 더하여 시간 도메인 밀도층 출력을 활용해 음성 특징을 생성한다.
- 세 단계 완전 연결 네트워크를 통해 텍스트 및 음성 모달에서 유래한 다중 수준 특징을 연결하여 융합한다.
- 다양한 모달에서 유래한 분류기의 조합을 통해 결정 수준 융합을 적용하여 탐지 정확도를 향상시킨다.
- 현장 처리 및 개인정보 위험 감소를 위한 실시간 추론을 가능하게 하는 엣지 컴퓨팅 아키텍처를 적용한다.
- 지연 시간과 저장 요구량을 줄이기 위해 필터 프루닝 및 양자화(예: 이진 신경망)와 같은 모델 압축 기법을 적용할 계획이다.
실험 결과
연구 질문
- RQ1음성과 텍스트 특징의 다중 수준 융합이 단일 모달 접근 방식에 비해 대화 중 폭력 행위 탐지 성능을 향상시킬 수 있는가?
- RQ2BERT 기반 텍스트 임베딩과 음성 특징(MFCC, 시간 도메인)의 통합은 폭력 의도를 얼마나 잘 포착할 수 있는가?
- RQ3음성 전사에서 유래한 심리언어학적 및 맥락적 특징은 폭력 분류 정확도를 얼마나 향상시키는가?
- RQ4엣지 컴퓨팅 및 현장 처리는 웨어러블 시스템에서 실시간이고 기밀성을 확보한 폭력 행위 탐지에 어떻게 기여하는가?
- RQ5이동 감지 및 근접 감지와 같은 추가 모달은 물리적 폭력 행위 탐지에 어떤 역할을 할 수 있는가?
주요 결과
- 제안된 다중 수준 멀티모달 융합 프레임워크는 F1 스코어 0.85를 달성하여 단일 모달 기반 베이스라인보다 뛰어난 성능을 보였다.
- 텍스트 기반 특징, 특히 BERT 임베딩이 음성 전용 특징보다 성능 향상에 더 크게 기여하였다.
- MFCC 및 시간 도메인 음성 특징의 통합은 폭력과 관련된 정서적 긴장감과 돌연한 변화를 탐지하는 데 모델의 능력을 향상시켰다.
- 장기적 주제 모델링을 통해 사자어나 영역 전용 언어를 포함한 맥락 의존적 폭력 행위 탐지에 뛰어난 강건성을 보였다.
- 필터 프루닝 및 양자화와 같은 모델 압축 기법은 모델 크기와 지연 시간을 줄이는 데 유용하며, 엣지 장치에의 배포를 가능하게 한다.
- 현장 처리 및 다중 신뢰 레이어 데이터 공유 모델을 통한 기밀성 보장 배포가 실현 가능하고 실생활 도입에 필수적임을 검증하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.