[논문 리뷰] Automatic Classification of X-rated Videos using Obscene Sound Analysis based on a Repeated Curve-like Spectrum Feature
이 논문은 음성 분석을 통해 성적 비속어 소리—예를 들어 성적 탄성과 비명 소리—를 탐지하여 X 레이팅 비디오를 자동으로 분류하기 위해 반복적인 곡선 형태의 스펙트럼 특징을 제안한다. 이 방법은 청소된 음성에서 96.6%의 F1 스코어를, 잡음이 있는 5dB SNR 데이터에서 92.6%의 F1 스코어를 기록하여 오직 음성 신호에 의존함으로써 고도로 정확한 명시적 콘텐츠 식별을 입증한다.
This paper addresses the automatic classification of X-rated videos by analyzing its obscene sounds. In this paper, obscene sounds refer to audio signals generated from sexual moans and screams during sexual scenes. By analyzing various sound samples, we determined the distinguishable characteristics of obscene sounds and propose a repeated curve-like spectrum feature that represents the characteristics of such sounds. We constructed 6,269 audio clips to evaluate the proposed feature, and separately constructed 1,200 X-rated and general videos for classification. The proposed feature has an F1-score, precision, and recall rate of 96.6%, 98.2%, and 95.2%, respectively, for the original dataset, and 92.6%, 97.6%, and 88.0% for a noisy dataset of 5dB SNR. And, in classifying videos, the feature has more than a 90% F1-score, 97% precision, and an 84% recall rate. From the measured performance, X-rated videos can be classified with only the audio features and the repeated curve-like spectrum feature is suitable to detect obscene sounds.
연구 동기 및 목표
- 오직 음성 신호에 의존하여 비디오 속 X 레이팅 콘텐츠를 자동으로 탐지하는 과제를 해결하기 위해.
- 성적 탄성과 비명 소리와 같은 비속어 소리에서 특징적인 청각 패턴을 식별하기 위해.
- 이러한 소리의 반복적이고 곡선 형태의 특성을 잘 반영하는 강건한 스펙트럼 특징을 개발하기 위해.
- 실제 적용 가능성을 확보하기 위해 청소된 음성과 잡음이 있는 음성 데이터셋 모두에서 특징의 성능을 평가하기 위해.
제안 방법
- 저자는 X 레이팅 비디오와 일반 비디오에서 추출한 총 6,269개의 음성 클립을 분석하여 비속어 소리에서 반복적인 스펙트럼 패턴을 식별한다.
- 성적 탄성과 비명 소리의 주기적이고 조화형인 구조를 모델링하는 새로운 반복적인 곡선 형태의 스펙트럼 특징을 제안한다.
- 이 특징는 주파수 대역 간에 반복적이고 부드러운 곡선 형태의 패턴을 강조하는 스펙트럼 에너볼롭 분석에서 유도된다.
- 기계 학습 모델을 제안된 스펙트럼 특징에 기반해 훈련하고, 원본 및 잡음이 있는 음성 데이터셋에서 평가함으로써 분류를 수행한다.
- 이 방법은 시각적 또는 텍스트 기반 콘텐츠에 의존하지 않고 오직 음성에만 집중한다.
- 표준 평가 지표인 F1 스코어, 정밀도, 재현율을 사용하여 청소된 음성과 5dB SNR로 떨어진 음성에서 성능을 평가한다.
실험 결과
연구 질문
- RQ1X 레이팅 비디오의 비속어 소리는 스펙트럼 특징을 통해 일반 음성과 신뢰성 있게 구분될 수 있는가?
- RQ2반복적인 곡선 형태의 스펙트럼 특징이 성적 탄성과 비명 소리의 청각적 특성을 효과적으로 포착하는가?
- RQ3실제 비디오 콘텐츠에서 흔히 발생하는 잡음 조건에서 제안된 특징이 얼마나 잘 일반화되는가?
- RQ4오직 음성 특징을 사용하여 X 레이팅 비디오의 자동 분류를 고정밀도로 달성할 수 있는가?
- RQ5이 방법은 청소된 음성과 손상된 음성 데이터셋 모두에서 어떤 성능을 보이는가?
주요 결과
- 제안된 반복적인 곡선 형태의 스펙트럼 특징은 원본(청소된) 음성 데이터셋에서 F1 스코어 96.6%, 정밀도 98.2%, 재현율 95.2%를 기록한다.
- 5dB 신호 대 잡음비(SNR)를 가진 잡음이 있는 데이터셋에서는 F1 스코어 92.6%, 정밀도 97.6%, 재현율 88.0%를 유지하며 뛰어난 성능을 보인다.
- 전체 비디오 분류 과정에서 이 방법은 F1 스코어 90% 이상, 정밀도 97%, 재현율 84%를 달성한다.
- 결과는 오직 음성 기반 분류를 통해 X 레이팅 콘텐츠를 식별하는 것이 가능하다는 것을 확인한다.
- 특징는 잡음에 강건하여 손상된 음성 조건에서도 높은 성능을 유지한다.
- 연구는 비속어 소리가 일관된 스펙트럼 패턴을 가지며, 제안된 방법을 통해 효과적으로 모델링하고 탐지할 수 있음을 보여준다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.