Skip to main content
QUICK REVIEW

[論文レビュー] Automatic Classification of X-rated Videos using Obscene Sound Analysis based on a Repeated Curve-like Spectrum Feature

Jae-Deok Lim, Byeong-Cheol Choi|arXiv (Cornell University)|Dec 9, 2011
Video Analysis and Summarization参考文献 16被引用数 3
ひとこと要約

本論文では、音声分析を用いて性的な喘ぎ声や叫び声などの不適切な音声を検出することで、X指定動画を自動的に分類するための繰り返しの曲線に似たスペクトル特徴を提案する。この手法はクリアな音声データでは96.6%のF1スコアを達成し、ノイズの強い5dB SNRデータでも92.6%を記録し、音声情報のみを用いても明確なコンテンツを高精度に特定できることを示している。

ABSTRACT

This paper addresses the automatic classification of X-rated videos by analyzing its obscene sounds. In this paper, obscene sounds refer to audio signals generated from sexual moans and screams during sexual scenes. By analyzing various sound samples, we determined the distinguishable characteristics of obscene sounds and propose a repeated curve-like spectrum feature that represents the characteristics of such sounds. We constructed 6,269 audio clips to evaluate the proposed feature, and separately constructed 1,200 X-rated and general videos for classification. The proposed feature has an F1-score, precision, and recall rate of 96.6%, 98.2%, and 95.2%, respectively, for the original dataset, and 92.6%, 97.6%, and 88.0% for a noisy dataset of 5dB SNR. And, in classifying videos, the feature has more than a 90% F1-score, 97% precision, and an 84% recall rate. From the measured performance, X-rated videos can be classified with only the audio features and the repeated curve-like spectrum feature is suitable to detect obscene sounds.

研究の動機と目的

  • 音声信号のみを用いて動画内のX指定コンテンツを自動的に検出する課題に対処すること。
  • 性的な喘ぎ声や叫び声などの不適切な音声に特徴的な音響的パターンを特定すること。
  • これらの音声の繰り返し的で曲線に似た性質を捉える、耐障害性の高いスペクトル特徴を開発すること。
  • 実世界の適用を想定し、クリアな音声とノイズのある音声データの両方で特徴の性能を評価すること。

提案手法

  • X指定動画と一般動画から抽出した6,269件の音声クリップを分析し、不適切な音声に共通する繰り返しのスペクトルパターンを同定した。
  • 性的な喘ぎ声や叫び声の周期的で調波に似た構造をモデル化する、新規の繰り返しの曲線に似たスペクトル特徴を提案した。
  • スペクトルエンVELOープ分析に基づき、周波数帯域全体にわたり繰り返し的で滑らかな曲線に似たパターンに注目した。
  • 提案されたスペクトル特徴を学習データとして機械学習モデルを訓練し、元のデータとノイズのあるデータの両方で分類を実施した。
  • 視覚的またはテキスト的コンテンツに依存せず、音声のみに焦点を当てた。
  • 標準的な指標(F1スコア、適合率、再現率)を用いて、クリアな音声と5dB SNRの劣化音声の両方で性能を評価した。

実験結果

リサーチクエスチョン

  • RQ1X指定動画内の不適切な音声は、スペクトル特徴を用いて一般の音声から信頼性高く区別できるか?
  • RQ2繰り返しの曲線に似たスペクトル特徴は、性的な喘ぎ声や叫び声の音響的特徴を効果的に捉えられるか?
  • RQ3実世界の動画コンテンツで一般的なノイズのある音声条件下でも、提案された特徴は一般化性を示せるか?
  • RQ4音声特徴のみを用いてX指定動画の自動分類を高精度で実現できるか?
  • RQ5この手法はクリアな音声と劣化音声の両方のデータセットでどの程度の性能を示すか?

主な発見

  • 提案された繰り返しの曲線に似たスペクトル特徴は、元の(クリアな)音声データセットでF1スコア96.6%、適合率98.2%、再現率95.2%を達成した。
  • SNRが5dBのノイズのあるデータセットでは、F1スコア92.6%、適合率97.6%、再現率88.0%の高い性能を維持した。
  • 動画全体の分類において、F1スコアは90%以上、適合率97%、再現率84%を達成した。
  • 音声のみを用いたX指定コンテンツの分類が、提案されたスペクトル特徴によって実現可能であることが確認された。
  • 特徴はノイズに対して頑健であり、劣化音声条件でも高い性能を維持した。
  • 本研究では、不適切な音声が一貫したスペクトルパターンを示しており、提案手法によって効果的にモデル化・検出可能であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。