Skip to main content
QUICK REVIEW

[论文解读] A Multimodal CNN-based Tool to Censure Inappropriate Video Scenes

Pedro V. A. de Freitas, Paulo Renato da Costa Mendes|arXiv (Cornell University)|Nov 10, 2019
Digital Media Forensic Detection参考文献 8被引用 5
一句话总结

本文提出了一种基于多模态CNN的系统,通过结合视觉和音频特征,自动检测并屏蔽不适当视频场景。通过利用预训练CNN对视频帧和音频进行迁移学习,该模型在正常内容上的F1得分为98.95%,在不适当内容上的F1得分为98.94%,实现了对有害片段的精确定位与屏蔽,同时保留了合法内容。

ABSTRACT

Due to the extensive use of video-sharing platforms and services for their storage, the amount of such media on the internet has become massive. This volume of data makes it difficult to control the kind of content that may be present in such video files. One of the main concerns regarding the video content is if it has an inappropriate subject matter, such as nudity, violence, or other potentially disturbing content. More than telling if a video is either appropriate or inappropriate, it is also important to identify which parts of it contain such content, for preserving parts that would be discarded in a simple broad analysis. In this work, we present a multimodal~(using audio and image features) architecture based on Convolutional Neural Networks (CNNs) for detecting inappropriate scenes in video files. In the task of classifying video files, our model achieved 98.95\% and 98.94\% of F1-score for the appropriate and inappropriate classes, respectively. We also present a censoring tool that automatically censors inappropriate segments of a video file.

研究动机与目标

  • 解决在不丢弃整个视频的前提下识别并屏蔽特定不适当视频场景的挑战。
  • 通过使用深度学习整合视觉与音频模态,改进现有视频分类方法。
  • 开发一种实用工具,仅对有害片段进行自动屏蔽,同时保留适当内容。
  • 通过聚焦于场景级检测而非整视频分类,减少内容审核中的误报。
  • 通过选择性屏蔽仅不适当的场景,使用户能够访问包含敏感但非冒犯性内容的教育或信息类视频(例如战争纪录片)。

提出的方法

  • 系统将视频分割为5秒的片段,以实现细粒度分析。
  • 使用两个预训练的CNN(主干网络):一个用于从视频帧中提取视觉特征,另一个用于从音频轨道中提取音频特征。
  • 应用迁移学习,基于ImageNet和AudioSet的数据集对主干网络进行微调。
  • 将两种模态的特征拼接成每个视频片段的单一特征向量。
  • 使用浅层全连接分类器结合多模态特征,预测某片段是否适当或不适当。
  • 在屏蔽阶段,对预测为不适当的片段的帧应用高斯模糊处理,并静音音频。

实验结果

研究问题

  • RQ1多模态CNN模型能否通过结合视觉和音频特征有效检测不适当的视频场景?
  • RQ2与单模态方法(如仅图像)相比,多模态方法在分类不适当视频内容方面的性能如何?
  • RQ3该模型在多大程度上能够实现对不适当内容的片段级定位,从而支持选择性屏蔽?
  • RQ4所提出的工具能否在有效屏蔽有害片段的同时,保持适当视频内容的完整性?
  • RQ5该模型在涉及用户上传或包含敏感内容的教育类视频等实际场景中具有多大适用性?

主要发现

  • 该模型在测试集上对正常视频片段的F1得分为98.95%,对不适当视频片段的F1得分为98.94%,表明其具有高精度与高召回率。
  • 该模型在20折交叉验证中表现出稳健的泛化能力,标准差较低,性能稳定。
  • 不适当内容的F1得分略低于正常内容,但仍高于98.9%,表明其对有害内容具有强大的检测能力。
  • 该工具通过在帧上应用高斯模糊和静音音频,仅对预测为不适当的片段进行屏蔽,其余视频内容得以完整保留。
  • 使用场景演示表明,系统可通过分割、分类和自动屏蔽内容的流水线处理方式,实现对长达一小时视频的自动处理。
  • 通过同时利用视觉和音频线索,该模型优于单模态方法,降低了复杂场景中误分类的风险。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。