Skip to main content
QUICK REVIEW

[论文解读] ADNet: A Deep Network for Detecting Adverts

Murhaf Hossari|arXiv (Cornell University)|Nov 9, 2018
Video Analysis and Summarization参考文献 11被引用 12
一句话总结

本文提出ADNet,一种基于VGG19启发的自定义架构的深度卷积神经网络,可自动检测户外视频帧中的广告牌。在包含18,945张图像的复合数据集上进行训练后,ADNet实现了94%的分类准确率,显著优于基线模型Inception-v3(56%),并以每帧57毫秒的速度处理视频帧,支持媒体制作中自动化产品投放的实时部署。

ABSTRACT

Online video advertising gives content providers the ability to deliver compelling content, reach a growing audience, and generate additional revenue from online media. Recently, advertising strategies are designed to look for original advert(s) in a video frame, and replacing them with new adverts. These strategies, popularly known as product placement or embedded marketing, greatly help the marketing agencies to reach out to a wider audience. However, in the existing literature, such detection of candidate frames in a video sequence for the purpose of advert integration, is done manually. In this paper, we propose a deep-learning architecture called ADNet, that automatically detects the presence of advertisements in video frames. Our approach is the first of its kind that automatically detects the presence of adverts in a video frame, and achieves state-of-the-art results on a public dataset.

研究动机与目标

  • 自动化后期内制作中识别广告集成候选视频帧的手动、耗时过程。
  • 解决现有深度学习方案在检测视频帧中现有广告(特别是广告牌)方面的缺失。
  • 开发一种系统,实现在目标广告和产品投放中高效、实时的广告牌检测。
  • 在公开数据集上,将自定义深度学习模型与Inception-v3等成熟架构的性能进行基准对比。
  • 探索未来将模型扩展至室内场景(如电影或电视剧)的可行性。

提出的方法

  • ADNet是一种受VGG19启发的自定义卷积神经网络架构,专为户外场景中的广告牌检测而设计。
  • 该模型采用一系列卷积和池化层,随后是使用ReLU和Softmax激活函数的全连接层。
  • 使用随机梯度下降进行训练,学习率为0.0001,批量大小为16,损失函数为分类交叉熵。
  • 训练数据集包含18,945张图像,其中9,395张为正样本(含广告牌),9,550张为负样本(无广告牌)。
  • 通过分类准确率(TP + TN) / (TP + TN + FP + FN)定义模型评估指标。
  • 采用微调后的预训练Inception-v3模型作为对比基准,使用相同的超参数在相同数据集上进行训练。

实验结果

研究问题

  • RQ1深度学习模型能否自动检测户外视频帧中广告牌的存在,从而减少对手动逐帧检查的依赖?
  • RQ2自定义设计的CNN(ADNet)在广告牌检测任务中与最先进的预训练模型(Inception-v3)相比表现如何?
  • RQ3ADNet在真实世界视频帧上的推理速度如何?是否能够在生产环境中支持实时处理?
  • RQ4哪些视觉混淆因素导致ADNet模型产生误分类错误?
  • RQ5该模型能否扩展以检测电影或电视剧等室内场景中的广告?

主要发现

  • ADNet在测试集上实现94%的分类准确率,显著优于基线模型Inception-v3的56%准确率。
  • 在配备GPU的系统上,ADNet每帧处理时间为57毫秒,证明其具备适用于生产环境的实时推理能力。
  • 视觉分析显示,误分类主要由与广告牌形状和外观相似的物体引起,如卡车后部、太阳能板支架和路牌。
  • 定性结果显示,该模型能以高精度正确识别含广告牌的正样本和不含广告牌的负样本。
  • ADNet与Inception-v3之间的性能差距表明,针对特定任务设计的网络架构在专用数据集上微调后,优于通用预训练模型。
  • 结果验证了深度学习可有效实现广告相关帧检测的自动化,从而简化媒体与广告行业的后期制作工作流程。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。