Skip to main content
QUICK REVIEW

[논문 리뷰] ADNet: A Deep Network for Detecting Adverts

Murhaf Hossari|arXiv (Cornell University)|2018. 11. 09.
Video Analysis and Summarization참고 문헌 11인용 수 12
한 줄 요약

이 논문은 VGG19를 영감으로 삼은 고유한 아키텍처를 가진 딥 컨volution 신경망인 ADNet을 제안한다. 이 모델은 외부 환경 영상 프레임에서 광고판을 자동으로 탐지한다. 18,945장의 이미지로 구성된 복합 데이터셋으로 훈련된 ADNet은 94%의 분류 정확도를 달성하였으며, 기준 모델인 Inception-v3(56%)를 크게 앞서며, 1프레임당 57ms로 영상 프레임을 처리하여 미디어 제작에서 자동 제품 배치를 실시간으로 구현할 수 있다.

ABSTRACT

Online video advertising gives content providers the ability to deliver compelling content, reach a growing audience, and generate additional revenue from online media. Recently, advertising strategies are designed to look for original advert(s) in a video frame, and replacing them with new adverts. These strategies, popularly known as product placement or embedded marketing, greatly help the marketing agencies to reach out to a wider audience. However, in the existing literature, such detection of candidate frames in a video sequence for the purpose of advert integration, is done manually. In this paper, we propose a deep-learning architecture called ADNet, that automatically detects the presence of advertisements in video frames. Our approach is the first of its kind that automatically detects the presence of adverts in a video frame, and achieves state-of-the-art results on a public dataset.

연구 동기 및 목표

  • 후반 작업에서 광고 통합을 위한 후보 영상 프레임을 수작업으로 확인하는 데 소요되는 시간을 줄이기 위해 자동화된 프로세스를 개발하는 것.
  • 특히 광고판을 포함한 영상 프레임에서 기존 광고를 탐지하기 위한 딥 러닝 기반 솔루션이 부족한 문제를 해결하는 것.
  • 표적 광고 및 제품 배치에 활용할 수 있는 효율적이고 실시간 광고판 탐지 시스템을 개발하는 것.
  • 공개 데이터셋을 기반으로 기존 아키텍처인 Inception-v3와 비교하여 고유한 딥 러닝 모델의 성능을 평가하는 것.
  • 향후 연구에서 모델을 실내 환경(예: 영화나 텔레비전 프로그램)의 광고 탐지로 확장할 수 있는지 탐색하는 것.

제안 방법

  • ADNet은 외부 환경에서 광고판 탐지를 위해 특화된 VGG19를 영감으로 삼은 고유한 컨volution 신경망 아키텍처이다.
  • 모델은 컨볼루션 및 풀링 레이어의 시리즈를 거친 후, ReLU 및 소프트맥스 활성화 함수를 사용하는 완전 연결 레이어를 포함한다.
  • 학습은 학습률 0.0001, 배치 크기 16, 카테고리 크로스엔트로피 손실 함수를 사용한 확률적 경사 하강법으로 수행된다.
  • 훈련 데이터셋은 18,945장의 이미지로 구성되어 있으며, 광고판이 포함된 양성 예제 9,395장과 광고판이 없는 음성 예제 9,550장으로 이루어져 있다.
  • 모델 평가에는 (TP + TN) / (TP + TN + FP + FN)로 정의된 분류 정확도가 사용된다.
  • 유사한 하이퍼파라미터를 사용하여 동일한 데이터셋에 대해 미세조정된 사전 훈련된 Inception-v3 모델을 사용한 비교 벤치마크가 수행된다.

실험 결과

연구 질문

  • RQ1딥 러닝 모델이 외부 영상 프레임에서 광고판의 존재를 자동으로 탐지하여 수작업으로 한 프레임씩 점검하는 데 의존도를 줄일 수 있는가?
  • RQ2특화 설계된 CNN(ADNet)의 성능이 광고판 탐지 작업에서 최신 기술인 사전 훈련된 모델(Inception-v3)과 비교해 어떻게 되는가?
  • RQ3ADNet의 추론 속도는 실제 영상 프레임에서 얼마나 되며, 실시간 처리를 생산 환경에서 지원할 수 있는가?
  • RQ4ADNet 모델에서 오분류 오류를 유발하는 주요 시각적 오해의 유형은 무엇인가?
  • RQ5이 모델은 영화나 텔레비전 프로그램과 같은 실내 환경의 광고 탐지로 확장될 수 있는가?

주요 결과

  • ADNet은 테스트 세트에서 94%의 분류 정확도를 달성하였으며, 기준 모델인 Inception-v3(56%)보다 뚜렷이 뛰어나다.
  • GPU를 탑재한 시스템에서 ADNet은 1프레임당 57ms로 처리하여 실시간 추론 능력을 입증하였으며, 생산 환경에 적합하다.
  • 시각적 분석 결과, 오분류의 주요 원인은 광고판과 유사한 형태와 외관을 가진 물체들, 즉 트럭 뒷면, 태양광 패널 지지대, 도로 표지판 등이다.
  • 정성적인 결과를 통해 모델은 양성 예제(광고판이 포함된 프레임)와 음성 예제(광고판이 없는 프레임)를 높은 정밀도로 올바르게 식별한다.
  • ADNet과 Inception-v3 간의 성능 격차는 전문화된 데이터셋에 대해 미세조정된 전용 아키텍처가 일반 목적의 사전 훈련된 모델보다 뛰어난 성능을 내는 것을 시사한다.
  • 결과는 딥 러닝이 광고 관련 프레임을 효과적으로 자동으로 탐지할 수 있음을 입증하며, 미디어 및 광고 분야의 후반 작업 워크플로우를 간소화할 수 있음을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.