[논문 리뷰] Ad-Net: Audio-Visual Convolutional Neural Network for Advertisement Detection In Videos
이 논문은 광고와 일반 콘텐츠 간 시각적 유사성으로 인해 전통적인 시각 기반 방법이 어려움을 겪는 브로드캐스트 영상에서 광고를 탐지하기 위해 시각 및 청각 특징을 융합하는 두 개의 스트림으로 구성된 Ad-Net을 제안한다. 딥 러닝을 활용함으로써 이는 82%의 정확도를 달성하여 수작업 특징 방법인 HOG+SVM(76.4%) 및 LBP+SVM(68.5%)를 크게 앞서며, 광고 탐지 성능을 향상시킨다.
Personalized advertisement is a crucial task for many of the online businesses and video broadcasters. Many of today's broadcasters use the same commercial for all customers, but as one can imagine different viewers have different interests and it seems reasonable to have customized commercial for different group of people, chosen based on their demographic features, and history. In this project, we propose a framework, which gets the broadcast videos, analyzes them, detects the commercial and replaces it with a more suitable commercial. We propose a two-stream audio-visual convolutional neural network, that one branch analyzes the visual information and the other one analyzes the audio information, and then the audio and visual embedding are fused together, and are used for commercial detection, and content categorization. We show that using both the visual and audio content of the videos significantly improves the model performance for video analysis. This network is trained on a dataset of more than 50k regular video and commercial shots, and achieved much better performance compared to the models based on hand-crafted features.
연구 동기 및 목표
- 광고 세그먼트가 메타데이터에 표시되지 않은 브로드캐스트 영상에서 광고를 탐지하는 문제에 대응한다.
- 스포츠 영상 등과 같은 제품 광고 간의 시각적 유사성으로 인해 기존의 단일 시각 기반 방법이 혼동을 겪는 문제를 해결한다.
- 청각 및 시각 모odalities를 통합하여 탐지 정확도를 향상시키는 딥 러닝 프레임워크를 개발한다.
- 사용자 프로파일에 기반한 콘텐츠 기반 대체를 가능하게 하여 개인화된 광고 교체를 지원한다.
제안 방법
- RGB 영상 프레임을 처리하는 시각 표현을 위한 스트림과, 청각 특징을 위한 청각 스펙트로그램을 처리하는 다른 스트림을 갖춘 두 개의 스트림 컨볼루션 신경망을 사용한다.
- 양쪽 스트림에서 다중 컨볼루션 및 풀링 레이어를 통해 고수준 표현을 추출한 후, 드롭아웃을 적용한 완전 연결 레이어를 통해 정규화를 수행한다.
- 비디오의 시각적 및 청각적 패턴을 공동으로 학습할 수 있도록 네트워크의 초기 단계에서 시각적 및 청각적 임베딩을 융합한다.
- 스티ochastic 미니배치 경사 하강법를 사용하여 학습하고, 분류를 위한 교차 엔트로피 손실과 과적합 방지를 위한 ℓ₂ 정규화를 조합한 손실 함수를 사용한다.
- 동일한 아키텍처를 활용해 비디오 콘텐츠 분류도 수행할 수 있도록 다중 작업 학습 확장 기능을 도입한다. 이 경우 추가로 교차 엔트로피 손실 항목을 하나 더 추가한다.
- 검증 성능을 기반으로 학습률 감소 스케줄, 배치 크기 200, ℓ₂ 가중치 감소 0.0001 등의 하이퍼파라미터를 최적화한다.
실험 결과
연구 질문
- RQ1시각 및 청각 특징을 함께 분석하는 딥 러닝 모델이 단일 시각 기반 모델보다 브로드캐스트 영상에서 광고를 더 정확하게 탐지할 수 있는가?
- RQ2전통적인 수작업 특징 방법인 HOG 및 LBP와 비교해 청각-시각 컨볼루션 신경망의 광고 탐지 성능은 어떠한가?
- RQ3광고와 일반 프로그램의 시각 콘텐츠가 유사하거나 모호한 경우, 청각 및 시각 표현을 융합함으로써 탐지 정확도는 얼마나 향상되는가?
- RQ4제안된 아키텍처는 광고 탐지와 비디오 콘텐츠 분류를 동시에 수행할 수 있는 다중 작업 학습을 지원할 수 있는가?
주요 결과
- 제안된 청각-시각 컨볼루션 신경망은 51,000개의 영상 및 광고 샷으로 구성된 테스트 세트에서 82%의 탐지 정확도를 달성하였으며, HOG+SVM(76.4%) 및 LBP+SVM(68.5%)를 크게 능가하였다.
- 모델은 청각적 및 시각적 신호를 효과적으로 활용하여 일반화 능력과 강건성을 향상시켰으며, 스포츠 클립과 제품 광고처럼 시각적으로 유사한 콘텐츠의 오분류를 줄였다.
- 학습 곡선은 과적합이 최소화된 안정적인 수렴을 보였으며, 이는 완전 연결 레이어 이후에 적용된 드롭아웃(0.5)과 ℓ₂ 정규화(λ = 0.0001) 덕분이었다.
- 청각-시각 융합 전략은 단일 모odal의 시각 기반 모델보다 정밀도와 재현율이 높았으며, 특히 모호한 경우에서 두드러졌다.
- 모델의 아키텍처는 다중 작업 학습을 지원하여 공유된 특징 표현을 기반으로 동시에 광고 탐지와 콘텐츠 분류를 수행할 수 있다.
- 결과적으로, 대규모 데이터셋에서 훈련된 엔드 투 엔드 딥 러닝 모델이 전통적인 수작업 특징 파ipeline보다 영상 광고 탐지에서 상당한 성능 향상을 이룰 수 있음을 검증하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.