Skip to main content
QUICK REVIEW

[논문 리뷰] RUC+CMU: System Report for Dense Captioning Events in Videos

Shizhe Chen, Yuqing Song|arXiv (Cornell University)|2018. 06. 22.
Multimodal Machine Learning Applications참고 문헌 8인용 수 4
한 줄 요약

이 논문은 시간적 제안 순서 매기기와 앙상블 캡션 생성을 조합한 이단계 밀도 있는 비디오 캡션 시스템을 제안하며, 다중모odal 특징(RGB, 플로우, 오디오)과 양방향 LSTM 컨텍스트 모델링을 활용한다. 제안 점수와 캡션 점수를 융합하여 재정렬함으로써 ActivityNet 테스트 세트에서 8.529 METEOR 점수를 기록하여 최신 기술 수준을 달성한다.

ABSTRACT

This notebook paper presents our system in the ActivityNet Dense Captioning in Video task (task 3). Temporal proposal generation and caption generation are both important to the dense captioning task. Therefore, we propose a proposal ranking model to employ a set of effective feature representations for proposal generation, and ensemble a series of caption models enhanced with context information to generate captions robustly on predicted proposals. Our approach achieves the state-of-the-art performance on the dense video captioning task with 8.529 METEOR score on the challenge testing set.

연구 동기 및 목표

  • 밀도 있는 비디오 캡션의 과제를 해결하기 위해 시간적 이벤트 국소화와 정확한 캡션 생성을 동시에 최적화한다.
  • 컨텍스트 인식 특징과 경계 변동성을 통합하여 제안 품질을 향상시켜 더 정밀한 이벤트 국소화를 달성한다.
  • 컨텍스트와 주제 정보를 강화한 다중 캡션 모델을 융합하여 캡션의 강건성을 향상시킨다.
  • 체계적인 모델 앙상블과 재정렬을 통해 ActivityNet Dense Captioning 벤치마크에서 최신 기술 수준의 성능을 달성한다.

제안 방법

  • 비디오를 겹치지 않는 64프레임 세그먼트로 나누고, 다중모달 특징을 추출한다: ResNet(이미지), I3D(운동), VGGish(오디오).
  • 양방향 LSTM을 사용하여 세그먼트 특징에서의 양방향 컨텍스트를 인코딩하며, 지도된 캡션 개념을 예측하도록 훈련한다.
  • 지상 진술 분포 클러스터에서 유도된 다수의 창 크기를 가진 슬라이딩 윈도우를 통해 후보 제안을 생성한다.
  • 내부(제안 내용), 외부(컨텍스트), 경계 변동성, 위치/지속 시간 비율의 네 가지 특징을 사용하여, 두 층의 피드포워드 신경망을 통해 제안을 순서 매긴다.
  • 세 가지 캡션 모델을 앙상블한다: 일반 LSTM, 시간적 어텐션 기반 모델, 주제 유도 모델(200개의 ActivityNet 카테고리 사용), 모두 자기 비판 강화 학습으로 미세조정한다.
  • 최종 출력을 제안 점수와 캡션 점수의 곱(s = s_p × s_c)을 사용하여 재정렬하며, 각 비디오당 상위 10개의 캡션을 선택한다.

실험 결과

연구 질문

  • RQ1다중모달 및 컨텍스트 특징은 밀도 있는 비디오 캡션에서 시간적 제안 생성을 어떻게 향상시킬 수 있는가?
  • RQ2컨텍스트와 주제 가이드를 갖춘 앙상블 캡션 모델링은 캡션 품질과 강건성을 얼마나 향상시킬 수 있는가?
  • RQ3학습된 제안 순서 매기기 모델은 저품질 제안을 효과적으로 걸러내면서도 높은 재현율을 유지할 수 있는가?
  • RQ4제안 품질 점수와 캡션 품질 점수를 재정렬을 통해 통합함으로써 밀도 있는 캡션의 전체 성능에 어떤 영향을 미치는가?

주요 결과

  • 슬라이딩 윈도우 베이스라인은 비디오당 241개의 제안을 생성하며, tiou ≥ 0.3일 때 정밀도는 28%이지만 재현율은 높아 98%이다.
  • 제안 순서 매기기 모델을 적용한 후(임계값 s_p > 0.5), 평균 제안 수는 53개로 감소하였고, 정밀도는 71%로 향상되었으며, 재현율은 여전히 84%를 유지하였다.
  • 캡션 앙상블 모델은 지상 진술 제안에 대해 13.75 METEOR를 기록하여 개별 모델을 능가하며, 모델 융합의 이점을 입증하였다.
  • 예측된 제안에 대해서도 앙상블 모델은 강력한 강건성을 유지하여 12.44 METEOR를 기록하였으며, 불완전한 제안과 증가한 제안 수로 인해 13.75에서 약간 감소하였다.
  • 최종 시스템은 ActivityNet 테스트 세트에서 최신 기술 수준의 8.529 METEOR 점수를 기록하여 강력한 일반화 능력과 성능을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.