Skip to main content
QUICK REVIEW

[논문 리뷰] Using Descriptive Video Services to Create a Large Data Source for Video Annotation Research

Atousa Torabi, Christopher Pal|arXiv (Cornell University)|2015. 03. 03.
Multimodal Machine Learning Applications참고 문헌 13인용 수 160
한 줄 요약

이 논문은 최소한의 인간 간섭으로 92장의 DVD에서 DVS 오디오 트랙을 자동으로 분할하고 정렬함으로써 대규모 DVS 유도 영상 애너테이션 데이터셋(M-VAD)을 제작한다. 음성 기반 DVS 서술 분리 및 정지 탐지 기반 시간 정렬을 통해 84.6시간의 영상과 전문적으로 작성된 시간적으로 정렬된 자연어 서술이 짝지어진 고품질 데이터셋을 생성하였으며, 이는 심층 학습 모델의 영상 서술 훈련을 가능하게 하여 의미적·문법적 풍부함을 향상시킨다.

ABSTRACT

In this work, we introduce a dataset of video annotated with high quality natural language phrases describing the visual content in a given segment of time. Our dataset is based on the Descriptive Video Service (DVS) that is now encoded on many digital media products such as DVDs. DVS is an audio narration describing the visual elements and actions in a movie for the visually impaired. It is temporally aligned with the movie and mixed with the original movie soundtrack. We describe an automatic DVS segmentation and alignment method for movies, that enables us to scale up the collection of a DVS-derived dataset with minimal human intervention. Using this method, we have collected the largest DVS-derived dataset for video description of which we are aware. Our dataset currently includes over 84.6 hours of paired video/sentences from 92 DVDs and is growing.

연구 동기 및 목표

  • 심층 학습 모델 훈련을 위한 대규모 고품질 영상 서술 데이터셋의 부족 문제를 해결하기 위해.
  • 최소한의 인간 간섭으로 DVD에서 DVS 서술을 자동으로 추출하고 정렬하는 방법을 개발하기 위해.
  • 다양한 장르와 전문 수준의 서술을 지원하는 공개 가능하고 균형 잡힌 영상 서술 연구용 데이터셋을 만들기 위해.
  • 기존의 영화 스크립트나 군중 캡션에 의존하는 방법과 비교해, 영상-텍스트 쌍의 품질과 정렬 정확도를 향상시키기 위해.
  • DVS 오디오 트랙에서 유래한 전문적으로 작성된 시간 정밀 서술을 사용해 엔드 투 엔드 영상 서술 모델을 훈련시킬 수 있도록 하기 위해.

제안 방법

  • 음성 신호 처리와 정지 탐지를 활용해 혼합 오디오 트랙에서 DVS 서술 세그먼트를 자동으로 분리하고 자연스러운 분할 지점을 식별하기 위해.
  • 빠른 푸리에 변환(FFT)을 통한 음성 유사도 분 析을 통해 DVS 세그먼트를 탐지하고 영상 콘텐츠와의 정렬을 향상시키기 위해.
  • DVS 서술과 시각 콘텐츠 사이의 잠재적인 1~2초의 오차를 보완하기 위해 각 영상 클립에 두 초의 시간 버퍼를 적용하기 위해.
  • 하이브리드 자동 음성 인식과 인간 전사 파이프라인을 사용해 DVS 오디오를 98% 이상의 정확도로 전사하기 위해.
  • 모델의 과적합을 줄이고 일반화 성능을 향상시키기 위해 텍스트 내 모든 고유명사를 하나의 토큰(예: 'SOMEONE')으로 대체하기 위해.
  • 장르 분포가 세트 간 유지되도록 균형 잡힌 훈련/검증/테스트 분할(38,949 / 4,888 / 5,149 클립)을 생성하기 위해.

실험 결과

연구 질문

  • RQ1상업용 DVD의 DVS 오디오 트랙을 자동으로 분할하고 영상 콘텐츠와 정렬하여 대규모 고품질 영상 서술 데이터셋을 생성할 수 있는가?
  • RQ2DVS 유도 서술의 품질과 정렬 정확도는 영화 스크립트나 군중 캡션에서 유도된 것과 비교해 어떻게 다른가?
  • RQ3데이터셋에서 고유명사를 제거하는 것이 영상 서술 모델의 성능 향상에 어느 정도 기여하는가?
  • RQ4이 데이터셋으로 훈련된 LSTM 기반 영상 서술 모델이 의미적으로 유의미하고 맥락적으로 관련 있는 서술을 생성할 수 있는가?
  • RQ5전문적으로 작성된 자연스러운 속도의 DVS 서술을 사용할 경우, 합성 또는 군중 캡션보다 영상 서술 작업에서 더 우수한 일반화 성능을 달성할 수 있는가?

주요 결과

  • M-VAD 데이터셋은 92장의 DVD에서 유래한 84.6시간의 영상과 55,904개의 자연어 서술을 포함하며, 클립의 중앙값 길이는 6.2초이다.
  • 이 데이터셋은 알려진 바에 비해 가장 큰 DVS 유도 영상 서술 데이터셋이며, 이전 연구가 46장의 DVD만을 사용하고 스크립트와 DVS를 병합한 것과 비교해 뛰어나다.
  • DVS 유도 서술은 높은 시간 정렬 정확도를 보이며, 최대 2초 이내의 오차만 존재하며, 문법적으로 복잡한 문장으로 작성되어 있다.
  • 어휘는 17,609개의 고유 단어를 포함하며, 이 중 9,512개는 명사, 2,571개는 동사, 3,560개는 형용사, 857개는 부사로 구성되어 있어 장면 요소에 대한 세밀한 시각적 서술을 반영한다.
  • 가장 자주 사용된 동사 10개에는 '보는'의 다섯 가지 동조어(예: 응시, 보다, 바라보다)가 포함되어 있어 서술의 초점이 시각적 주의와 관찰에 맞춰져 있음을 나타낸다.
  • 정성적 결과 분석에서, 이 데이터셋으로 훈련된 LSTM 모델은 원본 DVS 서술과 매우 유사한 의미적으로 유의미하고 맥락적으로 관련 있는 서술을 생성하는 것으로 나타났다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.