Skip to main content
QUICK REVIEW

[논문 리뷰] HowToCaption: Prompting LLMs to Transform Video Annotations at Scale

Nina Shvetsova, Anna Kukleva|arXiv (Cornell University)|2023. 10. 07.
Natural Language Processing Techniques인용 수 4
한 줄 요약

이 논문은 지침 영상에서 노이지한 자동 음성 인식(ASR) 자막을 바탕으로 고품질의 시간적으로 정렬된 영상 캡션을 생성하는 데 대규모 언어 모델(LLM)을 사용하는 HowToCaption를 제안한다. 이는 인간의 감독 없이도 스케일러블하고 인간과 유사한 영상 주석을 가능하게 하며, 텍스트-영상 검색 성능을 크게 향상시키고, 음성과 언어를 분리함으로써 텍스트-영상-음성 검색을 효과적으로 수행한다. 이는 여러 벤치마크에서 기존 방법들을 능가한다.

ABSTRACT

Instructional videos are a common source for learning text-video or even multimodal representations by leveraging subtitles extracted with automatic speech recognition systems (ASR) from the audio signal in the videos. However, in contrast to human-annotated captions, both speech and subtitles naturally differ from the visual content of the videos and thus provide only noisy supervision. As a result, large-scale annotation-free web video training data remains sub-optimal for training text-video models. In this work, we propose to leverage the capabilities of large language models (LLMs) to obtain high-quality video descriptions aligned with videos at scale. Specifically, we prompt an LLM to create plausible video captions based on ASR subtitles of instructional videos. To this end, we introduce a prompting method that is able to take into account a longer text of subtitles, allowing us to capture the contextual information beyond one single sentence. We further prompt the LLM to generate timestamps for each produced caption based on the timestamps of the subtitles and finally align the generated captions to the video temporally. In this way, we obtain human-style video captions at scale without human supervision. We apply our method to the subtitles of the HowTo100M dataset, creating a new large-scale dataset, HowToCaption. Our evaluation shows that the resulting captions not only significantly improve the performance over many different benchmark datasets for zero-shot text-video retrieval and video captioning, but also lead to a disentangling of textual narration from the audio, boosting the performance in text-video-audio tasks.

연구 동기 및 목표

  • 웹 영상 데이터셋에서 ASR가 생성한 자막이 노이지하고 영상 콘텐츠와 비정렬되어 있는 약한 감독 문제를 해결하기 위해.
  • 대규모 언어 모델(LLM)을 활용하여 인간의 주석 없이도 고품질의 인간과 유사한 영상 캡션을 스케일러블하게 생성하기 위해.
  • 더 정확하고 기술적인 캡션을 생성함으로써 영상 콘텐츠와 더 잘 정렬된 캡션을 만들어 텍스트-영상 검색 성능을 향상시키기 위해.
  • 지침 영상에서 텍스트 기술서를 음성 신호에서 분리함으로써 정규화 없이도 효과적인 텍스트-영상-음성 검색을 가능하게 하기 위해.
  • 다중모odal 모델 훈련 및 평가를 위한 새로운 대규모 데이터셋인 HowToCaption를 구축하기 위해.

제안 방법

  • 지침 영상에서 유래한 장문의 노이지한 ASR 전사본을 바탕으로 간결하고 기술적인 영상 캡션을 생성하기 위해 대규모 언어 모델(LLM)을 프롬프팅하는 것.
  • 단일 문장 이상의 맥락 정보를 포괄하는 프롬프팅 전략을 설계하여 캡션의 품질과 관련성 향상.
  • 생성된 각 캡션에 대한 시간 타임스탬프 예측을 위해 LLM 프롬프트를 확장함으로써 세밀한 영상 정렬을 가능하게 하는 것.
  • 짧은 시간 윈도우 내에서 필터링 및 재정렬 단계를 적용하여 타임스탬프 오류를 수정하고 영상 콘텐츠와의 동기화를 향상시키는 것.
  • 결과적으로 생성된 캡션을 텍스트-영상 모델 훈련을 위한 지도 신호로 사용하며, 핵심 혁신은 언어와 음성 간의 분리이다.
  • HowToCaption 데이터셋을 기반으로 다중모달 모델을 훈련하여 제로샷 텍스트-영상 및 텍스트-영상-음성 검색 작업에서의 성능 평가를 수행하는 것.

실험 결과

연구 질문

  • RQ1LLM은 노이지하고 장문의 ASR 전사본을 영상 콘텐츠와 정렬된 고품질의 기술적인 영상 캡션으로 효과적으로 변환할 수 있는가?
  • RQ2원시 ASR 전사본을 사용하는 것과 비교해 LLM이 생성한 캡션은 텍스트-영상 검색 성능을 향상시키는가?
  • RQ3텍스트 기술서를 음성 신호에서 분리함으로써 텍스트-영상-음성 검색 작업에서 더 나은 성능을 달성할 수 있는가?
  • RQ4HowToCaption 방법은 인간의 감독 없이도 스케일러블하고 인간과 유사한 영상 주석을 생성할 수 있는가?
  • RQ5HowToCaption로 훈련된 모델의 성능은 표준 텍스트-영상 검색 벤치마크에서 최신 기술(SOTA) 방법과 비교해 어떻게 되는가?

주요 결과

  • HowToCaption 방법은 YouCook2, MSR-VTT, MSVD, LSMDC 네 가지 벤치마크 데이터셋에서 텍스트-영상 검색 성능을 크게 향상시켰다.
  • YouCook2 데이터셋에서 R1 점수는 44.5, R5는 73.3, R10는 82.1을 기록하여 기존 SOTA 방법을 능가했다.
  • 제로샷 텍스트-영상+음성 검색에서 HowToCaption 기반 모델은 R1 점수 25.5를 기록하여 다음으로 좋은 베이스라인(EAO)보다 0.9점 높았다.
  • 언어와 음성 간의 분리를 통해 추가적인 정규화(예: 음성 타임스탬프 이동, 손실 가중치) 없이도 효과적인 텍스트-영상-음성 검색을 가능하게 했다.
  • HowToCaption 데이터셋은 원시 ASR 전사본보다 더 잘 일반화되는 강력한 훈련 신호를 제공하며, 여러 후행 작업에서 일관된 성능 향상을 입증했다.
  • 필터링 및 재정렬 단계는 시간 정렬을 향상시켜 타임스탬프 오류를 감소시키고 영상 콘텐츠와의 동기화를 강화했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.