Skip to main content
QUICK REVIEW

[論文レビュー] HowToCaption: Prompting LLMs to Transform Video Annotations at Scale

Nina Shvetsova, Anna Kukleva|arXiv (Cornell University)|Oct 7, 2023
Natural Language Processing Techniques被引用数 4
ひとこと要約

この論文では、教本的動画のノイズの多い自動音声認識(ASR)字幕から、高品質で時間的に整合性のある動画キャプションを生成するための、大規模言語モデル(LLM)を用いた HowToCaption の手法を提案する。これにより、人的な監視なしにスケーラブルに人間らしい動画アノテーションが可能になる。このアプローチは、テキスト-動画検索性能を顕著に向上させ、音声から分離された言語表現を実現することで、正則化を要せず、複数のベンチマークで先行手法を上回る性能を発揮する。

ABSTRACT

Instructional videos are a common source for learning text-video or even multimodal representations by leveraging subtitles extracted with automatic speech recognition systems (ASR) from the audio signal in the videos. However, in contrast to human-annotated captions, both speech and subtitles naturally differ from the visual content of the videos and thus provide only noisy supervision. As a result, large-scale annotation-free web video training data remains sub-optimal for training text-video models. In this work, we propose to leverage the capabilities of large language models (LLMs) to obtain high-quality video descriptions aligned with videos at scale. Specifically, we prompt an LLM to create plausible video captions based on ASR subtitles of instructional videos. To this end, we introduce a prompting method that is able to take into account a longer text of subtitles, allowing us to capture the contextual information beyond one single sentence. We further prompt the LLM to generate timestamps for each produced caption based on the timestamps of the subtitles and finally align the generated captions to the video temporally. In this way, we obtain human-style video captions at scale without human supervision. We apply our method to the subtitles of the HowTo100M dataset, creating a new large-scale dataset, HowToCaption. Our evaluation shows that the resulting captions not only significantly improve the performance over many different benchmark datasets for zero-shot text-video retrieval and video captioning, but also lead to a disentangling of textual narration from the audio, boosting the performance in text-video-audio tasks.

研究の動機と目的

  • Web動画データセットにおける弱い監視問題に取り組むこと。具体的には、ASRによって生成された字幕がノイズが多く、視覚的コンテンツとずれていること。
  • 大規模言語モデル(LLM)を活用することで、人的なアノテーションなしに、スケーラブルに高品質で人間らしい動画キャプションを生成すること。
  • 視覚的コンテンツとよりよく一致するように、より正確で記述的なキャプションを生成することで、テキスト-動画検索性能を向上させること。
  • 教本的動画におけるテキスト的記述と音声信号を分離することで、正則化を要せず、効果的なテキスト-動画-音声検索を実現すること。
  • マルチモーダルモデルの学習および評価のための新しい大規模データセット、HowToCaption を作成すること。

提案手法

  • 教本的動画の長時間でノイズの多い ASR トラックに基づいて、要約的で記述的な動画キャプションを生成するため、大規模言語モデル(LLM)をプロンプトする。
  • 単一の文を超える文脈的情報を捉えるプロンプト戦略を設計することで、キャプションの品質と関連性を向上させる。
  • 生成されたキャプションごとに時間的タイムスタンプを予測できるように、LLMのプロンプトを拡張し、細粒度の動画同期を可能にする。
  • 短い時間窓内でフィルタリングおよび再同期処理を適用することで、タイムスタンプの誤りを是正し、動画コンテンツとの同期性を向上させる。
  • 得られたキャプションを、テキスト-動画モデルの教師信号として用い、主なイノベーションは音声から言語を分離することにある。
  • HowToCaption データセット上でマルチモーダルモデルを学習し、ゼロショットのテキスト-動画およびテキスト-動画-音声検索タスクにおける性能を評価する。

実験結果

リサーチクエスチョン

  • RQ1LLM は、ノイズが多く、長時間にわたる ASR トラックを、視覚的コンテンツと整合性のある高品質で記述的な動画キャプションに効果的に変換できるか?
  • RQ2生の ASR トラックを用いる場合と比較して、LLM によって生成されたキャプションはテキスト-動画検索性能を向上させられるか?
  • RQ3テキスト的記述と音声信号を分離することで、テキスト-動画-音声検索タスクにおける性能が向上するか?
  • RQ4HowToCaption 法は、人的な監視なしにスケーラブルに人間らしい動画アノテーションを生成できるか?
  • RQ5HowToCaption で学習されたモデルの性能は、標準的なテキスト-動画検索ベンチマークで最先端の手法と比較してどうなるか?

主な発見

  • HowToCaption 法は、YouCook2、MSR-VTT、MSVD、LSMDC の4つのベンチマークデータセットにおいて、テキスト-動画検索性能を顕著に向上させた。
  • YouCook2 データセットでは、R1 スコアが 44.5、R5 が 73.3、R10 が 82.1 を達成し、先行の SOTA 手法を上回った。
  • ゼロショットのテキスト-動画+音声検索において、HowToCaption を用いたモデルは R1 スコア 25.5 を達成し、次善のベースライン(EAO)を 0.9 ポイント上回った。
  • 言語表現と音声の分離により、音声タイムスタンプのずれや損失重み付けといった追加の正則化を要せず、効果的なテキスト-動画-音声検索が可能になった。
  • HowToCaption データセットは、生の ASR トラックよりも一般化性に優れた強力な教師信号を提供しており、複数の下流タスクで一貫した性能向上が確認された。
  • フィルタリングおよび再同期処理により、時間的同期性が向上し、タイムスタンプの誤りが低減された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。