Skip to main content
QUICK REVIEW

[論文レビュー] Overview of MediaEval 2020 Predicting Media Memorability Task: What Makes a Video Memorable?

Alba García Seco de Herrera, Rukiye Savran Kızıltepe|arXiv (Cornell University)|Dec 31, 2020
Visual Attention and Saliency Detection被引用数 6
ひとこと要約

本論文は、TRECVid 2019 Video-to-Text データセットのサブセットを用いて、短時間(数分)および長時間(24–72時間)の動画記憶可能性を予測する機械学習モデルを評価する、MediaEval 2020 Predicting Media Memorability タスクの第3版を提示する。このタスクでは、アノテート済みの動画、事前に抽出された視覚的特徴(例:VGGFC7、C3D)、およびアマゾン Mechanical Turk での認識テストから得られた真値記憶可能性スコアを提供しており、スピアマンの順位相関を用いたモデルのベンチマークが可能である。

ABSTRACT

This paper describes the MediaEval 2020 Predicting Media Memorability task. After first being proposed at MediaEval 2018, the Predicting Media Memorability task is in its 3rd edition this year, as the prediction of short-term and long-term video memorability (VM) remains a challenging task. In 2020, the format remained the same as in previous editions. This year the videos are a subset of the TRECVid 2019 Video-to-Text dataset, containing more action rich video content as compared with the 2019 task. In this paper a description of some aspects of this task is provided, including its main characteristics, a description of the collection, the ground truth dataset, evaluation metrics and the requirements for participants’ run submissions.

研究の動機と目的

  • 短時間および長時間の記憶保持における動画記憶可能性を予測するための標準化されたベンチマークを確立すること。
  • 長時間記憶可能性のアノテーションを備えた公開可能なデータセットを提供することで、計算的動画記憶可能性分野の研究を前進させること。過去の研究ではこの点が稀であった。
  • 視覚的および時間的特徴を用いて、動画がどれほど記憶されやすいかを予測する機械学習モデルの開発を支援すること。
  • 一貫した評価指標と共有データを用いて、異なるアプローチの比較的評価を可能にすること。
  • 広告、教育、コンテンツ推薦などのマルチメディアアプリケーション分野における研究を促進し、動画コンテンツに対する人間の記憶の影響をモデル化すること。

提案手法

  • 参加者には、TRECVid 2019 Video-to-Text データセットから選ばれた、1,500本の短い動画(学習用590本、開発用410本、テスト用500本)のデータセットが提供された。選定基準は高いアクション含有量であった。
  • 各動画は、アマゾン Mechanical Turk での動画記憶可能性ゲームプロトコルを用いて、短時間および長時間の記憶可能性についてアノテートされた。ユーザーは、以前に見たことがあると認識した動画に対してスペースキーを押した。
  • 真値記憶可能性スコアは、短時間記憶については少なくとも16名のアノテーター、長時間記憶については少ないが依然として有意義な数のアノテーターからの正答認識率の割合として計算された。
  • 事前に抽出された視覚的特徴には、3つのキーフレーム(開始、中央、終了)からの画像レベル特徴(AlexNetFC7、HOG、HSVHist、RGBHist、LBP、VGGFC7)と、動画レベルのC3D特徴が含まれた。
  • 評価では、両サブタスクにおいて予測された記憶可能性スコアと真値記憶可能性スコアの間のスピアマンの順位相関が用いられた。
  • 参加者は最大10回の実行(サブタスクごとに5回)を提出可能であり、一方のサブタスクの予測結果を他方のサブタスクに直接使用することを制限するが、追加の実行のために相互アノテーションは許可された。

実験結果

リサーチクエスチョン

  • RQ1どの視覚的および時間的特徴が短時間記憶可能性を最も強く予測するか?
  • RQ2キーフレームからの特徴抽出と動画レベルの表現が、長時間記憶可能性予測にどのように寄与するか?
  • RQ3短時間記憶可能性で訓練されたモデルが、長時間記憶可能性予測にどれほど一般化可能か?
  • RQ4長時間記憶可能性のアノテーションを含めることで、動画記憶可能性モデルの予測性能はどの程度向上するか?
  • RQ5ユーザーのインタラクションパターン(例:反応時間、認識正確性)は、記憶可能性スコアの妥当性を検証するためにどのような役割を果たすか?

主な発見

  • MediaEval 2020 タスクは、長時間記憶可能性のアノテーションを備えた、公開可能な最初のデータセットを提供しており、過去の研究が主に短時間に焦点を当てていたのを拡張している。
  • データセットは、TRECVid 2019 Video-to-Text コレクションから抽出された1,500本の動画から構成され、学習用590本、開発用410本、テスト用500本である。
  • 真値記憶可能性スコアは、アマゾン Mechanical Turk での認識テストから収集され、短時間記憶については少なくとも16名のアノテーター、長時間記憶については少ないが依然として有意義な数のアノテーターに基づいた。
  • 事前に抽出された視覚的特徴には、6種類の画像レベル特徴(例:VGGFC7、HOG)と1種類の動画レベル特徴(C3D)が含まれており、多様なモデル開発を可能にしている。
  • タスクフレームワークは、記憶可能性予測タスクの標準指標であるスピアマンの順位相関を用いた比較的評価をサポートしている。
  • タスク設計により、短時間および長時間予測実行の間の直接的な漏洩が防止され、独立したモデル性能の公平な評価が保証されている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。