Skip to main content
QUICK REVIEW

[论文解读] MediaEval 2018: Predicting Media Memorability Task

Romain Cohendet, Claire-Hélène Demarty|arXiv (Cornell University)|Jul 3, 2018
Visual Attention and Saliency Detection参考文献 15被引用 8
一句话总结

本文介绍了 MediaEval 2018 视频记忆可预测性任务,这是一个基于 10,000 段无声音视频的大规模基准数据集,通过识别测试获取了短期和长期记忆可预测性标注。该研究提出了一套标准化协议,对短期分数进行校正而长期分数保持未校正状态,支持使用斯皮尔曼等级相关系数进行评估,并提供了预计算特征,以支持内容推荐和检索等应用中的模型开发。

ABSTRACT

In this paper, we present the Predicting Media Memorability task, which is proposed as part of the MediaEval 2018 Benchmarking Initiative for Multimedia Evaluation. Participants are expected to design systems that automatically predict memorability scores for videos, which reflect the probability of a video being remembered. In contrast to previous work in image memorability prediction, where memorability was measured a few minutes after memorization, the proposed dataset comes with short-term and long-term memorability annotations. All task characteristics are described, namely: the task's challenges and breakthrough, the released data set and ground truth, the required participant runs and the evaluation metrics.

研究动机与目标

  • 建立视频记忆可预测性的标准化基准,解决先前研究中缺乏统一协议和大规模数据集的问题。
  • 通过基于识别测试的协议,测量并量化人类对视频的长期记忆表现。
  • 提供一个包含 10,000 段短时(7 秒)无声音视频的公开数据集,附带短期和长期记忆可预测性评分,用于模型训练与评估。
  • 支持从视觉内容和可选元数据中预测视频记忆可预测性的计算模型开发。
  • 通过提供可靠、客观的视频记忆可预测性度量,支持内容推荐、检索和摘要等应用。

提出的方法

  • 数据集包含 10,000 段短时(7 秒)无声音视频,其中 8,000 个用于开发,2,000 个用于测试,均来自专业内容。
  • 记忆可预测性评分通过识别测试收集:参与者在 24–72 小时后识别重复出现的视频,短期评分在不同间隔(45–100 个视频)后收集。
  • 短期原始评分根据保留时长进行线性校正,以对齐不同间隔长度的影响,而长期评分因未观察到时长依赖性,故保持未校正状态。
  • 预计算特征包括 C3D 空间-时间特征、HMP、HoG、LBP、InceptionV3 fc7 特征、ORB、颜色直方图以及美学描述符,每个视频均提供。
  • 参与者使用视觉内容、提供的特征、可选标题和外部数据训练模型,短期和长期子任务需分别进行必需运行。
  • 评估采用测试集上预测值与真实记忆可预测性评分之间的斯皮尔曼等级相关系数,另提供其他指标用于比较。

实验结果

研究问题

  • RQ1视频重复之间的时间间隔如何影响短期记忆可预测性?是否可通过校正改善评分的标准化?
  • RQ2长期记忆可预测性评分在多大程度上与保留时长相关?是否需要进行校正?
  • RQ3在短期和长期记忆范围内,各种视觉特征和深度学习特征在预测视频记忆可预测性方面的有效性如何?
  • RQ4在短期记忆可预测性上训练的模型能否泛化到长期记忆可预测性,反之亦然?
  • RQ5不同特征表示(如 C3D、InceptionV3、HMP)在准确预测记忆可预测性方面有何贡献?

主要发现

  • 短期记忆可预测性评分根据保留时长进行了线性校正,以对齐不同重复间隔的影响,提升了与在 100 个视频后典型记忆表现的一致性。
  • 未发现保留时长与长期记忆可预测性评分之间存在显著关系,支持长期评分无需校正。
  • 平均每段视频获得 38 个短期和 13 个长期标注,确保了真实标签估计的稳健性。
  • 数据集包含 10,000 段具有多样化场景和原始标题的视频,支持多模态建模方法。
  • 官方评估指标为斯皮尔曼等级相关系数,强调排名性能而非绝对分数准确性。
  • 参与者可提交最多 10 次运行(每子任务 5 次),必需运行限制了对另一子任务真实标签的访问,以确保评估公平性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。