Skip to main content
QUICK REVIEW

[论文解读] Overview of The MediaEval 2022 Predicting Video Memorability Task

Lorin Sweeney, Mihai Gabriel Constantin|arXiv (Cornell University)|Dec 13, 2022
Visual Attention and Saliency Detection被引用 5
一句话总结

本文介绍了MediaEval预测视频记忆性任务的第5版,聚焦于使用Memento10k和VideoMem数据集进行短期视频记忆性预测,并引入了一项基于脑电图(EEG)的新子任务,用于个体特定的记忆识别预测。该任务强调归一化的短期记忆性分数,并采用斯皮尔曼等级相关系数和AUC作为评估指标,推动了媒体筛选与记忆认知建模的研究进展。

ABSTRACT

This paper describes the 5th edition of the Predicting Video Memorability Task as part of MediaEval2022. This year we have reorganised and simplified the task in order to lubricate a greater depth of inquiry. Similar to last year, two datasets are provided in order to facilitate generalisation, however, this year we have replaced the TRECVid2019 Video-to-Text dataset with the VideoMem dataset in order to remedy underlying data quality issues, and to prioritise short-term memorability prediction by elevating the Memento10k dataset as the primary dataset. Additionally, a fully fledged electroencephalography (EEG)-based prediction sub-task is introduced. In this paper, we outline the core facets of the task and its constituent sub-tasks; describing the datasets, evaluation metrics, and requirements for participant submissions.

研究动机与目标

  • 推动作为人类认知重要性代理指标的短期视频记忆性预测研究。
  • 通过用VideoMem替代TRECVid2019并提升Memento10k作为主数据集,改善模型在不同数据集间的泛化能力。
  • 引入一项基于EEG的新型子任务,利用神经生理信号预测个体对视频的识别能力。
  • 通过聚焦于归一化的短期记忆性分数并移除长期和原始分数,实现评估的标准化。
  • 支持结合视觉、文本和EEG特征的多模态系统开发,以提升记忆性预测性能。

提出的方法

  • 参赛者使用Memento10k数据集(10,000段三秒无声视频),其短期记忆性分数源自通过Memento记忆游戏进行的众包识别任务。
  • VideoMem数据集(10,000段七秒无声视频)用作第二数据集,以评估模型在不同领域间的泛化能力。
  • EEG子任务使用12名受试者在观看Memento10k视频后,通过二元反馈指示识别结果所提取的预处理EEG特征。
  • 系统利用视觉、文本和/或EEG特征进行记忆性分数预测,评估指标包括斯皮尔曼等级相关系数、皮尔逊相关系数和均方误差。
  • 对于子任务3,系统必须整合EEG特征以预测受试者是否会识别某段视频,评估指标为AUC。
  • 所有系统在每项数据集的1,500个独立测试集上进行评估,每个子任务最多提交五次。

实验结果

研究问题

  • RQ1在Memento10k数据集上,利用视觉和文本特征预测短期视频记忆性可达到何种性能?
  • RQ2模型在Memento10k与VideoMem之间相互泛化预测短期记忆性的能力如何?
  • RQ3EEG提取的特征是否能超越视觉和文本线索,提升对个体视频识别的预测能力?
  • RQ4视觉、文本和EEG等多模态特征对记忆性预测准确率的相对贡献如何?
  • RQ5与原始分数或长期分数相比,归一化的短期记忆性分数在模型性能和一致性方面表现如何?

主要发现

  • Memento10k数据集源自持续识别游戏,每段视频平均有90次标注,提供了具有高度标注者一致性、可靠的短期记忆性分数。
  • 尽管VideoMem数据集规模相似,但因其数据质量问题,已从上一届的TRECVid2019中替换,现作为泛化能力的第二基准。
  • EEGMem数据集提供了12名受试者的预提取特征,支持基于二元识别反馈的个体特定识别预测。
  • 采用斯皮尔曼等级相关系数作为主要评估指标,以确保预测与实际记忆性分数之间单调关系的稳健比较。
  • 基于EEG的子任务使神经认知信号在预测个体识别方面的应用成为可能,为媒体领域脑机接口应用开辟了新路径。
  • 任务设计支持每个子任务最多五次提交,允许对多种配置下的模型进行迭代优化与对比。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。