Skip to main content
QUICK REVIEW

[논문 리뷰] Overview of The MediaEval 2022 Predicting Video Memorability Task

Lorin Sweeney, Mihai Gabriel Constantin|arXiv (Cornell University)|2022. 12. 13.
Visual Attention and Saliency Detection인용 수 5
한 줄 요약

이 논문은 Memento10k 및 VideoMem 데이터셋을 사용하여 단기적 영상 기억성 예측에 중점을 두고, 개인별 인식 예측을 위한 새로운 EEG 기반 하위 과제를 포함한 MediaEval Predicting Video Memorability Task의 제5판을 소개한다. 이 과제는 정규화된 단기 기억성 점수에 중점을 두며, 스피어만 상관관계 및 AUC 메트릭을 사용하여 시스템을 평가하여 미디어 셀렉션 및 기억의 인지 모델링 분야의 연구를 발전시킨다.

ABSTRACT

This paper describes the 5th edition of the Predicting Video Memorability Task as part of MediaEval2022. This year we have reorganised and simplified the task in order to lubricate a greater depth of inquiry. Similar to last year, two datasets are provided in order to facilitate generalisation, however, this year we have replaced the TRECVid2019 Video-to-Text dataset with the VideoMem dataset in order to remedy underlying data quality issues, and to prioritise short-term memorability prediction by elevating the Memento10k dataset as the primary dataset. Additionally, a fully fledged electroencephalography (EEG)-based prediction sub-task is introduced. In this paper, we outline the core facets of the task and its constituent sub-tasks; describing the datasets, evaluation metrics, and requirements for participant submissions.

연구 동기 및 목표

  • 인간의 인지적 중요성의 산물로 간주되는 단기 영상 기억성 예측을 통해 연구를 발전시키기 위해.
  • TRECVid2019를 VideoMem로 대체하고 Memento10k를 주요 데이터셋으로 격상시켜 데이터셋 간 일반화 능력을 향상시키기 위해.
  • 신경생리학적 신호를 사용하여 개인의 영상 인식을 예측하는 새로운 EEG 기반 하위 과제를 도입하기 위해.
  • 원시 점수 및 장기 점수를 제거하고 정규화된 단기 기억성 점수에 중점을 두어 평가 기준을 표준화하기 위해.
  • 시각적, 텍스처적, EEG 기능을 통합한 다중모odal 시스템 개발을 지원하여 기억성 예측 정확도를 향상시키기 위해.

제안 방법

  • 참가자들은 Memento10k 데이터셋(10,000개의 3초 분량의 음성 없는 영상)을 사용하며, 이는 Memento 기억 게임을 통한 군중 기반 인식 작업에서 유도된 단기 기억성 점수를 포함한다.
  • VideoMem 데이터셋(10,000개의 7초 분량의 음성 없는 영상)은 도메인 간 일반화 평가를 위한 보조 데이터셋으로 사용된다.
  • EEG 기반 하위 과제는 Memento10k 영상을 시청한 12명의 피실험자로부터 사전에 추출된 EEG 특징을 사용하며, 이후 이들이 이진 피드백을 통해 인식 여부를 제시한다.
  • 시스템은 시각적, 텍스처적, 또는 EEG 특징을 사용하여 기억성 점수를 예측하도록 훈련되며, 평가 기준으로는 스피어만 상관관계, 피어슨 상관관계 및 평균 제곱오차가 사용된다.
  • 하위 과제 3의 경우, 시스템은 EEG 특징을 통합하여 피실험자가 영상을 인식할지를 예측해야 하며, AUC 기준으로 평가된다.
  • 모든 시스템은 각 데이터셋당 1,500개의 테스트 영상로 구성된 개별 테스트 세트에서 평가되며, 하위 과제당 최대 5개의 제출이 허용된다.

실험 결과

연구 질문

  • RQ1Memento10k 데이터셋에서 시각적 및 텍스처적 특징을 사용하여 단기 영상 기억성 예측 성능은 어느 정도 달성될 수 있는가?
  • RQ2모델은 Memento10k에서 VideoMem로, 또는 그 반대로 일반화하여 단기 기억성 예측을 얼마나 잘 수행할 수 있는가?
  • RQ3EEG 유도 특징은 시각적 및 텍스처적 신호를 초월하여 개인의 영상 인식 예측을 향상시킬 수 있는가?
  • RQ4다중모달 특징(시각적, 텍스처적, EEG)이 기억성 예측 정확도에 기여하는 상대적 기여도는 어떠한가?
  • RQ5정규화된 단기 기억성 점수는 원시 점수 또는 장기 점수와 비교해 모델 성능 및 일관성 측면에서 어떻게 다른가?

주요 결과

  • Memento10k 데이터셋은 평균 90회의 애너테이션을 포함한 지속적인 인식 게임에서 유도된 것으로, 높은 애너테이터 일관성을 보이며 신뢰할 수 있는 단기 기억성 점수를 제공한다.
  • VideoMem 데이터셋은 크기가 유사하지만, 데이터 품질 문제로 이전의 TRECVid2019 데이터셋에서 대체되었으며, 이제는 일반화 평가를 위한 보조 벤치마크로 사용된다.
  • EEGMem 데이터셋은 12명의 피실험자로부터 사전 추출된 특징을 제공하며, 인식 피드백의 이진 지도를 기반으로 개인별 인식 예측이 가능하다.
  • 예측된 기억성 점수와 실제 기억성 점수 간의 단조적 관계를 안정적으로 비교하기 위해 스피어만 순위 상관관계가 주 평가 지표로 채택되었다.
  • EEG 기반 하위 과제는 개인의 인식 예측에 뇌신경 신호를 평가할 수 있는 기회를 제공하며, 미디어 분야의 뇌-컴퓨터 인터페이스 응용 분야에 새로운 길을 열어준다.
  • 과제 설계는 하위 과제당 최대 5개의 제출을 허용하여, 다양한 구성에서의 모델 반복 개선 및 비교를 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.