[논문 리뷰] Overview of MediaEval 2020 Predicting Media Memorability Task: What Makes a Video Memorable?
이 논문은 MediaEval 2020 Predicting Media Memorability 과제의 제3판을 제시하며, TRECVid 2019 Video-to-Text 데이터셋의 일부를 사용하여 단기(분 단위) 및 장기(24–72시간) 비디오 기억성 예측을 위한 기계 학습 모델을 평가한다. 과제는 애너테이션된 비디오, 사전 추출된 시각적 특징(예: VGGFC7, C3D), 그리고 아마존 메카니컬 터크에서의 인식 테스트로부터 유도된 참값 기억성 점수를 제공하여, 스피어만의 순위 상관계수를 사용한 모델의 벤치마킹을 가능하게 한다.
This paper describes the MediaEval 2020 Predicting Media Memorability task. After first being proposed at MediaEval 2018, the Predicting Media Memorability task is in its 3rd edition this year, as the prediction of short-term and long-term video memorability (VM) remains a challenging task. In 2020, the format remained the same as in previous editions. This year the videos are a subset of the TRECVid 2019 Video-to-Text dataset, containing more action rich video content as compared with the 2019 task. In this paper a description of some aspects of this task is provided, including its main characteristics, a description of the collection, the ground truth dataset, evaluation metrics and the requirements for participants’ run submissions.
연구 동기 및 목표
- 단기 및 장기 기억 유지에서 비디오 기억성을 예측하기 위한 표준화된 벤치마크를 구축하기 위해.
- 기존 연구에서 드문 장기 기억성 애너테이션을 포함한 공개 가능한 데이터셋을 제공하여 계산 기반 비디오 기억성 연구를 촉진하기 위해.
- 시각적 및 시간적 특징을 사용하여 비디오가 얼마나 기억될 가능성이 있는지 예측할 수 있는 기계 학습 모델의 개발을 지원하기 위해.
- 일致한 평가 지표와 공통 데이터를 사용하여 다양한 접근 방식의 비교 평가를 가능하게 하기 위해.
- 광고, 교육, 콘텐츠 추천와 같은 다중미디어 응용 분야에서 인간 기억 효과를 비디오 콘텐츠에 모델링함으로써 연구를 촉진하기 위해.
제안 방법
- 참가자들에게 TRECVid 2019 Video-to-Text 데이터셋에서 유도된 1,500개의 짧은 비디오(훈련 590개, 개발 410개, 테스트 500개)로 구성된 데이터셋이 제공되었으며, 이는 높은 동작 콘텐츠를 지닌 것으로 선별되었다.
- 각 비디오는 아마존 메카니컬 터크에서의 비디오 기억성 게임 프로토콜을 사용하여 단기 및 장기 기억성에 대해 애너테이션되었다. 사용자는 이전에 본 비디오를 인식하기 위해 스페이스바를 눌렀다.
- 참값 기억성 점수는 단기 기억성의 경우 최소 16명의 애너테이터, 장기 기억성의 경우 적은 수이지만 여전히 유의미한 애너테이션 수를 기반으로 한 정확한 인식 비율로 계산되었다.
- 사전 추출된 시각적 특징으로는 3개의 핵심 프레임(시작, 중간, 종료)에서 추출된 이미지 수준의 특징(예: AlexNetFC7, HOG, HSVHist, RGBHist, LBP, VGGFC7)과 비디오 수준의 C3D 특징이 포함되었다.
- 평가에서는 두 하위 과제 모두에 대해 예측된 기억성 점수와 참값 기억성 점수 간의 스피어만의 순위 상관계수를 사용하였다.
- 참가자는 최대 10개의 런(하위 과제당 5개)을 제출할 수 있었으며, 한 하위 과제의 예측을 다른 하위 과제에 직접 사용하는 것을 방지하는 제약 조건이 있었지만, 추가 런을 위한 교차 애너테이션은 허용되었다.
실험 결과
연구 질문
- RQ1어떤 시각적 및 시간적 특징이 단기 비디오 기억성을 가장 강하게 예측하는가?
- RQ2핵심 프레임에서 추출된 특징과 비디오 수준의 표현이 장기 기억성 예측에 어떻게 기여하는가?
- RQ3단기 기억성 예측에 훈련된 모델이 장기 기억성 예측으로 일반화되는 정도는 어느 정도인가?
- RQ4장기 기억성 애너테이션의 포함이 비디오 기억성 예측 모델의 예측 성능을 얼마나 향상시키는가?
- RQ5사용자 상호작용 패턴(예: 반응 시간, 인식 정확도)이 기억성 점수의 검증에 어떤 역할을 하는가?
주요 결과
- MediaEval 2020 과제는 장기 비디오 기억성 애너테이션을 포함한 공개 가능한 첫 번째 데이터셋을 제공하며, 이는 이전 연구에서 단기 중심에 머물러 있음을 초월한다.
- 데이터셋은 TRECVid 2019 Video-to-Text 컬렉션에서 유도된 1,500개의 비디오로 구성되어 있으며, 훈련 세트 590개, 개발 세트 410개, 테스트 세트 500개로 나뉘어져 있다.
- 참값 기억성 점수는 아마존 메카니컬 터크에서의 인식 테스트를 통해 수집되었으며, 단기 점수는 최소 16명의 애너테이터, 장기 점수는 적은 수이지만 여전히 유의미한 애너테이션 수를 기반으로 하였다.
- 사전 추출된 시각적 특징으로는 6개의 이미지 수준 특징(예: VGGFC7, HOG)과 1개의 비디오 수준 특징(C3D)이 포함되어 있어 다양한 모델 개발을 가능하게 하였다.
- 과제 프레임워크는 기억성 예측 과제의 표준 지표인 스피어만의 순위 상관계수를 사용하여 비교 평가를 지원한다.
- 과제 설계는 단기 및 장기 예측 런 간 직접적인 유출을 방지하여 독립된 모델 성능 평가의 공정성을 확보한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.