[논문 리뷰] The YLI-MED Corpus: Characteristics, Procedures, and Plans
YLI-MED 코퍼스는 YFCC100M에서 유저가 생성한 50,700개의 비디오를 포함하는 공개적으로 이용 가능한 인간 레이블이 부여된 데이터셋으로, 10개의 목표 다중매체 이벤트(예: 생일 party, 결혼식)에 대해 2,000개의 비디오가 레이블링되고, 48,700개의 비이벤트 비디오가 포함되어 있다. 이 코퍼스는 이벤트 유형, 레이블러 간 일치도, 신뢰도 점수, 언어 및 음악과 같은 비이벤트 특성과 같은 상세한 레이블을 제공하여, 표준화된 훈련/테스트 분할 및 음성, 시각, 운동 분석을 위한 기능 번들로 다중매체 이벤트 검출 시스템의 훈련 및 평가를 가능하게 한다.
The YLI Multimedia Event Detection corpus is a public-domain index of videos with annotations and computed features, specialized for research in multimedia event detection (MED), i.e., automatically identifying what's happening in a video by analyzing the audio and visual content. The videos indexed in the YLI-MED corpus are a subset of the larger YLI feature corpus, which is being developed by the International Computer Science Institute and Lawrence Livermore National Laboratory based on the Yahoo Flickr Creative Commons 100 Million (YFCC100M) dataset. The videos in YLI-MED are categorized as depicting one of ten target events, or no target event, and are annotated for additional attributes like language spoken and whether the video has a musical score. The annotations also include degree of annotator agreement and average annotator confidence scores for the event categorization of each video. Version 1.0 of YLI-MED includes 1823 "positive" videos that depict the target events and 48,138 "negative" videos, as well as 177 supplementary videos that are similar to event videos but are not positive examples. Our goal in producing YLI-MED is to be as open about our data and procedures as possible. This report describes the procedures used to collect the corpus; gives detailed descriptive statistics about the corpus makeup (and how video attributes affected annotators' judgments); discusses possible biases in the corpus introduced by our procedural choices and compares it with the most similar existing dataset, TRECVID MED's HAVIC corpus; and gives an overview of our future plans for expanding the annotation effort.
연구 동기 및 목표
- 자동화된 이벤트 검출 연구를 지원하기 위해 다수의 유저 생성 비디오를 대규모로 공개할 수 있도록 다중매체 이벤트 레이블이 부여된 코퍼스를 구축하기 위해.
- 다중 단계 검증, 공감 점수, 레이블러들의 주관적 신뢰도 평가를 통해 레이블의 고품질을 확보하기 위해.
- 균형 잡힌 이벤트 분포와 부정 예제를 포함한 표준화된 훈련 및 테스트 세트를 제공함으로써 다양한 시스템 간 공정한 비교를 가능하게 하기 위해.
- YFCC100M 데이터셋에 언어 및 음악과 같은 비이벤트 특성과 같은 풍부하고 구조화된 레이블을 추가하기 위해.
- 향후 다중매체 게놈 프로젝트(MMGP)의 기반을 마련하기 위해, 더 넓은 범위의 이벤트 커버리지와 영상 콘텐츠에 대한 보다 광범위한 레이블링을 제공하기 위해.
제안 방법
- 레이블러들이 명확하고 일관된 기준을 확보하기 위해 반복적인 연구와 공감대 형성을 통해 이벤트 정의를 수립하였다.
- 키워드 및 메타데이터 필터를 사용해 YFCC100M에서 비디오를 수집한 후, 수동 검토 및 이벤트 및 비이벤트 특성에 대한 레이블링을 수행하였다.
- 레이블 신뢰도 평가를 위해 이중 레이블러 간 일치도 측정 지표와 주관적 신뢰도 평가를 사용하여 레이블러 간 일치도 및 신뢰도 점수를 계산하였다.
- 저일치도 비디오를 제거하고 공감 기반 필터링을 통해 사용자 편향을 줄인 후, 코퍼스를 훈련 및 테스트 세트로 분할하였다.
- 부정 비디오는 자동 메타데이터 필터링을 통해 선택하고 수동으로 검증하여, 목표 이벤트를 포함하지 않는지 확인하였다.
- 사전 계산된 기능들—예를 들어 음성 임베딩(YFCC-CC), 시각 기능(AlexNet), 이미지 기능(LIRE)—은 레이블과 함께 사전 계산되어 공개되었다.
실험 결과
연구 질문
- RQ1다중매체 이벤트 검출을 위한 대규모 공개 비디오 코퍼스를 어떻게 체계적으로 구축할 수 있으며, 고품질의 레이블링을 확보할 수 있는가?
- RQ2언어 및 음악과 같은 비이벤트 특성이 이벤트 검출 성능에 어느 정도의 영향을 미치는가?
- RQ3이벤트 유형의 분포와 레이블러 간 일치도가 이벤트 검출 모델의 신뢰성과 일반화 능력에 어떻게 영향을 미치는가?
- RQ4데이터 수집 절차에서 유도되는 주요 편향은 무엇이며, 코퍼스 설계에서 이를 어떻게 완화할 수 있는가?
- RQ5이 코퍼스를 기반으로 다중매체 게놈 프로젝트(MMGP)와 같은 대규모 비디오 레이블링의 확장 가능하고 협업 기반의 프레임워크를 효과적으로 구축할 수 있는가?
주요 결과
- YLI-MED v.1.0 코퍼스는 10개의 목표 이벤트에 대해 2,000개의 양성 비디오와 48,700개의 비이벤트 비디오를 포함하며, 균형 잡힌 훈련 및 테스트 세트로 분할되어 있다.
- 이벤트 분류에 대한 레이블러 간 일치도는 중간 수준에서 다소 높은 수준이었으며, 평균 신뢰도 점수는 레이블러의 높은 신뢰성을 반영하고 있다.
- 편집 및 음악과 같은 후처리 효과가 이벤트 검출 결정에 상당한 영향을 미쳤으며, 특히 음악이 주요 혼동 요인으로 작용하였다.
- 비영어어로 된 음성 특성은 상당수의 비디오에 존재했으며, 이는 이벤트 분류 결과와 상관관계가 있었다.
- 코퍼스는 TRECVID MED 및 HAVIC와 유사하게 설계되었지만, 절차적 차이로 인해 직접적인 비교가 어려울 수 있다.
- 음성, 시각, 운동 기능을 위한 기능 번들은 사전 계산되어 공개되어 있어, 후속 이벤트 검출 연구에서 즉각적으로 활용할 수 있다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.