[논문 리뷰] TRECVID 2020: A comprehensive campaign for evaluating video retrieval tasks across multiple application domains
TRECVID 2020은 비디오 요약 및 재난 현장 기술 및 색인화를 포함한 6개의 과제를 포함하여 비디오 검색을 위한 종합적인 평가 캠페인을 도입했다. 이 캠페인은 Vimeo V3C1, BBC EastEnders, VIRAT, 네팔 지진 영상 등 다양한 데이터셋을 사용하였으며, MAP, MT, DA 등의 지표를 활용한 인간 평가 및 자동 평가를 병행하였다. 비디오 요약은 12개 팀이 참가한 첫 해로, 최종 결과를 제출한 팀은 2개 팀이었다.
The TREC Video Retrieval Evaluation (TRECVID) is a TREC-style video analysis and retrieval evaluation with the goal of promoting progress in research and development of content-based exploitation and retrieval of information from digital video via open, metrics-based evaluation. Over the last twenty years this effort has yielded a better understanding of how systems can effectively accomplish such processing and how one can reliably benchmark their performance. TRECVID has been funded by NIST (National Institute of Standards and Technology) and other US government agencies. In addition, many organizations and individuals worldwide contribute significant time and effort. TRECVID 2020 represented a continuation of four tasks and the addition of two new tasks. In total, 29 teams from various research organizations worldwide completed one or more of the following six tasks: 1. Ad-hoc Video Search (AVS), 2. Instance Search (INS), 3. Disaster Scene Description and Indexing (DSDI), 4. Video to Text Description (VTT), 5. Activities in Extended Video (ActEV), 6. Video Summarization (VSUM). This paper is an introduction to the evaluation framework, tasks, data, and measures used in the evaluation campaign.
연구 동기 및 목표
- 다양한 실제 응용 분야에서 콘텐츠 기반 비디오 검색 및 분석을 향상시키기 위해.
- 임의의 검색, 인스턴스 검색, 비디오 요약, 장기 비디오 내 활동 인식 과제에서 시스템을 평가하기 위해.
- 재난 현장 기술 및 색인화 및 비디오 요약과 같은 새로운 과제를 도입하고 평가하기 위해.
- 비디오 검색 시스템의 신뢰할 수 있는 벤치마킹을 가능하게 하기 위해 표준화된 데이터셋과 평가 프로토콜을 제공하기 위해.
- 인간 평가 및 자동 평가를 기반으로 한 개방형 평가를 통해 연구 진전을 지원하기 위해.
제안 방법
- 임의의 비디오 검색 및 인스턴스 검색 과제에 Vimeo Creative Commons V3C1 데이터셋(100만 개 샷, 약 1000시간)을 활용하였다.
- 인스턴스 검색 및 비디오 요약 과제에 BBC EastEnders 영상(464시간)을 사용하였으며, 샷 수준의 분할과 MTCNN 및 FaceNet을 통한 얼굴 인식을 수행하였다.
- 장기 비디오 내 활동 과제(ActEV)에 VIRAT 데이터셋(10시간)을 적용하였으며, Kitware, Inc.에서 기준 annotation을 사용하여 주석을 하였다.
- VTT 과제에 V3C2의 1700개 영상 서브셋을 사용하였으며, 인간 주석과 MT 지표 및 직접 평가(DA)를 통한 자동 평가를 실시하였다.
- 2015년 네팔 지진 공개 재난 영상 5시간을 사용하여 재난 현장 기술 및 색인화 과제를 도입하였다.
- 하이브리드 평가 방식을 구현: AVS, INS, VSUM, DSDI 과제는 인간 평가자, VTT 및 ActEV 과제는 MAP, MT, DA를 통한 자동 평가를 실시하였다.
실험 결과
연구 질문
- RQ1다양하고 실제 세계의 비디오 응용 분야에서 관련 비디오 콘텐츠를 효과적으로 검색할 수 있는 방법은 무엇인가?
- RQ2장기 서사 비디오에서 주요 삶의 사건을 요약하기 위해 식별하는 데 있어 핵심 과제는 무엇인가?
- RQ3자동 및 인간 평가를 통해 짧은 클립에서 정확하고 종합적인 비디오 기술을 생성할 수 있는 시스템의 성능은 어떠한가?
- RQ4비구조적이고 실제 세계의 재난 영상에서 이벤트를 탐지하고 색인화할 수 있는 비디오 분석 시스템의 능력은 어느 정도인가?
- RQ5다른 평가 방법론(인간 대 자동)이 비디오 검색 및 기술 과제 평가에서 어떻게 비교되는가?
주요 결과
- 비디오 요약 과제가 처음으로 도입되었으며, 총 12개 팀이 참가하였고, 최종 결과를 제출한 팀은 2개 팀이었다.
- 최종 성과를 낸 두 팀은 비디오 요약을 위한 샷 중요도 계산에 얼굴 감지 점수와 자기 주의 메커니즘(self-attention mechanism, 예: VASNet)의 조합을 사용하였다.
- 인간 평가자들이 임의의 비디오 검색, 인스턴스 검색, 비디오 요약 과제를 평가하였고, 비디오 기술 과제 및 재난 현장 과제에는 자동 지표(MAP, MT, DA)를 사용하였다.
- ActEV 과제는 Kitware, Inc.에서 제공한 기준 주석을 사용하였으며, 표준 평가 프로토콜을 기반으로 평가되었다.
- DSDI 과제는 2015년 네팔 지진에서 확보한 5시간 분량의 데이터셋을 사용하였으며, 평균 평균 정확도(MAP)를 통해 결과가 평가되었다.
- 데이터 접근 지연이 참가에 악영향을 미쳤을 수 있으며, 특히 새로운 비디오 요약 과제에 있어 그러한 영향이 두드러졌다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.