[논문 리뷰] A Short Note on the Kinetics-700 Human Action Dataset
이 논문은 YouTube 영상에서 유저가 수행하는 동작 700개의 클래스를 포함하고, 각 클래스에 최소 600개의 비디오 클립이 포함된 Kinetics-700을 소개한다. 이는 Kinetics-600을 확장하여 다국어 쿼리 확장과 향상된 쿠리에이션을 통해 새로운 세분화되고 문화적으로 다양한 동작 클래스를 추가함으로써, 총 클립 수가 30% 증가한 65만 개로 증가하였다. 기준 I3D-RGB 모델은 검증 세트에서 58.7%의 top-1 정확도를 기록하여 이전 버전에 비해 작업 난이도가 상당히 높아졌음을 반영한다.
We describe an extension of the DeepMind Kinetics human action dataset from 600 classes to 700 classes, where for each class there are at least 600 video clips from different YouTube videos. This paper details the changes introduced for this new release of the dataset, and includes a comprehensive set of statistics as well as baseline results using the I3D neural network architecture.
연구 동기 및 목표
- 600개에서 700개의 인간 행동 클래스로 Kinetics 데이터셋을 확장하면서도 클립의 다양성과 품질을 유지하는 것.
- 다국어 쿼리 확장을 통해 세분화되고 문화적으로 다양한 행동 클래스를 포함시켜 데이터셋의 커버리지 향상.
- строго한 쿠리에이션 프로토콜을 유지하고 이전 버전과의 클래스 오버랩을 최소화하여 신규 데이터셋이 행동 인식 연구를 위한 확장 가능한 벤치마크로 남아 있도록 보장하는 것.
- 표준화된 검증 세트와 보류된 테스트 세트를 제공하여 다양한 모델 간의 공정한 비교를 가능하게 하고, 향후 행동 인식 분야의 벤치마크를 지원하는 것.
제안 방법
- 다국어 쿼리 확장을 도입하여 Kinetics 데이터 수집 파이프라인을 확장하여, 클래스 이름을 프랑스어, 포르투갈어, 스페인어로 번역함으로써 후보 영상 검색을 증가시켰다.
- 비디오 메타데이터와 제목의 가중치가 부여된 n-gram 표현을 사용하여 다국어 간 쿼리 텍스트를 매칭함으로써 검색 정확도와 다양성을 향상시켰다.
- 클립의 관련성과 품질을 보장하기 위해 커스터마이징된 인력 검증 절차를 도입하여 중복 및 저품질 콘텐츠를 필터링하였다.
- 학습, 검증, 테스트 세트 간의 엄격한 분리를 유지하였으며, 데이터 泄露를 방지하고 공정한 평가를 보장하기 위해 새로운 보류된 테스트 세트를 도입하였다.
- Kinetics-600의 597개 클래스를 최소한의 오버랩으로 유지하였으며, Kinetics-700과 Kinetics-600의 테스트 세트 간 오버랩은 3% 미만이었기에 Kinetics-600 모델을 Kinetics-700에서 안전하게 평가할 수 있었다.
- SGD와 모멘타임을 사용하고 학습률 감소를 적용하여 Kinetics-700 학습 세트에서 표준 I3D-RGB 모델을 처음부터 훈련시켰으며, 검증 및 테스트 분할에서 평가하였다.
실험 결과
연구 질문
- RQ1Kinetics 데이터셋을 700개 클래스로 확장함으로써 행동 인식 벤치마크의 확장성과 다양성은 어떻게 영향을 받는가?
- RQ2다국어 쿼리 확장은 새로운 세분화된 행동 클래스에 대해 관련 영상 클립을 얼마나 향상시킬 수 있는가?
- RQ3I3D-RGB와 같은 표준 모델의 성능은 Kinetics-600과 Kinetics-400에 비해 Kinetics-700에서 어떻게 변화하는가?
- RQ4인간 검증 및 품질 필터링을 포함한 새로운 쿠리에이션 절차는 데이터셋의 전체 난이도와 분포에 어떤 영향을 미치는가?
- RQ5Kinetics-700에서 새로 도입된 보류된 테스트 세트는 이전 버전과 비교해 모델 일반화와 평가의 공정성에 어떤 영향을 미치는가?
주요 결과
- Kinetics-700은 700개 클래스에 총 650,317개의 비디오 클립을 포함하고 있으며, 이는 Kinetics-600 대비 30% 증가한 것으로, 각 클래스에 최소 600개의 클립이 포함되어 있다.
- I3D-RGB 모델을 사용한 검증 세트에서 top-1 정확도는 58.7%, top-5 정확도는 81.7%를 기록하여, 이는 Kinetics-600(71.7% top-1)과 Kinetics-400(68.4% top-1)에 비해 작업 난이도가 상당히 높아졌음을 반영한다.
- 2019년 ActivityNet Kinetics 챌린지에서 상위 팀은 17.9%의 오차율을 기록하여 기준 I3D-RGB 모델의 29.3% 오차율을 크게 뛰어넘었다.
- 라틴 아메리카에서의 클립 비율은 Kinetics-400의 3%에서 Kinetics-700에서는 스페인어 및 포르투갈어 쿼리의 포함으로 8%로 증가하여 지리적 다양성이 향상되었다.
- Kinetics-700 테스트 세트와 Kinetics-600 분할 간 오버랩은 3% 미만으로 유지되어, Kinetics-600 모델을 Kinetics-700에서 안전하게 평가할 수 있지만, 반대는 학습 세트 오염으로 인해 불가능하다.
- I3D 모델이 가장 어려워하는 클래스로는 '무중력 상태에 있는 것'과 '슬라임 만들기' 등이 있었고, 가장 쉬운 클래스로는 '재스처'와 '드럼 연주' 등이 있었으며, 이는 모델이 연속적이고 고대비 동작에 강점을 보임을 반영한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.