[논문 리뷰] RSPNet: Relative Speed Perception for Unsupervised Video Representation Learning
RSPNet는 상대 재생 속도 인지(RSP)와 외관 중심의 비디오 인스턴스 구분(A-VID)을 활용하여 운동 및 외관 특징을 함께 학습하는 새로운 비지도 비디오 표현 학습 프레임워크를 제안한다. 절대 속도 예측 대신 상대 속도 비교를 도입하고, 속도 증강을 통한 인스턴스 구분 작업을 도입함으로써 RSPNet은 레이블이 없는 사전 훈련 데이터 없이 UCF101에서 행동 인식 작업에서 93.7%의 정확도를 달성한다.
We study unsupervised video representation learning that seeks to learn both motion and appearance features from unlabeled video only, which can be reused for downstream tasks such as action recognition. This task, however, is extremely challenging due to 1) the highly complex spatial-temporal information in videos; and 2) the lack of labeled data for training. Unlike the representation learning for static images, it is difficult to construct a suitable self-supervised task to well model both motion and appearance features. More recently, several attempts have been made to learn video representation through video playback speed prediction. However, it is non-trivial to obtain precise speed labels for the videos. More critically, the learnt models may tend to focus on motion pattern and thus may not learn appearance features well. In this paper, we observe that the relative playback speed is more consistent with motion pattern, and thus provide more effective and stable supervision for representation learning. Therefore, we propose a new way to perceive the playback speed and exploit the relative speed between two video clips as labels. In this way, we are able to well perceive speed and learn better motion features. Moreover, to ensure the learning of appearance features, we further propose an appearance-focused task, where we enforce the model to perceive the appearance difference between two video clips. We show that optimizing the two tasks jointly consistently improves the performance on two downstream tasks, namely action recognition and video retrieval. Remarkably, for action recognition on UCF101 dataset, we achieve 93.7% accuracy without the use of labeled data for pre-training, which outperforms the ImageNet supervised pre-trained model. Code and pre-trained models can be found at https://github.com/PeihaoChen/RSPNet.
연구 동기 및 목표
- 자기지도 비디오 표현 학습에서 정확도가 떨어지고 일관성이 없는 재생 속도 레이블 문제를 해결하기 위해.
- 클립 간의 상대 속도를 보다 안정적이고 일관성 있는 감독으로 사용하여 운동 특징 학습을 향상시키기 위해.
- 확장된 인스턴스 구분 작업을 통해 모델이 분류 가능한 외관 특징을 명시적으로 학습하도록 유도하기 위해.
- 운동 및 외관 표현 학습을 함께 최적화하여 더 나은 최종 성능을 달성하기 위해.
- 레이블이 없는 데이터로 사전 훈련을 하지 않고도 행동 인식 및 비디오 검색에서 최신 기술 수준의 성능을 입증하기 위해.
제안 방법
- 모델이 동일한 비디오의 두 클립 간의 상대 재생 속도를 예측하는 사전 과제로 상대 속도 인지(RSP)를 제안하며, 절대 속도 예측 대신 사용한다.
- 유사도 계산을 위해 특징을 128차원 공간으로 매핑하는 프로젝션 헤드를 사용하는 대비 학습 설정을 사용한다.
- A-VID 과제에서 속도 증강 전략을 도입하여 외관은 유지하면서 운동만 변화하는 양의 클립 쌍을 생성함으로써 외관 특징 학습을 향상시킨다.
- 운동(RSP)과 외관(A-VID) 과제를 위한 별도의 프로젝션 헤드를 갖춘 이중 브랜치 네트워크를 활용하여 독립적인 최적화를 가능하게 한다.
- 클래스 활성화 맵(CAM)을 사용하여 관심 영역(RoI) 주의를 시각화하여, 모델이 운동이 풍부한 영역과 외관 분류에 유용한 영역에 집중하고 있음을 확인한다.
- Kinetics-400에서 훈련하고, UCF101에서 상위-k 정확도 및 검색 성능을 평가한다.
실험 결과
연구 질문
- RQ1상대 재생 속도는 절대 속도 예측보다 운동 표현 학습에 더 안정적이고 효과적인 감독을 제공할 수 있는가?
- RQ2인스턴스 구분은 비디오 도메인에 효과적으로 어떻게 적응시킬 수 있는가? 이를 통해 외관 특징 학습을 유도할 수 있는가?
- RQ3상대 속도 인지와 외관 중심의 대비 학습을 함께 최적화하면 최종 비디오 이해 성능이 향상되는가?
- RQ4모델은 각 사전 과제에 대해 분류 가능한 시공간 영역에 주의를 기울이는가?
- RQ5RSPNet을 사용한 비지도 사전 훈련은 레이블이 없는 데이터 없이도 행동 인식에서 최신 기술 수준의 성능을 달성할 수 있는가?
주요 결과
- RSPNet은 레이블이 없는 사전 훈련 데이터 없이 Kinetics-400에서 비지도 사전 훈련을 수행함으로써 UCF101에서 행동 인식 작업에서 상위-1 정확도 93.7%를 달성한다.
- Pace와 같은 최신 기술 수준의 베이스라인을 모두의 상위-k 검색 메트릭에서 능가한다.
- 정성적 검색 결과는 모델이 운동과 외관이 매우 유사한 비디오를 성공적으로 검색하고 있음을 보여주며, 효과적인 공동 특징 학습을 확인한다.
- RoI 시각화 결과는 RSP 헤드가 운동이 풍부한 영역(예: 움직이는 사지)에 집중하는 반면, A-VID 헤드는 분류에 도움이 되는 외관 특징(예: 옷차림 패atters, 얼굴 특징)에 주목하고 있음을 확인한다.
- 상대 속도 레이블의 사용은 절대 속도 예측에서 발생하는 레이블 일관성 문제를 감소시켜 더 안정적이고 효과적인 운동 표현 학습을 가능하게 한다.
- A-VID에서의 속도 증강 전략은 모델이 외관에 불변하는 특징을 학습하도록 유도하여 운동 변화에 대한 강건성을 향상시켰다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.