[논문 리뷰] SeCo: Exploring Sequence Supervision for Unsupervised Representation Learning
SeCo는 대비 학습 프레임워크 내에서 인스턴스 식별 및 시간 순서 검증 작업을 통해 영상의 세 가지 유형의 순서 감독—공간적, 시공간적, 순차적—을 활용함으로써 영상에 대한 새로운 비지도 표현 학습 프레임워크를 제안한다. 이는 행동 인식에서 ImageNet 지도 학습 전훈보다 UCF101과 HMDB51에서 각각 2.96%, 6.47% 높은 최신 기준 성능을 달성한다.
A steady momentum of innovations and breakthroughs has convincingly pushed the limits of unsupervised image representation learning. Compared to static 2D images, video has one more dimension (time). The inherent supervision existing in such sequential structure offers a fertile ground for building unsupervised learning models. In this paper, we compose a trilogy of exploring the basic and generic supervision in the sequence from spatial, spatiotemporal and sequential perspectives. We materialize the supervisory signals through determining whether a pair of samples is from one frame or from one video, and whether a triplet of samples is in the correct temporal order. We uniquely regard the signals as the foundation in contrastive learning and derive a particular form named Sequence Contrastive Learning (SeCo). SeCo shows superior results under the linear protocol on action recognition (Kinetics), untrimmed activity recognition (ActivityNet) and object tracking (OTB-100). More remarkably, SeCo demonstrates considerable improvements over recent unsupervised pre-training techniques, and leads the accuracy by 2.96% and 6.47% against fully-supervised ImageNet pre-training in action recognition task on UCF101 and HMDB51, respectively. Source code is available at \url{https://github.com/YihengZhang-CV/SeCo-Sequence-Contrastive-Learning}.
연구 동기 및 목표
- 인간 레이블이 부족하고 비용이 높은 영상 데이터 문제를 해결하기 위해 영상 내재적 구조를 활용해 비지도 표현 학습을 수행한다.
- 영상 시퀀스 내에서 공간적(프레임 내부), 시공간적(프레임 간), 순차적(시간 순서) 세 가지 유형의 감독을 체계적으로 탐색하고 활용한다.
- 이러한 감독 신호들을 하나의 종단 간 학습 절차에 통합하는 통합된 대비 학습 프레임워크를 개발한다.
- 비지도 전훈을 통해 순서 감독를 활용할 경우 종속된 ImageNet 전훈을 초월할 수 있음을 입증한다.
제안 방법
- 세 가지 프록시 작업 설계: 동일 프레임 내에서 패치를 구분하는 내부 프레임 인스턴스 식별, 동일 영상 내에서 패치를 구분하는 외부 프레임 인스턴스 식별, 올바른 프레임 순서를 검증하는 시간 순서 검증.
- 기본 프레임에 데이터 증강을 적용하여 내부 및 외부 프레임 작업에서 쿼리 및 키 뷰를 생성한다.
- MoCo에서 영감을 얻어 미니배치 간 키를 저장하는 메모리 백을 사용하여 외부 프레임 대비 학습을 향상시킨다.
- 인스턴스 식별 작업에는 InfoNCE 손실을 사용하고, 시간 순서 검증에는 교차 엔트로피 손실을 사용하는 학습 가능한 분류기를 활용한다.
- 공유된 ResNet18 백본을 사용해 세 작업을 종단 간으로 동시에 학습한다.
- 긍정 쌍(동일 프레임 또는 동일 영상) 간 유사도를 최대화하고 부정 쌍 간 유사도를 최소화하는 대비 학습 원리를 활용한다.
실험 결과
연구 질문
- RQ1영상 시퀀스 내재적 시공간적 구조가 비지도 표현 학습에 효과적인 감독으로 기능할 수 있는가?
- RQ2공간적, 시공간적, 순차적 세 가지 유형의 순서 감독이 일반적인 영상 표현 학습에 어떻게 기여하는가?
- RQ3통합된 대비 학습 프레임워크가 여러 형태의 순서 감독을 효과적으로 통합하여 성능 향상을 이끌 수 있는가?
- RQ4순서 감독를 활용한 비지도 전훈이 종속된 ImageNet 전훈보다 후행 영상 인식 작업에서 성능이 뛰어나게 되는가?
주요 결과
- 선형 평가 프rotocol 하에서 SeCo는 UCF101에서 50.81%의 top-1 정확도를 달성하여 이전의 모든 비지도 방법을 뛰어넘고 새로운 최고 기록을 수립한다.
- 사전 훈련 + 미세조정 프로토콜 하에서 HMDB51에서는 55.55%의 top-1 정확도를 기록하여 최고의 경쟁자인 VIE-Full을 7.95%포인트 뛰어넘는다.
- 미세조정 프로토콜 하에서 SeCo 사전 훈련은 UCF101과 HMDB51에서 각각 ImageNet 지도 사전 훈련보다 2.96%, 6.47% 높은 정확도를 달성한다.
- SeCo는 UCF101과 HMDB51 양쪽에서 모두 지도 학습된 ImageNet 사전 훈련을 뛰어넘어, 영상 표현 학습에서 순서 감독의 우수성을 입증한다.
- 제거 실험을 통해 공간적, 시공간적, 순차적 세 가지 프록시 작업 모두가 최종 성능에 기여한다는 것이 확인된다.
- SeCo는 2D ResNet18 백본만으로도 더 복잡한 3D 아키텍처인 VIE-Full(3D ResNet18 및 SlowFast 네트워크 사용)을 뛰어넘는 강력한 성능을 기록한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.