[논문 리뷰] Removing the Background by Adding the Background: Towards Background Robust Self-supervised Video Representation Learning
이 논문은 배경 제거(BE)를 제안하며, 비디오의 각 프레임에 정적 프레임을 추가하여 모델이 운동 불변 특징을 학습하도록 유도함으로써 배경 편향에 대한 모델의 강건성을 향상시키는 단순하면서도 효과적인 자기지도 학습 비디오 표현 학습 방법이다. BE는 MoCo와 조합했을 때 UCF101에서 16.4% 향상되고 HMDB51에서 19.1% 향상되어 강력한 일반화 능력과 장면 신호에 대한 의존도 감소를 보여준다.
Self-supervised learning has shown great potentials in improving the video representation ability of deep neural networks by getting supervision from the data itself. However, some of the current methods tend to cheat from the background, i.e., the prediction is highly dependent on the video background instead of the motion, making the model vulnerable to background changes. To mitigate the model reliance towards the background, we propose to remove the background impact by adding the background. That is, given a video, we randomly select a static frame and add it to every other frames to construct a distracting video sample. Then we force the model to pull the feature of the distracting video and the feature of the original video closer, so that the model is explicitly restricted to resist the background influence, focusing more on the motion changes. We term our method as \emph{Background Erasing} (BE). It is worth noting that the implementation of our method is so simple and neat and can be added to most of the SOTA methods without much efforts. Specifically, BE brings 16.4% and 19.1% improvements with MoCo on the severely biased datasets UCF101 and HMDB51, and 14.5% improvement on the less biased dataset Diving48.
연구 동기 및 목표
- 데이터셋 편향으로 인해 비디오 모델이 배경 신호에 과도하게 의존하는 문제를 해결하기 위해.
- 학습 중에 배경 일관성을 명시적으로 방해함으로써 정적 장면 정보에 대한 모델 의존도를 줄이기 위해.
- 기존 자기지도 학습 비디오 학습 프레임워크에 아키텍처 변경 없이 쉽게 통합할 수 있는 단순하고 즉시 사용 가능한 방법을 개발하기 위해.
- 운동 패턴에 초점을 맞춤으로써 새로운 동작에 대한 일반화 능력 향상과 배경에 관계없이 동작 인식 성능 향상을 위해.
제안 방법
- 각 비디오에 대해 무작위로 정적 프레임을 선택하고, 이 프레임을 비디오의 모든 프레임에 추가하여 혼란을 유도하는 비디오 샘플을 생성한다.
- 일致성 정규화를 사용하여 원본 비디오와 배경이 방해된 비디오 간의 특징 거리를 최소화하도록 모델을 훈련시킨다.
- 기존 자기지도 학습 파ip라인에 쉽게 통합할 수 있는 데이터 증강 기법으로 구현된다.
- 대조 학습(MoCo 등)과 사전 과제 기반 방법 양쪽 모두와 호환된다.
- 배경 제거된 샘플은 모델이 정적 장면 구조보다 운동 패턴에 집중하도록 유도한다.
- 경량이며 추가 파라미터나 복잡한 훈련 절차가 필요하지 않다.
실험 결과
연구 질문
- RQ1단순한 데이터 증강 전략이 자기지도 학습 비디오 학습에서 모델의 배경 신호 의존도를 줄일 수 있는가?
- RQ2배경 노이즈를 추가하면 모델이 동작 인식에서 운동 패턴에 더 집중하게 되는가?
- RQ3배경 제거(BE)가 편향이 강한 및 덜 편향된 비디오 데이터셋에서 성능 향상에 어느 정도 기여하는가?
- RQ4이 방법은 사전 훈련 중에 볼 수 없었던 새로운 동작에 대한 일반화 능력을 향상시키는가?
- RQ5장면 편향이 최소한인 데이터셋에서 테스트했을 때 모델이 강건성을 유지하는가?
주요 결과
- BE는 MoCo와 조합했을 때 UCF101에서 16.4% 향상되고 HMDB51에서 19.1% 향상되어 편향이 심한 데이터셋에서 뚜렷한 성과 향상을 보였다.
- 편향이 덜한 Diving48 데이터셋에서는 MoCo 대비 14.5% 향상되어 낮은 편향 환경에서도 효과적임을 입증했다.
- 연기자 중심의 Actor-HMDB51 데이터셋에서 지도 학습과 자기지도 학습 모델 간 성능 격차가 19.1%에서 2.9%로 크게 감소하여 BE가 장면 편향 의존도를 줄임을 보여주었다.
- 시각화 결과는 BE로 사전 훈련된 모델이 악성 외란 조건에서도 움직이는 대상에 더 집중하고 정적 배경에 덜 영향을 받는다는 것을 확인했다.
- 다양한 백본과 자기지도 학습 프레임워크 전반에서 일관된 성능 향상을 유지하여 일반화 능력과 강건성을 입증했다.
- BE로 훈련된 모델은 새로운 클래스로의 전이 능력이 뛰어나며, 주의 맵이 배경이 아닌 운동 영역을 명확히 강조함을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.