Skip to main content
QUICK REVIEW

[논문 리뷰] Learning a Condensed Frame for Memory-Efficient Video Class-Incremental Learning

Yixuan Pei, Zhiwu Qing|arXiv (Cornell University)|2022. 11. 02.
Human Pose and Action Recognition인용 수 12
한 줄 요약

FrameMaker는 비디오 클래스-증분 학습에서 다수의 비디오 프레임을 하나의 대표 프레임으로 압축하여 메모리 사용을 크게 줄이면서도 성능을 유지하는 메모리 효율적인 방법을 제안한다. 이는 손실된 시공간 정보를 복구하기 위해 인스턴스별 프롬프트를 도입함으로써 상태최고 수준의 정확도를 달성하며, HMDB51, UCF101, Something-Something V2에서 이전 방법에 비해 20%의 메모리만으로도 성능을 확보한다.

ABSTRACT

Recent incremental learning for action recognition usually stores representative videos to mitigate catastrophic forgetting. However, only a few bulky videos can be stored due to the limited memory. To address this problem, we propose FrameMaker, a memory-efficient video class-incremental learning approach that learns to produce a condensed frame for each selected video. Specifically, FrameMaker is mainly composed of two crucial components: Frame Condensing and Instance-Specific Prompt. The former is to reduce the memory cost by preserving only one condensed frame instead of the whole video, while the latter aims to compensate the lost spatio-temporal details in the Frame Condensing stage. By this means, FrameMaker enables a remarkable reduction in memory but keep enough information that can be applied to following incremental tasks. Experimental results on multiple challenging benchmarks, i.e., HMDB51, UCF101 and Something-Something V2, demonstrate that FrameMaker can achieve better performance to recent advanced methods while consuming only 20% memory. Additionally, under the same memory consumption conditions, FrameMaker significantly outperforms existing state-of-the-arts by a convincing margin.

연구 동기 및 목표

  • 비디오 클래스-증분 학습에서 프레임을 여러 장 저장할 경우 발생하는 높은 메모리 비용을 해결한다.
  • 인식 정확도를 훼손하지 않으면서 예시 메모리 오버헤드를 줄인다.
  • 프레임 압축으로 인해 발생하는 시공간 정보 손실을 보완한다.
  • 메모리 제약 조건이 있는 환경에서 증분 비디오 학습의 실용적 구현을 가능하게 한다.
  • 학습 가능한 프롬프트를 갖춘 단일 압축 프레임이 메모리 제약 조건 하에서 다수의 프레임 예시보다도 뛰어난 성능을 낼 수 있음을 입증한다.

제안 방법

  • 프레임 압축은 각 비디오에 대해 미분 가능한 가중치를 학습하여 다수의 프레임을 가중 평균하여 하나의 압축 프레임으로 통합한다.
  • 압축 프레임은 대조 손실을 통해 원본 비디오 클립의 특징 임베딩을 최적화하여 일치시킨다.
  • 인스턴스별 프롬프트는 압축 프레임의 픽셀 단위에서 정밀한 보정을 수행하기 위해 학습 가능한 프레임별 파라미터 벡터를 도입한다.
  • 프롬프트는 압축 모듈과 함께 엔드 투 엔드로 훈련되어 세밀한 시공간 정보를 복구한다.
  • 이 방법은 특징 추출을 위한 하나의 브랜치와 프롬프트 기반 보정을 위한 다른 브랜치로 구성된 이중 브랜치 네트워크를 사용한다.
  • 메모리 효율성은 각 비디오당 하나의 압축 프레임만 저장함으로써 달성된다.

실험 결과

연구 질문

  • RQ1단일 압축 프레임이 클래스-증분 학습에서 정확한 동작 인식을 위해 충분한 시공간 정보를 유지할 수 있는가?
  • RQ2인스턴스별 프롬프트가 프레임 압축 과정에서 손실된 정보를 효과적으로 복구할 수 있는가?
  • RQ3성능을 유지하거나 향상시키면서 얼마나 많은 메모리 소비를 줄일 수 있는가?
  • RQ4동일한 메모리 예산 하에서 제안된 방법이 다수 프레임 예시 저장 방식과 비교해 어떻게 성능을 냈는가?
  • RQ5다양한 동작 카테고리, 특히 시간적·공간적 역동성이 뚜렷한 동작들에 대해 모델이 일반화 가능한가?

주요 결과

  • FrameMaker는 HMDB51, UCF101, Something-Something V2에서 이전 최신 기술 대비 20%의 메모리만으로도 뛰어난 정확도를 달성하며, 메모리 소비를 크게 줄였다.
  • UCF101에서 FrameMaker는 1.2MB의 메모리로 85.6%의 정확도를 기록했으며, 동일한 메모리 예산 하에서 TCD(6.0MB)보다 1.4% 높은 성능을 보였다.
  • 인스턴스별 프롬프트는 'Hug'와 'CliffDiving'와 같이 도전적인 동작에서 프레임 압축만으로는 3.2%까지 성능 향상을 이끌어냈다.
  • 각 태스크 분석 결과, 프롬프트 기반 보정이 후속 증분 태스크에서 가장 큰 성능 향상을 보였으며, 이는 효과적인 기억 상실 방지 기능을 확인한다.
  • 제거 실험 결과 공유 프롬프트 사용 시 평균 0.78% 성능 저하가 발생함을 확인하여, 인스턴스별 적응의 필요성을 입증했다.
  • 압축 가중치는 운동 중심 동작에서 핵심 프레임에 의미 있는 주의를 기울임을 보여주어, 이 방법이 중요한 시간적 콘텐츠를 효과적으로 식별할 수 있음을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.