Skip to main content
QUICK REVIEW

[논문 리뷰] MovieChat: From Dense Token to Sparse Memory for Long Video Understanding

Enxin Song, Wenhao Chai|arXiv (Cornell University)|2023. 07. 31.
Multimodal Machine Learning Applications인용 수 4
한 줄 요약

MovieChat는 밀도 높은 비디오 토큰의 슬라이딩 윈도우와 두 단계의 메모리 메커니즘—단기(동적) 및 장기(압축됨)—을 사용하는 혁신적인 메모리 보강 프레임워크를 제안한다. 이는 대규모 언어 모델에서 효율적인 장기 비디오 이해를 가능하게 한다. 이는 이전 방법 대비 프레임당 VRAM 비용이 10,000배 낮아지며, 최대 10,000+ 프레임의 장기 비디오에서 최신 기술 성능을 달성하고, 1,000개의 장기 비디오와 14,000개의 인간 레이블링 QA 쌍을 포함하는 MovieChat-1K 벤치마크를 도입한다.

ABSTRACT

Recently, integrating video foundation models and large language models to build a video understanding system can overcome the limitations of specific pre-defined vision tasks. Yet, existing systems can only handle videos with very few frames. For long videos, the computation complexity, memory cost, and long-term temporal connection impose additional challenges. Taking advantage of the Atkinson-Shiffrin memory model, with tokens in Transformers being employed as the carriers of memory in combination with our specially designed memory mechanism, we propose the MovieChat to overcome these challenges. MovieChat achieves state-of-the-art performance in long video understanding, along with the released MovieChat-1K benchmark with 1K long video and 14K manual annotations for validation of the effectiveness of our method.

연구 동기 및 목표

  • 다중모odal LLM에서 장기 비디오 처리의 높은 계산 및 메모리 비용 문제를 해결하기 위해.
  • 장기 비디오 이해에서 장기 시간적 의존성을 유지하는 데 도전하는 데에.
  • 최소한의 메모리 오버헤드로 종단 간 장기 비디오 추론을 지원하는 시스템을 개발하기 위해.
  • 장기 비디오 이해 시스템 평가를 위한 표준화된 벤치마크를 구축하기 위해.
  • 생물학적으로 영감을 받은 메모리 아키텍처를 사용해 시각 기반 모델과 LLM을 통합하여 확장 가능한 비디오 이해를 가능하게 하기 위해.

제안 방법

  • 프레임에서 밀도 높은 비디오 토큰을 추출하기 위해 슬라이딩 윈도우를 사용하며, 이를 단기 메모리 버퍼에서 순차적으로 처리한다.
  • 고정 길이의 단기 메모리를 사용하며, 오래된 토큰을 기각하고 이를 장기 메모리로 통합함으로써 동적으로 업데이트한다.
  • 통합된 단기 토큰을 압축하는 투영층을 적용하여 압축된, 지속 가능한 장기 메모리 표현으로 변환한다.
  • 사용자 상호작용 및 추론을 위해 장기 메모리 표현을 대규모 언어 모델과 통합한다.
  • Atkinson-Shiffrin 메모리 모델을 영감으로 삼으며, 단기 메모리를 버퍼로 모델링하고 장기 메모리를 안정적이고 압축된 저장소로 모델링한다.
  • 이전 윈도우에서 통합된 토큰을 다음 윈도우의 초기화에 사용함으로써, 대체 초기화 전략보다 일관성과 성능을 향상시킨다.

실험 결과

연구 질문

  • RQ1메모리 보강 아키텍처가 다중모달 LLM에서 장기 비디오 이해의 계산 및 메모리 비용을 효과적으로 줄일 수 있는가?
  • RQ2단기 메모리 길이와 압축 간의 균형이 장기 비디오 작업 성능에 미치는 영향은 무엇인가?
  • RQ3생물학적으로 영감을 받은 메모리 메커니즘이 비디오 이해에서 장기 시간적 추론을 향상시킬 수 있는가?
  • RQ4단기 메모리 초기화 전략의 차이가 최종 성능에 미치는 영향은 무엇인가?
  • RQ5통합 프레임워크가 장기 비디오에서 전역 및 브레이크포인트 모드의 비디오 질의 응답 모두를 지원할 수 있는 정도는 어느 정도인가?

주요 결과

  • MovieChat는 MovieChat-1K 벤치마크에서 시간 이해(TU) 3.12점, 일관성(CO) 3.12점으로 장기 비디오 이해 분야에서 최신 기술 성능을 달성한다.
  • 시스템은 단지 24GB의 VRAM을 사용하여 10,000+ 프레임 비디오의 추론을 지원하며, 이는 이전 방법 대비 프레임당 VRAM 비용이 10,000배 낮아진 것이다.
  • 중간 길이의 메모리 버퍼에서 성능이 최고조에 이를 것으로 나타나, 정보 유지와 압축 손실 사이의 최적 균형이 존재함을 시사한다.
  • 이전 윈도우의 통합 토큰을 사용한 초기화가 가장 뛰어난 성능을 보이며, 마지막 토큰 또는 균일 샘플링 방법보다 뛰어나다.
  • 프레임워크는 애니메이션, TV 시리즈, 컴필레이션 등 다양한 장기 비디오 유형에서 전역 및 브레이크포인트 질의 응답 모드 모두에서 강력한 성능 유지를 보인다.
  • MovieChat-1K 벤치마크는 고품질의 인간 레이블링 데이터를 제공하며, 14,000개의 질문-답변 쌍을 포함하여 장기 비디오 이해 시스템의 신뢰할 수 있는 평가를 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.