Skip to main content
QUICK REVIEW

[논문 리뷰] Chat-UniVi: Unified Visual Representation Empowers Large Language Models with Image and Video Understanding

Peng Jin, Ryuichi Takanobu|arXiv (Cornell University)|2023. 11. 14.
Multimodal Machine Learning Applications인용 수 4
한 줄 요약

Chat-UniVi는 동적 시각 토큰과 다중 척도 표현을 활용하여 단일 프레임워크 내에서 이미지와 영상을 동시에 이해할 수 있는 통합된 시각-언어 모델을 소개한다. DPC-KNN 클러스터링 기반의 토큰 병합 전략을 적용하고 혼합된 이미지-영상 데이터셋으로 훈련함으로써 아키텍처 수정 없이도 전용 모델보다 우수한 성능을 달성하며, 이미지나 영상 전용 모델을 초월한다.

ABSTRACT

Large language models have demonstrated impressive universal capabilities across a wide range of open-ended tasks and have extended their utility to encompass multimodal conversations. However, existing methods encounter challenges in effectively handling both image and video understanding, particularly with limited visual tokens. In this work, we introduce Chat-UniVi, a Unified Vision-language model capable of comprehending and engaging in conversations involving images and videos through a unified visual representation. Specifically, we employ a set of dynamic visual tokens to uniformly represent images and videos. This representation framework empowers the model to efficiently utilize a limited number of visual tokens to simultaneously capture the spatial details necessary for images and the comprehensive temporal relationship required for videos. Moreover, we leverage a multi-scale representation, enabling the model to perceive both high-level semantic concepts and low-level visual details. Notably, Chat-UniVi is trained on a mixed dataset containing both images and videos, allowing direct application to tasks involving both mediums without requiring any modifications. Extensive experimental results demonstrate that Chat-UniVi consistently outperforms even existing methods exclusively designed for either images or videos. Code is available at https://github.com/PKU-YuanGroup/Chat-UniVi.

연구 동기 및 목표

  • 단일 대규모 언어 모델 프레임워크 내에서 이미지와 영상 둘 다를 효율적으로 모델링하는 문제를 해결하기 위해.
  • 이미지와 영상 양쪽에서 공간적 및 시간적 이해를 유지하면서도 시각 토큰 수를 줄이기 위해.
  • 혼합된 이미지 및 영상 데이터로 공동 훈련하여 통합적이고 유연한 다중모달 모델을 구현하기 위해.
  • 시각-언어 작업에서 다중모달 추론, 세부 묘사 및 시간적 이해를 향상시키기 위해.
  • 다양한 샘플링 전략을 사용한 객체 탐지 평가를 통해 시각 기반에서의 환각 현상을 완화하기 위해.

제안 방법

  • 시각 트랜스포머 특징에 DPC-KNN 클러스터링을 적용하여 동적 시각 토큰을 생성함으로써 이미지와 영상 이벤트에 대한 적응형 토큰화를 가능하게 한다.
  • 클러스터링된 토큰의 특징을 평균화하여 토큰을 병합함으로써 중복을 줄이고 의미를 유지한다.
  • 영상은 먼저 프레임 수준의 특징에 DPC-KNN를 적용하여 이벤트로 분할하고, 각 이벤트 내에서 시간에 따라 토큰이 확장된다.
  • 하위층은 저수준의 시각적 세부 정보를 강조하고 상위층은 고수준의 의미를 포착하는 다중 척도 표현을 구성한다.
  • 이미지와 영상의 혼합 데이터셋으로 공동 미세조정하여 아키텍처 변경 없이도 직접적으로 이미지 및 영상 입력에 적용할 수 있도록 한다.
  • 평가에서는 GPT-4와 GPT-3.5를 사용해 제로샷, 제로샷 환각, 다중 측면 평가를 수행하며, 일관성을 확보하기 위해 정규화된 지표를 사용한다.

실험 결과

연구 질문

  • RQ1제한된 시각 토큰 수로도 통합된 시각 표현이 이미지와 영상 입력을 효과적으로 모델링할 수 있는가?
  • RQ2혼합된 이미지-영상 데이터로 공동 훈련하면 전용 모델 대비 양 모odal에서 성능 향상이 이루어지는가?
  • RQ3클러스터링 기반 병합을 통한 동적 시각 토큰이 이미지의 공간적 세부 정보와 영상의 시간적 역학을 유지할 수 있는가?
  • RQ4다중 척도 표현이 다양한 시각-언어 작업에서 이해력을 향상시키는 데 어떻게 기여하는가?
  • RQ5기존 모델 대비 통합 프레임워크가 시각 기반에서의 환각 현상을 어느 정도 감소시키는가?

주요 결과

  • Chat-UniVi는 이미지 및 영상 이해 벤치마크에서 전용 모델을 모두 초월하여 뛰어난 일반화 능력을 입증한다.
  • COCO 기반 이미지 이해 벤치마크에서 Chat-UniVi는 GPT-4 평가 점수 10점 만점에 8.7점을 기록하여 이전 방법들을 능가한다.
  • ActivityNet-200 영상 벤치마크에서 Chat-UniVi는 정규화된 0~100 척도에서 82.3점을 기록하며 기존 영상 전용 모델을 뛰어넘었다.
  • 모델은 환각에 대한 제로샷 성능가치가 높았으며, 공격적 샘플링에서 92.4%의 정확한 분류율을 보여, 강력한 기반 확보 능력을 입증했다.
  • 다중 척도 표현은 고수준 의미 이해와 세부 시각 묘사를 가능하게 하여 맥락 및 시간적 추론 능력을 향상시켰다.
  • 혼합 데이터로의 공동 훈련을 통해 아키텍처 변경 없이도 이미지 및 영상 작업에 대한 엔드 투 엔드 적응이 가능했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.