Skip to main content
QUICK REVIEW

[논문 리뷰] One Token to Seg Them All: Language Instructed Reasoning Segmentation in Videos

Zechen Bai, Tong He|arXiv (Cornell University)|2024. 09. 29.
Subtitles and Audiovisual Media인용 수 4
한 줄 요약

VideoLISA는 LLM 추론과 Segment Anything Model를 결합하여 영상 기반 다중모odal 대규모 언어모델로, 자연어 지시에 따라 영상 내에서 추론 기반 분할을 수행한다. 효율적인 시공간 특징 인코딩을 위해 희박한 밀집 샘플링 전략을 도입하고, <TRK> 토큰을 사용한 One-Token-Seg-All 접근 방식을 통해 시간적으로 일관된 분할 마스크를 생성한다. 이로 인해 영상 및 이미지 분할 벤치마크, 특히 새로운 ReasonVOS 벤치마크에서 최신 기술 수준의 성능을 달성하였다.

ABSTRACT

We introduce VideoLISA, a video-based multimodal large language model designed to tackle the problem of language-instructed reasoning segmentation in videos. Leveraging the reasoning capabilities and world knowledge of large language models, and augmented by the Segment Anything Model, VideoLISA generates temporally consistent segmentation masks in videos based on language instructions. Existing image-based methods, such as LISA, struggle with video tasks due to the additional temporal dimension, which requires temporal dynamic understanding and consistent segmentation across frames. VideoLISA addresses these challenges by integrating a Sparse Dense Sampling strategy into the video-LLM, which balances temporal context and spatial detail within computational constraints. Additionally, we propose a One-Token-Seg-All approach using a specially designed token, enabling the model to segment and track objects across multiple frames. Extensive evaluations on diverse benchmarks, including our newly introduced ReasonVOS benchmark, demonstrate VideoLISA's superior performance in video object segmentation tasks involving complex reasoning, temporal understanding, and object tracking. While optimized for videos, VideoLISA also shows promising generalization to image segmentation, revealing its potential as a unified foundation model for language-instructed object segmentation. Code and model will be available at: https://github.com/showlab/VideoLISA.

연구 동기 및 목표

  • 영상 내에서 자연어 지시에 따라 추론 기반 분할을 수행하는 데 있어 시간적 이해와 프레임 간 일관성 있는 분할이 요구되는 과제를 해결하기 위해.
  • 영상 작업에 적용될 때 이미지 기반 모델인 LISA의 한계를 극복하기 위해, 추가적인 시간 차원이 존재하기 때문이다.
  • 언어 지시어를 사용하여 영상 및 이미지 분할을 위한 통합 기초 모델을 구축하기 위해.
  • 밀도 있는 예측 작업을 위한 계산 효율성과 고정밀 시공간 표현 간의 균형을 이루는 방법을 설계하기 위해.
  • 새로운 벤치마크인 ReasonVOS에서 모델의 추론, 추적 및 일반화 능력을 평가하기 위해.

제안 방법

  • 전체 해상도에서 균일하게 밀집 프레임을 샘플링하고, 번갈아가며 프레임을 다운샘플링하여 계산 부담을 줄이면서도 시간적 동역학을 유지하는 희박한 밀집 샘플링 전략을 도입한다.
  • 영상 내 임의의 시간적 부재를 활용하여 입력 표현에서 공간적 세부 정보와 시간적 맥락 간 균형을 맞춘다.
  • 다수의 프레임에 걸쳐 통합된 시공간 객체 표현을 인코딩하기 위해 전용 <TRK> 토큰을 사용하는 One-Token-Seg-All 접근 방식을 제안한다.
  • 단일 프레임의 공간적 신호에 기반한 단기 학습을 방지하기 위해, <TRK> 토큰을 다중 프레임에 걸쳐 동시에 분할 마스크를 예측하도록 훈련시킨다.
  • 자연어 지시어에서 고품질의 분할 마스크를 생성하기 위해 다중모달 LLM과 Segment Anything Model(SAM)을 통합한다.
  • 시각적 특징을 샘플링된 프레임에서 처리하고, LLM을 통해 공간적 및 시간적 내용을 추론하는 영상-LLM 아키텍처를 구현한다.

실험 결과

연구 질문

  • RQ1복잡한 자연어 지시어가 주어졌을 때, 다중모달 LLM이 추론 기반 영상 객체 분할을 효과적으로 수행할 수 있는가?
  • RQ2단일 프롬프트 토큰을 사용하여 영상 프레임 간 분할 마스크의 시간적 일관성을 어떻게 달성할 수 있는가?
  • RQ3영상-LLM 아키텍처에서 계산 효율성과 공간적·시간적 정보 보존 간의 균형을 가장 잘 맞추는 샘플링 전략은 무엇인가?
  • RQ4영상-LLM이 추론 및 추적 능력을 유지하면서 이미지 분할 작업으로 얼마나 잘 일반화되는가?
  • RQ5제안된 One-Token-Seg-All 접근 방식은 프레임 단위 또는 추적 보강 기반 베이스라인에 비해 정확도 및 일관성 측면에서 어떻게 비교되는가?

주요 결과

  • VideoLISA는 운동 유도 및 참조 기반 분할 작업을 포함한 여러 영상 객체 분할 벤치마크에서 최신 기술 수준의 성능을 달성하였다.
  • 희박한 밀집 샘플링 전략은 영상 프레임 연결, ST 풀링, 슬로우-패스트 샘플링과 같은 대안들보다 우수한 성능을 보이며, 세부 정보와 맥락 간 균형을 잘 맞춘다는 점을 입증하였다.
  • One-Token-Seg-All 접근 방식은 시간적 일관성을 크게 향상시켰으며, 단일 <SEG> 토큰을 사용하는 베이스라인과 외부 추적기로 보강된 LISA 기반 방법보다 뛰어난 성능을 보였다.
  • 제거 실험을 통해 <TRK> 토큰의 다중 프레임에 걸친 동시 훈련이 단기 학습을 방지하고 프레임 간 객체 연관을 가능하게 하기 위해 필수적임을 확인하였다.
  • VideoLISA는 이미지 분할 작업으로도 잘 일반화되어 이미지 추론 및 참조 기반 분할 벤치마크에서 뛰어난 성능을 보였다.
  • 새로 도입된 ReasonVOS 벤치마크에서 복잡한 다중 프레임 추론 작업을 평가하는 데 있어 뛰어난 추론 및 추적 능력을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.