[논문 리뷰] Vista-LLaMA: Reducing Hallucination in Video Language Models via Equal Distance to Visual Tokens
Vista-LLaMA는 주어진 비디오 컨텐츠에서 생성된 텍스트가 문장 길이가 길어질수록 점점 더 비디오에서 벗어나는 현상인 환각을 줄이기 위해 주목사의 계산 과정에서 모든 시각적 토큰과 언어 토큰 간의 거리를 동일하게 유지하는 새로운 비디오-언어 모델을 제안한다. 이는 문장 길이에 관계없이 일관된 시각적 영향력을 보장한다. 본 모델은 등거리-시각적 토큰(EDVT) 어텐션 메커니즘과 개선된 시간 모델링을 위한 순차적 시각 프로젝터를 도입하여, NExT-QA에서 60.7의 zero-shot 정확도와 MSRVTT-QA에서 60.5의 정확도를 기록하며 최신 기술 수준(SoTA) 성능을 달성한다.
Recent advances in large video-language models have displayed promising outcomes in video comprehension. Current approaches straightforwardly convert video into language tokens and employ large language models for multi-modal tasks. However, this method often leads to the generation of irrelevant content, commonly known as "hallucination", as the length of the text increases and the impact of the video diminishes. To address this problem, we propose Vista-LLaMA, a novel framework that maintains the consistent distance between all visual tokens and any language tokens, irrespective of the generated text length. Vista-LLaMA omits relative position encoding when determining attention weights between visual and text tokens, retaining the position encoding for text and text tokens. This amplifies the effect of visual tokens on text generation, especially when the relative distance is longer between visual and text tokens. The proposed attention mechanism significantly reduces the chance of producing irrelevant text related to the video content. Furthermore, we present a sequential visual projector that projects the current video frame into tokens of language space with the assistance of the previous frame. This approach not only captures the temporal relationship within the video, but also allows less visual tokens to encompass the entire video. Our approach significantly outperforms various previous methods (e.g., Video-ChatGPT, MovieChat) on four challenging open-ended video question answering benchmarks. We reach an accuracy of 60.7 on the zero-shot NExT-QA and 60.5 on the zero-shot MSRVTT-QA, setting a new state-of-the-art performance. This project is available at https://jinxxian.github.io/Vista-LLaMA.
연구 동기 및 목표
- 문장 길이가 길어질수록 생성된 텍스트가 비디오 컨텐츠에서 점점 더 벗어나는 비디오-언어 모델의 환각 문제를 해결한다.
- 장문의 컨텍스트를 가진 비디오-언어 모델에서 시각적 영향력이 감소하는 문제를 해결하기 위해, 시각적 토큰과 언어 토큰 간의 일관된 어텐션 거리를 확보한다.
- 이전 프레임의 프로젝션 표현을 조건으로 하여 각 프레임의 시각적 토큰을 생성하는 순차적 시각 프로젝터를 통해 영상 이해의 시간 모델링을 향상시킨다.
- 微fine-tuning이 필요 없이 zero-shot 오픈-ended 비디오 질의응답 벤치마크에서 최신 기술 수준의 성능을 달성한다.
제안 방법
- 시각적 토큰과 언어 토큰 간 어텐션 계산 시 로테이션 위치 인코딩을 생략하여 등거리 효과를 유지하는 등거리-시각적 토큰(EDVT) 어텐션 메커니즘을 도입한다.
- 언어 토큰 간 어텐션에 대해서만 로테이션 위치 인코딩을 유지하여 텍스트 시퀀스 내의 상대적 토큰 순서와 맥락을 보존한다.
- 이전 프레임의 프로젝션 표현을 조건으로 하여 각 프레임의 시각적 토큰을 생성하는 순차적 시각 프로젝터를 설계하여, 추가 파라미터 없이도 시간 모델링을 가능하게 한다.
- 사전 훈련된 모델(예: BLIP-2)에서 초기화된 학습 가능한 시각 프로젝터를 사용해 영상 프레임을 언어 공간으로 매핑한다. 이는 시각적 표현 학습을 향상시킨다.
- 단일 스트림 트랜스포머 아키텍처를 사용하여 시각적 토큰과 언어 토큰이 동일한 시퀀스에 공존하며, EDVT 어텐션을 통해 시각적 토큰이 생성 과정에 일관되게 영향을 미치도록 한다.
- 정기적인 간격으로 영상 프레임을 샘플링하고 이를 시각적 토큰으로 변환함으로써 장시간 영상의 표현에 필요한 시각적 토큰 수를 줄이며, 동시에 시간 역동성을 유지한다.
![Figure 1 : Video language processing with LLaMA [ 24 ] and our Vista-LLaMA . The vanilla LLaMA treats visual tokens ( ) the same as other language tokens ( ), weakening the impact for tokens in long distance. Our model retains the same mechanism for language tokens and strengthens the impact of the](https://ar5iv.labs.arxiv.org/html/2312.08870/assets/x1.png)
실험 결과
연구 질문
- RQ1모든 언어 토큰과 시각적 토큰 간의 등거리 어텐션 거리를 유지함으로써 장문의 컨텍스트를 가진 비디오-언어 생성에서 환각 현상을 줄일 수 있는가?
- RQ2시각적 토큰과 언어 토큰 간의 상대적 위치 인코딩이 없을 경우, 장기간의 시퀀스에서 시각적 콘텐츠에 대한 어텐션 능력에 어떤 영향을 미치는가?
- RQ3독립적인 프레임 프로젝션 대비 순차적 시각 프로젝터가 비디오-언어 모델의 시간적 추론 능력에 얼마나 기여하는가?
- RQ4제안된 EDVT 어텐션과 순차적 프로젝터 설계가 zero-shot 비디오 질의응답 벤치마크에서 최신 기술 수준의 성능을 달성할 수 있는가?
- RQ5모델의 성능가 다양한 유형의 비디오 질의, 특히 시간적, 서술적, 인과적 추론 작업에 대해 일반화되는가?
주요 결과
- Vista-LLaMA는 NExT-QA 벤치마크에서 기존 방법(예: Video-ChatGPT, MovieChat)보다 뚜렷하게 높은 60.7의 zero-shot 정확도로 새로운 최신 기술 수준 성능을 달성한다.
- MSRVTT-QA 벤치마크에서는 60.5의 zero-shot 정확도를 기록하여 오픈-ended 비디오 질의응답에 대한 강력한 일반화 능력을 보여준다.
- 순차적 시각 프로젝터(SEQQ-Former)는 선형 및 표준 Q-Former 프로젝터보다 우수한 성능을 보이며, 특히 시간적 추론 질문에서 두각을 나타내어 영상 역동성의 모델링이 향상됨을 시사한다.
- 모델은 텍스트 생성에서 환각 현상을 줄였다: 정성적 비교에서 Video-ChatGPT가 실패한 바, 전화기 방향, 사람 자세 등 객체의 위치와 행동을 정확히 식별한다.
- 시각적 토큰 수를 늘리면 전체 정확도는 향상되지만, 시간적 질문에 대해서는 성능이 악화됨을 확인하여 현재 모델이 더 많은 시각 입력이 있어도 여전히 시간적 추론에 어려움을 겪고 있음을 시사한다.
- EDVT 어텐션 메커니즘이 원거리 토큰에 대해서도 시각적 영향력을 효과적으로 유지하여, 관련 없는 또는 환각적인 콘텐츠가 생성될 위험을 줄였다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.