[논문 리뷰] Fine-grained Audio-Visual Joint Representations for Multimodal Large Language Models
이 논문은 다중모달 LLM를 위한 정교한 오디오-비디오 공동 표현 프레임워크인 FAVOR를 제안한다. 이는 인과 Q-프리저를 통해 프레임 수준의 시간 동기화와 인과적 어텐션을 가능하게 하여 음성-비디오 공동 추론 능력을 향상시킨다. 시간적 인과 추론이 필요한 영상 질의응답 작업에서 정확도를 25% 향상시키며, 오디오-비디오 이해 및 잠재적 추론 능력에서 최신 기술 수준의 성능을 입증한다.
Audio-visual large language models (LLM) have drawn significant attention, yet the fine-grained combination of both input streams is rather under-explored, which is challenging but necessary for LLMs to understand general video inputs. To this end, a fine-grained audio-visual joint representation (FAVOR) learning framework for multimodal LLMs is proposed in this paper, which extends a text-based LLM to simultaneously perceive speech and audio events in the audio input stream and images or videos in the visual input stream, at the frame level. To fuse the audio and visual feature streams into joint representations and to align the joint space with the LLM input embedding space, we propose a causal Q-Former structure with a causal attention module to enhance the capture of causal relations of the audio-visual frames across time. An audio-visual evaluation benchmark (AVEB) is also proposed which comprises six representative single-modal tasks with five cross-modal tasks reflecting audio-visual co-reasoning abilities. While achieving competitive single-modal performance on audio, speech and image tasks in AVEB, FAVOR achieved over 20% accuracy improvements on the video question-answering task when fine-grained information or temporal causal reasoning is required. FAVOR, in addition, demonstrated remarkable video comprehension and reasoning abilities on tasks that are unprecedented by other multimodal LLMs. An interactive demo of FAVOR is available at https://github.com/BriansIDP/AudioVisualLLM.git, and the training code and model checkpoints will be released soon.
연구 동기 및 목표
- 다중모달 LLM에서 정교한 오디오-비디오 융합의 부족, 특히 프레임 수준에서 음성과 비디오 간 상호작용에 대응하기 위해.
- 오디오-비디오 프레임 간의 인과적 의존성을 모델링하여 영상 이해에서 시간적 추론 능력을 향상시키기 위해.
- 음성, 청각 이벤트, 이미지, 비디오를 종합적으로 표현하는 통합 프레임워크를 개발하여 엔드 투 엔드 다중모달 LLM 추론을 가능하게 하기 위해.
- LLM에서의 오디오-비디오 다중모달 추론 평가를 위한 종합적 벤치마크를 구축하기 위해.
제안 방법
- 순차적 오디오-비디오 프레임 시퀀스에서의 순차적 의존성을 모델링하면서도 시간 순서를 유지하는 인과 어텐션 메커니즘을 갖춘 인과 Q-프리저를 제안한다.
- 오디오와 비디오 입력을 시간적으로 정렬하기 위한 프레임 수준 동기화 모듈을 도입하여 정교한 다중모달 상호작용을 가능하게 한다.
- 변동 길이 입력을 처리하고 계산 부담을 줄이기 위해 장기 입력 시퀀스를 고정 길이 슬라이딩 윈도우로 분할한다.
- 출력 쿼리가 오디오-비디오 입력으로부터 서로 다른, 중복되지 않은 정보를 포착하도록 유도하기 위해 다각도 훈련 손실을 활용한다.
- 학습 가능한 프로젝션 헤드를 사용하여 공동 오디오-비디오 표현을 LLM의 텍스트 임베딩 공간과 정렬한다.
- 11개의 작업(5개의 다중모달 추론 작업 포함)을 포함한 새로운 오디오-비디오 평가 벤치마크(AVEB)를 제안하여 모델 성능을 평가한다.

실험 결과
연구 질문
- RQ1정교한 오디오-비디오 시간적 의존성을 모델링함으로써 다중모달 LLM이 시간적 인과 추론이 필요한 영상 질의응답 작업에서 뛰어난 성능을 달성할 수 있는가?
- RQ2비디오의 시각적 요소와 청각 이벤트 외에 음성 콘텐츠까지 통합함으로써 다중모달 LLM의 추론 능력은 어떻게 향상되는가?
- RQ3표준 자기어텐션 대비 인과 어텐션 메커니즘이 오디오-비디오 시퀀스의 순차적 관계 모델링에 얼마나 더 효과적인가?
- RQ4다각도 정규화가 오디오-비디오 공동 표현의 표현 능력과 일반화 능력에 미치는 영향은 무엇인가?
- RQ5제안된 프레임워크는 단순한 단모달 작업을 초월해, 예를 들어 영상 클립에서 유머나 의도를 이해하는 등 잠재적 추론 능력을 보여줄 수 있는가?
주요 결과
- FAVOR는 시간적 인과 추론이 필요한 영상 질의응답 작업에서 25%의 절대 정확도 향상을 기록하며, InstructBLIP 기준선을 압도적으로 뛰어넘었다.
- 오디오-비디오 사운드 소스 검출(AVSSD) 작업에서 FAVOR는 단일모달 모델 대비 10% 이상의 절대 정확도 향상을 달성했다.
- 모델은 자동 음성 인식(ASR)을 포함한 단일모달 작업에서도 뛰어난 성능을 보였으며, 최적 설정에서 WER가 최대 15% 감소했다.
- 다각도 손실이 핵심적인 역할을 했다: 너무 높은 값은 특히 ASR에서 환각 현상과 성능 저하를 유발했다.
- FAVOR는 유머나 감정의 맥락을 이해하는 등 잠재적 추론 능력을 보였다. 이는 대화, 시각적 맥락, 배경 음향을 통합함으로써 가능했다.
- 최적의 프레임 속도는 2.0 FPS였다. 이는 모델 성능과 추론 효율성을 균형 잡고, 토큰 수를 최소화하면서도 오디오-비디오 시퀀스 간 정렬을 최대화했다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.