Skip to main content
QUICK REVIEW

[논문 리뷰] AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment

Yuqin Cao, Xiongkuo Min|ArXiv.org|2025. 01. 30.
Noise Effects and Management인용 수 4
한 줄 요약

논문은 다중 차원의 점수를 매기는 LMM 기반 모델 AGAV-Rater를 도입하고, AGAVQA 데이터셋으로 뒷받침되는 최적의 AGAV를 선택합니다.

ABSTRACT

Many video-to-audio (VTA) methods have been proposed for dubbing silent AI-generated videos. An efficient quality assessment method for AI-generated audio-visual content (AGAV) is crucial for ensuring audio-visual quality. Existing audio-visual quality assessment methods struggle with unique distortions in AGAVs, such as unrealistic and inconsistent elements. To address this, we introduce AGAVQA-3k, the first large-scale AGAV quality assessment dataset, comprising $3,382$ AGAVs from $16$ VTA methods. AGAVQA-3k includes two subsets: AGAVQA-MOS, which provides multi-dimensional scores for audio quality, content consistency, and overall quality, and AGAVQA-Pair, designed for optimal AGAV pair selection. We further propose AGAV-Rater, a LMM-based model that can score AGAVs, as well as audio and music generated from text, across multiple dimensions, and selects the best AGAV generated by VTA methods to present to the user. AGAV-Rater achieves state-of-the-art performance on AGAVQA-3k, Text-to-Audio, and Text-to-Music datasets. Subjective tests also confirm that AGAV-Rater enhances VTA performance and user experience. The dataset and code is available at https://github.com/charlotte9524/AGAV-Rater.

연구 동기 및 목표

  • AI-생성 오디오-비주얼 콘텐츠(AGAV)에서 고유한 왜곡으로 인한 AGAV 품질 자동 평가의 필요성을 제시한다.
  • 다양한 차원의 MOS를 갖춘 대규모 AGAVQA 데이터셋과 최적의 AGAV 쌍 라벨을 개발한다.
  • AGAV-Rater를 개발하여 AGAVs, TTA, TTM에 대한 다차원 점수를 예측할 수 있는 LMM 기반 모델을 만든다.
  • AGAV-Rater의 최신 기술 성능과 더 높은 품질의 AGAV 출력을 선택하는 데의 유용성을 입증한다.

제안 방법

  • AGAVQA를 두 부분으로 구성: 다차원 MOS용 AGAVQA-MOS와 최적 AGAV 쌍 선택용 AGAVQA-Pair를 구성한다.
  • 텍스트 정의 라벨(우수/양호)을 가진 오디오-자막 데이터셋(VGGSound, AudioCaps, MusicCaps)에서 파생된 50,952개의 instruction-response 페어를 사전학습에 사용한다.
  • 세 차원의 인간 주석 MOS에서 MOS를 Fine-tune한다(오디오 품질, 콘텐츠 일관성, 전체 품질).
  • 두 단계 학습을 채택한다: 텍스트 정의 레벨로의 사전학습, 이후 MOS 데이터에 대한 수치 점수(PLCC 손실)로 미세 조정.
  • VideoLLaMA2 아키텍처를 기반으로 비디오/오디오 인코더를 분리하고, 공유 공간으로의 투영 및 다중 모달 평가를 위한 텍스트 프롬프트와의 통합을 수행한다.
  • AGAVQA-MOS, TTA, TTM 데이터셋에서 SRCC, KRCC, PLCC, RMSE를 사용해 평가한다.

실험 결과

연구 질문

  • RQ1LMM을 AGAV 콘텐츠에 대한 수치형 다차원 품질 점수로 출력하도록 적응시킬 수 있는가?
  • RQ2사전학습된 AGAV-Rater가 본 적이 없는 AGAV 콘텐츠와 VTA 방법에 대해 일반화할 수 있는가?
  • RQ3다양한 학습 전략(텍스트 정의 레벨로의 사전학습 대 직접 MOS 미세조정)이 다차원 점수 예측 정확도에 더 유리한가?
  • RQ4 AGAV-Rater가 실제 VTA 응용에서 최적의 AGAV 출력을 선택하는 데 도움을 줄 수 있는가?

주요 결과

  • AGAV-Rater가 AGAVQA-MOS, Text-to-Audio(TTA), Text-to-Music(TTM) 데이터셋에서 최신 성능을 달성한다.
  • 텍스트 정의 레벨로의 사전학습은 작은 데이터셋(TTA 및 TTM)에서 성능을 크게 향상시킨다.
  • 다차원 지시사항은 오디오 품질 및 콘텐츠 일관성 신호를 활용해 전반적인 A/V 품질 예측을 개선한다.
  • AGAV-Rater는 데이터 간 일반화가 강하며, AGAVQA-Pair 선택 작업에서 오픈 소스 및 클로즈드 소스 LMM보다 우수의 성능을 보인다.
  • 주관적 실험에서 AGAV-Rater가 더 높은 품질의 AGAV를 선택하도록 도와 주며 사용자 경험을 향상시키는 것으로 나타났다(예: ElevenLabs 개선 테스트에서 선호도 80%).

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.