Skip to main content
QUICK REVIEW

[논문 리뷰] Tackling Data Bias in MUSIC-AVQA: Crafting a Balanced Dataset for Unbiased Question-Answering

Xiulong Liu, Zhikang Dong|arXiv (Cornell University)|2023. 10. 10.
Speech and Audio Processing인용 수 4
한 줄 요약

이 논문은 MUSIC-AVQA 데이터셋에서 심각한 답변 편향을 규명하고 이를 완화하며, 36.7만 개의 훈련 QA 쌍과 향상된 청각-시각 복잡도를 갖춘 더 큰 균형 잡힌 벤치마크인 MUSIC-AVQA v2.0을 제안한다. 새로운 다중모달 모델은 청각 스펙트로그램 트랜스포머(ASP) 브랜치와 교차모달 픽셀 단위의 어텐션을 통합하여, LAVISH 대비 2.26%의 정확도 향상과 AVST 대비 4.42%의 향상을 달성했으며, AVQA 분야에서 새로운 최고 성능을 확립한다.

ABSTRACT

In recent years, there has been a growing emphasis on the intersection of audio, vision, and text modalities, driving forward the advancements in multimodal research. However, strong bias that exists in any modality can lead to the model neglecting the others. Consequently, the model's ability to effectively reason across these diverse modalities is compromised, impeding further advancement. In this paper, we meticulously review each question type from the original dataset, selecting those with pronounced answer biases. To counter these biases, we gather complementary videos and questions, ensuring that no answers have outstanding skewed distribution. In particular, for binary questions, we strive to ensure that both answers are almost uniformly spread within each question category. As a result, we construct a new dataset, named MUSIC-AVQA v2.0, which is more challenging and we believe could better foster the progress of AVQA task. Furthermore, we present a novel baseline model that delves deeper into the audio-visual-text interrelation. On MUSIC-AVQA v2.0, this model surpasses all the existing benchmarks, improving accuracy by 2% on MUSIC-AVQA v2.0, setting a new state-of-the-art performance.

연구 동기 및 목표

  • 원래 MUSIC-AVQA 데이터셋에서 이진, 세는, 시간적 질문 유형에서 특히 두드러진 심각한 답변 편향을 규명하고 정량화하는 것.
  • 왜곡된 답변 분포를 줄이기 위해 보완 영상과 질문을 수집하여 더 균형 잡히고 대표성이 높은 AVQA 벤치마크를 구성하는 것.
  • 언어 사전 지식과 편향에 의한 과적합을 극복하기 위해 청각, 시각, 언어 모달리티를 효과적으로 융합하는 새로운 베이스라인 모델을 개발하는 것.
  • 편향된 대비 균형 잡힌 테스트 분할에서의 성능 비교를 통해 모델 일반화 능력을 평가하고, 새로운 벤치마크의 우수성을 입증하는 것.
  • 미래의 AVQA 연구를 위한 신뢰할 수 있고 편향이 없는 벤치마크를 확립하여 진정한 다중모달 추론 능력을 반영하는 것.

제안 방법

  • MUSIC-AVQA의 전반적인 33개 질문 템플릿에서 답변 분포를 체계적으로 분석하여, 특히 이진 질문과 세는 질문에서 극단적인 편향이 있는 템플릿을 규명하는 것.
  • 특히 고편향 템플릿에서 소수의 답변에 대한 균형 잡힌 분포를 확보하기 위해 수동으로 1,204개의 추가 실재 영상과 8,100개의 새로운 QA 쌍을 수집하는 것.
  • 사전 학습된 청각 스펙트로그램 트랜스포머(ASP) 브랜치를 통합하여 청각 표현을 향상시키는 새로운 베이스라인 모델 LAST-Att를 설계하는 것.
  • 청각 및 시각 공간적 특징 맵 간의 교차모달 픽셀 단위 어텐션을 도입하여 미세한 수준의 청각-시각 기반을 향상시키는 것.
  • 편향된 원본 데이터셋과 새로운 균형 잡힌 MUSIC-AVQA v2.0에서 모델을 훈련하고 평가하며, 공정한 비교를 위해 별도의 검증 및 테스트 분할을 사용하는 것.
  • 유사한 어휘지만 반대되는 답변을 가진 1,643개의 쌍으로 구성된 이진 QA 평가를 실시하여 언어 사전 지식에 대한 모델의 강건성을 테스트하는 것.

실험 결과

연구 질문

  • RQ1원래 MUSIC-AVQA 데이터셋의 답변 편향이 AVQA에서 모델의 일반화 능력과 신뢰성에 얼마나 심각하게 악영향을 미치는가?
  • RQ2더 다양한 답변과 균일한 분포를 갖춘 새로운 균형 잡힌 데이터셋은 모델 성능 향상과 언어 사전 지식에 대한 과도한 의존도 감소에 기여하는가?
  • RQ3AST 브랜치와 교차모달 픽셀 단위 어텐션의 통합이 AVQA에서 다중모달 추론 능력을 상당히 향상시키는가?
  • RQ4균형 잡힌 데이터셋에서 훈련된 모델은 편향된 데이터셋에서 훈련된 모델과 비교해 어떤 성능을 보이는가? 이는 양쪽 테스트 분할에서 평가된 결과이다.
  • RQ5대조적 이진 QA 평가가 모델의 언어 패턴 암기 여부가 아닌 진정한 청각-시각적 맥락 이해 능력을 효과적으로 측정할 수 있는가?

주요 결과

  • 원래 편향된 MUSIC-AVQA 데이터셋에서 훈련된 모델은 편향된 테스트 세트에서 높은 정확도를 기록하지만(예: LAVISH의 경우 +2.96%), 균형 잡힌 테스트 세트에서는 성능이 떨어지며, 이는 데이터 편향에 대한 과적합을 확인한다.
  • MUSIC-AVQA v2.0에서 훈련된 LAVISH 모델은 균형 잡힌 테스트 세트에서 원래 세트 대비 2.96%의 정확도 향상을 기록하여 일반화 능력 향상을 입증한다.
  • 제안된 LAST-Att 모델은 균형 잡힌 테스트 세트에서 LAVISH 대비 2.26%의 정확도 향상과 AVST 대비 4.42%의 향상을 달성하여 새로운 최고 성능을 확립한다.
  • 대조적 이진 QA 평가에서 LAST-Att는 LAVISH 대비 4.39%, AVST 대비 6.46%의 성능 향상을 기록하여 언어 사전 지식에 의존하기보다는 청각-시각 맥락을 올바르게 추론할 수 있음을 입증한다.
  • 새로운 데이터셋인 MUSIC-AVQA v2.0은 1,204개의 추가 실재 영상과 8,100개의 새로운 QA 쌍을 포함하며, 3개 이상의 악기 조합을 포함한 복잡한 앙상블에 중점을 두어 대표성과 도전도를 향상시켰다.
  • 본 연구는 AVQA 데이터셋의 데이터 편향이 모델이 빈번한 답변을 선호하게 하여 다중모달 추론 능력을 떨어뜨리며, 균형 잡힌 데이터가 신뢰할 수 있는 벤치마크를 확보하는 데 필수적임을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.