Skip to main content
QUICK REVIEW

[论文解读] Tackling Data Bias in MUSIC-AVQA: Crafting a Balanced Dataset for Unbiased Question-Answering

Xiulong Liu, Zhikang Dong|arXiv (Cornell University)|Oct 10, 2023
Speech and Audio Processing被引用 4
一句话总结

本文识别并缓解了MUSIC-AVQA数据集中严重的答案偏差问题,提出MUSIC-AVQA v2.0——一个更大、更均衡的基准数据集,包含36.7万个训练QA对,并增强了音视频复杂度。该研究提出一种新型多模态模型,包含音频频谱变换器(AST)分支与跨模态像素级注意力机制,在平衡测试集上相较LAVISH模型提升2.26%准确率,相较AVST模型提升4.42%,创下AVQA任务的新SOTA性能。

ABSTRACT

In recent years, there has been a growing emphasis on the intersection of audio, vision, and text modalities, driving forward the advancements in multimodal research. However, strong bias that exists in any modality can lead to the model neglecting the others. Consequently, the model's ability to effectively reason across these diverse modalities is compromised, impeding further advancement. In this paper, we meticulously review each question type from the original dataset, selecting those with pronounced answer biases. To counter these biases, we gather complementary videos and questions, ensuring that no answers have outstanding skewed distribution. In particular, for binary questions, we strive to ensure that both answers are almost uniformly spread within each question category. As a result, we construct a new dataset, named MUSIC-AVQA v2.0, which is more challenging and we believe could better foster the progress of AVQA task. Furthermore, we present a novel baseline model that delves deeper into the audio-visual-text interrelation. On MUSIC-AVQA v2.0, this model surpasses all the existing benchmarks, improving accuracy by 2% on MUSIC-AVQA v2.0, setting a new state-of-the-art performance.

研究动机与目标

  • 识别并量化原始MUSIC-AVQA数据集中在二元、计数及时间类问题类型中的严重答案偏差。
  • 通过收集补充视频与问题,构建更均衡、更具代表性的AVQA基准,以减少答案分布的偏斜。
  • 开发一种新型基线模型,有效融合音频、视觉与语言模态,以克服语言先验与偏差导致的过拟合问题。
  • 通过对比在有偏与均衡测试划分上的模型泛化性能,评估模型泛化能力,证明新基准的优越性。
  • 为未来AVQA研究建立一个可靠、无偏的基准,真实反映多模态推理能力。

提出的方法

  • 系统分析MUSIC-AVQA中全部33种问题模板的答案分布,识别出存在极端偏斜的模板,尤其关注二元与计数类问题。
  • 人工收集1,204个额外真实视频与8,100个新QA对,确保答案分布均衡,尤其针对高偏差模板中的少数答案类别。
  • 设计新型基线模型LAST-Att,集成预训练的音频频谱变换器(AST)分支,以提升音频表征能力。
  • 引入音频与视觉空间特征图之间的跨模态像素级注意力机制,增强细粒度的音视频对齐能力。
  • 在原始有偏数据集与新均衡的MUSIC-AVQA v2.0上分别训练与评估模型,使用独立的验证与测试划分以保证公平比较。
  • 通过1,643对语义相同但答案相反的配对二元问题,开展对比性二元QA评估,测试模型对语言先验的鲁棒性。

实验结果

研究问题

  • RQ1原始MUSIC-AVQA数据集中的答案偏差在多大程度上损害了AVQA模型的泛化能力与可靠性?
  • RQ2一个包含更多样化且均匀分布答案的新均衡数据集,是否能提升模型性能并减少对语言先验的依赖?
  • RQ3集成AST分支与跨模态像素级注意力机制,是否能显著提升AVQA中的多模态推理能力?
  • RQ4在平衡数据集上训练的模型,与在有偏数据集上训练的模型相比,在两个测试划分上的表现如何?
  • RQ5对比性二元QA评估是否能有效衡量模型对音视频上下文的真实理解能力,而非仅记忆语言模式?

主要发现

  • 在原始有偏MUSIC-AVQA数据集上训练的模型,在有偏测试集上表现更优(如LAVISH模型提升+2.96%),但在平衡测试集上表现更差,证实了对数据偏差的过拟合现象。
  • 在MUSIC-AVQA v2.0上训练的LAVISH模型,在平衡测试集上相较其在有偏数据集上的表现,准确率提升2.96%,表明泛化能力显著增强。
  • 所提出的LAST-Att模型在平衡测试集上相较LAVISH模型提升2.26%,相较AVST模型提升4.42%,创下新SOTA性能。
  • 在对比性二元QA评估中,LAST-Att相较LAVISH与AVST分别提升4.39%与6.46%,证明其能基于音视频上下文进行推理,而非依赖语言先验。
  • 新数据集MUSIC-AVQA v2.0包含1,204个额外真实视频与8,100个新QA对,重点涵盖3种及以上乐器的复杂组合,显著提升数据代表性与挑战性。
  • 本研究证实,AVQA数据集中的数据偏差会导致模型偏好高频答案,削弱其跨模态推理能力,而均衡数据对可靠基准测试至关重要。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。