[论文解读] What Gives the Answer Away? Question Answering Bias Analysis on Video QA Datasets
本文使用 RoBERTa 分析视频问答(QA)数据集中的问题回答偏差,发现预训练语言模型在不使用视频输入的情况下,对多项选择题的准确率仍能达到 37–48%,显著高于 20% 的随机基线。研究识别出标注者身份和推理类问题类型(例如 'why'/'how')是主要的偏差来源,并建议采用标注者无重叠的训练-测试划分方式,以减少偏差并提升泛化能力。
Question answering biases in video QA datasets can mislead multimodal model to overfit to QA artifacts and jeopardize the model's ability to generalize. Understanding how strong these QA biases are and where they come from helps the community measure progress more accurately and provide researchers insights to debug their models. In this paper, we analyze QA biases in popular video question answering datasets and discover pretrained language models can answer 37-48% questions correctly without using any multimodal context information, far exceeding the 20% random guess baseline for 5-choose-1 multiple-choice questions. Our ablation study shows biases can come from annotators and type of questions. Specifically, annotators that have been seen during training are better predicted by the model and reasoning, abstract questions incur more biases than factual, direct questions. We also show empirically that using annotator-non-overlapping train-test splits can reduce QA biases for video QA datasets.
研究动机与目标
- 调查 MovieQA 和 TVQA 等流行视频 QA 数据集中问题回答偏差的程度。
- 评估像 RoBERTa 这类预训练语言模型是否能在不使用视觉或多模态上下文的情况下,在 QA 任务中取得高准确率。
- 识别这些偏差的根本原因,包括标注者身份和问题类型(例如事实性 vs. 推理类)。
- 推荐改进的数据集划分策略——特别是标注者无重叠的划分方式——以减少偏差并提升模型泛化能力。
- 提供关于主观/抽象问题与客观/事实性问题在偏差敏感性方面权衡的见解。
提出的方法
- 在 MovieQA 和 TVQA 的问题-答案对上微调 RoBERTa,将问题与每个答案选项拼接作为输入。
- 在 RoBERTa 上添加一个 4 层的 MLP 头,使用交叉熵损失预测每个答案正确的概率。
- 在两种设置下评估性能:'QA-only'(在 Q+A 上微调 RoBERTa)和 'Answer-only'(仅在答案上微调 RoBERTa)。
- 通过基于标注者身份划分数据集进行消融研究,以评估标注者重叠带来的偏差。
- 分析模型在不同问题类型(例如 'why'、'how'、'what'、'who')上的表现,以识别偏差模式。
- 使用混淆矩阵和重划分策略(例如 w118)验证偏差来源,并评估无重叠划分策略的有效性。
实验结果
研究问题
- RQ1RoBERTa 在不使用任何视觉或多模态上下文的情况下,能在多大程度上正确回答视频 QA 问题?
- RQ2视频 QA 数据集中的主要偏差来源是什么——标注者身份还是问题类型?
- RQ3RoBERTa 在事实性问题(例如 'who'、'what')和推理类问题(例如 'why'、'how')上的表现有何差异?
- RQ4使用标注者无重叠的训练-测试划分是否能减少 QA 偏差并提升模型泛化能力?
- RQ5问题-答案对中的偏差如何影响最先进视频 QA 模型和评估指标的可靠性?
主要发现
- 在 QA-only 设置下,RoBERTa 在 MovieQA 和 TVQA 上的验证准确率分别为 37.33% 和 48.91%,远超 20% 的随机猜测基线。
- 模型在无视频输入的情况下于 TVQA 上达到 48.91% 的准确率,表明数据集中存在强烈的语言偏差,可被语言模型利用。
- 标注者身份是显著的偏差来源:模型在训练中见过的标注者的问题上表现更好;无重叠划分使性能下降 10–15%,表明偏差被有效降低。
- 推理类问题(例如 'why'、'how')比事实性问题(例如 'what'、'who')引发的偏差更严重,RoBERTa 在 MovieQA 的 'why/how' 问题上表现优于基线超过 10%。
- 在无重叠划分中性能下降(例如,当冻结 RoBERTa 时,TVQA 上从 48.91% 降至 30.75%)证实,当测试问题来自未见过的标注者时,偏差被有效减少。
- 本研究建议未来工作采用标注者无重叠的划分方式,以实现更可靠、偏差更低的视频 QA 模型评估。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。