[论文解读] Speech-Based Visual Question Answering
本文提出基于语音的视觉问答(VQA),引入一种端到端深度神经网络,直接处理音频波形;同时提出一种先通过ASR再进行基于文本的VQA的流水线方法。尽管端到端模型性能低于流水线方法,但其在噪声环境下表现出更强鲁棒性,并展示了在低资源语言场景下的可行性。作者发布了包含200小时合成语音和1小时真实语音的语音VQA数据集。
This paper introduces speech-based visual question answering (VQA), the task of generating an answer given an image and a spoken question. Two methods are studied: an end-to-end, deep neural network that directly uses audio waveforms as input versus a pipelined approach that performs ASR (Automatic Speech Recognition) on the question, followed by text-based visual question answering. Furthermore, we investigate the robustness of both methods by injecting various levels of noise into the spoken question and find both methods to be tolerate noise at similar levels.
研究动机与目标
- 探索使用口语问题而非文本进行视觉问答的可行性。
- 比较端到端音频到答案建模与流水线ASR方法的性能。
- 评估两种方法在不同背景噪声水平下的鲁棒性。
- 发布一个用于公开使用的新型语音VQA数据集,包含合成与真实人类录制的语音。
- 研究在零样本和噪声环境下,仅音频模型与基于文本模型之间的性能差距。
提出的方法
- 训练一个端到端深度神经网络,将原始音频波形直接映射到VQA答案,无需中间转录过程。
- 流水线方法首先通过ASR将口语问题转录为文本,然后将生成的文本输入标准基于文本的VQA模型。
- 音频输入通过CNN与RNN架构处理,以从原始波形中提取时序与频谱特征。
- 基于文本的VQA模型使用堆叠注意力机制,将问题与图像相关区域对齐。
- 两种模型均在新构建的基于语音的VQA数据集上进行训练,该数据集源自VQA 1.0数据集,包含合成与真实人类录制的语音。
- 通过在不同信噪比下向语音语句中注入噪声,评估两种方法的鲁棒性。
实验结果
研究问题
- RQ1与基于ASR的流水线VQA系统相比,端到端音频到答案模型的性能如何?
- RQ2在口语问题背景噪声逐渐增加的情况下,两种方法的性能表现如何?
- RQ3在合成语音上训练的模型与在真实人类录制语音上测试的模型之间,性能差距有多大?
- RQ4在零样本设定下,仅音频方法与基于文本方法的泛化能力有何差异?
- RQ5在低资源语言场景下,端到端音频建模是否可作为ASR的可行替代方案?
主要发现
- 流水线ASR方法(TextMod)在合成数据和真实人类录制数据上均优于端到端音频模型(SpeechMod),在原始文本上达到53.09%的准确率,在录制语音上达到41.66%。
- SpeechMod在合成语音上达到42.69%的准确率,但在真实人类录制语音上仅达21.46%,表明其对自然语音变化的泛化能力较差。
- 两种方法在噪声下的退化率相似,随着噪声增加,准确率下降水平相当,表明其鲁棒性相当。
- SpeechMod的零样本性能下降幅度更大(7%),而TextMod仅下降4%,表明基于文本的模型对未见词汇的泛化能力更强。
- 合成语音与真实人类录制语音的频谱图存在显著差异,这解释了SpeechMod在真实语音上表现差的原因,即音频特征不匹配。
- 作者发布了211小时的语音VQA数据集(200小时合成,1小时真实),以支持未来语音与视觉融合的研究。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。