[论文解读] ActivityNet-QA: A Dataset for Understanding Complex Web Videos via Question Answering
本文介绍了 ActivityNet-QA,这是一个大规模、完全由人工标注的视频问答数据集,包含来自 ActivityNet 的 5,800 段长而复杂的网络视频中的 58,000 对问答对。该研究评估了 VideoQA 基线模型,并表明动态采样和平均池化融合策略显著提升了性能,尤其在需要时空推理的长视频上表现更优。
Recent developments in modeling language and vision have been successfully applied to image question answering. It is both crucial and natural to extend this research direction to the video domain for video question answering (VideoQA). Compared to the image domain where large scale and fully annotated benchmark datasets exists, VideoQA datasets are limited to small scale and are automatically generated, etc. These limitations restrict their applicability in practice. Here we introduce ActivityNet-QA, a fully annotated and large scale VideoQA dataset. The dataset consists of 58,000 QA pairs on 5,800 complex web videos derived from the popular ActivityNet dataset. We present a statistical analysis of our ActivityNet-QA dataset and conduct extensive experiments on it by comparing existing VideoQA baselines. Moreover, we explore various video representation strategies to improve VideoQA performance, especially for long videos. The dataset is available at https://github.com/MILVLG/activitynet-qa
研究动机与目标
- 为解决现有 VideoQA 数据集存在的局限性,如规模小、自动生成、时长短、动作多样性有限等问题。
- 利用来自 ActivityNet 数据集的长而复杂的网络视频,构建一个大规模、完全由人工标注的 VideoQA 基准。
- 通过现有 VideoQA 基线评估新数据集的难度,并分析视频表征策略的影响。
- 探索适用于长视频理解的 VideoQA 中有效视频特征提取与融合技术。
- 提供一个双语对齐的 QA 资源,以支持未来多语言 VideoQA 研究。
提出的方法
- 在 ActivityNet 的 5,800 个视频中,通过众包方式为每个视频标注 10 对人工问答对,共生成 58,000 对问答对。
- 采用多流视频特征提取管道,使用 I3D 网络生成外观特征和运动特征。
- 应用动态采样(DS)和固定采样(FS)策略,提取具有代表性的视频单元,其中 DS 优先选择动作密集的片段。
- 使用时间注意力机制和平均池化进行特征融合,以提升时空推理能力。
- 在该数据集上评估多种 VideoQA 模型(E-VQA、E-MN、E-SA),采用不同的融合与采样策略。
- 对采样频率(T = 20, 40, 60)和融合方法进行消融研究,分析性能权衡。
实验结果
研究问题
- RQ1现有 VideoQA 模型在大规模、长时长、人工标注的数据集(如 ActivityNet-QA)上的性能泛化能力如何?
- RQ2不同视频采样策略(固定采样 vs. 动态采样)对 VideoQA 准确率的影响如何,特别是在长视频上的表现?
- RQ3哪种视频特征融合策略(平均池化、最大池化、早期融合)能取得最佳性能与鲁棒性?
- RQ4不同采样频率(T = 20, 40, 60)如何影响模型准确率与计算复杂度?
- RQ5当前 VideoQA 模型的失败模式是什么,特别是在时间推理与静态帧理解之间的差异?
主要发现
- E-SA 模型在所有问题类型上均优于 E-VQA 和 E-MN,其在是/否类问题上达到 59.4% 的准确率,在 'Other' 类问题上达到 28.4% 的准确率。
- 与固定采样(FS)相比,动态采样(DS)使所有基线模型的性能至少提升 1%,表明其在捕捉与动作相关帧方面更有效。
- 平均池化融合策略在所有采样频率和方法下均取得最高准确率和最佳鲁棒性。
- 随着采样频率增加(T = 20 到 60),固定采样与动态采样之间的性能差距缩小,表明更密集的采样能保留更多视频细节。
- 密集采样(T = 60)增加了模型复杂度并导致性能下降,表明细节与效率之间存在权衡。
- 定性分析显示,模型在针对静态帧的问题上表现更优,但在需要时间推理的问题上表现不佳,凸显了未来研究的关键挑战。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。