[论文解读] Accelerating Real-Time Question Answering via Question Generation
Ocean-Q 通过离线使用问题生成(QG)模型生成大量 QA 对,加速了实时问答,使在线推理可通过 n-gram 匹配实现,无需实时神经编码。相比最快的 RTQA 系统,其推理速度提升 4 倍,准确率仅下降 3% 至 3.8%,显著降低计算与能耗成本,同时保持了具有竞争力的性能。
Although deep neural networks have achieved tremendous success for question answering (QA), they are still suffering from heavy computational and energy cost for real product deployment. Further, existing QA systems are bottlenecked by the encoding time of real-time questions with neural networks, thus suffering from detectable latency in deployment for large-volume traffic. To reduce the computational cost and accelerate real-time question answering (RTQA) for practical usage, we propose to remove all the neural networks from online QA systems, and present Ocean-Q (an Ocean of Questions), which introduces a new question generation (QG) model to generate a large pool of QA pairs offline, then in real time matches an input question with the candidate QA pool to predict the answer without question encoding. Ocean-Q can be readily deployed in existing distributed database systems or search engine for large-scale query usage, and much greener with no additional cost for maintaining large neural networks. Experiments on SQuAD(-open) and HotpotQA benchmarks demonstrate that Ocean-Q is able to accelerate the fastest state-of-the-art RTQA system by 4X times, with only a 3+% accuracy drop.
研究动机与目标
- 为解决依赖实时神经编码的实时问答(RTQA)系统所面临的高计算与延迟开销问题。
- 消除在 RTQA 系统在线推理过程中维护和运行大型神经网络的需求。
- 通过使用问题生成(QG)模型离线预生成大量候选 QA 对,实现 RTQA 的加速,使推理时可快速匹配,无需实时编码。
- 通过数据增强、多任务学习和多样化束搜索提升 QG 质量,以增强下游 RTQA 性能。
- 建立一个无需在实时推理中使用神经网络的开放域 RTQA 新基准。
提出的方法
- 使用在文档中提取的答案片段进行端到端训练的问题生成模型,离线生成候选 QA 对。
- 通过从上下文中抽取答案并随后生成问题,创建多样化的候选 QA 对。
- 利用最先进的 QA 模型对 QA 对进行验证,以过滤和纠正低质量或错误的 QA 对。
- 在在线推理阶段,通过 n-gram 重叠将输入问题与预生成的 QA 池进行匹配,实现即时检索,绕过神经编码。
- 在在线匹配中采用两步排序器,高效检索前几项候选 QA 对,再进行 n-gram 匹配。
- 在 QG 训练过程中采用多任务学习和多样化束搜索,以提升问题的多样性与质量。
实验结果
研究问题
- RQ1离线问题生成是否能显著降低问答系统中的实时推理延迟?
- RQ2在不使用神经网络的在线推理流程中,其准确率在多大程度上能与最先进 RTQA 模型保持竞争力?
- RQ3数据增强与 QG 质量提升对最终 RTQA 系统性能有何影响?
- RQ4用预计算的 QA 匹配替代实时神经编码时,速度提升与准确率之间的权衡如何?
- RQ5通过多任务学习与多样化束搜索训练的 QG 模型,能否生成更高质量的候选问题,从而提升 RTQA 性能?
主要发现
- Ocean-Q 在 SQuAD-Open 和 HotpotQA 基准上,使现有最快 RTQA 系统的推理速度提升 4 倍,准确率仅下降 3.0% 至 3.8%。
- 两步排序器提升了检索准确率,在每查询 200 个段落时达到 SQuAD-Open 上的 83.4%,优于 DrQA 的 77.8%,且段落数量更少。
- 将候选答案数量从 10 增加到 100,使 SQuAD 和 HotpotQA 上的 RTQA 分数分别提升 16.96 和 18.85 分。
- 将束搜索大小从 1 增加到 20,使 SQuad 和 HotpotQA 上的 RTQA 分数分别提升 12.02 和 11.59 分,证明了生成更多多样化问题的优势。
- 若移除 QA 对验证步骤,准确率下降 9.46%,证实该步骤在提升输出质量方面具有关键作用。
- 使用领域内数据进行数据增强(DA-sim)使 SQuAD 上的 QG 指标提升 0.83/0.61/0.71,HotpotQA 上提升 2.07/1.61/2.14;而使用多样化数据(DA-div)在 SQuAD 上表现低于基线。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。