QUICK REVIEW
[论文解读] A Study of BERT for Non-Factoid Question-Answering under Passage Length Constraints
Yosi Mass, Haggai Roitman|arXiv (Cornell University)|Aug 19, 2019
Topic Modeling参考文献 10被引用 14
一句话总结
本文研究了在段落长度限制下,使用 BERT 微调进行非事实型问答的性能,比较了逐点式与成对式学习排序方法。研究发现,使用 256 个标记的序列时 BERT 表现最佳,而通过注意力机制进行段落分割可实现对更长段落的处理,仅造成适度的准确率损失。
ABSTRACT
We study the use of BERT for non-factoid question-answering, focusing on the passage re-ranking task under varying passage lengths. To this end, we explore the fine-tuning of BERT in different learning-to-rank setups, comprising both point-wise and pair-wise methods, resulting in substantial improvements over the state-of-the-art. We then analyze the effectiveness of BERT for different passage lengths and suggest how to cope with large passages.
研究动机与目标
- 评估 BERT 在严格输入长度限制下,用于非事实型问答段落重排序的有效性。
- 比较使用 BERT 进行段落重排序时,逐点式与成对式学习排序策略的性能。
- 分析段落长度对 BERT 表示质量的影响,并确定最优序列长度。
- 开发并评估通过分段与表示聚合处理超过 BERT 512 个标记限制的段落的方法。
- 为在长度受限输入环境下实际部署 BERT 于真实世界问答系统提供实用指导。
提出的方法
- 使用预训练的基础模型,基于查询-段落对,采用交叉熵损失进行逐点排序微调(BERT[PW]),以及采用三元组损失进行成对排序微调(BERTlets)。
- 使用 BERT 的 [CLS] 标记表示作为最终句子对嵌入向量用于评分。
- 探索将段落分割为 128 个标记的块,通过多头注意力机制将块级表示聚合为段落级表示。
- 评估了其他聚合方法,包括最大池化,其结果与基于注意力的融合方法相似。
- 使用 Adam 优化器,初始初始学习率为 2e-5,在 Tesla K40m GPU 上训练三轮。
- 使用标准信息检索指标(P@1、MAP 和 MRR)在三个基准数据集(nfL6、WebAP 和 WikiPassageQA)上评估性能。
实验结果
研究问题
- RQ1在输入长度限制下,BERT 在非事实型段落重排序中的表现如何?
- RQ2BERT 在段落重排序中的最优序列长度(SeqLen)是多少?其表现如何随段落长度变化?
- RQ3将段落分割为较小块并结合基于注意力的聚合,能否有效处理超过 BERT 512 个标记限制的段落?
- RQ4在使用 BERT 微调进行段落重排序时,逐点式与成对式学习排序策略的性能表现如何比较?
- RQ5通过分段处理长段落与保持重排序准确率之间的权衡是什么?
主要发现
- 在所有数据集中,使用 256 个标记序列的 BERT 表现最佳,在 nfL6 数据集上的 P@1 指标上,相比 BM25 和先前的深度学习基线模型,性能最高提升达 120%。
- 在较短(64、128)和较长(384)序列长度下性能下降,尤其在平均段落长度较长的 WikiPassageQA 上表现更明显。
- 将段落分割为两个或三个 128 个标记的块,并结合基于注意力的聚合,可实现对超过 512 个标记段落的处理,尽管相比完整长度处理,性能有适度下降。
- 在 WikiPassageQA 上,BERTlets 成对方法优于 BERT[PW](MAP=0.74 vs. 0.71);而在 WebAP 上,BERT[PW] 略胜 BERTlets(P@1=0.55 vs. 0.53)。
- 对块表示进行最大池化可获得与基于注意力的聚合相似的结果,表明简单池化是融合方法的可行替代方案。
- 本研究证实,逐点式与成对式微调策略性能相当,其中 BERTlets 在某些设置下表现略优。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。