Skip to main content
QUICK REVIEW

[论文解读] HFL-RC System at SemEval-2018 Task 11: Hybrid Multi-Aspects Model for Commonsense Reading Comprehension

Zhipeng Chen, Yiming Cui|arXiv (Cornell University)|Mar 15, 2018
Topic Modeling参考文献 6被引用 12
一句话总结

本论文提出 HMA(混合多方面)模型,一种用于常识阅读理解的神经网络,通过在文本、问题和答案选项之间计算注意力机制,生成多方面预测。通过将词匹配、词性标注和模糊匹配特征整合到双向LSTM与注意力机制架构中,该模型在 SemEval-2018 任务11 测试集上取得了 84.13% 的准确率,位列24名参赛者中的第一名。

ABSTRACT

This paper describes the system which got the state-of-the-art results at SemEval-2018 Task 11: Machine Comprehension using Commonsense Knowledge. In this paper, we present a neural network called Hybrid Multi-Aspects (HMA) model, which mimic the human's intuitions on dealing with the multiple-choice reading comprehension. In this model, we aim to produce the predictions in multiple aspects by calculating attention among the text, question and choices, and combine these results for final predictions. Experimental results show that our HMA model could give substantial improvements over the baseline system and got the first place on the final test set leaderboard with the accuracy of 84.13%.

研究动机与目标

  • 解决在不依赖外部知识库的前提下,实现多项选择阅读理解中的常识推理挑战。
  • 通过多方面注意力机制建模文本、问题与选项之间的交互关系,提升模型性能。
  • 通过引入手工设计的特征(如词性标注、词匹配和模糊匹配)增强表征学习能力。
  • 在利用常识知识进行机器理解的 SemEval-2018 任务11 基准测试中实现最先进性能。

提出的方法

  • HMA 模型采用混合架构,结合词级、字符级与特征级嵌入,最终嵌入维度为 218d。
  • 对文本、问题与选项分别应用共享的 Highway 网络,随后使用独立的 Bi-LSTM 层捕获上下文表征。
  • 计算三种注意力机制:选项感知的文本注意力、选项感知的问题注意力以及自注意力机制的问题注意力,每种机制捕捉不同的相关性方面。
  • 通过 softmax 操作组合来自多个方面的注意力得分,并对概率进行求和以获得最终预测。
  • 系统采用多任务学习目标,使用分类交叉熵损失进行端到端训练。
  • 通过七种单模型的投票集成学习方法,进一步提升测试集上的性能。

实验结果

研究问题

  • RQ1神经网络模型是否能在不依赖外部知识库的前提下,实现常识阅读理解的最先进性能?
  • RQ2多方面注意力机制在建模文本、问题与答案选项之间关系方面的有效性如何?
  • RQ3手工设计的特征(如词性标注和模糊匹配)在处理模糊或改写问题时,对模型性能的提升程度如何?
  • RQ4对问题应用自注意力机制是否能增强模型处理复杂或否定性问题的能力?

主要发现

  • HMA 模型在验证集上达到 84.48% 的准确率,相较于简单 RNN 基线模型提升了 12.78%。
  • 七种单模型的集成在验证集上将性能提升至 86.46%,在最终测试集上达到 84.13%,获得第一名。
  • 引入模糊匹配特征带来了 1%–2% 的准确率增益,证明其在捕捉超越精确词匹配的语义相似性方面具有重要价值。
  • 词干化处理导致性能显著下降,表明模型更受益于完整形态的词表示,而非形态归一化处理。
  • 在官方测试集上,该模型优于所有其他排名靠前的系统,包括 Yuanfudao(83.95%)和 MITRE(82.27%)

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。