Skip to main content
QUICK REVIEW

[論文レビュー] HFL-RC System at SemEval-2018 Task 11: Hybrid Multi-Aspects Model for Commonsense Reading Comprehension

Zhipeng Chen, Yiming Cui|arXiv (Cornell University)|Mar 15, 2018
Topic Modeling参考文献 6被引用数 12
ひとこと要約

本論文では、テキスト、質問、選択肢の間で注目を計算するマルチアスペクト予測を生成するためのニューラルネットワーク、HMA(ハイブリッドマルチアスペクト)モデルを提示する。Bi-LSTMと注目ベースのアーキテクチャに単語マッチング、品詞タグ、ファジーマッチング特徴を統合することで、SemEval-2018 Task 11のテストセットで84.13%の精度を達成し、24名の参加者の中で1位を獲得した。

ABSTRACT

This paper describes the system which got the state-of-the-art results at SemEval-2018 Task 11: Machine Comprehension using Commonsense Knowledge. In this paper, we present a neural network called Hybrid Multi-Aspects (HMA) model, which mimic the human's intuitions on dealing with the multiple-choice reading comprehension. In this model, we aim to produce the predictions in multiple aspects by calculating attention among the text, question and choices, and combine these results for final predictions. Experimental results show that our HMA model could give substantial improvements over the baseline system and got the first place on the final test set leaderboard with the accuracy of 84.13%.

研究の動機と目的

  • 外部知識ベースに依存せずに、複数選択式読解における常識的推論の課題に対処すること。
  • テキスト、質問、選択肢間の相互作用をマルチアスペクト注目メカニズムでモデル化することで、モデルの性能を向上させること。
  • 品詞タグ、単語マッチング、ファジーマッチングなどの手作業特徴を組み込むことで表現学習を強化すること。
  • 常識的知識を用いた機械理解のためのSemEval-2018 Task 11ベンチマークで最先端の性能を達成すること。

提案手法

  • HMAモデルは、単語レベル、文字レベル、特徴レベルの埋め込みを統合したハイブリッドアーキテクチャを採用し、最終的な埋め込みサイズは218次元である。
  • テキスト、質問、選択肢のそれぞれに共通のハイウェイネットワークを適用した後、別々のBi-LSTM層を用いて文脈表現を捉える。
  • 3つの注目メカニズムを計算する:選択肢に適合したテキスト注目、選択肢に適合した質問注目、自己注目された質問注目。それぞれが異なる関連性の側面を捉える。
  • 複数のアスペクトからの注目スコアをソフトマックス演算で結合し、最終予測のための確率を合算する。
  • 最終的なエンドツーエンド学習を実現するため、カテゴリカル交差エントロピー損失を用いたマルチタスク学習目的関数を採用する。
  • 7つの単一モデルの投票によるアンサンブル学習により、テストセットでの性能がさらに向上した。

実験結果

リサーチクエスチョン

  • RQ1外部知識に依存せずに、ニューラルネットワークモデルが常識的読解で最先端の性能を達成できるか?
  • RQ2マルチアスペクト注目は、テキスト、質問、選択肢間の関係をどの程度効果的にモデル化できるか?
  • RQ3品詞タグやファジーマッチングなどの手作業特徴は、曖昧または言い換えられた質問において、モデルの性能をどの程度向上させるか?
  • RQ4質問に対する自己注目は、複雑または否定的な質問を処理する能力をモデルが向上させるか?

主な発見

  • HMAモデルは開発セットで84.48%の精度を達成し、単純なRNNベースラインから12.78%の向上を示した。
  • 7つの単一モデルのアンサンブルにより、開発セットでは86.46%、最終テストセットでは84.13%の精度に向上し、1位を獲得した。
  • ファジーマッチング特徴の追加により1%〜2%の精度上昇が見られ、正確な単語マッチングを超えた意味的類似性の捉え方の価値が示された。
  • 語形の表層化(ステミング)により性能が著しく低下したため、形態素正規化よりも完全形態の単語表現の方がモデルに有利であることが示された。
  • 公式テストセットにおいて、Yuanfudao(83.95%)やMITRE(82.27%)を含む、他の上位システムをすべて上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。