Skip to main content
QUICK REVIEW

[論文レビュー] Question-Answering with Grammatically-Interpretable Representations

Hamid Palangi, Paul Smolensky|arXiv (Cornell University)|May 23, 2017
Topic Modeling被引用数 11
ひとこと要約

この論文は、テンソル積表現(TPR)を用いて解釈可能で文法的に解釈可能な内部表現を生成する質問応答モデル、テンソル積再帰ネットワーク(TPRN)を紹介する。ソフトアテンションを用いて記号(語の意味を表す)と役割(文法的機能を近似する)を結合することで学習するが、TPRNは言語的教師なし条件下でもSQuADベンチマークで最先端の性能を達成すると同時に、隠れ層の言語的解釈を可能にする。

ABSTRACT

We introduce an architecture, the Tensor Product Recurrent Network (TPRN). In our application of TPRN, internal representations learned by end-to-end optimization in a deep neural network performing a textual question-answering (QA) task can be interpreted using basic concepts from linguistic theory. No performance penalty need be paid for this increased interpretability: the proposed model performs comparably to a state-of-the-art system on the SQuAD QA task. The internal representation which is interpreted is a Tensor Product Representation: for each input word, the model selects a symbol to encode the word, and a role in which to place the symbol, and binds the two together. The selection is via soft attention. The overall interpretation is built from interpretations of the symbols, as recruited by the trained model, and interpretations of the roles as used by the model. We find support for our initial hypothesis that symbols can be interpreted as lexical-semantic word meanings, while roles can be interpreted as approximations of grammatical roles (or categories) such as subject, wh-word, determiner, etc. Fine-grained analysis reveals specific correspondences between the learned roles and parts of speech as assigned by a standard tagger (Toutanova et al. 2003), and finds several discrepancies in the model's favor. In this sense, the model learns significant aspects of grammar, after having been exposed solely to linguistically unannotated text, questions, and answers: no prior linguistic knowledge is given to the model. What is given is the means to build representations using symbols and roles, with an inductive bias favoring use of these in an approximately discrete manner.

研究の動機と目的

  • 言語理論に基づいて解釈可能な内部表現を生成する質問応答用の深層学習モデルを開発すること。
  • アンノテートされたテキスト、質問、回答のみで学習されたニューラルネットワークが、明示的な教師なし条件下でも、語の意味や文法的役割といった言語的構造を表現できるかどうかを調査すること。
  • このような解釈可能性が、SQuADのような困難なベンチマークで性能を犠牲にすることなく達成可能であることを示すこと。
  • 学習された表現が、品詞や文法的役割といった既存の言語学的概念と意味的に整合しているかどうかを検証すること。

提案手法

  • モデルはBiDAFのLSTMベースの再帰層を、記号ベクトルと役割ベクトルのテンソル積による結合を用いてエンコードするテンソル積再帰ユニット(TPRU)に置き換える。
  • 各単語は、語彙的意味をエンコードする記号(符号)と文法的機能をエンコードする役割(ロール)のテンソル積として形成されるTPRによって表現される。
  • モデルはSQuADデータセット上でエンドツーエンド学習を実行し、スパン予測の正確性を最適化するとともに、記号および役割ベクトルを学習する。
  • 特定の単語に対して選択された記号と役割を分析することで解釈可能性を達成し、品詞や文法的役割といった言語学的カテゴリへのマッピングを可能にする。
  • アーキテクチャは、記号と役割の離散的配置を促進するインダクティブバイアスを組み込んでおり、性能を維持したまま解釈可能性を向上させる。
  • 詳細な分析では、学習された役割が標準的な品詞タガー出力と比較され、両者に整合性がある一方で、特定の状況では性能が向上していることが明らかになった。

実験結果

リサーチクエスチョン

  • RQ1アンノテートされたテキスト、質問、回答のみで学習された深層ニューラルネットワークが、語の意味や文法的役割といった言語的概念に対応する内部表現を意味的に有意義に学習できるか。
  • RQ2モデルが学習する記号が語彙的意味にどの程度対応し、役割が主語や目的語といった文法的機能にどの程度対応するか。
  • RQ3明示的な言語的教師なし条件下でも、モデルの内部構造が学習された構文や意味を示す証拠を示すか。
  • RQ4言語学的理論に基づいてモデルの表現の解釈可能性を検証でき、これによりモデルの挙動の理解が向上するか。

主な発見

  • TPRNモデルはSQuAD質問応答ベンチマークで最先端の性能を達成しており、解釈可能性のための性能の低下がないことが示された。
  • 学習された記号は一貫して意味的に関連する語をグループ化しており、それらが語彙的意味をエンコードしているという仮説を支持する。
  • 学習された役割は、主語、目的語、wh語といった言語学的理論における文法的役割と強く相関しており、モデルが構文的構造を獲得していることが示唆される。
  • 詳細な分析により、モデルの役割割付けは、特に複雑または曖昧な文脈において、標準的な品詞タガーを上回ることが判明した。
  • モデルの内部表現は、生のテキストと教師信号からのエンドツーエンド学習にもかかわらず、構造的で記号的類似の表現として解釈可能である。
  • 本研究は、品詞や文法的役割といった抽象的な言語学的概念が、明示的な言語的教師なし条件下でもタスク駆動学習から自然に出現しうることを実証的に支持する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。