Skip to main content
QUICK REVIEW

[論文レビュー] Are Training Resources Insufficient? Predict First Then Explain!

Myeongjun Jang, Thomas Lukasiewicz|arXiv (Cornell University)|Aug 29, 2021
Topic Modeling参考文献 34被引用数 5
ひとこと要約

この論文は、説明可能NLPにおける支配的である説明→予測(EtP)モデルおよび統合モデルの代替として、データおよび学習効率に優れた予測→説明(PtE)アーキテクチャを提案する。PtEモデルは、限られた説明データでも優れた性能を達成し、EtPモデルよりも高速に学習が可能であり、よりラベルに依存した説明を生成することを示している。

ABSTRACT

Natural language free-text explanation generation is an efficient approach to train explainable language processing models for commonsense-knowledge-requiring tasks. The most predominant form of these models is the explain-then-predict (EtP) structure, which first generates explanations and uses them for making decisions. The performance of EtP models is highly dependent on that of the explainer by the nature of their structure. Therefore, large-sized explanation data are required to train a good explainer model. However, annotating explanations is expensive. Also, recent works reveal that free-text explanations might not convey sufficient information for decision making. These facts cast doubts on the effectiveness of EtP models. In this paper, we argue that the predict-then-explain (PtE) architecture is a more efficient approach in terms of the modelling perspective. Our main contribution is twofold. First, we show that the PtE structure is the most data-efficient approach when explanation data are lacking. Second, we reveal that the PtE structure is always more training-efficient than the EtP structure. We also provide experimental results that confirm the theoretical advantages.

研究の動機と目的

  • 説明可能NLPにおける低データ環境下での説明→予測(EtP)モデルの非効率性を解決すること。
  • 意思決定において説明を先に処理するモデルがより自然または効果的であるという仮定に挑戦すること。
  • 予測→説明(PtE)アーキテクチャがデータ効率性および学習効率性に優れているかどうかを調査すること。
  • PtEモデルが生成する説明の質、特にラベルに依存した性質やラベルに条件づけられた性質を調査すること。
  • 説明データが限られている状況においてPtEが優れたアーキテクチャ選択であるという理論的および実証的根拠を提供すること。

提案手法

  • 学習目的を、入力テキストに対してラベルと説明の同時尤度を最大化することに定式化する:$\mathcal{L} = \prod_{i=1}^{n} p(y_i, e_i|x_i)$。
  • 同時尤度をPtE構造に分解する:$p(y_i|x_i) \cdot p(e_i|x_i, y_i)$、ここで予測が説明生成の前に実行される。
  • 分類と説明生成の両方の損失を組み合わせて最小化することで、PtEモデルをエンドツーエンドで学習する。
  • 2段階の学習戦略を実装する:まず分類器を学習し、次に予測ラベルに条件づけられた説明生成器をファインチューニングする。
  • 同一の設定下でPtEとEtP($p(e_i|x_i) \cdot p(y_i|x_i, e_i)$)および統合モデル($p(e_i, y_i|x_i)$)を比較する。
  • ラベルに条件づけられた説明生成を用いることで、説明が予測された意思決定と整合的であることを保証する。

実験結果

リサーチクエスチョン

  • RQ1説明データが乏しい状況において、予測→説明(PtE)アーキテクチャは、説明→予測(EtP)および統合モデルよりもデータ効率性に優れているか?
  • RQ2PtEアーキテクチャは、EtP構造と比較して学習時間を短縮するのか? もしそうならば、その理由は何か?
  • RQ3PtEモデルは、EtPモデルと比較して、よりラベルに依存した説明を生成できるか?
  • RQ4PtEモデルの説明は、入力として使用されていない場合でも、意思決定に意味的に寄与する程度はどの程度か?
  • RQ5EtPモデルに見られる露出バイアス(exposure bias)は性能にどのように影響するのか? また、PtEはこの問題を緩和できるか?

主な発見

  • 説明データが限られている状況において、PtEモデルはEtPおよび統合モデルよりも顕著に優れた性能を示し、優れたデータ効率性を実証した。
  • PtEモデルは、EtPモデルよりも一貫して学習効率性に優れており、性能を維持または向上させつつ、より短い学習時間を要する。
  • 質的および定量的分析を通じて、PtEモデルはEtPモデルよりもよりラベルに依存した説明を生成することが確認された。
  • PtEアーキテクチャは、ラベルに条件づけられた説明生成を可能にし、説明が予測ラベルと整合的であることを保証する。
  • PtEモデルは露出バイアスを回避し、半ラベル付きの説明を生成する必要がなくなるという、EtPフレームワークの一般的な問題を解消する。
  • 実証的結果から、説明データが乏しくても、PtEはEtPを精度および説明の忠実性の両面で上回ることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。