Skip to main content
QUICK REVIEW

[論文レビュー] FLUTE: Figurative Language Understanding through Textual Explanations

Tuhin Chakrabarty, Arkadiy Saakyan|arXiv (Cornell University)|May 24, 2022
Natural Language Processing Techniques被引用数 7
ひとこと要約

FLUTEは、比喩的言語理解のための新しい9,000サンプルのベンチマークであり、意味的・比喩的文のペアに帰結/矛盾ラベルと自由形式の説明文を付与している。この研究では、GPT-3と人間のアノテーター(クラウドワーカーや専門家)を組み合わせたモデルインザループフレームワークを用いて、高品質なデータ収集をスケーラブルに実現し、T5をFLUTEで微調整することで、e-SNLIで微調整した場合よりも優れた説明が得られることを示した。これは、比喩的言語を「正しい理由」で理解するモデルを構築するという目標を前進させる。

ABSTRACT

Figurative language understanding has been recently framed as a recognizing textual entailment (RTE) task (a.k.a. natural language inference, or NLI). However, similar to classical RTE/NLI datasets, the current benchmarks suffer from spurious correlations and annotation artifacts. To tackle this problem, work on NLI has built explanation-based datasets such as e-SNLI, allowing us to probe whether language models are right for the right reasons.Yet no such data exists for figurative language, making it harder to assess genuine understanding of such expressions. To address this issue, we release FLUTE, a dataset of 9,000 figurative NLI instances with explanations, spanning four categories: Sarcasm, Simile, Metaphor, and Idioms. We collect the data through a model-in-the-loop framework based on GPT-3, crowd workers, and expert annotators. We show how utilizing GPT-3 in conjunction with human annotators (novices and experts) can aid in scaling up the creation of datasets even for such complex linguistic phenomena as figurative language. The baseline performance of the T5 model fine-tuned on FLUTE shows that our dataset can bring us a step closer to developing models that understand figurative language through textual explanations.

研究の動機と目的

  • 比喩的言語理解の説明ベースのベンチマークの不足に取り組み、モデルが表面的な相関関係を超えて一般化しているかどうかを評価することが困難であることを是正すること。
  • 自然言語の説明を伴う、スケーラブルで高品質な比喩的NLIインスタンスのデータセットを開発し、モデルの解釈可能性を本物の意味で向上させること。
  • 説明に anchored された比喩的言語データで微調整することにより、従来のNLIベンチマークと比較して、モデルのパフォーマンスと説明品質が向上するかどうかを評価すること。
  • GPT-3と人間による検証を組み合わせたモデルインザループフレームワークが、複雑な言語データセットを構築するのに有効であることを実証すること。

提案手法

  • モデルインザループフレームワークにより、Few-shotプロンプティングを用いたGPT-3で多様な意味的・比喩的文のペアを生成し、人的作業の負担を軽減する。
  • クラウドワーカーが意味的整合性を保ちつつ、意味的な文を皮肉表現に最小限の編集で変換する。
  • 専門家アノテーターがGPT-3の出力を正確性、一貫性、言語的質の観点から検証・精錬する。
  • 各インスタンスには、帰結/矛盾意思決定の自然言語説明が含まれており、それらは比喩的表現に基づいている。
  • データセットは、<意味的文, 比喩的文>のペアとして構造化されており、ラベル(帰結/矛盾)と説明を含み、悪態、比喩、隠喩、慣用句をカバーする。
  • e-SNLIとFLUTEの両方のデータを用いて、ラベル予測と説明生成の両方を同時に微調整するT5モデルを訓練する。

実験結果

リサーチクエスチョン

  • RQ1モデルインザループフレームワークは、比喩的言語のための高品質で説明に anchored されたデータセットの作成を、効果的にスケーリングできるか?
  • RQ2FLUTEで微調整することで、e-SNLIで微調整した場合と比較して、比喩的言語理解における説明品質が向上するか?
  • RQ3FLUTEで微調整されたモデルは、ベースラインモデルと比較して、比喩的表現についてより頑健で忠実な推論を示すか?
  • RQ4FLUTEで微調整されたモデルが生成する説明は、一般NLIデータで訓練されたモデルの説明と比較して、整合性と関連性の観点で優れているか?

主な発見

  • FLUTEで微調整されたT5モデルは、自動評価および人的評価の両方で、e-SNLIで微調整した同じモデルよりも顕著に優れた品質のテキスト説明を生成した。
  • FLUTEに比喩的表現に直接関連する説明が含まれていることで、標準的なNLIベンチマークよりもモデルの推論をより信頼性高く評価できるようになった。
  • GPT-3と専門家による検証を組み合わせたモデルインザループアプローチにより、高品質で多様な比喩的言語インスタンスの作成が成功裏にスケーリングされた。
  • このデータセットは、説明に anchored された比喩的言語データで訓練されたモデルが、分布外や悪意のある例に対してもより適切に対処できるようになることを示している。
  • Big-bench や IMPLI といった既存のベンチマークとは異なり、FLUTEは非帰結の例が意味的文の部分だけでなく、比喩的意味そのものと矛盾するように保証しているため、優れている。
  • 人的評価により、FLUTEで微調整されたモデルが生成する説明は、一般NLIデータで訓練されたモデルの説明よりも忠実で文脈的に関連性が高いことが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。