Skip to main content
QUICK REVIEW

[論文レビュー] EPIE Dataset: A Corpus For Possible Idiomatic Expressions

Prateek Saxena, Soma Paul|arXiv (Cornell University)|Jun 16, 2020
Natural Language Processing Techniques参考文献 14被引用数 4
ひとこと要約

本論文は、717の慣用的表現を含む25,206文の英語文から構成され、静的(Static)および形式的(Formal)タイプに分類された、大規模で部分的に自動構築されたコーパス、EPIEデータセットを紹介する。このデータセットにより、BiLSTM-CRFモデルを用いたシーケンスラベリングによる慣用的表現検出が高精度で実現され、独立したテストセットにおいて最大95%の正確性と92%の再現率を達成した。これは、自然言語処理における比喩や慣用的表現の検出を顕著に前進させた。

ABSTRACT

Idiomatic expressions have always been a bottleneck for language comprehension and natural language understanding, specifically for tasks like Machine Translation(MT). MT systems predominantly produce literal translations of idiomatic expressions as they do not exhibit generic and linguistically deterministic patterns which can be exploited for comprehension of the non-compositional meaning of the expressions. These expressions occur in parallel corpora used for training, but due to the comparatively high occurrences of the constituent words of idiomatic expressions in literal context, the idiomatic meaning gets overpowered by the compositional meaning of the expression. State of the art Metaphor Detection Systems are able to detect non-compositional usage at word level but miss out on idiosyncratic phrasal idiomatic expressions. This creates a dire need for a dataset with a wider coverage and higher occurrence of commonly occurring idiomatic expressions, the spans of which can be used for Metaphor Detection. With this in mind, we present our English Possible Idiomatic Expressions(EPIE) corpus containing 25206 sentences labelled with lexical instances of 717 idiomatic expressions. These spans also cover literal usages for the given set of idiomatic expressions. We also present the utility of our dataset by using it to train a sequence labelling module and testing on three independent datasets with high accuracy, precision and recall scores.

研究の動機と目的

  • 自然言語における慣用的表現の検出に向けた大規模で高カバレッジのデータセットの不足を解消すること。
  • 既存のデータセットが小さく、特にフレーズ型慣用的表現のカバレッジに制限があることの課題を克服すること。
  • 意味的および文法的使用の両方を含む豊富で構造化されたデータセットを提供することで、機械学習ベースの慣用的表現検出を可能にすること。
  • 語形変化の違いにより、異なる検出戦略を要する静的および形式的慣用的表現の区別を明確にすること。
  • 機械翻訳や比喩検出などの下流NLPタスクを支援するため、慣用的表現認識の精度を向上させること。

提案手法

  • 表面形に基づいて候補となる慣用的表現を抽出するために、StringNetを用いて英国Nationalコーパス(BNC)からデータを抽出する。
  • 候補となる慣用的表現は、2,000の頻出英語慣用的表現をインド諸言語にマッピングするIMILデータセットから取得する。
  • 非慣用的使用やノイズの多いパターンを除去する二段階のフィルタリングプロセスを実施し、妥当な慣用的表現の部分を含む文のみを保持する。
  • 正確な文字列一致を要する静的慣用的表現と、変形・変形形を含む形式的慣用的表現にデータセットを分割し、それぞれ異なる検出アプローチを要する。
  • 300次元のGloVe埋め込みを用い、BiLSTM-CRFシーケンスラベリングモデルを形式的慣用的表現サブセットで学習し、3つの独立したデータセットで評価する。
  • モデルはSemEval-2013 Task 5bおよびPIEコーパスで微調整され、全使用例および慣用的使用例の両方で性能を測定する。

実験結果

リサーチクエスチョン

  • RQ1大規模で部分的に自動構築されたデータセットは、英語のテキストにおける慣用的表現検出を改善できるか?
  • RQ2静的および形式的慣用的表現の区別は、シーケンスラベリングモデルの慣用的表現検出性能にどのように影響するか?
  • RQ3EPIEデータセットで学習したモデルは、SemEval-2013やPIEコーパスなどの独立した、ドメイン外のデータセットへどの程度一般化できるか?
  • RQ4データセット全体における慣用的表現の出現頻度分布はどのようなものか?また、それはモデル学習にどのように影響するか?
  • RQ5シーケンスラベリングアプローチは、フレーズ型慣用的表現の意味的使用と直訳的使用の両方を高精度で検出できるか?

主な発見

  • EPIEデータセットには、717の慣用的表現を含む25,206件の文が含まれており、そのうち21,891件が静的慣用的表現、3,135件が形式的慣用的表現を含む。
  • EPIE形式的慣用的表現サブセットで学習したモデルは、自身のテスト分割で98%の正確性、95%の正確性、91%の再現率を達成した。
  • SemEval-2013「全単語」データセットでは、全使用例で84%の正確性、90%の正確性、85%の再現率を達成し、慣用的使用例のみで86%の正確性、93%の正確性、86%の再現率を達成した。
  • SemEval-2013「語彙サンプル」データセットでは、全使用例で89%の正確性および90%の正確性を達成し、慣用的使用例では92%の正確性、95%の正確性、92%の再現率を達成した。
  • PIEコーパスでは、全使用例で69%の正確性および60%の正確性を達成したが、慣用的使用例のみでは88%の正確性、94%の正確性、88%の再現率を達成した。
  • 形式的慣用的表現の平均出現回数は8.75、標準偏差は8.61であり、指数関数的分布に近い分布を示している。一方、静的慣用的表現は平均60.9、標準偏差160と、極めて偏った分布を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。