Skip to main content
QUICK REVIEW

[論文レビュー] How consistent are our discourse annotations? Insights from mapping RST-DT and PDTB annotations.

Vera Demberg, Fatemeh Torabi Asr|arXiv (Cornell University)|Apr 28, 2017
Natural Language Processing Techniques被引用数 7
ひとこと要約

本稿は、ペーン・ディス courseツリークイック(PDTB)と修辞的構造理論ディスコースツリークイック(RST-DT)をマッピングし、ディスコースアノテーションにおけるフレームワーク間の一貫性を評価する。段階的アプローチによるアライメント手法を提案し、明示的関係では高い一致を示すが、暗黙的関係では顕著に低い一致を示すことが判明。これは主に、2つのフレームワーク間でのアノテーション目的と操作的定義の違いに起因する。

ABSTRACT

Discourse-annotated corpora are an important resource for the community. However, these corpora are often annotated according to different frameworks, making comparison of the annotations difficult. This is unfortunate, since mapping the existing annotations would result in more (training) data for researchers in automatic discourse relation processing and researchers in linguistics and psycholinguistics. In this article, we present an effort to map two large corpora onto each other: the Penn Discourse Treebank and the Rhetorical Structure Theory Discourse Treebank. We first propose a method for aligning the discourse segments, and then evaluate the observed against the expected mappings for explicit and implicit relations separately. We find that while agreement on explicit relations is reasonable, agreement between the frameworks on implicit relations is astonishingly low. We identify sources of systematic discrepancies between the two annotation schemes; many of the differences in annotation can be traced back to different operationalizations and goals of the PDTB and RST frameworks. We discuss the consequences of these discrepancies for future annotation, and the usability of the mapped data for theoretical studies and the training of automatic discourse relation labellers.

研究の動機と目的

  • 主なディスコースコーパス2つ(PDTBとRST-DT)間のディスコースアノテーションの一貫性を評価すること。
  • 異なる理論的フレームワーク間でのディスコースアノテーションを比較する課題に対処し、データ統合とモデル学習の障壁を解消すること。
  • 特に暗黙的ディスコース関係に関して、PDTBとRST-DTのアノテーション方式の系統的な不一致を特定すること。
  • マッピングされたデータの理論的ディスコース研究および自動ディスコース関係ラベリングの用途としての有用性を評価すること。
  • 異なるフレームワークの目的と操作的定義の影響を分析することで、今後のディスコースアノテーション実務に知見を提供すること。

提案手法

  • テクスト的スパンと構造的類似性に基づき、PDTBとRST-DT間のディスコースセグメントをアライメントする手法を提案する。
  • 明示的および暗黙的ディスコース関係の両方について、観察されたアライメントと期待されるアライメントを比較することで、アライメントの妥当性を評価する。
  • アノテーションの目的と操作的定義の違いを分析することで、2つのフレームワーク間の不一致を解明する。
  • 明示的および暗黙的関係の両方について、一致度を測る定量的評価指標を用いる。
  • 各フレームワークがディスコース関係のカテゴリーをどのように定義し、適用しているかを検討することで、不一致の原因を同定する。
  • マッピングされたデータを用いて、自動ディスコース関係分類器の学習や理論的研究への応用可能性を評価する。

実験結果

リサーチクエスチョン

  • RQ1PDTBとRST-DTのディスコースアノテーションは、セグメントレベルでマッピングされた際にどの程度一貫しているか?
  • RQ2PDTBとRST-DTは、明示的ディスコース関係と暗黙的関係の両方において、どの程度一致しているか?
  • RQ3PDTBとRST-DTのアノテーション方式に生じる系統的な不一致の主な要因は何か?
  • RQ42つのフレームワークの異なる操作的定義と目的が、アノテーションの一貫性にどのように影響しているか?
  • RQ5マッピングされたデータは、自動ディスコース関係ラベラーの学習や理論的ディスコース研究の支援に、どの程度活用可能か?

主な発見

  • PDTBとRST-DTにおける明示的ディスコース関係の一致度は、妥当に高い水準にあり、これらのケースではアノテーションの一貫性が保たれていることが示された。
  • 暗黙的ディスコース関係の一致度は顕著に低く、これらの関係がフレームワーク間で根本的に異なる方法でアノテートされていることが示唆された。
  • アノテーションにおける系統的な不一致は、主にPDTBとRSTフレームワークの操作的定義および理論的目的の違いに起因している。
  • 暗黙的関係における低一貫性は、自動ディスコース関係分類器の学習に両コーパスのデータを統合する信頼性を損なう。
  • マッピングされたデータは、アノテーションの違いがランダムではなく、異なる設計原理に起因していることを示しており、フレームワーク間の比較可能性を制限している。
  • 研究の結果、データ再利用性と理論的整合性を高めるために、ディスコースアノテーションフレームワークの整合性を高める必要があることが強調された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。