[論文レビュー] Evaluating Text Coherence at Sentence and Paragraph Levels
本稿では、文レベルの順序付けとは補完的である文書レベルのテキスト順序付けを、テキストの整合性を評価するためのタスクとして導入する。8つの多様なデータセット(4つは文レベル、4つは文書レベル)で既存のモデルを評価し、合成データを用いた学習可能性と頑健性を評価し、人的評価を通じてWLCS-lが広く使われているτ指標よりも人間の判断と相関が高く、グラフベースのモデルが優れた性能と頑健性を示すことを示している。
In this paper, to evaluate text coherence, we propose the paragraph ordering task as well as conducting sentence ordering. We collected four distinct corpora from different domains on which we investigate the adaptation of existing sentence ordering methods to a paragraph ordering task. We also compare the learnability and robustness of existing models by artificially creating mini datasets and noisy datasets respectively and verifying the efficiency of established models under these circumstances. Furthermore, we carry out human evaluation on the rearranged passages from two competitive models and confirm that WLCS-l is a better metric performing significantly higher correlations with human rating than tau, the most prevalent metric used before. Results from these evaluations show that except for certain extreme conditions, the recurrent graph neural network-based model is an optimal choice for coherence modeling.
研究の動機と目的
- 文レベルの順序付けとは補完的な文書レベルのテキスト順序付けを提案・確立し、より包括的な整合性評価を実現すること。
- 多様なドメインとデータスケールにおいて、既存のテキスト順序付けモデルの性能、学習可能性、頑健性を評価すること。
- 再順序化されたテキストにおける人間の判断と自動指標(τ、Accuracy、WLCS-l)の相関を評価すること。
- さまざまなデータ条件下での整合性モデリングに最も効果的なモデルアーキテクチャを同定すること。
提案手法
- 4つのドメイン特化型コーパス(ニュース、発表文、エコノミスト、楽曲歌詞)を用いた文書順序付けタスクを提案し、文レベルの要約にとどまらない拡張を実現する。
- 4つの文レベル(NIPS、AAN、arXiv、SIND)と4つの文書レベル(ニュース、発表文、エコノミスト、楽曲歌詞)の8つのデータセットを収集・前処理し、長さ、語彙、分割に関する詳細な統計を提供する。
- 標準指標(τ、Accuracy、WLCS-l)を用いてモデル性能を評価し、3名のレビュアーによる人的評価を実施してモデル生成順序の整合性を評価する。
- ミニデータセット(ダウンサンプリングによって)とノイズ付きデータセット(ノイズを注入することで)を人工的に作成し、モデルの学習可能性と頑健性をテストする。
- 人的アノテーションの信頼性を検証するためにKrippendorff’s αと評価者間相関を適用する。
- 重回帰分析を用いて指標の性能を比較し、WLCS-lが人間評価を予測する際、最高の決定係数(R-squared = 0.665)を示した。
実験結果
リサーチクエスチョン
- RQ1既存のテキスト順序付けモデルは、多様なドメインにおいて文レベルおよび文書レベルでどの程度の性能を示すか?
- RQ2自動指標(τ、Accuracy、WLCS-l)の相対的な有効性は、テキスト整合性の人的判断をどの程度うまく予測できるか?
- RQ3低リソース(ミニデータセット)およびノイズ付きデータ条件下でのモデルの性能は、学習可能性と頑健性を示すか?
- RQ4グラフベースの再帰的ニューラルネットワークモデル(SE-Graph)は、さまざまなデータスケールおよびノイズレベルでも優れた性能を維持するか?
- RQ5WLCS-lは、文順序付けの整合性を評価する際、τよりも信頼性が高い指標と見なせるか?
主な発見
- WLCS-lは人間の判断と最も高い相関を示す(決定係数 = 0.665)、τ(決定係数 = 0.571)とAccuracy(決定係数 = 0.618)を顕著に上回る。
- 再帰的グラフニューラルネットワークベースのモデル(SE-Graph)は、学習可能性と頑健性に優れ、データ不足やノイズ注入下でも高い性能を維持する。
- 人的評価では、レビュアーが文の内在的複雑さに影響を受けることが判明し、これは整合性の認識を歪め、モデルの優位性を誤って印象づける要因となる可能性がある。
- 評価者間一致度は中程度(Krippendorff’s α = 0.53)であり、整合性評価は詳細なガイドラインがないと複雑で主観的であることが示された。
- SOTAモデルのSE-Graphは人的評価ではATTOrderNetよりわずかに劣っているが、これは実際の整合性品質の問題ではなく、複雑さの影響による可能性がある。
- 本研究では、WLCS-lがτよりも信頼性の高い自動指標であることが確認され、一対比較指標からシーケンスレベル指標への移行が有効であると示唆された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。