Skip to main content
QUICK REVIEW

[論文レビュー] Text Segmentation Based on Similarity between Words

Hideki Kozima|ArXiv.org|Jan 23, 1996
Natural Language Processing Techniques参考文献 3被引用数 4
ひとこと要約

本稿では、意味ネットワークを通じた語の類似度を測定することによって、一貫性のあるテキストセグメントを同定する新しいテキスト分割手法である語彙的結束プロファイル(LCP)を紹介する。人間によるアノテーション済みセグメントと比較したところ、LCPは人間の判断と強い相関を示し、話題の境界を検出する強固な手法を提供するとともに、代名詞の解消や省略の解消を支援する。

ABSTRACT

This paper proposes a new indicator of text structure, called the lexical cohesion profile (LCP), which locates segment boundaries in a text. A text segment is a coherent scene; the words in a segment are linked together via lexical cohesion relations. LCP records mutual similarity of words in a sequence of text. The similarity of words, which represents their cohesiveness, is computed using a semantic network. Comparison with the text segments marked by a number of subjects shows that LCP closely correlates with the human judgments. LCP may provide valuable information for resolving anaphora and ellipsis.

研究の動機と目的

  • テキストセグメント境界を特定するための客観的で計算的に根拠のある指標を開発すること。
  • 語の類似度を用いた語彙的結束を、語の並びの関数としてモデル化すること。
  • 話題分析を支援し、代名詞の解消や省略の解消を可能にするツールを提供すること。
  • 妥当性と信頼性を検証するため、人間によるアノテーション済みテキストセグメントと比較して本手法を評価すること。
  • 意味ネットワークに基づく語の類似度が、人間の一貫性認識と強く相関することを示すこと。

提案手法

  • テキストシーケンス内の連続する語同士の相互類似度を記録する語彙的結束プロファイル(LCP)を構築する。
  • 意味ネットワークを用いて語の類似度を計算し、語のペア間の語彙的結束を捉える。
  • 類似度の著しい低下が見られる箇所を検出し、潜在的なセグメント境界を特定する。
  • 比較と検証のための基準として、人間によるアノテーション済みテキストセグメントを用いる。
  • 構文的構造ではなく、意味的関係に基づいて結束を定量的に評価する計算モデルを採用する。
  • 語の類似度を表現・計算するために、事前に定義された意味ネットワークに依存する。

実験結果

リサーチクエスチョン

  • RQ1意味ネットワークを用いた語の類似度測定が、テキストセグメント境界を信頼性高く示すことができるか。
  • RQ2LCPは人間が特定したテキストセグメントとどの程度相関するか。
  • RQ3LCPは話題における代名詞の解消や省略の解消をどの程度支援できるか。
  • RQ4構文的または統計的手法に比べて、意味的類似度に基づく語彙的結束はセグメント検出において優れているか。
  • RQ5テキストシーケンス全体にわたる語の類似度プロファイルは、話題の一貫性を効果的にモデル化できるか。

主な発見

  • 語彙的結束プロファイル(LCP)は人間によるアノテーション済みセグメントと強い相関を示し、セグメント境界の特定指標としての妥当性を裏付けている。
  • LCPは、語の類似度の低下を検出することで、話題境界を効果的に捉えている。
  • 本手法は、意味的類似度がテキスト内での語彙的結束の信頼できる代理指標であることを示している。
  • LCPは、自然言語処理における代名詞の解消や省略の解消を支援する貴重な構造的情報を提供する。
  • 構文的または統計的手法に比べ、意味的関係を活用することで本手法は優れた性能を示している。
  • 結果から、意味ネットワークを用いて計算された語の類似度が、人間のテキストの一貫性認識を高い精度でモデル化できることを確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。