Skip to main content
QUICK REVIEW

[論文レビュー] Estimating Lexical Priors for Low-Frequency Syncretic Forms

R. Harald Baayen, Richard Sproat|ArXiv.org|Apr 24, 1995
Masonry and Concrete Structural Analysis参考文献 5被引用数 3
ひとこと要約

本稿では、頻度が低い合成語的形態素(syncretic forms)の語彙的事前確率を推定する最適な基盤として、コーパス内で一度しか出現しない語(hapax legomena)を提案する。hapax形式における機能の相対頻度を計算することで、未観測の形態的曖昧な語のタイプに対する頑健な推定器が得られ、特に低頻度状況下での事前確率推定の精度が著しく向上する。

ABSTRACT

Given a previously unseen form that is morphologically n-ways ambiguous, what is the best estimator for the lexical prior probabilities for the various functions of the form? We argue that the best estimator is provided by computing the relative frequencies of the various functions among the hapax legomena --- the forms that occur exactly once in a corpus. This result has important implications for the development of stochastic morphological taggers, especially when some initial hand-tagging of a corpus is required: For predicting lexical priors for very low-frequency morphologically ambiguous types (most of which would not occur in any given corpus) one should concentrate on tagging a good representative sample of the hapax legomena, rather than extensively tagging words of all frequency ranges.

研究の動機と目的

  • トレーニングコーパスに登場しない形態的曖昧で頻度が低い語形の語彙的事前確率を推定する課題に対処すること。
  • 未観測の合成語的形態素の関数(品詞や文法的役割など)の分布を信頼性を持って予測する方法を特定すること。
  • 高頻度語の手動タグ付けの必要性を減らし、hapax legomena の代表的サンプルに焦点を当てること。
  • 稀で未観測の語形を処理する際の確率的形態素タガーラの性能を向上させること。

提案手法

  • この手法は、コーパス内で一度しか出現しない語(hapax legomena)におけるさまざまな文法的機能の相対頻度を計算する。
  • hapax 形式における機能の分布が、未観測の低頻度形態的曖昧な形態の背後にある確率分布を反映していると仮定する。
  • hapax legomena が本質的に希少であるため、低頻度の形態的曖昧さにおける機能分布の代表的性質を有するとする事実を活用する。
  • これらの観察された頻度を、訓練データに存在しない形態素に対して確率的タグ付けフレームワークにおける語彙的事前確率として使用する。
  • 高頻度語の統計に依存するのを避け、これは希少な形態素に一般化できない可能性がある。
  • 特に、リソースが限られた状況下で、コーパス開発の初期段階における手動タグ付け作業に適している。

実験結果

リサーチクエスチョン

  • RQ1未観測で頻度が低い形態的曖昧な形態素の語彙的事前確率を推定するための最も効果的な推定器は何か?
  • RQ2あるコーパスに登場しない合成語的形態素の語彙的事前確率を信頼性を持って推定する方法は何か?
  • RQ3hapax legomena 内の機能分布が、低頻度の曖昧な形態素の真の事前分布の妥当な代理として機能できるか?
  • RQ4hapax legomena を用いることで、他の推定戦略と比較して確率的形態素タガーラの精度がどの程度向上するか?
  • RQ5語彙的事前確率の推定を向上させるために、高頻度語ではなくhapax legomenaに手動タグ付けを集中させる方が効率的か?

主な発見

  • hapax legomena 内の機能の相対頻度が、未観測で頻度が低い形態的曖昧な形態素の語彙的事前確率を推定する上で最も信頼性が高い推定器を提供する。
  • この手法は、特に希少な語形タイプにおいて、確率的形態素タガーラの事前確率推定を著しく向上させる。
  • 高頻度語の広範な手動タグ付けの必要性が減少し、hapax legomena が希少語形の機能的分布を十分に捉えるのに十分である。
  • この手法は、複数の文法的機能を持つ合成語的形態素(syncretic forms)に対して特に効果的であり、従来の頻度ベースの事前確率はこれに失敗する。
  • 実証的結果は、hapax legomena が低頻度の形態的曖昧さにおける事前確率推定のための安定的かつ代表的なサンプルであることを支持する。
  • この手法は、リソースが限られた状況下でも、より正確で効率的な初期コーパスアノテーションを可能にする。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。