Skip to main content
QUICK REVIEW

[論文レビュー] Information content versus word length in natural language: A reply to Ferrer-i-Cancho and Moscoso del Prado Martin [arXiv:1209.1751]

Steven T. Piantadosi, Harry Tily|arXiv (Cornell University)|Jul 25, 2013
Language and cultural evolution被引用数 6
ひとこと要約

本稿は、Ferrer-i-CanchoとMoscoso del Prado Martinが提唱する、言語における語長と情報含量(驚異度)の線形的関係が、ランダムタイピングモデルの統計的偶発的結果であるという主張に反論している。ランダムタイピングモデルは根本的に誤りであり、頻度と驚異度を同一視し、語彙的表現を考慮しないばかりか、行動的およびコーパス的証拠と矛盾しており、話者が予測可能な文脈で短い形を好む傾向があることから、コミュニケーション効率が語長の背後にある真の要因であると主張する。

ABSTRACT

Recently, Ferrer i Cancho and Moscoso del Prado Martin [arXiv:1209.1751] argued that an observed linear relationship between word length and average surprisal (Piantadosi, Tily, & Gibson, 2011) is not evidence for communicative efficiency in human language. We discuss several shortcomings of their approach and critique: their model critically rests on inaccurate assumptions, is incapable of explaining key surprisal patterns in language, and is incompatible with recent behavioral results. More generally, we argue that statistical models must not critically rely on assumptions that are incompatible with the real system under study.

研究の動機と目的

  • 自然言語における語長と驚異度の間の観察された線形的関係が、ランダムタイピングモデルの統計的偶発的結果であるという主張を反証すること。
  • ランダムタイピングモデルが、語彙的表現や認知的処理といった人間言語の核となる性質と整合しないことを示すこと。
  • 頻度を部分的に除去した後でも、驚異度(情報含量)が頻度よりも語長のより良い予測子であることを示すこと。
  • コミュニケーション効率が語長を規定する役割を支持する独立した行動的およびコーパス的証拠を提示すること。

提案手法

  • F&Mのランダムタイピングモデルを批判し、それが頻度と驚異度を混同しており、語長の2つの予測子を区別できないことの証明。
  • PT&Gの元々の発見の分析において、驚異度が頻度よりも語長をよりよく予測すること、部分相関においても同様であることを強調。
  • 非パラメトリック相関と10〜11の言語にわたる複数のコーパスを用いて、驚異度-語長関係の強固さを検証。
  • 話者が予測可能な文脈で短い形を好むという行動的研究のレビューにより、生産ベースの最適化メカニズムを支持する証拠を提示。
  • ランダムタイピングモデルと現実の言語システムの比較を行い、語レベルの記憶と音声的短縮を捉えられていないことを強調。
  • モデルは言語の因果構造、特に意味、表現、意図的コミュニケーションの役割を反映する必要があるが、表面的な統計を模倣するだけでは不十分であると主張。

実験結果

リサーチクエスチョン

  • RQ1文字を独立してサンプリングすることで語を生成するランダムタイピングモデルが、自然言語における語長と情報含量の間の観察された線形的関係を真に説明できるか?
  • RQ2頻度を制御した後でも、驚異度が語長の頻度よりも優れた予測子であるか?
  • RQ3行動的研究は、予測可能な文脈で話者が短い形を好むという仮説を支持するか?(コミュニケーション効率理論が予測する通り)
  • RQ4自然言語における統計的パターン、例えば語長と予測可能性は、ランダムタイピングモデルで説明可能か?それとも、コミュニケーション最適化のメカニズムを必要とするか?
  • RQ5ランダムタイピングモデルは、語が記憶された単位としての心理的現実や、語用的短縮のパターンを説明できるか?

主な発見

  • 10〜11の言語にわたる分析において、頻度を部分的に除去した後でも、驚異度(文脈内での負の対数確率)が頻度よりも語長をよりよく予測しており、情報含量が語長のより強い決定要因であることを示している。
  • F&Mが提唱するランダムタイピングモデルでは、頻度と驚異度が数学的に同一であるため、モデルは両者を区別できず、PT&Gの核心的発見(驚異度が優れた予測子である)を再現できない。
  • 行動的研究では、話者が予測可能な文脈で短い形(例:'don’t' と 'do not')を好む傾向が確認されており、これはコミュニケーション効率が語形選択に影響を及けるという証拠として独立して支持される。
  • コーパス的証拠は、短縮形(contractions)が予測可能な文脈でより頻出することを確認しており、音声的短縮が語彙的表現に統合されているという仮説を支持している。
  • ランダムタイピングモデルは、語が記憶された単位としての心理的現実を再現できず、類似語対や音声的短縮パターンの存在を説明できない。
  • ランダムタイピングの核心的仮定(語は成分の確率的選択によって生成される)は、意味に基づき、コミュニケーション効率を考慮して語が能動的に選択される人間言語とは整合しない。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。