Skip to main content
QUICK REVIEW

[论文解读] JCoLA: Japanese Corpus of Linguistic Acceptability

Taiga Someya, Yushi Sugimoto|arXiv (Cornell University)|Sep 22, 2023
Topic ModelingComputer Science被引用 3
一句话总结

本稿では、教科書、ハンドブック、学術雑誌から手作業で抽出した10,020文の日本語文に、二値の受容可能性判断が付された、日本語コーパスJCoLAを紹介する。9種類の日本語言語モデルを評価した結果、一部のモデルはドメイン内(単純な)判断において人間を上回る性能を示したが、理論的に複雑な(ドメイン外)判断、特に動詞一致やNPIライセンスのような長距離の句構造的依存関係に対しては、人間の性能を上回るモデルは存在しなかった。

ABSTRACT

Neural language models have exhibited outstanding performance in a range of downstream tasks. However, there is limited understanding regarding the extent to which these models internalize syntactic knowledge, so that various datasets have recently been constructed to facilitate syntactic evaluation of language models across languages. In this paper, we introduce JCoLA (Japanese Corpus of Linguistic Acceptability), which consists of 10,020 sentences annotated with binary acceptability judgments. Specifically, those sentences are manually extracted from linguistics textbooks, handbooks and journal articles, and split into in-domain data (86 %; relatively simple acceptability judgments extracted from textbooks and handbooks) and out-of-domain data (14 %; theoretically significant acceptability judgments extracted from journal articles), the latter of which is categorized by 12 linguistic phenomena. We then evaluate the syntactic knowledge of 9 different types of Japanese language models on JCoLA. The results demonstrated that several models could surpass human performance for the in-domain data, while no models were able to exceed human performance for the out-of-domain data. Error analyses by linguistic phenomena further revealed that although neural language models are adept at handling local syntactic dependencies like argument structure, their performance wanes when confronted with long-distance syntactic dependencies like verbal agreement and NPI licensing.

研究动机与目标

  • 日本語言語モデルの包括的な句構造的評価データセットの不足に対処すること。
  • 教科書レベルの現象と理論的に重要な句構造的現象を反映した、言語学的にきめ細やかな受容可能性判断のコーパスを構築すること。
  • この新しいベンチマーク上で、9種類の多様な日本語言語モデルの句構造的知識を評価すること。
  • ニューラルモデルに見られる体系的な弱み、特に長距離の句構造的依存関係に関する弱みを特定すること。

提出的方法

  • コーパスは、言語学の教科書、ハンドブック、学術雑誌から10,020文を手作業で抽出することで構築された。
  • 文はドメイン内(86%)とドメイン外(14%)に分割され、後者は12の言語現象に分類された。
  • 各文に対して、専門の言語学者が二値の受容可能性判断を割り当てた。
  • 9種類の異なる種類の事前学習済み日本語言語モデルを微調整し、JCoLAベンチマーク上で評価した。
  • 性能は受容可能性予測の正答率で測定され、誤差分析は言語現象ごとに層別された。
  • 本研究では、モデルの性能を人間の判断と比較し、特にドメイン内とドメイン外データの差に注目した。

实验结果

研究问题

  • RQ1日本語言語モデルは、単純で教科書レベルの句構造的現象に関する受容可能性判断タスクで、人間水準またはそれ以上の性能を達成できるか?
  • RQ2日本語言語モデルは、学術文献に見られるより複雑で理論的に重要な句構造的現象に効果的に一般化できるか?
  • RQ3現在のニューラル言語モデルにとって、どの言語現象が最大の挑戦となるか?
  • RQ4言語モデルはどの程度、動詞一致やNPIライセンスのような長距離の句構造的依存関係を捉えられるか?
  • RQ5学習データにおける言語現象の分布が、モデルの性能にどのように影響するか?

主要发现

  • いくつかの言語モデルが、教科書やハンドブックからの単純な受容可能性判断を含むJCoLAのドメイン内サブセットで、人間の性能を上回った。
  • ドメイン外サブセット、すなわち学術雑誌からの理論的に重要な判断を含む部分では、どのモデルに対しても人間の性能を上回るものは存在しなかった。
  • 局所的な句構造的依存関係、たとえば項構造やフィラー・ギャップ現象のような、相対的に短距離の依存関係では、モデルの性能が良好であった。
  • 長距離の依存関係では性能が著しく低下し、特に動詞一致やNPI/NCIライセンスのような、文のスパンにわたって句構造的特徴を追跡する必要がある現象で困難をきたした。
  • 束縛(binding)の高精度は、そのカテゴリに好意的例が93.1%も占めるため、データの不均衡が性能に影響しているとされる。
  • JCoLAにおける言語現象の偏った分布、特に一部の現象について約10件程度の文しか存在しないことから、信頼できる評価やモデルの一般化が制限されている。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。