[論文レビュー] Corpus of Chinese Dynastic Histories: Gender Analysis over Two Millennia
本稿では、2,000年間にわたる古典的中国語の文章をカバーする、24の中国王朝編年史から構成されるオープンソースのコーパスを紹介する。このコーパスは、性別言語の計算的分析を可能にする。キーワード分析を用いた性別固有語の分析により、男性語の優位性が歴史的に安定していることが明らかになり、時間的変化を扱う意味的分析に有用な意味的表現が得られた。
Chinese dynastic histories form a large continuous linguistic space of approximately 2000 years, from the 3rd century BCE to the 18th century CE. The histories are documented in Classical (Literary) Chinese in a corpus of over 20 million characters, suitable for the computational analysis of historical lexicon and semantic change. However, there is no freely available open-source corpus of these histories, making Classical Chinese low-resource. This project introduces a new open-source corpus of twenty-four dynastic histories covered by Creative Commons license. An original list of Classical Chinese gender-specific terms was developed as a case study for analyzing the historical linguistic use of male and female terms. The study demonstrates considerable stability in the usage of these terms, with dominance of male terms. Exploration of word meanings uses keyword analysis of focus corpora created for genderspecific terms. This method yields meaningful semantic representations that can be used for future studies of diachronic semantics.
研究の動機と目的
- 計算言語学の分野において低リソースである現在の古典的中国語の編年史の自由に利用可能なオープンソースコーパスの不足に対処すること。
- 体系的な言語的分析を可能にするために、古典的中国語の性別固有語の標準化されたリストの開発。
- 2,000年間にわたる歴史的文献における男性語と女性語の使用に関する時間的変化のパターンを調査すること。
- 焦点コーパスにおけるキーワード分析を通じて、性別言語語の意味的表現を生成すること。
- 再利用可能なライセンス付きコーパスを提供することで、将来的な研究を支援し、古典的中国語における意味的変化と歴史的語彙の研究を促進すること。
提案手法
- 紀元前3世紀から西暦18世紀までの期間をカバーする、24の中国王朝編年史から構成される2,000万文字を超えるコーパスの構築。
- 新たに作成された古典的中国語の性別固有語のリストを適用し、コーパス全体にわたる関連語彙を同定および抽出すること。
- キーワード・イン・コンテキスト(KWIC)およびキーワード分析技術を用いて、男性語と女性語の意味的プロファイルを検討すること。
- 性別固有語に焦点を当てたコーパスの作成により、意味的比較分析を可能にすること。
- 時間的経過に伴う意味的安定性と変化をモデル化するための計算言語学的手法の適用。
- 研究の再現可能性と再利用可能性を確保するため、コーパスをクリエイティブ・コモンズ・ライセンスのもとで公開すること。
実験結果
リサーチクエスチョン
- RQ1古典的中国語の編年史における性別固有語の使用は、2,000年間にわたってどのように変化してきたか?
- RQ2歴史的文献における男性語と女性語の語彙的・文法的使用において、どの程度の意味的安定性が見られるか?
- RQ3キーワード分析を用いて性別言語語の文脈的使用を分析した際に、どのような意味的パターンが浮き彫りになるか?
- RQ4性別言語語に焦点を当てたコーパスは、時間的変化を扱う意味的研究において、どのように意味的な表現を生み出すか?
- RQ5古典的中国語の歴史的物語における性別言語の構造的および語彙的特徴は何か?
主な発見
- コーパスは、あらゆる王朝時代にわたり男性語の優位性が一貫して支配的であることを示しており、長期にわたる言語的・文化的な非対称性を示している。
- 古典的中国語における性別固有語は、2,000年の期間にわたって使用パターンに顕著な安定性を示しており、意味的ずれは最小限に抑えられている。
- 焦点コーパスにおけるキーワード分析により、性別言語語の整合的な意味的表現が成功裏に生成された。これは、時間的変化研究におけるその有用性を裏付けている。
- 本研究は、古典的中国語のような低リソースな歴史的言語においても、計算手法が意味的パターンを効果的に抽出・分析できることを確認した。
- コーパスのオープンソース化により、歴史的中国語のテキストにおけるジェンダーと言語の包括的かつ大規模な分析が可能になった。
- 本プロジェクトは、将来的な研究の基盤を提供し、意味的変化、ジェンダー表現、東アジアの文献的伝統における歴史的言語表現に関する研究を促進する。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。