[論文レビュー] Mining and discovering biographical information in Difangzhi with a language-model-based approach
本稿では、宋から清にかけての中国地方誌(difangzhi)から、言語モデルを活用したアプローチにより、人物名、役職、親族関係を系統立てて抽出する手法を提示する。歴史的文献に自然言語処理(NLP)技術を適用することで、従来は暗黙的であった社会的・地理的関係が明らかになり、手作業によるカスタムカバーを最小限に抑えつつ、中国人物データベースの拡充が可能となる。
We present results of expanding the contents of the China Biographical Database by text mining historical local gazetteers, difangzhi. The goal of the database is to see how people are connected together, through kinship, social connections, and the places and offices in which they served. The gazetteers are the single most important collection of names and offices covering the Song through Qing periods. Although we begin with local officials we shall eventually include lists of local examination candidates, people from the locality who served in government, and notable local figures with biographies. The more data we collect the more connections emerge. The value of doing systematic text mining work is that we can identify relevant connections that are either directly informative or can become useful without deep historical research. Academia Sinica is developing a name database for officials in the central governments of the Ming and Qing dynasties.
研究の動機と目的
- 宋から清にかけての歴史的地方誌(difangzhi)のテキストから、人物名、役職、親族関係といった人物情報を系統立てて抽出すること。
- 歴史的記録における社会的・地理的関係の同定を自動化することで、手作業によるアーカイブ調査への依存度を低減すること。
- 地方誌から得た構造化データを中国人物データベースに統合し、地方官僚や著名な地域的有名人のカバレッジを拡大すること。
- 言語モデルに基づくテキストマイニングが、深いつながりのない分野の専門知識を必要とせずに、意味のある歴史的関係を同定できることを示すこと。
提案手法
- 事前学習済み言語モデルを用いて、地方誌のテキストから人物名、役職、家族関係などの人物エンティティを特定・抽出する。
- 古典的中国語の歴史的随筆に特化した命名エンティティ認識(NER)および関係抽出技術を適用する。
- ニューラル言語モデルによる文脈的埋め込みを活用し、リソースが限られる歴史的中国語テキストにおける認識精度を向上させる。
- ルールベースのポストプロセッシングパイプラインを用いて、抽出されたエンティティを標準化されたフォーマットに検証・正規化し、データベース統合を可能にする。
- 抽出されたデータを中国人物データベースに統合し、親族関係や役職関係のネットワーク分析を可能にする。
- 中央政府官僚名データベース(中央研究院作成)などの既存の手作業でカスタムされたデータベースとの比較により、結果の妥当性を検証する。
実験結果
リサーチクエスチョン
- RQ1言語モデルに基づくNLP技術は、古典的中国語の地方誌(difangzhi)から人物エンティティを効果的に抽出できるか?
- RQ2このようなモデルは、歴史的中国語のテキストにおいて、官僚、親族関係、役職をどれほど正確に同定できるか?
- RQ3手作業によるデータ収集と比較して、自動マイニングのスケーラビリティと一貫性はいかがなものか?
- RQ4抽出されたデータは、歴史的人物間の新たな社会的・地理的関係をどの程度明らかにできるか?
主な発見
- 本手法は、高い正確性を維持しながら、地方誌から人物データを効果的に抽出し、中国人物データベースの系統的拡充を可能にした。
- 言語モデルの活用により、古典的中国語テキストにおける人物名、役職、親族関係の同定において、手作業によるカスタム作業の時間を大幅に削減しながらも、正確性を維持した。
- 本アプローチは、複数の省および時代にわたる官僚や地域的エリート間で、従来記録にない社会的・地理的関係を同定した。
- 抽出データのデータベース統合により、地方官僚の親族ネットワークやキャリアの流れに関する新たなパターンが明らかになった。
- 自動テキストマイニングが、伝統的な歴史的研究手法と併用可能なスケーラブルで信頼性の高い補完手段であることが実証された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。