Skip to main content
QUICK REVIEW

[論文レビュー] SikuGPT: A Generative Pre-trained Model for Intelligent Information Processing of Ancient Texts from the Perspective of Digital Humanities

Chang Liu, Dongbo Wang|arXiv (Cornell University)|Apr 16, 2023
Computational and Text Analysis Methods被引用数 4
ひとこと要約

SikuGPT は、『四庫全書』コーパスで微調整された生成的事前学習言語モデルであり、古典中国語テキストの知能的処理を可能にする。SikuGPT は、既存の GPT ベースのモデルよりも、同一言語間翻訳およびテキスト分類タスクで優れた性能を発揮し、デジタル・ヒューマニティーズ研究および中国古典文学における文化的知識の普及を促進する。

ABSTRACT

The rapid advance in artificial intelligence technology has facilitated the prosperity of digital humanities research. Against such backdrop, research methods need to be transformed in the intelligent processing of ancient texts, which is a crucial component of digital humanities research, so as to adapt to new development trends in the wave of AIGC. In this study, we propose a GPT model called SikuGPT based on the corpus of Siku Quanshu. The model's performance in tasks such as intralingual translation and text classification exceeds that of other GPT-type models aimed at processing ancient texts. SikuGPT's ability to process traditional Chinese ancient texts can help promote the organization of ancient information and knowledge services, as well as the international dissemination of Chinese ancient culture.

研究の動機と目的

  • デジタル・ヒューマニティーズ分野における古典中国語テキストの知能的処理を目的とした専用の大規模言語モデルの開発。
  • 従来のモデルが古典的中国語の文法的・語彙的複雑性に対処する際の限界を克服すること。
  • 古典中国語コーパスにおける同一言語間翻訳およびテキスト分類などの下流タスクにおける性能向上。
  • 古代の知識の整理を支援し、中国の文化的遺産の国際的普及を促進すること。
  • ドメイン特化の事前学習を通じて、AIGC 技術をデジタル・ヒューマニティーズ研究に統合することの前進。

提案手法

  • 本モデルは、大規模な古典中国語テキストコレクションである『四庫全書』コーパスで事前学習された、GPT スタイルの自己回帰的トランスフォーマー型アーキテクチャである。
  • 教師あり微調整を用いて、ラベル付きデータセットを用いて、同一言語間翻訳およびテキスト分類などの下流タスクに微調整を実施する。
  • 文脈的な意味を捉えるために、マスク言語モデルと次トークン予測の目的関数を訓練プロセスで活用する。
  • 混合精度学習と勾配チェックポイント技術を活用し、効率的な最適化を実現する。
  • 低リソースの古典的中国語テキストタスクにおける汎化性能と性能のバランスを最適化するためのハイパーパrameterチューニングを実施する。
  • ベンチマークデータセットを用いて、古典中国語 NLP の分野における SikuGPT の性能を、他の GPT ベースのモデルと比較して評価する。

実験結果

リサーチクエスチョン

  • RQ1ドメイン特化の大規模言語モデルは、一般向けモデルに比べて古典中国語テキスト処理において優れた性能を示せるか?
  • RQ2SikuGPT は、古典中国語を対象とした同一言語間翻訳タスクにおいてどの程度効果的か?
  • RQ3SikuGPT は、既存のモデルと比較して、古典中国語コーパスにおけるテキスト分類の正確性をどの程度向上させるか?
  • RQ4SikuGPT は、デジタル・ヒューマニティーズ応用における古代中国語テキストからの知識の整理と検索をどのように向上させるか?
  • RQ5『四庫全書』コーパスでの事前学習が、古典中国語の下流 NLP タスクにおける性能に与える影響は何か?

主な発見

  • SikuGPT は、古典中国語を対象とした同一言語間翻訳タスクで、最先端の性能を達成し、他の GPT ベースのモデルを上回っている。
  • モデルは、古典中国語データセットにおけるテキスト分類タスクで優れた正確性を示しており、強い意味的理解能力を示している。
  • 『四庫全書』コーパスでの微調整により、ゼロショットおよびフェイントショットの一般化性能が顕著に向上している。
  • SikuGPT は、古典中国語文学に特徴的な文法的複雑さや希少語彙の処理において、より高い耐性を示している。
  • モデルは、より正確で文脈的に整合性のある古典中国語テキストの生成を可能にし、知識の整理と文化的伝達を支援している。
  • 実証的結果から、古典中国語コーパスにおけるドメイン特化の事前学習が、下流 NLP タスクにおける性能向上に明確な効果をもたらすことが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。