Skip to main content
QUICK REVIEW

[論文レビュー] The Hebrew Bible as Data: Laboratory - Sharing - Experiences

Dirk Roorda|arXiv (Cornell University)|Jan 8, 2015
Digital Humanities and Scholarship参考文献 3被引用数 4
ひとこと要約

本稿では、Linguistic Annotation Framework (LAF) に基づき、Python を用いた科学的計算によって駆動される ETCBC のヘブライ聖書テキストデータベースを対象とする、公開可能でウェブベースの照会システムである SHEBANQ を提示する。研究者はドメイン固有の照会言語(MQL)を用いて、言語的照会を生成・保存・共有・再現可能にできる。これにより、ヘブライ聖書に関するデジタル・ヒューマニティーズ研究における再現可能性と学際的協働が促進される。

ABSTRACT

The systematic study of ancient texts including their production, transmission and interpretation is greatly aided by the digital methods that started taking off in the 1970s. But how is that research in turn transmitted to new generations of researchers? We tell a story of Bible and computer across the decades and then point out the current challenges: (1) finding a stable data representation for changing methods of computation; (2) sharing results in inter- and intra-disciplinary ways, for reproducibility and cross-fertilization. We report recent developments in meeting these challenges. The scene is the text database of the Hebrew Bible, constructed by the Eep Talstra Centre for Bible and Computer (ETCBC), which is still growing in detail and sophistication. We show how a subtle mix of computational ingredients enable scholars to research the transmission and interpretation of the Hebrew Bible in new ways: (1) a standard data format, Linguistic Annotation Framework (LAF); (2) the methods of scientific computing, made accessible by (interactive) Python and its associated ecosystem. Additionally, we show how these efforts have culminated in the construction of a new, publicly accessible search engine SHEBANQ, where the text of the Hebrew Bible and its underlying data can be queried in a simple, yet powerful query language MQL, and where those queries can be saved and shared.

研究の動機と目的

  • 異なる分野間でヘブライ聖書に関する計算的リサーチの共有と再現性を確保する課題に対処すること。
  • ヘブライ聖書の言語的アノテーションの保存・照問・共有を可能にする持続可能なオープンインfraストラクチャを構築すること。
  • 神学的研究者、計算言語学者、学生の間のギャップを、アクセス可能で共有可能な照問ワークフローによって埋めること。
  • オープンスタンダードと科学的計算ツールを用いた、歴史言語学的研究のための現代的なデータラボを構築すること。
  • 機関のアーカイブとバージョン管理を活用して、ETCBC の言語的データとメソドロジーの長期的保存とアクセス可能性を確保すること。

提案手法

  • ヘブライ聖書の言語的アノテーションのための安定的で標準化されたデータフォーマットとして、Linguistic Annotation Framework (LAF) を採用すること。
  • ヘブライ聖書のテキストにおける言語的パターンを照会するドメイン固有の照問言語(MQL)を備えたウェブアプリケーション、SHEBANQ を構築すること。
  • 照問の保存・共有メカニズムを実装し、研究者間での再現可能性と協働的知識構築を促進すること。
  • LAFリソースの分析・操作を支援するツール、LAF-Fabric を開発すること。
  • Python や GitHub などのオープンソースソフトウェアエコシステムを活用し、非専門家プログラマーにもアクセス可能で拡張性のある環境を実現すること。
  • ETCBC のデータとドキュメンテーションを、信頼できる研究データリポジトリ DANS にアーカイブし、長期的保存とアクセスを確保すること。

実験結果

リサーチクエスチョン

  • RQ1ヘブライ聖書の言語的アノテーションは、進化する計算手法をサポートする安定的で機械処理可能なフォーマットとして、どのように表現できるか?
  • RQ2多様な学術コミュニティ間で、効果的に言語的照問を共有・再現可能にするメカニズムとは何か?
  • RQ3ウェブベースのシステムは、複雑なテクストデータを照問する際、聖書学者と計算言語学者の両方を満足させるように、どのように設計できるか?
  • RQ4オープンスタンダードとオープンソースソフトウェアは、持続可能で協働的なデジタル・ヒューマニティーズ研究をどのように促進するか?
  • RQ5機関リポジトリとバージョン管理システムは、デジタル聖書学の長期的アクセス可能性と信頼性をどのように高めるか?

主な発見

  • SHEBANQ システムは、MQL 言語を用いた使いやすい照問インターフェースを通じて、ヘブライ聖書の言語的データへの公開アクセスを成功裏に実現した。
  • LAF 標準の採用により、進化する計算ニーズをサポートする安定的かつ相互運用可能なデータモデルが実現された。
  • LAF-Fabric の統合により、機能頻度の自動分析とアノテーションの一貫性検証が可能になった。
  • プロジェクトは初期段階での採用を達成しており、非ゼロのアクセスログと、神学的および計算言語学コミュニティからの関心の増加が証明されている。
  • GitHub を用いたコード共有と DANS を用いたデータアーカイブにより、ソフトウェアおよびデータの透明性・バージョン管理・永続的アクセスが実現された。
  • 研究者が商業ソフトウェアベンダーよりも独立して、共有可能なデジタル研究インfraストラクチャを構築・維持できることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。