Skip to main content
QUICK REVIEW

[論文レビュー] iLCM - A Virtual Research Infrastructure for Large-Scale Qualitative Data

Andreas Niekler, Arnim Bleier|arXiv (Cornell University)|May 11, 2018
Computational and Text Analysis Methods参考文献 14被引用数 6
ひとこと要約

iLCMは、大規模なテキスト解析を可能にするソフトウェアとしてのサービス(SaaS)仮想研究基盤を提供する。この基盤は、ルーデス・コーパス・マイナー(LCM)とオープン・リサーチ・コンピューティング(ORC)環境を統合しており、計算的社会科学およびデジタル・ヒューマニティーズ分野における非構造的および構造的データの再現可能で混合手法による分析を可能にする。システムは、GUIを介した非技術的ユーザーと、コードベースのワークフローを介した上級ユーザーの両方をサポートしており、分析パイプラインの共有と再利用を可能にする中央リポジトリを備えている。

ABSTRACT

The iLCM project pursues the development of an integrated research environment for the analysis of structured and unstructured data in a "Software as a Service" architecture (SaaS). The research environment addresses requirements for the quantitative evaluation of large amounts of qualitative data with text mining methods as well as requirements for the reproducibility of data-driven research designs in the social sciences. For this, the iLCM research environment comprises two central components. First, the Leipzig Corpus Miner (LCM), a decentralized SaaS application for the analysis of large amounts of news texts developed in a previous Digital Humanities project. Second, the text mining tools implemented in the LCM are extended by an "Open Research Computing" (ORC) environment for executable script documents, so-called "notebooks". This novel integration allows to combine generic, high-performance methods to process large amounts of unstructured text data and with individual program scripts to address specific research requirements in computational social science and digital humanities.

研究の動機と目的

  • 計算的社会科学およびデジタル・ヒューマニティーズ分野における、大規模な定性的テキストデータのスケーラブルで再現可能な分析の増大するニーズに対応すること。
  • 一般的なテキストマイニングツールを用いる非技術的研究者と、カスタム分析スクリプトを必要とする上級ユーザーの間のギャップを埋めること。
  • 実行可能で文書化されたプロセスを備えた中央リポジトリを通じて、テキスト分析ワークフローの再現可能性と再利用可能性を向上させること。
  • 非構造的テキスト解析と構造的データ処理を統合した一貫した環境で、混合手法研究を支援すること。
  • 過去のプロトタイプ導入からのユーザーのフィードバックに基づき、使いやすさの向上と分析能力の拡張を図ること。

提案手法

  • ルーデス・コーパス・マイナー(LCM)は、標準的なテキストマイニング手法を用いて、ニュースコーパスなどの大規模なテキストコレクションを前処理および分析するためのブラウザベースのGUIを提供する。
  • LCMは、キーワード抽出、頻度および共起分析、固有表現認識、トピックモデリングなどの非構造的テキストに対する分析をサポートする。
  • オープン・リサーチ・コンピューティング(ORC)コンponentsは、構造的データのためのインタラクティブなノートブックでカスタム分析スクリプトを書くことと実行することを可能にする。
  • LCMや外部ソース(例:メタデータ、アンケートデータ)からの構造的データをORC環境にインポートし、統計的およびネットワーク解析を実行できる。
  • LCMとORCの統合により、一貫した再現可能なワークフロー内で、生テキストから構造的データ分析に至るまでのエンドツーエンドの分析が可能になる。
  • 中央リポジトリは、ノートブック、データ、結果、およびドキュメントを格納し、研究プロセスの透明性、共有、再利用を保証する。

実験結果

リサーチクエスチョン

  • RQ1ニュース、ソーシャルメディア、議会記録からの大規模な定性的データは、どのように再現可能でスケーラブルな方法で分析可能か?
  • RQ2GUIベースのテキストマイニングとコードベースの分析を組み合わせたハイブリッドアーキテクチャは、社会科学研究における多様なユーザーの専門知識をどの程度支援できるか?
  • RQ3テキストマイニングと構造的データ解析をどのように統合することで、計算的社会科学における混合手法研究を支援できるか?
  • RQ4デジタル・ヒューマニティーズおよび社会科学分野で大規模なテキスト分析ツールを用いる研究者が満たすべき使いやすさと手法的要件は何か?
  • RQ5実行可能ノートブックと中央集権的バージョン管理を通じて、テキスト分析ワークフローの再現性をどのように向上できるか?

主な発見

  • iLCM基盤は、大規模なテキスト解析のためのLCMと、カスタムスクリプト実行のためのORC環境を効果的に統合しており、広範なアクセス性と高度な分析能力を両立している。
  • システムは、データ、コード、結果、ドキュメントを含む完全な分析ワークフローを中央ノートブックリポジトリに保存することで、再現可能な研究を支援している。
  • ウィキペディアの生物関連項目におけるジェンダーバイアス分析や、経済政策レポートにおけるトピック・人物ネットワーク分析といったユースケースは、プラットフォームが複雑な現実世界の研究課題を処理できる能力を示している。
  • GUIベースのLCMにより、プログラミング経験のないユーザーも、ニューヨーク・タイムズコーパスのような大規模コーパスに対してキーワード抽出やトピックモデリングといった主要なテキストマイニングタスクを実行できる。
  • ORCコンponentは、LCMの出力から得られるネットワーク構造やトピックの共起関係に対する細かく洗練された分析を上級ユーザーが行えるようにし、仮説検証や統計的妥当性の検証を支援する。
  • プロトタイプの初期ユーザーからのフィードバックは、二重構成アーキテクチャが、計算的熟練度に差がある研究者を効果的に支援していることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。