Skip to main content
QUICK REVIEW

[論文レビュー] Thematic Analysis with Open-Source Generative AI and Machine Learning: A New Method for Inductive Qualitative Codebook Development

Andrew Katz, Gabriella Coloyan Fleming|arXiv (Cornell University)|Sep 28, 2024
Artificial Intelligence in EducationComputer Science被引用数 3
ひとこと要約

本論文は、オープンソースの生成AIと機械学習を活用したGATOSワークフローを紹介する。この手法は、主題分析のための定性的コードブックを帰納的に生成するもので、既知の主題構造を持つ合成データセットにおいて、その構造と一致するテーマを信頼性高く同定することを示している。本研究は、大規模な社会科学分野の研究において、人的に手作業でコード化する方法に代わるスケーラブルで妥当な代替手法を提供する。

ABSTRACT

This paper aims to answer one central question: to what extent can open-source generative text models be used in a workflow to approximate thematic analysis in social science research? To answer this question, we present the Generative AI-enabled Theme Organization and Structuring (GATOS) workflow, which uses open-source machine learning techniques, natural language processing tools, and generative text models to facilitate thematic analysis. To establish validity of the method, we present three case studies applying the GATOS workflow, leveraging these models and techniques to inductively create codebooks similar to traditional procedures using thematic analysis. Specifically, we investigate the extent to which a workflow comprising open-source models and tools can inductively produce codebooks that approach the known space of themes and sub-themes. To address the challenge of gleaning insights from these texts, we combine open-source generative text models, retrieval-augmented generation, and prompt engineering to identify codes and themes in large volumes of text, i.e., generate a qualitative codebook. The process mimics an inductive coding process that researchers might use in traditional thematic analysis by reading text one unit of analysis at a time, considering existing codes already in the codebook, and then deciding whether or not to generate a new code based on whether the extant codebook provides adequate thematic coverage. We demonstrate this workflow using three synthetic datasets from hypothetical organizational research settings: a study of teammate feedback in teamwork settings, a study of organizational cultures of ethical behavior, and a study of employee perspectives about returning to their offices after the pandemic. We show that the GATOS workflow is able to identify themes in the text that were used to generate the original synthetic datasets.

研究の動機と目的

  • オープンソースの生成AIモデルが、社会科学分野の帰納的定性的コードブック開発を効果的に支援できるかどうかを調査すること。
  • 数千件のアンケート回答や何時間にもわたるインタビュー記録などの大量のテキストデータを扱う際の、手作業による主題分析のスケーラビリティの課題を解決すること。
  • GATOSワークフローの妥当性を検証するため、実世界の組織研究の文脈を模倣するように設計された合成データセットにおける既知の主題構造と照合して、生成されたコードブックを比較すること。
  • 人的に手作業でコード化するのを最小限に抑えつつ、主題の正確性を維持したまま、再現可能で透明性があり、費用対効果に優れた主題分析の方法を確立すること。
  • リtrieval-augmented generationとプロンプト工学が、AIが生成する定性的コードおよび主題の信頼性と一貫性をどのように向上させるかを検討すること。

提案手法

  • GATOSワークフローは、オープンソースの大規模言語モデル(LLM)、自然言語処理(NLP)ツール、およびリトリーブ・アンプリーブド・ジェネレーション(RAG)を統合し、帰納的コードブック生成を自動化する。
  • この手法は、従来の主題分析と同様の段階的プロセスに従う:データに慣れること、初期コードの生成、主題の特定、主題の見直しと精練、階層的コードブックの作成。
  • ブロウンとクラークの6段階主題分析フレームワークに基づいた明確な指示を用いたプロンプト工学により、LLMが構造的なコード化および主題同定タスクを遂行できるように誘導する。
  • テーマの顕著性、重複、研究質問との適合性を評価するためのリフレクション・プロンプトを用いて、コードの関連性と主題の一貫性を評価する。
  • JSON形式の出力構造により、最終的なコードブックの一貫性と機械可読性を保証し、テーマ名、関連する概念、関連コード、および関係性を含む。
  • このワークフローは、実世界の組織研究を模倣する3つの合成データセット(同僚からのフィードバック、倫理的組織文化、パンデミック後のオフィス復帰の見解)でテストされた。
Figure 1 : Data Generation Process
Figure 1 : Data Generation Process

実験結果

リサーチクエスチョン

  • RQ1オープンソースの生成AIモデルは、社会科学分野の定性的研究における人間の主題分析の帰納的プロセスをどの程度再現できるか。
  • RQ2GATOSワークフローは、合成データセットの事前に定義された主題構造と一致するテーマおよびサブテーマを信頼性高く同定できるか。
  • RQ3リトリーブ・アンプリーブド・ジェネレーションとプロンプト工学の統合は、AIが生成するコードブックの一貫性と主題的正確性をどのように向上させるか。
  • RQ4GATOSワークフローは、多様な組織研究の文脈において、意味的で重複のないテーマをどの程度効果的に同定できるか。
  • RQ5大規模なテキストコーパスに適用した場合、伝統的な手作業によるコード化と比較して、GATOSの方法はスケーラビリティ、一貫性、主題の忠実度の観点でどの程度優れているか。

主な発見

  • GATOSワークフローは、すべての3つの合成データセットにおいて、元のデータ生成に使われた既知の主題構造とよく一致するテーマを同定した。
  • AIが生成したコードブックは一貫性があり主題的関連性を示しており、テーマは研究の質問とデータの文脈を的確に反映していた。
  • テーマの顕著性と適合性を評価する構造化されたリフレクション・プロンプトのおかげで、重複または不要なコードの作成が効果的に削減された。
  • リトリーブ・アンプリーブド・ジェネレーションの統合により、モデルが関連するデータ抜粋に基づいてコードの提案を行う能力が向上し、文脈的正確性が向上した。
  • テーマとサブテーマの間の明確な関係性を持つ階層的コードブックが生成され、従来の方法で作成されたコードブックの構造を模倣した。
  • 結果から、熟練した専門家が設計したプロンプトとNLPパイプラインに従って、オープンソースの生成AIが、大規模な定性的研究における手作業による主題コード化の妥当でスケーラブルな代替手段として機能できる可能性が示された。
Figure 2 : Distribution of Simulated Response Lengths for Teammate Feedback
Figure 2 : Distribution of Simulated Response Lengths for Teammate Feedback

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。