[論文レビュー] LLM-in-the-loop: Leveraging Large Language Model for Thematic Analysis
本稿では、GPT-3.5 などの大規模言語モデル(LLM)を人間のコーダーと統合することで、質的研究における主題分析(TA)を簡素化する LLM-in-the-loop フレームワークを提案する。文脈内学習と反復的ディスカッションプロンプトを用いることで、人間とLLMの合意度 κ = 0.87(Music Shuffle)および κ = 0.81(Password Manager)を達成する高品質なコードブックを生成し、人間のみによる性能と同等またはそれを上回る結果を得るとともに、作業負荷と時間の消費を削減する。
Thematic analysis (TA) has been widely used for analyzing qualitative data in many disciplines and fields. To ensure reliable analysis, the same piece of data is typically assigned to at least two human coders. Moreover, to produce meaningful and useful analysis, human coders develop and deepen their data interpretation and coding over multiple iterations, making TA labor-intensive and time-consuming. Recently the emerging field of large language models (LLMs) research has shown that LLMs have the potential replicate human-like behavior in various tasks: in particular, LLMs outperform crowd workers on text-annotation tasks, suggesting an opportunity to leverage LLMs on TA. We propose a human-LLM collaboration framework (i.e., LLM-in-the-loop) to conduct TA with in-context learning (ICL). This framework provides the prompt to frame discussions with a LLM (e.g., GPT-3.5) to generate the final codebook for TA. We demonstrate the utility of this framework using survey datasets on the aspects of the music listening experience and the usage of a password manager. Results of the two case studies show that the proposed framework yields similar coding quality to that of human coders but reduces TA's labor and time demands.
研究の動機と目的
- 従来の主題分析(TA)が複数の人間コーダーを必要とする作業負荷が大きく、時間もかかるという点を解決すること。
- 大規模言語モデル(LLM)が、高品質なコーディングを維持しながら、人間のコーダーの補完的・代替的役割を果たせるかどうかを検討すること。
- BraunとClarke(2006)のTA手順に準拠した構造的ディスカッションプロンプトを通じて、コードブックの反復的精錬を可能にする人間–LLM協働フレームワークを設計すること。
- LLMの入力長制限に対処するため、品質を損なわずに部分的なデータを用いてコードブックの開発を行う手法を検討すること。
- 実世界のアンケートデータセットを用いてフレームワークを検証し、人間のみによるTAと同等の実行可能性と性能を示すこと。
提案手法
- フレームワークは、文脈内学習(ICL)を用いて、初期コード抽出からコードブックの精錬に至るまで、主題分析の各段階をLLMにガイドする。
- 人間コーダーとLLMが、事前に定義されたプロンプトを用いてループ形式のディスカッションを繰り返し行い、代表的なコードとテーマの合意形成を段階的に精錬する。
- LLMは、研究課題に基づいて自由記述応答から初期コードを生成し、類似コードをテーマ的カテゴリーにグループ化する。
- フレームワークは二段階のプロセスを採用する:入力長制限を考慮して部分データを用いたコードブック生成、その後にサンプリングされた応答を対象に最終コーディングとインナーアノテーター間一致度(IAA)の計算を行う。
- BraunとClarke(2006)のTA手順の各段階(熟悉、初期コード化、テーマ開発、レビュー)に特化したプロンプトを設計している。
- GPT-3.5 をマシンコーダー(MC)として活用し、人間コーダー(HC)が出力を検証・精錬することで、研究目的およびデータの意味論と整合するよう保証する。

実験結果
リサーチクエスチョン
- RQ1大規模言語モデル(LLM)は、人間コーダーの補完的・代替的役割として、主題分析を効果的に支援できるか。
- RQ2人間–LLM協働フレームワークをどのように構築すれば、主題分析における高品質・信頼性の高いコードブック生成を実現できるか。
- RQ3LLM統合が、従来の人間のみによるコーディングと比較して、アノテーター間一致度(IAA)にどのような影響を与えるか。
- RQ4長大な質的データセットを処理する際、LLMの入力長制限に対処するにはどうすればよいか。
- RQ5文脈内学習と反復的ディスカッションプロンプトの使用が、主題分析におけるコードブックの品質と一貫性を向上させるか。
主な発見
- Music Shuffle ケーススタディにおいて、LLM-in-the-loop フレームワークは加重Cohenのκ = 0.87 を達成し、元の人のみによる合意度(κ = 0.66)を上回った。
- Password Manager ケーススタディでは、フレームワークがκ = 0.81を達成し、元の人のみによる合意度(κ = 0.77)を上回った。
- 人間とLLMによる協働で生成されたコードブックは、元の人間が作成したコードブックと高い意味的類似度(コサイン類似度 0.8864 および 0.8895)を示した。
- フレームワークは、初期コード化の自動化と人間とLLM間の効率的ディスカッションを可能にすることで、主題分析に要する時間と作業負荷を顕著に削減した。
- 部分的なデータを用いたコードブック開発は、LLMの入力長制限に対する実用的解決策であることが判明し、コードブックの品質に顕著な低下は認められなかった。
- 主題分析に内在する主観性にもかかわらず、反復的ディスカッションプロセスにより、人間とLLMコーダー間のバイアス低減と一貫性向上が図られた。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。