[论文解读] LLM-in-the-loop: Leveraging Large Language Model for Thematic Analysis
本文提出了一种 LLM-in-the-loop 框架,将 GPT-3.5 等大型语言模型(LLMs)与人类编码员结合,以简化定性研究中的主题分析(TA)。通过上下文学习和迭代式讨论提示,该框架生成了高质量的代码本,人类与 LLM 的一致性系数 κ = 0.87(Music Shuffle)和 κ = 0.81(Password Manager),在质量上匹配或超过纯人工表现,同时显著降低了人力与时间成本。
Thematic analysis (TA) has been widely used for analyzing qualitative data in many disciplines and fields. To ensure reliable analysis, the same piece of data is typically assigned to at least two human coders. Moreover, to produce meaningful and useful analysis, human coders develop and deepen their data interpretation and coding over multiple iterations, making TA labor-intensive and time-consuming. Recently the emerging field of large language models (LLMs) research has shown that LLMs have the potential replicate human-like behavior in various tasks: in particular, LLMs outperform crowd workers on text-annotation tasks, suggesting an opportunity to leverage LLMs on TA. We propose a human-LLM collaboration framework (i.e., LLM-in-the-loop) to conduct TA with in-context learning (ICL). This framework provides the prompt to frame discussions with a LLM (e.g., GPT-3.5) to generate the final codebook for TA. We demonstrate the utility of this framework using survey datasets on the aspects of the music listening experience and the usage of a password manager. Results of the two case studies show that the proposed framework yields similar coding quality to that of human coders but reduces TA's labor and time demands.
研究动机与目标
- 为解决传统主题分析(TA)依赖多名人类编码员所带来的高人力投入与耗时问题。
- 探究大型语言模型(LLMs)是否能够有效支持或替代人类编码员进行 TA,同时保持高质量编码。
- 设计一种人机协作框架,通过结构化讨论提示实现代码本的迭代优化。
- 通过使用部分数据进行代码本开发,解决 LLM 输入长度限制问题,同时不降低质量。
- 在真实世界调查数据集上验证该框架,证明其可行性与性能可媲美纯人工 TA。
提出的方法
- 该框架利用上下文学习(ICL)引导 LLM 完成主题分析的每一步,包括初始编码提取与代码本优化。
- 人类编码员与 LLM 通过预设提示进行循环式讨论,迭代优化并达成一致的代表性编码与主题。
- LLM 基于研究问题从自由文本响应中生成初始编码,随后将相似编码归类为主题类别。
- 该框架采用两阶段流程:首先使用数据子集生成代码本(以控制输入长度),随后在抽样响应上进行最终编码与编码者内一致性(IAA)计算。
- 提示语针对 Braun 和 Clarke(2006)TA 程序的每个阶段进行专门设计,包括熟悉数据、初始编码、主题构建与审查。
- 该方法利用 GPT-3.5 作为机器编码员(MC),人类编码员(HCs)负责验证与优化输出,以确保与研究目标和数据语义的一致性。

实验结果
研究问题
- RQ1大型语言模型(LLM)能否有效支持或替代人类编码员进行主题分析?
- RQ2如何构建人机协作框架,以确保主题分析中生成高质量、可靠的代码本?
- RQ3LLM 集成对编码者间一致性(IAA)的影响如何,相较于传统纯人工编码?
- RQ4在处理长篇定性数据集时,如何应对 LLM 的输入长度限制?
- RQ5使用上下文学习与迭代式讨论提示是否能提升主题分析中代码本的质量与一致性?
主要发现
- 在 Music Shuffle 案例研究中,LLM-in-the-loop 框架实现了加权 Cohen’s kappa 系数 0.87,超过原始纯人工一致性(κ = 0.66)。
- 在 Password Manager 案例研究中,框架实现了 kappa 系数 0.81,超过原始纯人工一致性(κ = 0.77)。
- 人机协作生成的代码本与原始人工生成代码本在语义上高度相似(余弦相似度分别为 0.8864 和 0.8895)。
- 该框架通过自动化初始编码并促进人机间高效讨论,显著减少了主题分析所需的时间与人力。
- 使用部分数据进行代码本开发被证明是应对 LLM 输入长度限制的可行方案,且未造成代码本质量的显著下降。
- 尽管主题分析本身具有固有主观性,但迭代式讨论过程有效减少了偏差,提升了人机编码员之间的一致性。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。