Skip to main content
QUICK REVIEW

[논문 리뷰] Large Language Models for Large-Scale, Rigorous Qualitative Analysis in Applied Health Services Research

Sasha Ronaghi, Emma‐Louise Aveling|arXiv (Cornell University)|2026. 01. 20.
Health Policy Implementation Science인용 수 0
한 줄 요약

논문은 대규모 다기관 정성 건강서비스 연구에 대한 작업별 인간–LLM 프레임워크를 제시하여 두 가지 과제에서 분석의 엄격성을 유지하면서 효율성 증가를 입증한다: 피드백 보고서의 질적 합성 및 개입을 다듬기 위한 연역적 코딩.

ABSTRACT

Large language models (LLMs) show promise for improving the efficiency of qualitative analysis in large, multi-site health-services research. Yet methodological guidance for LLM integration into qualitative analysis and evidence of their impact on real-world research methods and outcomes remain limited. We developed a model- and task-agnostic framework for designing human-LLM qualitative analysis methods to support diverse analytic aims. Within a multi-site study of diabetes care at Federally Qualified Health Centers (FQHCs), we leveraged the framework to implement human-LLM methods for (1) qualitative synthesis of researcher-generated summaries to produce comparative feedback reports and (2) deductive coding of 167 interview transcripts to refine a practice-transformation intervention. LLM assistance enabled timely feedback to practitioners and the incorporation of large-scale qualitative data to inform theory and practice changes. This work demonstrates how LLMs can be integrated into applied health-services research to enhance efficiency while preserving rigor, offering guidance for continued innovation with LLMs in qualitative research.

연구 동기 및 목표

  • 응용 보건 서비스 연구에서 인간–LLM 질적 분석 방법을 위한 작업- 및 모델 비특정 프레임워크를 개발한다.
  • 12개 연방자격진료센터(FQHCs)에 걸친 다기관 당뇨 관리 연구를 통해 프레임워크를 시연한다.
  • (a) 비교적 사이트 수준 피드백 보고서를 생성하고 (b) 실행 개입을 다듬기 위한 연역적 코딩을 수행하기 위해 LLM을 사용한다.
  • 현장 연구에서 LLM 지원 분석이 효율성, 엄격성, 해석적 통제에 미치는 영향을 평가한다.

제안 방법

  • 작업 정의: 작은 데이터 샘플에서 목표, 산출물, 필요 연구자 참여를 명확히 한다.
  • 인간–LLM 방법 설계: 작업을 분해하고 목적을 명시하며 각 구성요소에 대해 서로 다른 인간/AI 구성 조합을 시험한다.
  • 소규모 데이터에서 방법 평가: 과제별 엄격성 기준(근거화, 이론-데이터 통합, 관련성)을 사용하여 LLM 포함 여부에 따른 산출물을 비교한다.
  • 더 큰 데이터 세트의 전체 작업에 방법을 적용하고 평가하여 효율성과 연구 목표에 대한 영향을 평가한다.
  • 작업 1: 22개 진료 영역에 걸친 비교적 사이트 수준 요약을 산출하기 위한 질적 합성으로, 적은 샘플 프롬프트와 도메인 정의를 사용하여 사이트 데이터를 주제별로 정리하고 교차-사이트 합성을 위해 LLM의 도움을 받는다.
  • 작업 2: 당뇨 관리 개입을 다듬기 위한 연역적 질적 코딩으로, 임베딩 기반 검색과 구성된 하위 질문 접근법을 사용한 검색 증강 생성(RAG)으로 인용문을 포함한 부호화된 산출물을 생성한다.
Figure 1: The framework we developed and applied for developing task-specific human-LLM qualitative analysis methods.
Figure 1: The framework we developed and applied for developing task-specific human-LLM qualitative analysis methods.

실험 결과

연구 질문

  • RQ1대규모 질적 건강서비스 연구에서 엄격성을 보존하면서 효율성을 높이기 위해 작업 특화된 인간–LLM 방법을 어떻게 설계할 수 있는가?
  • RQ2LLMs가 데이터를 조직하고 연구자의 해석적 분석을 보조하되 대체하지 않는 요약 또는 코딩 산출물을 얼마나 잘 생성할 수 있는가?
  • RQ3다기관 당뇨 관리 연구에서 LLM-지원 질적 분석이 시간 효율성 및 개입 개선에 정보를 제공하는 데 어떤 실질적 영향을 미치는가?

주요 결과

  • LLMs는 사이트 수준 요약을 주제별로 구성할 수 있어 소규모 테스트에서 비교적 피드백 보고서 초안 작성 시간을 최대 30–55%까지 줄인다.
  • LLM 보조 산출물은 합성 작업의 질에서 수작업의 질적 구성과 일치할 수 있지만, 실행 가능성과 도메인 정의와의 정렬을 보장하기 위해 연구자의 해석이 필요하다.
  • LLMs는 검색 증강 생성(RAG)을 통해 대형 전사를 대상으로 연역적 코딩을 지원할 수 있지만, 연구자가 이를 검증하고 맥락화하지 않으면 산출물이 깊이나 맥락을 결여할 수 있다.
  • 인간–LLM 협업은 해석적 통제력을 보존하며 연구자가 최종 판단을 유지하여 산출물이 데이터 및 분석 목표에 고정되도록 한다.
  • 이 프레임워크는 167개 전사를 19개의 실천 영역 코드로 효율적으로 포함시키고 개입 개선에 정보를 제공하여 추가 여덟 개 사이트에서의 구현을 지원한다.
  • 본 연구는 원시 데이터 접근성과 LLM 생성 결과의 투명성, 신뢰성, 반성성, 편향 평가를 유지하기 위한 신중한 설계의 필요성을 강조한다.
Figure 2: Illustrative differences in cross-site synthesis output by human and LLM (independently) for telehealth and appointment management themes within the “Information and Communication Technology” domain
Figure 2: Illustrative differences in cross-site synthesis output by human and LLM (independently) for telehealth and appointment management themes within the “Information and Communication Technology” domain

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.