[논문 리뷰] Moving Beyond LDA: A Comparison of Unsupervised Topic Modelling Techniques for Qualitative Data Analysis of Online Communities
이 연구는 온라인 커뮤니티 데이터의 정성적 분석을 위해 대규모 언어 모델(Large Language Model, LLM) 기반 주제 모델링 기법인 BERTopic을 전통적 방법(LDA 및 NMF)과 비교하여 평가한다. 연구자들은 BERTopic이 더 일관되고 세부적인, 논리적으로 구성된 주제를 생성함으로써 미묘한 관계를 드러내는 데 뛰어난 성능을 보였으며, 12명의 참가자 중 8명이 더 깊은 통찰력과 실행 가능한 결과를 얻는 데 BERTopic을 선호했지만, 주제 수가 많아지는 문제에 직면해 있다.
Social media constitutes a rich and influential source of information for qualitative researchers. Although computational techniques like topic modelling assist with managing the volume and diversity of social media content, qualitative researcher's lack of programming expertise creates a significant barrier to their adoption. In this paper we explore how BERTopic, an advanced Large Language Model (LLM)-based topic modelling technique, can support qualitative data analysis of social media. We conducted interviews and hands-on evaluations in which qualitative researchers compared topics from three modelling techniques: LDA, NMF, and BERTopic. BERTopic was favoured by 8 of 12 participants for its ability to provide detailed, coherent clusters for deeper understanding and actionable insights. Participants also prioritised topic relevance, logical organisation, and the capacity to reveal unexpected relationships within the data. Our findings underscore the potential of LLM-based techniques for supporting qualitative analysis.
연구 동기 및 목표
- 온라인 커뮤니티에서 정성적 데이터 분석을 위한 LLM 기반 주제 모델링 기법인 BERTopic의 사용성과 효과성을 평가하기 위해.
- 프로그래밍 전문 지식이 부족한 정성적 연구자가 계산 기반 주제 모델링 도구를 도입하는 데 겪는 장벽을 해결하기 위해.
- 주제 품질, 해석 가능성, 연구자 선호도 측면에서 BERTopic을 전통적 방법(LDA 및 NMF)과 비교하기 위해.
- 대규모 소셜미디어 데이터를 분석하는 데 도움이 되는 계산 기반 도구의 핵심 설계 요구사항을 규명하기 위해.
- BERTopic을 계산 기반 주제 분석(Computational Thematic Analysis, CTA) 툴킷에 통합하고, 연구 워크플로우 및 통찰 생성에 미치는 영향을 평가하기 위해.
제안 방법
- BERTopic을 CTA 툴킷에 통합하여, 변환기 기반 단어 임베딩과 맥락 이해 기능을 활용해 주제 모델링을 수행하였다.
- 온라인 커뮤니티, 특히 Reddit에서 수집한 정성적 데이터셋에 BERTopic, LDA, NMF를 적용하여 주제 출력 결과를 비교하였다.
- 모델 성능을 정량적으로 평가하기 위해 주제 일관성 및 다양성 지표를 사용하였으며, 특히 일관성이 핵심 평가 기준으로 작용하였다.
- 12명의 정성적 연구자와의 반구조화된 인터뷰를 통해 사용성, 주제의 해석 가능성, 방법 간 선호도를 평가하였다.
- 실습 평가를 실시하여 연구자들이 자신의 데이터셋에 CTA 툴킷을 적용하고, 다양한 모델 간 주제 클러스터를 비교하였다.
- 계산 자원 요구량 문제를 해결하기 위해 GPU 활용을 지원하고, BERTopic의 요구사항을 충족시키기 위해 데이터 필터링 및 사전 처리 파이프라인을 수정하였다.

실험 결과
연구 질문
- RQ1정성적 연구자들은 BERTopic이 생성한 주제가 LDA 및 NMF와 비교해 일관성, 관련성, 해석 가능성 측면에서 어떻게 평가하는가?
- RQ2프로그래밍 전문 지식과 데이터 사전 처리 문제로 인해 정성적 연구자가 전통적 주제 모델링 도구를 사용할 때 겪는 주요 과제는 무엇인가?
- RQ3BERTopic은 온라인 커뮤니티의 정성적 데이터 내에서 예상치 못한 관계를 깊이 있는 이해와 탐색에 어떻게 기여하는가?
- RQ4연구자가 주제 조직, 논리적 구조, 실행 가능한 통찰을 고려할 때 주제 모델링 방법을 선택하는 데 어떤 기준을 우선시하는가?
- RQ5정성적 연구에서 LLM 기반 주제 모델의 사용성을 향상시키기 위해 가장 필요한 설계 기능(예: 시각화, 검색, 계층적 구조 등)은 무엇인가?
주요 결과
- 12명의 정성적 연구자 중 8명이 BERTopic을 선호하였으며, 이는 더 세부적이고 일관되며 논리적으로 구성된 주제 클러스터를 생성할 수 있기 때문이다.
- BERTopic은 주제 일관성 및 다양성 지표에서 LDA 및 NMF를 앞서며, 더 높은 품질과 의미 있는 주제 표현을 나타낸다.
- 연구자들은 BERTopic이 데이터 내에서 예상치 못했지만 중요한 관계를 드러내는 능력을 높이 평가하였으며, 이는 더 깊이 있고 세밀한 분석을 가능하게 한다.
- 비록 강점이 있지만, 일부 참가자들은 BERTopic이 생성하는 주제 수가 너무 많아 혼란스럽다고 느꼈으며, 이는 더 나은 계층적 시각화의 필요성을 시사한다.
- LDA 및 NMF는 불필요한 기호와 수학 기호 문제로 인해 광범위한 수동 데이터 정제가 필요로 했지만, BERTopic은 사전 처리가 덜 필요했다.
- CTA 툴킷에 계층적 시각화가 부족하다는 점이 주요 제한요소로 지목되었으며, 이는 연구자들이 복잡한 주제 구조를 효과적으로 탐색하는 데 제약을 가했다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.