Skip to main content
QUICK REVIEW

[논문 리뷰] Automating Systematic Literature Reviews with Natural Language Processing and Text Mining: a Systematic Literature Review

Girish Sundaram, Daniel Berleant|arXiv (Cornell University)|2022. 11. 20.
Software Engineering Research인용 수 6
한 줄 요약

이 논문은 자연어 처리(NLP) 및 텍스트 마이닝을 사용하여 시스템적 문헌 리뷰(SLR)를 자동화하는 데 중점적인 29项의 연구를 분석하는 체계적 문헌 리뷰를 제시한다. 연구는 연구 선택, 데이터 추출, 품질 평가, 통합 분석 등의 핵심 자동화 대상들을 규명하면서도, 주로 사용되는 기계학습 기법, 지속적인 과제, 그리고 특히 품질 평가와 통합 분석 분야에서의 현재 접근법의 격차를 드러내며, SLR의 효율성과 확장성을 향상시키기 위한 향후 연구가 필요하다고 주장한다.

ABSTRACT

Objectives: An SLR is presented focusing on text mining based automation of SLR creation. The present review identifies the objectives of the automation studies and the aspects of those steps that were automated. In so doing, the various ML techniques used, challenges, limitations and scope of further research are explained. Methods: Accessible published literature studies that primarily focus on automation of study selection, study quality assessment, data extraction and data synthesis portions of SLR. Twenty-nine studies were analyzed. Results: This review identifies the objectives of the automation studies, steps within the study selection, study quality assessment, data extraction and data synthesis portions that were automated, the various ML techniques used, challenges, limitations and scope of further research. Discussion: We describe uses of NLP/TM techniques to support increased automation of systematic literature reviews. This area has attracted increase attention in the last decade due to significant gaps in the applicability of TM to automate steps in the SLR process. There are significant gaps in the application of TM and related automation techniques in the areas of data extraction, monitoring, quality assessment and data synthesis. There is thus a need for continued progress in this area, and this is expected to ultimately significantly facilitate the construction of systematic literature reviews.

연구 동기 및 목표

  • 자연어 처리(NLP) 및 텍스트 마이닝을 활용한 시스템적 문헌 리뷰(SLR) 자동화의 범위와 목표를 조사하기 위해.
  • 연구 선택, 데이터 추출, 품질 평가, 데이터 통합 분석 등의 SLR 과정 단계 중에서 기존 연구에서 어떤 단계가 자동화되었는지 규명하기 위해.
  • 자동화 연구에서 사용된 기계학습 기법을 분석하고 그 효과성과 한계를 평가하기 위해.
  • 품질 평가 및 데이터 통합 분석 분야에서의 현재 자동화 격차를 부각하고 향후 연구 방향을 제안하기 위해.
  • 연구자와 실무자들이 자동화된 SLR 워크플로우를 채택하고 개선하는 데 안내하기 위해 최신 기술 동향을 종합적으로 개괄하기 위해.

제안 방법

  • SLR의 핵심 단계인 연구 선택, 품질 평가, 데이터 추출, 데이터 통합 분석의 자동화에 중점을 둔 29项의 연구를 대상으로 체계적 문헌 리뷰를 수행하였다.
  • 연구 선택, 품질 평가, 데이터 추출, 데이터 통합 분석 등의 핵심 SLR 단계의 자동화에 관련된 연구를 선별하였다.
  • 자동화 목표, 사용된 기계학습 기법(예: NLP 모델, 군집화, 분류), 구현 방식에 따라 연구를 분류하였다.
  • 자동화 결과를 특정 SLR 단계에 매핑하여 각 단계의 성숙도와 커버리지 수준을 평가하였다.
  • 검토된 문헌의 주제 분석을 통해 과제, 한계 및 연구 격차를 통합 분석하였다.
  • SLR 라이프사이클 전반에서 자동화 기법의 범위와 영향을 평가하기 위해 구조화된 프레임워크를 사용하였다.

실험 결과

연구 질문

  • RQ1자연어 처리(NLP) 및 텍스트 마이닝을 사용하여 시스템적 문헌 리뷰 과정의 어느 단계가 가장 자주 자동화되고 있는가?
  • RQ2SLR 작업 자동화에 주로 사용되는 기계학습 및 NLP 기법은 무엇인가?
  • RQ3기존의 SLR 자동화 연구에서 보고된 주요 과제와 한계는 무엇인가?
  • RQ4SLR에서 데이터 추출, 품질 평가, 데이터 통합 분석의 자동화 수준은 어느 정도 성숙해졌는가?
  • RQ5시스템적 문헌 리뷰의 자동화를 향상시키기 위한 핵심 연구 격차와 향후 방향은 무엇인가?

주요 결과

  • 연구 선택 단계가 가장 자동화되어 있으며, NLP 모델을 활용한 중복 검출 및 관련성 선별에서 높은 정확도가 보고되었다.
  • 데이터 추출 자동화는 중간 정도로 발전되어 있으나, 구조적 스키마 설계와 도메인 특화 레이블링의 필요성으로 인해 제한을 받고 있다.
  • 품질 평가는 여전히 주요 과제로 남아 있으며, 자동화 도구를 구현한 연구가 적어 심각한 연구 격차가 존재한다.
  • 데이터 통합 분석 자동화는 개발이 부족하여, 연구 간 결과를 요약하거나 통합하는 데 NLP의 사용이 극히 미미하다.
  • 대부분의 연구가 BERT 기반 모델과 전통적 분류기와 같은 지도 학습 기법에 의존하고 있으나, 교차 검증이나 벤치마킹을 보고한 연구는 소수에 그친다.
  • 진전이 있었음에도 불구하고, SLR의 전체 자동화는 아직 완료되지 않았으며, 확장성, 해석 가능성, 도메인 간 일반화의 한계가 지속적으로 존재한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.