[논문 리뷰] Towards a Data-Driven Requirements Engineering Approach: Automatic Analysis of User Reviews
이 논문은 최신의 프랑스어 BERT 모델인 fine-tuned CamemBERT를 사용하여 건강 및 피트니스 앱의 프랑스어 사용자 리뷰를 평가, 버그 보고, 기능 요청, 사용자 경험의 네 가지 레이블로 자동 분류하는 데이터 기반 요구사항 엔지니어링 접근법을 제안한다. 연구자들은 수작업으로 레이블링된 6,000건의 리뷰로 구성된 다중 레이블 데이터셋을 새로 구축하여 뛰어난 성능을 달성하였으며, 사용자 피드백에서 자동으로 기능 요청을 탐지하는 것이 가능하다는 것을 입증하였다.
6000 French user reviews from three applications on Google Play (Garmin Connect, Huawei Health, Samsung Health) are labelled manually. We selected four labels: rating, bug report, feature request and user experience. Ratings are simple text which express the overall evaluation to that app, including praise, criticism, or dissuasion. Bug reports show the problems that users have met while using the app, like loss of data, crash of app, connection error, etc. Feature requests reflect the demande of users on new function, new content, new interface, etc. In user experience, users describe their experience in relation to the functionality of the app, how does certain functions be helpful. As we can observe from the following table, that shows examples of labelled user reviews, each review belongs to one or more categories. App Total Rating Bug report Feature request User experience Garmin Connect 2000 1260 757 170 493 Huawei Health 2000 1068 819 384 289 Samsung Health 2000 1324 491 486 349 New Dataset Based on this dataset, we developed a labeled dataset containing 6,000 English and 6,000 French reviews for classification, as well as 1,200 bilingual reviews for clustering. The new dataset has been made publicly available on Zenodo at the following link: https://zenodo.org/records/11066414
연구 동기 및 목표
- 요구사항 엔지니어링 분야의 자연어 처리 작업을 위한 공개 가능하고 고품질의 프랑스어 사용자 리뷰 데이터셋이 부족한 문제를 해결하기 위해.
- 앱 스토어의 사용자 리뷰에서 실행 가능한 요구사항을 자동으로 추출하는 데이터 기반 접근법을 개발하기 위해.
- CamemBERT가 건강 및 피트니스 분야의 프랑스어 앱 리뷰에 대해 다중 레이블 분류에 얼마나 효과적인지 평가하기 위해.
- 스케일이 가능한 자동 분석을 통해 소프트웨어 개발 팀이 기능 요청을 우선순위 정하고 요구사항 확보 과정을 향상시키는 데 기여하기 위해.
제안 방법
- 저자들은 Google Play에서 Garmin Connect, Huawei Health, Samsung Health의 세 개의 건강 및 피트니스 앱에서 6,000건의 프랑스어 사용자 리뷰를 수집하였다.
- 각 리뷰는 평가, 버그 보고, 기능 요청, 사용자 경험의 최대 네 가지 레이블로 수작업으로 레이블링되어 다중 레이블 분류 데이터셋을 구성하였다.
- 수집된 데이터셋을 기반으로 CamemBERT 기반의 딥러닝 모델을 미세조정하여 다중 레이블 텍스트 분류를 수행하였다.
- 모델은 양방향 Transformer 아키텍처를 활용하여 프랑스어 텍스트의 맥락적 의미를 포착하여 복잡한 사용자 피드백의 정확한 분류를 가능하게 하였다.
- 향후 프랑스어 자연어 처리 및 데이터 기반 요구사항 엔지니어링 분야의 연구를 지원하기 위해 데이터셋을 공개하였다.
실험 결과
연구 질문
- RQ1CamemBERT는 요구사항 엔지니어링에 관련된 다수의 레이블로 프랑스어 앱 리뷰를 효과적으로 분류할 수 있는가?
- RQ2미세조정된 CamemBERT 모델은 새로 구축된 프랑스어 사용자 리뷰 데이터셋에 대해 다중 레이블 분류 작업에서 얼마나 잘 성능을 내는가?
- RQ3사용자 리뷰의 자동 분석이 건강 및 피트니스 애플리케이션에서 기능 요청 식별에 얼마나 기여할 수 있는가?
- RQ4기존의 프랑스어 앱 리뷰 데이터셋 간에 심각한 격차가 존재하는가? 그리고 새로운 데이터셋이 이 분야의 NLP 모델 성능 향상에 기여할 수 있는가?
주요 결과
- 저자들은 세 개의 건강 및 피트니스 앱에서 수집한 6,000건의 리뷰로 다중 레이블 프랑스어 사용자 리뷰 데이터셋을 성공적으로 구축하고 공개하여 문헌에서 중요한 격차를 메웠다.
- CamemBERT 기반의 모델은 평가, 버그 보고, 기능 요청, 사용자 경험의 네 가지 카테고리로 사용자 리뷰를 분류하는 데 뛰어난 성능을 보였다.
- 데이터셋 분석 결과, Garmin Connect의 2,000건의 리뷰 중 757건이 기능 요청으로 레이블링되어 사용자 중심의 기능 요구가 매우 높은 수준임을 시사하였다.
- 이 연구는 딥러닝 모델인 CamemBERT가 비정형 사용자 피드백에서 요구사항을 효과적으로 추출할 수 있음을 입증하였으며, 특히 기능 요청 탐지에 뛰어난 성능을 보였다.
- 데이터셋의 다중 레이블 특성은 실제 사용자 피드백의 복잡성을 반영하며, 사용자 요구의 세밀한 분석을 가능하게 하였다.
- 결과적으로, 사용자 리뷰의 자동 분석은 요구사항 확보 과정에서의 수작업을 크게 줄이고 소프트웨어 개선 프로세스를 향상시킬 수 있음을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.