Skip to main content
QUICK REVIEW

[논문 리뷰] Sentiment Analysis of Users' Reviews on COVID-19 Contact Tracing Apps with a Benchmark Dataset

Kashif Ahmad, Firoj Alam|arXiv (Cornell University)|2021. 03. 01.
COVID-19 Digital Contact Tracing인용 수 5
한 줄 요약

이 논문은 46개 국가의 47개 코로나19 밀접접촉자 추적 앱에 대한 사용자 리뷰의 자동 감성 분석을 위한 벤치마크 데이터셋과 파이프라인을 제안한다. 34,534건의 수동 레이블링된 리뷰를 기반으로 군중 소싱(annotation)을 수행하고, RoBERTa와 같은 트랜스포머 모델을 포함한 다양한 AI 모델을 훈련시켜 평균 F1 스코어 최대 94.8%를 달성하였으며, 이는 자동 감성 분류의 높은 실현 가능성을 보여주고, 개인정보, 기술적 문제, 앱 성능과 같은 핵심 사용자 우려 사항을 특정한다.

ABSTRACT

Contact tracing has been globally adopted in the fight to control the infection rate of COVID-19. Thanks to digital technologies, such as smartphones and wearable devices, contacts of COVID-19 patients can be easily traced and informed about their potential exposure to the virus. To this aim, several interesting mobile applications have been developed. However, there are ever-growing concerns over the working mechanism and performance of these applications. The literature already provides some interesting exploratory studies on the community's response to the applications by analyzing information from different sources, such as news and users' reviews of the applications. However, to the best of our knowledge, there is no existing solution that automatically analyzes users' reviews and extracts the evoked sentiments. In this work, we propose a pipeline starting from manual annotation via a crowd-sourcing study and concluding on the development and training of AI models for automatic sentiment analysis of users' reviews. In total, we employ eight different methods achieving up to an average F1-Scores 94.8% indicating the feasibility of automatic sentiment analysis of users' reviews on the COVID-19 contact tracing applications. We also highlight the key advantages, drawbacks, and users' concerns over the applications. Moreover, we also collect and annotate a large-scale dataset composed of 34,534 reviews manually annotated from the contract tracing applications of 46 distinct countries. The presented analysis and the dataset are expected to provide a baseline/benchmark for future research in the domain.

연구 동기 및 목표

  • 코로나19 밀접접촉자 추적 앱 사용자 리뷰의 감성 분석을 위한 과제 특화, 대규모, 수동 레이블링된 데이터셋의 부족을 해결하기 위해.
  • 높은 정확도로 사용자 리뷰의 감성을 자동으로 분류할 수 있는 AI 모델을 개발하고 평가하기 위해.
  • 체계적인 감성 분석을 통해 개인정보, 기술적 문제, 앱 성능과 같은 핵심 사용자 우려 사항을 식별하고 분석하기 위해.
  • 향후 디지털 공중보건 및 감성 분석 분야의 연구를 지원하기 위해 표준화된 벤치마크 데이터셋을 제공하기 위해.

제안 방법

  • 공개 앱 스토어를 통해 46개 국가의 47개 밀접접촉자 추적 앱에서 데이터 수집을 시작으로 다단계 파이프라인을 개발하였다.
  • 34,534건의 리뷰를 감성 카테고리(긍정, 부정, 중립, 기술적 문제)로 수동으로 레이블링하기 위해 군중 소싱 연구를 수행하였다.
  • 기본적인 방법(나이브 베이즈, 서포트 벡터 머신), 딥 러닝(LSTM, BiLSTM), 트랜스포머 기반 모델(BERT, RoBERTa, XML-RoBERTa)을 포함한 8종의 기계학습 및 딥 러닝 모델을 훈련 및 평가하였다.
  • 모델들은 레이블링된 데이터셋에서 미세조정(fine-tuned)되었으며, 이진 및 삼분류 분류 작업에서 표준 자연어 처리 지표인 정밀도, 재현도, F1 스코어를 사용해 평가되었다.
  • 세 가지 분류 작업을 시행하였다: 이진(긍정 대 부정), 이진(긍정 대 비긍정), 삼분류(긍정, 부정, 중립) 감성 분류.
  • 클래스 불균형, 특히 중립 클래스에 주의를 기울여 매크로 평균 F1 스코어를 사용해 성능을 평가하였다.

실험 결과

연구 질문

  • RQ1글로벌 코로나19 밀접접촉자 추적 앱의 사용자 리뷰 감성 분포는 어떻게 되며, 국가 및 앱 간에 어떻게 다를까?
  • RQ2특히 트랜스포머 모델이 고전적 및 딥 러닝 방법에 비해 밀접접촉자 추적 앱 리뷰의 감성을 분류하는 데 얼마나 효과적인가?
  • RQ3사용자 리뷰에서 자주 나타나는 기술적 문제와 개인정보 관련 우려는 무엇이며, 감성 균형과 어떻게 관련이 있는가?
  • RQ4대규모 수동 레이블링된 벤치마크 데이터셋이 이 특정 과제에서 감성 분석 모델의 성능을 얼마나 향상시키는가?

주요 결과

  • 제안된 벤치마크 데이터셋은 46개 국가의 47개 밀접접촉자 추적 앱에서 온 34,534건의 수동 레이블링된 사용자 리뷰를 포함하며, 향후 연구를 위한 종합적 자원을 제공한다.
  • 가장 높은 성능을 보인 모델인 XML-RoBERTa가 모든 분류 작업에서 평균 F1 스코어 94.8%를 달성하여 자동 감성 분석의 높은 실현 가능성을 입증하였다.
  • 트랜스포머 모델이 고전적 및 딥 러닝 모델보다 뛰어난 성능을 보였으며, RoBERTa 기반 모델이 모든 작업에서 가장 높은 정밀도, 재현도, F1 스코어를 기록하였다.
  • 대부분의 리뷰는 세 가지 카테고리에 속해 있었으며, 긍정(35.6%), 부정(30.2%), 기술적 문제(25.8%)였고, 중립은 오직 8.4%에 불과했다.
  • 등록 문제, 연결 문제, 앱 성능 열악함 등의 기술적 문제는 부정 감성과 뚜렷한 관련이 있었으며, 강한 정서적 영향을 미친다.
  • GPS 추적 및 개인 정보(예: 갤러리 접근)에 대한 개인정보 우려는 비기술적 문제 중 가장 두드러진 것으로 나타났으며, 항상 부정 리뷰에 등장하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.