[논문 리뷰] An Opinion Mining of Text in COVID-19 Issues along with Comparative Study in ML, BERT & RNN
이 논문은 코로나19 관련 방글라어 텍스트를 위한 다국어 의견 마이닝 시스템을 제안하며, 기존 기계학습(ML), 순환 신경망(RNN), BERT 기반 모델을 비교한다. 기계학습 모델에서는 91%의 정확도를 기록하고, 딥러닝 모델에서는 79%의 정확도를 기록하여, 방글라어와 같은 저자원 언어에서 공중보건 위기 상황 동안 의견 마이닝 시스템을 구현하는 것이 가능하다는 것을 입증한다.
The global world is crossing a pandemic situation where this is a catastrophic outbreak of Respiratory Syndrome recognized as COVID-19. This is a global threat all over the 212 countries that people every day meet with mighty situations. On the contrary, thousands of infected people live rich in mountains. Mental health is also affected by this worldwide coronavirus situation. Due to this situation online sources made a communicative place that common people shares their opinion in any agenda. Such as affected news related positive and negative, financial issues, country and family crisis, lack of import and export earning system etc. different kinds of circumstances are recent trendy news in anywhere. Thus, vast amounts of text are produced within moments therefore, in subcontinent areas the same as situation in other countries and peoples opinion of text and situation also same but the language is different. This article has proposed some specific inputs along with Bangla text comments from individual sources which can assure the goal of illustration that machine learning outcome capable of building an assistive system. Opinion mining assistive system can be impactful in all language preferences possible. To the best of our knowledge, the article predicted the Bangla input text on COVID-19 issues proposed ML algorithms and deep learning models analysis also check the future reachability with a comparative analysis. Comparative analysis states a report on text prediction accuracy is 91% along with ML algorithms and 79% along with Deep Learning Models.
연구 동기 및 목표
- 코로나19 문제와 관련된 방글라어 텍스트를 처리할 수 있는 의견 마이닝 시스템을 개발하는 것.
- 기존 기계학습, RNN, BERT 기반 모델이 방글라어 텍스트 분류에 대해 성능을 평가하는 것.
- 글로벌 보건 위기 상황에서 방글라어와 같은 저자원 언어를 위한 의견 마이닝 시스템을 구현하는 데의 가능성을 평가하는 것.
- 다국어, 저자원 환경에서 감성 분류에 대한 모델 정확도와 신뢰성의 비교 분석을 제공하는 것.
제안 방법
- 코로나19 문제와 관련된 온라인 소스에서 수집한 방글라어 텍스트 댓글을 수집하고 전처리하는 작업.
- 전처리된 방글라어 텍스트에 대해 전통적 기계학습 모델(예: SVM, 나이브 베이즈)을 적용하여 감성 분류.
- 동일한 방글라어 데이터셋에 대해 RNN 기반 모델을 구현하여 시퀀스 모델링 및 감성 예측.
- 전이 학습을 활용하여 사전 학습된 BERT 모델(mBERT)을 방글라어 텍스트 감성 분류에 대해 미세조정.
- 방글라어 전용으로 특화된 토크나이저, 불용어 제거, 표준화 등의 표준 NLP 전처리 단계를 적용.
- 모든 모델을 표준 분류 평가 지표를 사용하여 평가하였으며, 주요 성능 측정 기준으로 정확도를 사용.
실험 결과
연구 질문
- RQ1기존 기계학습 모델은 코로나19 관련 방글라어 텍스트의 감성 분류에 얼마나 효과적인가?
- RQ2저자원 방글라어 텍스트에 대한 RNN 기반 모델의 감성 분류 성능은 어떠한가?
- RQ3이 특정 저자원 환경에서 BERT 기반 미세조정은 기계학습 및 RNN 모델에 비해 감성 예측에서 어떻게 비교되는가?
- RQ4글로벌 대유행 기간 동안 저자원 비영어 텍스트를 처리하는 데 있어 다양한 NLP 모델의 상대적 정확도는 어떠한가?
주요 결과
- 기계학습 모델은 코로나19 관련 방글라어 텍스트의 감성 분류에서 최고의 정확도 91%를 기록하였다.
- RNN 기반 모델은 동일한 작업에서 감성 분류 정확도 79%를 기록하여 중간 수준의 성능을 보였다.
- BERT 기반 모델은 강력한 성능를 보였지만, 이 특정 저자원 환경에서는 기존 기계학습 모델에 뒤지지 않았다.
- 비교 분석을 통해 기계학습 모델이 훈련 데이터가 제한된 상황에서 방글라어 감성 분석에 딥러닝 모델보다 더 효과적일 수 있음을 확인하였다.
- 이 연구는 전이 학습 및 미세조정을 통해 의견 마이닝 시스템을 저자원 언어인 방글라어에 효과적으로 적용할 수 있음을 입증하였다.
- 결과적으로 기계학습 모델은 공중보건 긴급 상황에서 비영어, 저자원 환경에서 감성 분석에 있어서 실용적이고 정확한 선택임을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.