[논문 리뷰] COVID-19-related Nepali Tweets Classification in a Low Resource Setting
이 논문은 다국어 트랜스포머 모델(mBERT 및 MuRIL)을 사용하여 코로나19 관련 니파리 트윗을 여덟 가지 핵심 주제로 분류하기 위한 저자원 NLP 파이프라인을 제안한다. 트렌드를 시각화하기 위해 웹 기반 대시보드를 구현하였으며, 더 큰 데이터셋에서 MuRIL이 mBERT를 능가함을 입증하였고, 모든 데이터, 모델 및 도구는 공개적으로 사용 가능하도록 오픈소스화되었다.
Billions of people across the globe have been using social media platforms in their local languages to voice their opinions about the various topics related to the COVID-19 pandemic. Several organizations, including the World Health Organization, have developed automated social media analysis tools that classify COVID-19-related tweets into various topics. However, these tools that help combat the pandemic are limited to very few languages, making several countries unable to take their benefit. While multi-lingual or low-resource language-specific tools are being developed, they still need to expand their coverage, such as for the Nepali language. In this paper, we identify the eight most common COVID-19 discussion topics among the Twitter community using the Nepali language, set up an online platform to automatically gather Nepali tweets containing the COVID-19-related keywords, classify the tweets into the eight topics, and visualize the results across the period in a web-based dashboard. We compare the performance of two state-of-the-art multi-lingual language models for Nepali tweet classification, one generic (mBERT) and the other Nepali language family-specific model (MuRIL). Our results show that the models' relative performance depends on the data size, with MuRIL doing better for a larger dataset. The annotated data, models, and the web-based dashboard are open-sourced at https://github.com/naamiinepal/covid-tweet-classification.
연구 동기 및 목표
- 니파리 트윗에서 코로나19 논의 주제로 가장 흔한 여덟 가지 주제를 특정하기.
- 대통합된 파이프라인을 개발하여 패닉 기간 동안 니파리 소셜 미디어 콘텐츠를 수집, 분류, 시각화하기.
- 저자원 니파리 텍스트에서 다국어 및 니파리 최적화된 언어 모델(mBERT 및 MuRIL)의 성능 평가하기.
- 실시간 공중 여론 및 주제 트렌드 감시를 위한 공개 접근이 가능한 웹 기반 대시보드 구축 및 배포하기.
제안 방법
- 트위터에서 코로나19 관련 용어를 포함한 니파리 트윗을 수집하기 위해 키워드 기반 웹 크롤러를 구축하였다.
- 주제적 내용을 바탕으로 니파리 트윗 데이터셋을 여덟 가지 사전 정의된 주제로 주석 처리하였다.
- 주석 처리된 데이터셋을 사용하여 두 개의 다국어 트랜스포머 모델(mBERT 및 MuRIL)을 텍스트 분류 작업에 맞추어 미세조정하였다.
- 분류된 트윗의 주제 분포와 시간적 추세를 시각화하기 위해 웹 기반 대시보드를 구현하였다.
- 표준 분류 지표를 사용하여 모델 성능을 비교하고, 데이터셋 크기가 모델 정확도에 미치는 영향을 분석하였다.
- 주석 처리된 데이터셋, 훈련된 모델, 대시보드 코드를 연구 공동체가 재사용 및 확장할 수 있도록 오픈소스로 공개하였다.
실험 결과
연구 질문
- RQ1코로나19 관련 니파리 트윗에서 가장 흔한 여덟 가지 논의 주제는 무엇인가?
- RQ2mBERT와 같은 다국어 모델과 MuRIL과 같은 언어별 최적화 모델이 저자원 니파리 텍스트 분류에서 어떻게 성능을 내는가?
- RQ3데이터셋 크기가 니파리 트윗 분류에서 mBERT와 MuRIL 간 상대적 성능에 의미 있는 영향을 미치는가?
- RQ4자동화된 파이프라인이 저자원 언어에서 실시간으로 공중 여론을 수집, 분류, 시각화하는 데 효과적으로 작용할 수 있는가?
- RQ5오픈소스 도구가 저자원 언어 환경에서 공중 보건 모니터링을 얼마나 잘 지원할 수 있는가?
주요 결과
- 니파리 코로나19 트윗에서 가장 흔한 여덟 가지 주제는 증상, 백신, 오락성 정보, 정부 정책, 정신 건강, 경제적 영향, 검사, 해외 여행 제한이었다.
- 더 큰 주석 처리된 데이터셋에서 미세조정된 MuRIL이 니파리 트윗 분류 작업에서 mBERT를 능가하였다.
- 작은 데이터셋에서 mBERT와 MuRIL 간 성능 격차가 줄어들었으며, 이는 MuRIL의 우월성이 충분한 훈련 데이터가 확보되었을 때 더 두드러진다는 것을 시사한다.
- 웹 기반 대시보드는 공중 논의의 시간적 추세를 성공적으로 시각화하여 주제의 빈도를 실시간으로 모니터링할 수 있도록 하였다.
- 모든 파이프라인—데이터, 모델, 대시보드—가 오픈소스로 공개되어 재현 가능성과 저자원 NLP 분야의 향후 확장성을 높였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.