[논문 리뷰] SOLD: Sinhala Offensive Language Dataset
이 논문은 문장 수준와 토큰 수준에서 모두 레이블이 부여된 10,000개의 트위터 게시글을 포함한, 스리랑카에서 약 1,700만 명이 사용하는 언어인僧伽라어에 대한 공개된 대규모 수작업 주석 처리된 폭력적 언어 데이터셋인 SOLD을 소개한다. 이는 모델의 해석 가능성 향상을 위해 개발되었다. 또한, 145,000개 이상의 트위터 게시글을 포함한 반감독 학습 기반 확장 버전인 SemiSOLD를 제시하여, 자원이 부족한 언어인僧伽라어에서도 폭력적 언어 탐지 성능을 향상시킬 수 있도록 한다.
The widespread of offensive content online, such as hate speech and cyber-bullying, is a global phenomenon. This has sparked interest in the artificial intelligence (AI) and natural language processing (NLP) communities, motivating the development of various systems trained to detect potentially harmful content automatically. These systems require annotated datasets to train the machine learning (ML) models. However, with a few notable exceptions, most datasets on this topic have dealt with English and a few other high-resource languages. As a result, the research in offensive language identification has been limited to these languages. This paper addresses this gap by tackling offensive language identification in Sinhala, a low-resource Indo-Aryan language spoken by over 17 million people in Sri Lanka. We introduce the Sinhala Offensive Language Dataset (SOLD) and present multiple experiments on this dataset. SOLD is a manually annotated dataset containing 10,000 posts from Twitter annotated as offensive and not offensive at both sentence-level and token-level, improving the explainability of the ML models. SOLD is the first large publicly available offensive language dataset compiled for Sinhala. We also introduce SemiSOLD, a larger dataset containing more than 145,000 Sinhala tweets, annotated following a semi-supervised approach.
연구 동기 및 목표
- 자원이 부족한 언어, 특히僧伽라어에서 폭력적 언어 탐지에 사용할 수 있는 주석 처리된 데이터셋의 부족함을 해결하기 위해.
- NLP 및 AI 연구를 지원하기 위해 고품질의 수작업으로 정제된僧伽라어 폭력적 언어 탐지용 데이터셋을 개발하기 위해.
- 僧伽라어에서 폭력적 콘텐츠의 토큰 수준 주석 처리를 통해 모델의 설명 가능성 향상시키기 위해.
- 반감독 학습 방법을 활용하여, 145,000개 이상의 트위터 게시글을 포함한 더 큰 데이터셋인 SemiSOLD를 확장하여, 보다 넓은 모델 훈련을 가능하게 하기 위해.
- 스리랑카에서 1,700만 명 이상이 사용하는 언어인僧伽라어를 대상으로 강력한 폭력적 언어 탐지 시스템 개발을 가능하게 하기 위해.
제안 방법
- 문장 수준와 토큰 수준에서 10,000개의僧伽라어 트위터 게시글을 수작업으로 주석 처리하여 폭력적 콘텐츠와 비폭력적 콘텐츠를 구분하기 위해.
- 원시僧伽라어 트위터 게시글에서 반감독 학습 파이프라인을 적용하여 더 큰 데이터셋인 SemiSOLD를 생성하기 위해.
- 반감독 레이블링 과정을 지도하고 검증하기 위해 수작업 주석 처리된 데이터를 활용하기 위해.
- SOLD와 SemiSOLD에서 폭력적 언어 탐지 모델을 훈련하고 평가하기 위해 표준 NLP 및 기계학습 기법을 적용하기 위해.
- 분류 및 출력의 설명 가능성 모두를 지원하기 위해 이중 수준 주석 체계를 설계하기 위해.
- SOLD와 SemiSOLD에서 여러 모델을 평가하여 자원이 부족한 환경에서의 성능과 내구성 평가하기 위해.
실험 결과
연구 질문
- RQ1수작업 주석 처리된僧伽라어 폭력적 언어 데이터셋이 폭력적 콘텐츠 탐지에 대한 NLP 모델 성능 향상에 얼마나 효과적인가?
- RQ2반감독 학습이 자원이 부족한 언어인僧伽라어와 같은 언어에서 폭력적 언어 탐지의 확장성 향상에 어느 정도 기여하는가?
- RQ3토큰 수준 주석 처리가僧伽라어 폭력적 언어 탐지 모델의 설명 가능성과 정밀도 향상에 기여하는가?
- RQ4SOLD에서 훈련된 모델의 성능은 SemiSOLD에서 훈련된 모델와 F1 점수 및 내구성 측면에서 어떻게 비교되는가?
- RQ5데이터셋 크기와 주석 품질이 자원이 부족한 언어 환경에서 모델 일반화 능력에 미치는 영향은 무엇인가?
주요 결과
- SOLD는 공개된 대규모 수작업 주석 처리된僧伽라어 폭력적 언어 데이터셋으로서, 문장 수준와 토큰 수준의 레이블이 부여된 10,000개의 트위터 게시글을 포함한다.
- 반감독 학습 기반 확장된 데이터셋인 SemiSOLD는 145,000개 이상의僧伽라어 트위터 게시글을 포함하여, 폭력적 언어 탐지에 대한 훈련 데이터를 크게 확장한다.
- 이중 수준 주석(문장 수준와 토큰 수준)은 특정 폭력적 단어나 어구를 식별함으로써 모델의 설명 가능성을 향상시킨다.
- 이 데이터셋은 자원이 부족한 언어인僧伽라어에서도 경쟁 가능한 성능을 달성할 수 있는 기계학습 모델 훈련을 가능하게 한다.
- 본 연구는 반감독 데이터 확장을 통해 폭력적 언어 데이터셋의 확장이 가능하며, 주석 품질을 유지할 수 있음을 입증한다.
- SOLD와 SemiSOLD의 공개는 향후 자원이 부족한 NLP 분야의 연구, 특히僧伽라어에서의 혐오 발언 및 사이버 불링 탐지 분야의 연구를 가능하게 한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.