[논문 리뷰] Contextual Lexicon-Based Approach for Hate Speech and Offensive Language Detection.
이 논문은 맥락에 따라 달라지는지 여부를 분류한 수동으로 애너테이션된 악성 표현 어휘집을 활용하여 브라질 포르투갈어에서 혐오 발언과 모욕적 언어를 탐지하는 맥락 기반 어휘집 기반 접근법을 제안한다. 이 방법은 포르투갈어 데이터셋에서 최신 기술 수준의 성능을 달성하며, 악성 언어 및 혐오 발언 탐지 작업에서 기존 베이스라인을 능가한다.
This paper provides a new approach for offensive language and hate speech detection on social media. Our approach incorporates an offensive lexicon composed of implicit and explicit offensive and swearing expressions annotated with binary classes: context-dependent and context-independent offensive. Due to the severity of the hate speech and offensive comments in Brazil, and the lack of research in Portuguese, Brazilian Portuguese is the language used to validate the proposed method. Nevertheless, our proposal may be applied to any other language or domain. Based on the obtained results, the proposed approach showed high-performance overcoming the current baselines for European and Brazilian Portuguese.
연구 동기 및 목표
- 브라질 소셜 미디어에서 증가하는 혐오 발언 및 악성 콘텐츠 문제를 다루며, 포르투갈어 분야의 연구가 여전히 제한되어 있음을 고려한다.
- 브라질 포르투갈어에 특화된 어휘집 기반 탐지 시스템을 개발하며, 이 분야에서 자원이 부족한 언어인 브라질 포르투갈어를 대상으로 한다.
- 맥락에 따라 달라지는 표현과 맥락에 관계없이 항상 악성인 표현을 구분함으로써 탐지 성능을 향상시킨다.
- 포르투갈어를 초월해 다른 언어나 도메인에 적용 가능한 재사용 가능한 프레임워크를 구축한다.
제안 방법
- 브라질 포르투갈어에서 명시적이고 암시적인 악성 표현을 포함한 맞춤형 악성 어휘집을 구축한다.
- 어휘집 항목 각각에 대해 맥락에 따라 달라지는지 여부 또는 맥락에 관계없이 항상 악성인지 여부를 이진 레이블로 애너테이션한다.
- 어휘집을 맥락 기반 분류 모델에 통합하여 문장 맥락 내에서 단어 수준의 악성 가능성 평가를 수행한다.
- 문장 내 단어의 맥락 임베딩을 활용하여 특정 맥락에서 악성 표현이 실제로 악성일 가능성이 있는지 판단한다.
- 실제 브라질 포르투갈어 소셜 미디어 데이터를 기반으로 모델을 훈련하고 평가한다.
- 다른 언어로의 적용을 위해 어휘집 구축 및 애너테이션 파이프라인을 재사용한다.
실험 결과
연구 질문
- RQ1기존 방법과 비교해 맥락 인식 어휘집 기반 접근법이 브라질 포르투갈어에서 악성 언어 탐지 성능을 향상시킬 수 있는가?
- RQ2맥락에 따라 달라지는 표현과 맥락에 관계없이 항상 악성인 표현을 구분하는 것이 탐지 정확도 향상에 얼마나 효과적인가?
- RQ3이 접근법이 브라질 포르투갈어를 초월해 다른 언어나 도메인으로 일반화될 수 있는 정도는 어느 정도인가?
- RQ4맥락 정보를 통합함으로써 암시적 악성 언어 탐지에 상당한 기여가 이루어지는가?
주요 결과
- 제안된 접근법은 브라질 포르투갈어에서 악성 언어 및 혐오 발언 탐지 작업에서 최신 기술 수준의 성능을 달성했다.
- 모델은 기존 베이스라인을 능가했으며, 명시적 및 암시적 악성 언어 탐지 모두에서 높은 F1 점수와 정밀도를 보였다.
- 맥락에 따라 달라지는 표현과 맥락에 관계없이 항상 악성인 표현을 구분하는 것이 탐지 정확도 향상에 기여했다.
- 이 방법은 강력한 일반화 잠재력을 보였으며, 유사한 어휘집 기반 적응이 가능한 다른 언어에 적용 가능할 것으로 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.