Skip to main content
QUICK REVIEW

[논문 리뷰] Fine-Tuning Llama 2 Large Language Models for Detecting Online Sexual Predatory Chats and Abusive Texts

Thanh Thi Nguyen, Campbell Wilson|arXiv (Cornell University)|2023. 08. 28.
Hate Speech and Cyberbullying Detection인용 수 5
한 줄 요약

이 논문은 영어, 로마우르두어, 우르두어 데이터셋에서 온라인 성적 유혹 대화 및 폭력적 텍스트를 탐지하기 위해 LoRA를 통해 오픈소스 Llama 2 7B 대규모 언어 모델을 피지테이닝하는 방법을 제안한다. 이 방법은 다양한 데이터 크기, 불균형 수준, 언어에서 뛰어난 일관된 성능을 보이며, 비영어 데이터가 극히 적은 경우조차도 전통적 방법을 능가한다. 이는 다국어 디지털 안전 응용 분야에서 유해 콘텐츠 탐지에 대한 일반화되고 자동화된 솔루션을 보여준다.

ABSTRACT

Detecting online sexual predatory behaviours and abusive language on social media platforms has become a critical area of research due to the growing concerns about online safety, especially for vulnerable populations such as children and adolescents. Researchers have been exploring various techniques and approaches to develop effective detection systems that can identify and mitigate these risks. Recent development of large language models (LLMs) has opened a new opportunity to address this problem more effectively. This paper proposes an approach to detection of online sexual predatory chats and abusive language using the open-source pretrained Llama 2 7B-parameter model, recently released by Meta GenAI. We fine-tune the LLM using datasets with different sizes, imbalance degrees, and languages (i.e., English, Roman Urdu and Urdu). Based on the power of LLMs, our approach is generic and automated without a manual search for a synergy between feature extraction and classifier design steps like conventional methods in this domain. Experimental results show a strong performance of the proposed approach, which performs proficiently and consistently across three distinct datasets with five sets of experiments. This study's outcomes indicate that the proposed method can be implemented in real-world applications (even with non-English languages) for flagging sexual predators, offensive or toxic content, hate speech, and discriminatory language in online discussions and comments to maintain respectful internet or digital communities. Furthermore, it can be employed for solving text classification problems with other potential applications such as sentiment analysis, spam and phishing detection, sorting legal documents, fake news detection, language identification, user intent recognition, text-based product categorization, medical record analysis, and resume screening.

연구 동기 및 목표

  • 다양한 데이터셋에 대해 고도로 최적화된 초모수 조정과 수작업 특징 엔지니어링이 필요한 전통적 텍스트 분류 방법의 한계를 해결하기 위해.
  • 대규모 언어 모델(Large Language Models, LLMs)을 활용해 온라인 성적 유혹 행동과 폭력적 언어를 탐지하기 위한 일반화되고 자동화된 접근법을 개발하기 위해.
  • 언어(영어, 로마우르두어, 우르두어), 데이터 크기, 클래스 불균형 등의 다양한 데이터 특성에서 피지테이닝된 Llama 2의 성능을 평가하기 위해.
  • 특히 자원이 부족한 데이터셋에서 영어와 다른 스크립트를 사용하는 언어인 우르두어와 같은 비영어 언어에서 해로운 콘텐츠 탐지 가능성을 입증하기 위해.
  • 예를 들어 성적 유혹 대화 탐지에 국한되지 않고 실제 디지털 안전 응용 분야에 적용 가능한 확장 가능한, 일률적인 솔루션을 마련하기 위해.

제안 방법

  • 텍스트 분류 작업에 효율적으로 적응시키기 위해 LoRA(Low-Rank Adaptation) 기법을 사용해 Llama 2 7B LLM을 피지테이닝하는 것.
  • 다양한 데이터 크기와 클래스 불균형 수준을 가진 세 가지 별도의 데이터셋(영어, 로마우르두어, 우르두어)에서 학습하는 것.
  • LLM의 사전 학습된 세계 지식과 맥락 이해 능력을 활용하는 제로샷에서 소수의 샘플로의 피지테이닝 전략을 적용하는 것.
  • 유해 콘텐츠 탐지 작업을 위해 표준 텍스트 분류 헤드와 교차 엔트로피 손실을 사용해 레이블을 예측하는 것.
  • 모든 데이터셋과 언어 변형에서 정확도, 정밀도, 재현도, F1 점수와 같은 표준 NLP 메트릭을 사용해 성능을 평가하는 것.
  • 재학습을 광범위하게 수행하지 않고도 모델 행동을 탐지 작업에 맞추기 위해 프롬프트 엔지니어링과 지시 조정을 적용하는 것.

실험 결과

연구 질문

  • RQ1피지테이닝된 Llama 2 7B LLM은 다양한 데이터 크기, 불균형 수준, 언어에서 일관되고 높은 성능을 달성할 수 있는가?
  • RQ2수작업 특징 엔지니어링과 분류기 선택에 의존하는 전통적 기계 학습 파이프라인에 비해 LLM 기반 접근법이 우수한 성능을 보이는가?
  • RQ3우르두어처럼 영어와 다른 스크립트를 사용하는 저자원 언어에서 폭력적이고 성적 유혹적인 콘텐츠 탐지에 LLM 접근법이 얼마나 효과적인가?
  • RQ4피지테이닝된 LLM은 짧은 대화 메시지와 더 긴 폭력적 메시지 등 다양한 길이와 유형의 텍스트에 일반화될 수 있는가?
  • RQ5LoRA 피지테이닝은 전문적인 탐지 작업에 적응시키는 동안 LLM의 일반 지식을 얼마나 잘 유지하는가?

주요 결과

  • 피지테이닝된 Llama 2 7B 모델은 로마우르두어 데이터셋에서 F1 점수 99.2%를 기록했으며, 이는 이전 연구에서 제안된 CNN(91.6%) 및 LogitBoost(99.2%)보다 뛰어난 성능이다.
  • 단지 1,736개의 학습 샘플만을 가진 우르두어 데이터셋에서도 저자원 환경임에도 불구하고 강력한 성능을 보였으며, 대부분의 전통적 방법보다 뛰어났다.
  • 모델은 데이터 크기, 불균형 정도, 언어에 관계없이 영어, 로마우르두어, 우르두어의 세 데이터셋 전반에서 일관된 성능을 보였다.
  • LLM 기반 접근법은 수작업 특징 엔지니어링과 분류기 선택이 필요 없었으며, 일반화되고 자동화된 파이프라인을 제공했다.
  • 모델은 다양한 텍스트 길이에서 뛰어난 내성성을 보였으며, 짧은 채팅 메시지와 더 긴 폭력적 콘텐츠 모두에 적합함을 시사했다.
  • 결과적으로 LoRA를 통해 피지테이닝된 Llama 2는 다국어 온라인 안전 분야의 실제 응용 분야, 예를 들어 혐오 발언, 사이버그루밍, 유해 콘텐츠 탐지에 효과적으로 도입될 수 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.