Skip to main content
QUICK REVIEW

[논문 리뷰] Explaining Hate Speech Classification with Model Agnostic Methods

Durgesh Nandini, Ute Schmid|arXiv (Cornell University)|2023. 05. 30.
Adversarial Robustness in Machine Learning인용 수 4
한 줄 요약

이 논문은 예측에 BERT를 사용하고 해석 가능성에 LIME을 사용하는 모델에 종속되지 않는 후행 해석 프레임워크를 제안한다. 이 방법은 높은 분류 성능를 유지하면서도 영향력 있는 텍스트 특징을 효과적으로 식별함으로써 소셜미디어 텍스트에서 모델 결정에 대한 투명하고 편향이 감소된 설명을 제공한다.

ABSTRACT

There have been remarkable breakthroughs in Machine Learning and Artificial Intelligence, notably in the areas of Natural Language Processing and Deep Learning. Additionally, hate speech detection in dialogues has been gaining popularity among Natural Language Processing researchers with the increased use of social media. However, as evidenced by the recent trends, the need for the dimensions of explainability and interpretability in AI models has been deeply realised. Taking note of the factors above, the research goal of this paper is to bridge the gap between hate speech prediction and the explanations generated by the system to support its decision. This has been achieved by first predicting the classification of a text and then providing a posthoc, model agnostic and surrogate interpretability approach for explainability and to prevent model bias. The bidirectional transformer model BERT has been used for prediction because of its state of the art efficiency over other Machine Learning models. The model agnostic algorithm LIME generates explanations for the output of a trained classifier and predicts the features that influence the model decision. The predictions generated from the model were evaluated manually, and after thorough evaluation, we observed that the model performs efficiently in predicting and explaining its prediction. Lastly, we suggest further directions for the expansion of the provided research work.

연구 동기 및 목표

  • NLP에서 혐오 발언 예측과 모델의 해석 가능성 간 격차를 메우기 위해.
  • 혐오 발언 분류 결정에 대해 후행적이고 모델에 종속되지 않는 설명을 제공하기 위해.
  • 소셜미디어 텍스트 분석에서 설명 가능성 기법을 통해 모델 편향을 줄이기 위해.
  • 수동 평가를 통해 설명의 효과성을 평가하기 위해.
  • 해석 가능한 혐오 발언 탐지 시스템의 향후 확장 기반을 마련하기 위해.

제안 방법

  • 소셜미디어 텍스트에서 혐오 발언 탐지에 사용하기 위해 미세조정된 BERT를 주요 분류기로 사용하였다.
  • 로컬이고 인스턴스 수준의 설명을 생성하기 위해 모델에 종속되지 않는 설명 방법으로 LIME을 적용하였다.
  • 입력 토큰을 변형하여 모델의 예측에 영향을 주는 특징를 식별하기 위해 LIME을 사용하였다.
  • 변형된 샘플들에 대한 특징 중요도 점수를 분석하여 대체가치 설명을 생성하였다.
  • 수동 주석을 통해 설명의 충실도와 관련성을 평가하기 위해 설명을 평가하였다.
  • BERT의 높은 예측 정확도와 LIME의 해석 가능성의 조합을 통해 투명한 의사결정을 가능하게 하였다.

실험 결과

연구 질문

  • RQ1BERT가 생성한 혐오 발언 예측을 모델에 종속되지 않는 방법(예: LIME)이 얼마나 효과적으로 설명할 수 있는가?
  • RQ2BERT의 혐오 발언 분류 결정에서 가장 영향력 있는 텍스트 특징는 무엇인가?
  • RQ3LIME가 생성한 설명이 인간 주석 기반의 이유와 얼마나 일치하는가?
  • RQ4후행 설명 방법은 혐오 발언 탐지에서 모델 편향의 위험을 줄일 수 있는가?
  • RQ5최신 NLP 모델에 대해 해석 가능성은 어떻게 체계적으로 통합될 수 있는가?

주요 결과

  • BERT 기반 분류기는 목표 데이터셋에서 최첨단 성능을 보이며 혐오 발언 탐지에 높은 효과성을 입증하였다.
  • LIME는 모델의 예측에 영향을 주는 의미적으로 관련 있는 단어를 강조한 로컬이고 인스턴스 전용 설명을 성공적으로 생성하였다.
  • 수동 평가를 통해 설명이 충실하고 의미가 있으며 인간 주석 기반의 이유와 높은 일치도를 보였다.
  • 모델에 종속되지 않는 접근 방식을 통해 BERT 분류기의 아키텍처 변경 없이도 해석 가능성을 확보하였다.
  • LIME의 통합은 투명성을 높이고 투명하지 않거나 편향된 모델 결정의 위험을 줄였다.
  • 결과는 고정확도 모델과 후행 설명 기법을 조합하는 것이 윤리적인 AI 구현에 실현 가능함을 뒷받침한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.