Skip to main content
QUICK REVIEW

[논문 리뷰] Chain of Explanation: New Prompting Method to Generate Higher Quality Natural Language Explanation for Implicit Hate Speech

Huang Fan, Haewoon Kwak|arXiv (Cornell University)|2022. 09. 11.
Topic Modeling인용 수 4
한 줄 요약

이 논문은 히ュ리스틱 단어, 증오의 의도 표현, 대상 집단 식별을 통합함으로써 암묵적 증오 발언에 대한 자연어 설명(NLE) 품질을 향상시키는 새로운 방법인 체인 오브 엑스플레인레이션(CoE) 프롬프팅을 소개한다. 이 방법은 BLEU-1 점수를 44.0에서 62.3으로 상승시키며, 인간 평가에서도 높은 점수를 기록하여 생성된 NLE가 높은 정보성(4.48/7)과 명확성(4.34/7)을 보이며, 베이스라인 모델을 능가하고 인간이 작성한 설명과 유사한 수준을 확보한다.

ABSTRACT

Recent studies have exploited advanced generative language models to generate Natural Language Explanations (NLE) for why a certain text could be hateful. We propose the Chain of Explanation (CoE) Prompting method, using the heuristic words and target group, to generate high-quality NLE for implicit hate speech. We improved the BLUE score from 44.0 to 62.3 for NLE generation by providing accurate target information. We then evaluate the quality of generated NLE using various automatic metrics and human annotations of informativeness and clarity scores.

연구 동기 및 목표

  • 암묵적 증오 발언에 대한 고품질 자연어 설명(NLE)의 부족을 해결하기 위해, 이는 명시적 형태보다 탐지가 더 어려운 편이다.
  • 사전 훈련된 언어 모델(PLM)을 사용하여 NLE 생성을 향상시키기 위한 프롬프팅 기법의 잠재력을 탐색하기 위해.
  • 표준 자동 평가 지표를 넘어서 인간의 주석을 통합하여 정보성과 명확성 평가를 포함함으로써 NLE 품질 평가를 종합적으로 수행하기 위해.
  • 자동 평가 지표와 인간 평가 간의 상관관계를 조사하기 위해.
  • 암묵적 증오 발언 탐지에 대한 NLE의 충실도와 해석 가능성 향상을 위한 프롬프팅 프레임워크를 제안하기 위해.

제안 방법

  • 히ュ리스틱 단어, 증오의 의도 표현, 대상 집단 식별을 통합한 체인 오브 엑스플레인레이션(CoE) 프롬프팅 프레임워크를 제안한다.
  • 시퀀스 투 시퀀스 입력 형식을 사용한다: [STR] + H_text + tweet + [SEP] + D_hate + [SEP] + D_target + [SEP] + H_NLE + 생성된 NLE + [END].
  • 다음과 같은 구조화된 프롬프팅을 통합한다: '주어진 텍스트: ', '이 텍스트는 증오스럽습니까? 예', '대상 집단은: {target}', 그리고 '이것이 증오스러운 이유는:'를 통해 설명 생성을 유도한다.
  • LatentHatred 데이터셋에서 CoE 프롬프트를 사용하여 여러 생성형 언어 모델(BART, T5 등)을 훈련하고 평가한다.
  • 포괄적인 평가를 위해 자동 평가 지표(BLEU, ROUGE, BERTScore, BLEURT, SARI, NUBIA)와 인간 평가를 모두 활용한다.
  • 정보성과 명확성에 대한 인간 주석을 위해 세 명의 경험이 풍부한 연구보조원을 활용하였으며, 모호한 케이스를 필터링한 후 Krippendorff’s alpha를 통한 간접자간 신뢰도는 0.35였다.

실험 결과

연구 질문

  • RQ1프롬프팅 기법이 암묵적 증오 발언에 대한 자연어 설명(NLE) 품질을 유의미하게 향상시킬 수 있는가?
  • RQ2대상 집단 정보를 프롬프트에 통합할 경우 NLE 품질과 자동 평가 지표 점수에 어떤 영향을 미치는가?
  • RQ3BLEU, ROUGE, BERTScore와 같은 자동 평가 지표가 인간 평가의 정보성과 명확성과 얼마나 상관이 있는가?
  • RQ4CoE 프롬프팅 방법은 자동 회귀 생성 기반 모델 대비 설명 품질과 충실도 측면에서 어떻게 비교되는가?
  • RQ5구조화된 프롬프팅이 모델이 생성한 설명의 모호성을 줄이고 해석 가능성 향상에 어떤 영향을 미치는가?

주요 결과

  • CoE 프롬프팅 방법은 BLEU-1 점수를 44.0(베이스라인)에서 62.3으로 상승시켜 기준 설명과의 n-gram 겹침 수준을 뚜렷이 향상시켰다.
  • 프롬프트에서 대상 집단 정보를 제거할 경우 BLEU-1 점수가 15.5점 하락함으로써, 이 정보가 설명 품질 향상에 핵심적인 역할을 한다는 점을 확인했다.
  • 최고의 모델이 생성한 NLE에 대한 인간 주석 기반 정보성 및 명확성 점수는 각각 4.48/7과 4.34/7이었으며, 인간이 작성한 설명(5.20 및 4.53)과 유사한 수준의 높은 일치도를 보였다.
  • BLEURT, BERTScore, NUBIA는 인간 평가와 가장 강한 슼머 상관관계(r = 0.50, 0.34, 0.48)를 보였으며, ROUGE-L 및 SARI와 같은 전통적 지표를 능가했다.
  • SARI는 명확성 평가와 가장 낮은 상관관계(0.051)를 보였으며, NLE 평가에 있어 신뢰성이 떨어짐을 시사했다.
  • 자동 평가 지표와 인간 평가 간 상관관계는 다양하게 나타났다: BLEU-1과 ROUGE-L은 정보성 평가와 더 강한 상관관계(r = 0.31 및 0.32)를 보였지만, 명확성 평가와는 상대적으로 낮은 상관관계(r = 0.15 및 0.18)를 보였으며, 이는 자동 지표가 의미적 명확성을 충분히 반영하지 못함을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.