[논문 리뷰] COLD: A Benchmark for Chinese Offensive Language Detection
이 논문은 COLDataset(37,480개의 주석 처리된 댓글)과 COLDetector라는 BERT 기반 분류기로 구성된 중국어 공격적 언어 탐지용 벤치마크인 COLD를 소개한다. 이 벤치마크는 중국어 언어 모델에서 공격적 생성을 유도할 수 있는 입력, 특히 반편견 및 집단 대상 프롬프트가 공격적 출력을 유발할 수 있음을 드러내며, 배포 시 잠재적인 심각한 안전 위험을 보여준다.
Offensive language detection is increasingly crucial for maintaining a civilized social media platform and deploying pre-trained language models. However, this task in Chinese is still under exploration due to the scarcity of reliable datasets. To this end, we propose a benchmark --COLD for Chinese offensive language analysis, including a Chinese Offensive Language Dataset --COLDATASET and a baseline detector --COLDETECTOR which is trained on the dataset. We show that the COLD benchmark contributes to Chinese offensive language detection which is challenging for existing resources. We then deploy the COLDETECTOR and conduct detailed analyses on popular Chinese pre-trained language models. We first analyze the offensiveness of existing generative models and show that these models inevitably expose varying degrees of offensive issues. Furthermore, we investigate the factors that influence the offensive generations, and we find that anti-bias contents and keywords referring to certain groups or revealing negative attitudes trigger offensive outputs easier.
연구 동기 및 목표
- 중국어 공격적 언어 탐지용 신뢰할 수 있는 데이터셋과 검출기가 부족한 문제를 해결하기 위해.
- 인기 있는 중국어 생성 언어 모델의 공격성 수준을 평가하고 공격적 출력을 유도하는 요인을 특정하기 위해.
- 반편견 프롬프트와 같이 비공격적인 입력이 여전히 공격적 생성을 유도할 수 있는지 조사하기 위해.
- 향후 중국어 NLP 분야에서 공격적 언어에 관한 연구를 위한 표준화된 벤치마크를 제공하기 위해.
- 보기에는 중립적이거나 윤리적인 내용이지만 간과할 수 있는 안전 위험에 대한 경각심을 일깨우기 위해.
제안 방법
- COLDataset는 37,480개의 중국어 소셜미디어 댓글을 반자동 및 수동 주석 처리하여 이진 공격성 레이블을 부여함으로써 구축되었다.
- 테스트 세트에는 공격적 내용을 세분화하여 개인 공격, 집단 공격, 반편견, 기타 비공격적 유형으로 분류하는 세분화된 주석 체계가 적용되었다.
- COLDetector는 COLDataset에 맞춰 미세조정된 BERT-base-Chinese 모델로, 기준 공격적 언어 검출기 역할을 한다.
- 벤치마크는 CDialGPT, CPM, EVA와 같은 주요 중국어 생성 모델에서의 공격적 생성 위험을 평가하는 데 사용되었다.
- 입력 프롬프트를 체계적으로 변화시켜, 반편견 언어, 집단 특화 关련 키워드, 부정적 태도 어휘 등 촉발 요인을 분석하였다.
- 통계적 분석을 통해 다양한 입력 유형 간의 공격적 출력 비율을 비교하여 고위험 촉발 요인을 규명하였다.
실험 결과
연구 질문
- RQ1비공격적이거나 반편견적 내용으로 프롬프트된 중국어 생성 언어 모델이 얼마나 공격적인 출력을 생성하는가?
- RQ2집단 대상 키워드나 부정적 태도 어휘와 같은 어떤 입력 유형이 공격적 생성을 가장 잘 유도하는가?
- RQ3COLDetector는 기존 방법 대비 중국어 공격적 언어 탐지에서 어떤 성능을 보이는가?
- RQ4COLD와 같은 벤치마크가 중국어 언어 모델의 배포 이전 안전 위험을 식별하고 완화하는 데 도움이 될 수 있는가?
- RQ5왜 일부 비공격적 입력은 명시적으로 공격적인 입력과 유사한 비율로 공격적 출력을 유도하는가?
주요 결과
- 공격적 입력 뿐 아니라 비공격적 입력, 특히 반편견 프롬프트까지도 중국어 언어 모델에서 공격적 생성을 유도할 수 있으며, 비공격적 입력의 공격적 출력 비율이 명시적 공격적 입력과 유사하게 나타났다.
- 공정성을 추구하는 반편견 콘텐츠는 집단 특화 키워드와 부정적 태도 어휘가 내재되어 있어 공격적 출력을 더 자주 유도한다.
- COLDetector는 COLDataset에서 뛰어난 성능을 보였으며, 제안된 벤치마크에 맞춰 미세조정된 경우 기존 방법보다 뛰어난 성능을 보였다.
- 벤치마크는 현재 데이터셋에서 맥락 정보가 반영되지 않았음을 드러내어 향후 대화 수준의 공격적 언어 탐지 작업이 필요하다는 점을 시사한다.
- 기준 모델의 성능은 데이터 커버리지와 학습 기법의 한계로 인해 제한되어 있어, 더 다양한 및 세분화된 주석이 추가될 경우 향상 가능성이 있음을 시사한다.
- 비공격적으로 보이지만 윤리적으로 중립적이거나 긍정적인 입력에서도 안전 문제를 간과할 수 있음을 강조하며, 모델 평가 시 더 넓은 검출 기준이 필요하다고 주장한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.