[논문 리뷰] Towards Auditing Large Language Models: Improving Text-based Stereotype Detection
이 논문은 성별, 인종, 직업, 종교를 아우르는 52,751개의 인스턴스를 포함하는 새로운 멀티그레인 스테레오타입 데이터셋을 소개하고, 영어 텍스트를 위한 다중 클래스 스테레오타입 분류기를 제안한다. 이 모델은 일대다 이진 기반 모델보다 뛰어난 성능을 보이며, XAI 도구를 통해 일관된 특징 중요도 신호를 확인하고, GPT 계열 모델에서 시간이 지남에 따라 편향이 유의미하게 감소하는 것으로 드러나, LLM의 스테레오타입 편향을 감시하기 위한 견고한 프레임워크를 확립한다.
Large Language Models (LLM) have made significant advances in the recent past becoming more mainstream in Artificial Intelligence (AI) enabled human-facing applications. However, LLMs often generate stereotypical output inherited from historical data, amplifying societal biases and raising ethical concerns. This work introduces i) the Multi-Grain Stereotype Dataset, which includes 52,751 instances of gender, race, profession and religion stereotypic text and ii) a novel stereotype classifier for English text. We design several experiments to rigorously test the proposed model trained on the novel dataset. Our experiments show that training the model in a multi-class setting can outperform the one-vs-all binary counterpart. Consistent feature importance signals from different eXplainable AI tools demonstrate that the new model exploits relevant text features. We utilise the newly created model to assess the stereotypic behaviour of the popular GPT family of models and observe the reduction of bias over time. In summary, our work establishes a robust and practical framework for auditing and evaluating the stereotypic bias in LLM.
연구 동기 및 목표
- 편향된 훈련 데이터에서 유래한 대규모 언어 모델(LLM)의 스테레오타입 출력에 대한 증가하는 윤리적 우려를 다루기 위해.
- 성별, 인종, 직업, 종교를 아우르는 다각적 스테레오타입을 포괄하는 종합적인 다중 그레인 데이터셋을 구축하기 위해.
- 기존의 일대다 이진 접근 방식보다 뛰어난 성능을 보이는 새로운 스테레오타입 분류기를 개발하기 위해.
- LLM의 스테레오타입 편향을 평가하고 모니터링하기 위한 실용적이고 감사 가능한 프레임워크를 제공하기 위해.
- GPT 계열과 같은 인기 있는 LLM에서 편향의 변화 과정을 분석하기 위해.
제안 방법
- 성별, 인종, 직업, 종교의 네 가지 스테레오타입 범주에 걸쳐 52,751개의 인간 레이블이 부여된 멀티그레인 스테레오타입 데이터셋을 구축하기 위해.
- 새로운 데이터셋으로 훈련된 다중 클래스 스테레오타입 분류기를 설계하여 영어 텍스트 내의 스테레오타입 연관성을 탐지하기 위해.
- 특징 중요도 신호의 일관성과 모델의 해석 가능성 보장을 위해 다수의 설명 가능한 AI(XAI) 도구를 사용하기 위해.
- 비교 평가를 위해 다중 클래스 및 일대다 이진 설정 모두에서 분류기를 훈련하기 위해.
- 다른 버전의 GPT 계열 모델을 감시하기 위해 훈련된 분류기를 적용하여 편향의 변화 추세를 추적하기 위해.
- 모델 성능과 편향 추세를 비교하기 위해 표준화된 평가 프로토콜을 적용하기 위해.
실험 결과
연구 질문
- RQ1다중 클래스 스테레오타입 분류기가 전통적인 일대다 이진 분류기보다 텍스트 기반 스테레오타입을 탐지하는 데 더 뛰어난 성능을 보일 수 있는가?
- RQ2여러 XAI 도구 간에 일관된 특징 중요도 신호가 나타나는가? 이는 신뢰할 수 있는 모델 행동을 의미하는가?
- RQ3GPT 계열 모델의 스테레오타입 편향은 다양한 세대와 버전 간에 어떻게 변화하는가?
- RQ4새로운 멀티그레인 스테레오타입 데이터셋이 교차적 스테레오타입 탐지에 얼마나 기여하는가?
- RQ5제안된 프레임워크는 배포된 LLM에서 편향을 감시하고 모니터링하기 위한 실용적인 도구로 사용될 수 있는가?
주요 결과
- 다중 클래스 분류기는 일대다 이진 기반 모델보다 뛰어난 성능을 보이며, 동시에 스테레오타입 탐지의 이점을 입증한다.
- 여러 XAI 도구가 일관된 특징 중요도 신호를 생성하여, 모델이 전문 직업 및 성별에 따라 달라지는 대명사와 같은 관련 언어적 신호에 의존하고 있음을 확인한다.
- GPT 계열 모델의 후속 버전을 통해 스테레오타입 출력의 유의미한 감소가 탐지되어 편향 완화에 진전이 있음을 시사한다.
- 멀티그레인 스테레오타입 데이터셋은 성별, 인종, 직업, 종교에 걸쳐 다양한 교차적 스테레오타입을 효과적으로 포착한다.
- 제안된 프레임워크는 LLM의 스테레오타입 편향을 체계적으로 감시할 수 있게 하며, 확장 가능하고 해석 가능한 평가 파이프라인을 제공한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.