[논문 리뷰] Few-shot Instruction Prompts for Pretrained Language Models to Detect Social Biases
이 논문은 피팅 트레이닝 없이 소수의 지도 데이터를 사용하여 텍스트 내 소수의 편향을 탐지하기 위한 소수 샘플 지시 프롬프팅 방법을 제안한다. 소규모 레이블링된 레포지터리에서 클래스 균형을 이루고 의미적으로 유사한 예시를 선택하고, 이를 구조화된 지시 프롬프트로 사용하여 대규모 사전 훈련된 언어 모델(PLM)을 활용함으로써, 다양한 편향 탐지 작업에서 최신 기술 수준 또는 경쟁력 있는 성능을 달성한다. 530B 파라미터 모델은 최소 13%의 AUC 향상을 보이며, 레이블링된 샘플이 100개 밖에 없을 때에도 강건한 성능을 유지한다.
Detecting social bias in text is challenging due to nuance, subjectivity, and difficulty in obtaining good quality labeled datasets at scale, especially given the evolving nature of social biases and society. To address these challenges, we propose a few-shot instruction-based method for prompting pre-trained language models (LMs). We select a few class-balanced exemplars from a small support repository that are closest to the query to be labeled in the embedding space. We then provide the LM with instruction that consists of this subset of labeled exemplars, the query text to be classified, a definition of bias, and prompt it to make a decision. We demonstrate that large LMs used in a few-shot context can detect different types of fine-grained biases with similar and sometimes superior accuracy to fine-tuned models. We observe that the largest 530B parameter model is significantly more effective in detecting social bias compared to smaller models (achieving at least 13% improvement in AUC metric compared to other models). It also maintains a high AUC (dropping less than 2%) when the labeled repository is reduced to as few as $100$ samples. Large pretrained language models thus make it easier and quicker to build new bias detectors.
연구 동기 및 목표
- 큰 비용이 들거나 노이즈가 많은 레이블링 데이터셋이 필요로 하지 않으면서도, 텍스트 내 미묘하고 주관적인 사회적 편향을 탐지하는 데 도전하는 것.
- 대규모 PLM의 피팅 트레이닝에 따른 한계, 즉 높은 계산 비용, 치명적인 기억 상실, 소규모 데이터셋에서의 과적합 문제를 극복하는 것.
- 다양한 유형의 편향에 대해 제로샷 및 소수 샘플 탐지에 효과적으로 작용할 수 있도록 대규모 PLM의 내부 지식을 활용하는 융통성 있는 소수 샘플 프롬프팅 프레임워크를 개발하는 것.
- 무작위 또는 균일한 샘플링 대신 클래스 균형을 이룬 의미적으로 유사한 예시를 선택하여 성능과 강건성을 향상시키는 것.
- 효과적으로 프롬프팅된 대규모 PLM가 최소한의 레이블링 데이터만으로도 피팅 트레이닝된 모델보다 편향 탐지에서 뛰어난 성능을 보일 수 있음을 입증하는 것.
제안 방법
- 이 방법은 쿼리 텍스트와 소규모 서포트 레포지터리의 레이블링 예시를 공통된 의미 공간에 임bedding하는 문장 인코더를 사용한다.
- 쿼리 임베딩과 레포지터리 임베딩 간의 코사인 유사도를 기반으로 각 클래스당 고정된 수의 예시를 선택함으로써 클래스 균형을 확보한다.
- 선택된 예시와 편향의 정의, 쿼리 텍스트를 자연어 지시 프롬프트로 조합하며, 빈칸 채우기 템플릿 형식으로 포맷한다.
- 이 프롬프트는 대규모 사전 훈련된 언어 모델(예: 530B 파라미터 모델)에 입력되며, 각 편향 클래스에 대한 조건부 토큰 확률에 기반해 예측을 생성한다.
- 이 방법은 모델의 내부 지식과 일반화 능력에 의존하며, 피팅 트레이닝이나 파rameter 업데이트를 전혀 수행하지 않는다.
- 이 방법은 인간이 애너테이션한 데이터셋을 사용해 다수의 이진 및 다중 클래스 편향 탐지 작업에서 평가된다.
실험 결과
연구 질문
- RQ1의미적으로 선택된 예시를 사용한 소수 샘플 지시 프롬프팅이, 편향 탐지에서 피팅 트레이닝된 모델보다 우월한 성능을 보일 수 있는가?
- RQ2다양한 프롬프트 설계와 예시 선택 전략이 대규모 사전 훈련된 언어 모델의 성능에 어떤 영향을 미치는가?
- RQ3레이블링 레포지터리의 크기가 크게 줄어들었을 때, 이 방법이 얼마나 높은 성능을 유지할 수 있는가?
- RQ4클래스 균형을 이룬 의미적 예시를 사용할 경우, 무작위 또는 균일한 샘플링보다 탐지 정확도가 향상되는가?
- RQ5동일한 프롬프팅 프레임워크가 굵직한 및 미세한 분류 유형을 포함한 다양한 유형의 편향에 대해 일반화 가능한가?
주요 결과
- 530B 파라미터 대규모 언어 모델은 대부분의 편향 탐지 작업에서 더 작은 모델들보다 최소 13% 이상의 AUC 향상을 기록했다.
- 이 방법은 최소한의 레이블링 데이터를 사용해도 높은 성능를 유지했으며, 레이블링 레포지터리가 35,000개에서 100개로 줄어들었을 때 AUC가 2% 미만으로 감소했다.
- 소수 샘플 프롬프팅 접근법은 평가된 8개 작업 중 3개에서 피팅 트레이닝된 모델을 능가했으며, 더 나은 일반화 능력을 보였다.
- 이 방법은 암묵적, 대상 지향적, 맥락 의존적 형태의 다양한 사회적 편향을 성공적으로 탐지함으로써 강건성과 유연성을 입증했다.
- 아블레이션 스터디와 정성적 분석을 통해, 이 방법이 표면적 히وري스틱이나 키워드 매칭이 아닌 깊은 의미적 이해에 기반한다는 것이 확인되었다.
- 이 프레임워크는 이진 및 다중 클래스 편향 분류 작업 모두에서 효과적으로 작동했으며, 다양한 편향 정의와 대상 집단에 적응 가능함을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.