[논문 리뷰] Reducing Non-Normative Text Generation from Language Models
이 논문은 규범적 텍스트 분류기를 보상 신호로 사용하여 GPT-2를 강화학습 기반 정밀조정하는 정책 기반 강화학습 접근법을 제안한다. 이는 다섯 개의 데이터셋에서 비규범적 텍스트 생성을 27–61% 감소시킨다. 이 방법은 규범적 코퍼스에서의 대규모 재학습이 필요 없이, 사전에 학습된 분류기를 활용해 사회적으로 적절한 출력으로 모델을 이끌어낸다.
Large-scale, transformer-based language models such as GPT-2 are pretrained on diverse corpora scraped from the internet. Consequently, they are prone to generating non-normative text (i.e. in violation of social norms). We introduce a technique for fine-tuning GPT-2, using a policy gradient reinforcement learning technique and a normative text classifier to produce reward and punishment values. We evaluate our technique on five data sets using automated and human participant experiments. The normative text classifier is 81-90% accurate when compared to gold-standard human judgments of normative and non-normative generated text. Our normative fine-tuning technique is able to reduce non-normative text by 27-61%, depending on the data set.
연구 동기 및 목표
- 인터넷에서 크롤링한 데이터로부터 유해하거나 이단적인 행동을 반영하는 경향이 있는 대규모 언어모델(GPT-2 등)이 생성하는 비규범적 텍스트를 줄이기 위해.
- 가치 정렬 전제(특히 규범적 텍스트 분류기)가 강화학습을 위한 효과적인 비미분 가능 보상 함수로 기능할 수 있는지 탐색하기 위해.
- 자동화된 메트릭과 인간 평가를 모두 활용하여 다양한 데이터셋에서 이 방법의 효과성을 평가하기 위해.
- 감성 및 독성 탐지와 같은 다른 분류 작업에 동일한 기법을 적용하여 일반화 능력을 입증하기 위해.
- 해로운 언어 생성을 제어하기 위한 대규모 재학습 또는 데이터셋의 편향 제거와 대체 가능한 확장 가능한, 데이터 효율적인 방법을 제공하기 위해.
제안 방법
- 사전에 학습된 규범적 텍스트 분류기에서 유도된 보상 신호를 사용하여 GPT-2를 정책 기반 강화학습으로 정밀조정한다.
- Goofus & Gallant 만화 스토리에서 학습된 규범적 분류기는 생성된 텍스트를 규범적 또는 비규범적으로 레이블링하여 강화학습의 보상 신호를 제공한다.
- 보상 함수는 비가역적이므로, 모델의 출력 품질에 기반한 역전파 업데이트를 위해 정책 기반 그래디언트를 사용한다.
- ROCStories, Plotto, 과학소설 서사 등 다양한 데이터셋에 이 방법을 적용하여 일반화 능력과 효과성을 평가한다.
- 규범적 분류기를 부정적 감성 및 독성 언어 탐지 모델로 대체하여 아블레이션을 수행함으로써, 다양한 기준으로의 이식 가능성(전이 가능성)을 입증한다.
- 모든 테스트 세트에서 비규범적 콘텐츠 감소를 검증하기 위해 인간 평가와 자동화된 메트릭을 함께 사용한다.
실험 결과
연구 질문
- RQ1사전에 학습된 규범적 텍스트 분류기가 GPT-2에서 비규범적 텍스트 생성을 줄이기 위해 효과적으로 보상 함수로 기능할 수 있는가?
- RQ2이 강화학습 기반 정밀조정 방법이 다양한 텍스트 생성 작업에서 비규범적 출력을 얼마나 줄일 수 있는가?
- RQ3감성 또는 독성 탐지와 같은 다른 기준으로 학습된 분류기를 사용할 경우, 이 방법이 일반화되는가?
- RQ4기본적으로 비규범성 수준이 다른 데이터셋 간에서 이 방법의 성능는 어떻게 달라지는가?
- RQ5이 기법은 더 큰 규모의 데이터 재학습 또는 편향 제거와 대체 가능한 확장 가능한 방법으로 활용될 수 있는가?
주요 결과
- 제안된 정밀조정 방법은 다섯 개의 평가 데이터셋에서 비규범적 텍스트 생성을 27–61% 감소시켰으며, 더 높은 비율의 비규범적 텍스트를 포함한 데이터셋에서 더 큰 감소율을 보였다.
- 연구에서 사용된 규범적 텍스트 분류기는 규범적 및 비규범적 텍스트에 대한 황금 표준 인간 평가와 비교해 81–90%의 정확도를 달성했다.
- 이 방법은 다른 분류 작업으로도 일반화되었으며, 부정적 감성 및 독성 언어 탐지 분류기를 사용할 경우에도 효과적이었다.
- 인간 평가 결과, 정밀조정된 모델이 유의미하게 더 적은 비규범적 서술을 생성하는 것으로 확인되어 자동화된 결과를 지지했다.
- 규범적 분류기는 Goofus & Gallant 만화에서 소량의 few-shot 데이터로 학습되었음에도 불구하고, 이 기법은 제한된 레이블된 데이터로도 효과적으로 작동했다.
- 이 방법은 대규모 재학습이 필요 없이 가치 정렬 전제에 따라 생성을 정렬함으로써 언어 모델의 자가 검열 행동을 가능하게 한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.