Skip to main content
QUICK REVIEW

[논문 리뷰] On Measuring Social Biases in Prompt-Based Multi-Task Learning

Afra Feyza Akyürek, Sejin Paik|arXiv (Cornell University)|2022. 05. 23.
Topic Modeling인용 수 4
한 줄 요약

이 논문은 입력 형식이 프롬프트 기반 다중 작업 학습에서 사회적 편향에 어떻게 영향을 미치는지 조사한다. 주로 대규모 텍스트-투-텍스트 언어 모델인 T0를 대상으로 한다. 의미적으로 동일한 입력에 대해 질문-답변(QA) 형식과 전제-가설(NLI) 형식을 비교함으로써, 저자는 T0가 성능은 유사함에도 불구하고 훈련 데이터의 정렬에 기인하여 QA 형식에서 훨씬 더 높은 편향을 보임을 발견한다. 저자는 수작업으로 작성된 가설을 가진 자연어 추론(NLI)에 대한 첫 번째 편향 벤치마크인 BBNLI를 도입하였으며, 향후 다중 작업 모델에서 편향 완화 연구를 지원하기 위해 코드와 데이터를 공개한다.

ABSTRACT

Large language models trained on a mixture of NLP tasks that are converted into a text-to-text format using prompts, can generalize into novel forms of language and handle novel tasks. A large body of work within prompt engineering attempts to understand the effects of input forms and prompts in achieving superior performance. We consider an alternative measure and inquire whether the way in which an input is encoded affects social biases promoted in outputs. In this paper, we study T0, a large-scale multi-task text-to-text language model trained using prompt-based learning. We consider two different forms of semantically equivalent inputs: question-answer format and premise-hypothesis format. We use an existing bias benchmark for the former BBQ and create the first bias benchmark in natural language inference BBNLI with hand-written hypotheses while also converting each benchmark into the other form. The results on two benchmarks suggest that given two different formulations of essentially the same input, T0 conspicuously acts more biased in question answering form, which is seen during training, compared to premise-hypothesis form which is unlike its training examples. Code and data are released under https://github.com/feyzaakyurek/bbnli.

연구 동기 및 목표

  • 문제의 내용과는 별개로, 문제를 인코딩하는 방식이 대규모 언어 모델에서 사회적 편향에 영향을 미치는지 조사하는 것.
  • 동일한 의미적 입력에 대해 질문-답변(QA) 형식과 자연어 추론(NLI) 형식 간의 편향 수준을 비교하는 것.
  • 수작업으로 작성된 가설을 가진 자연어 추론(NLI)에 대한 첫 번째 편향 벤치마크인 BBNLI를 제작하고 공개하여, 인지적 및 사회적 편향에 대한 체계적 평가를 지원하는 것.
  • 특히 다양한 프롬프트로 훈련된 T0와 같은 모델에서, 입력 형식과 내용을 분리하여 영향을 분석하는 것.
  • 모델 성능을 저하시키지 않은 채, 대체 입력 형식을 통해 편향을 완화할 수 있는 통찰을 제공하는 것.

제안 방법

  • 저자는 62개 데이터셋과 12개 작업을 아우르는 다양한 프롬프트로 훈련된 11B 파라미터 다중 작업 텍스트-투-텍스트 모델인 T0를 사용한다.
  • 편향 평가에 두 가지 벤치마크를 사용한다: BBQ(기존의 QA 편향 벤치마크)와 BBNLI(16개의 해로운 스테레오타입에 대해 세 가지 도메인에서 수작업으로 작성된 가설을 가진 새로운 NLI 편향 벤치마크).
  • BBNLI의 각 예제는 QA 형식과 NLI 형식으로 모두 제공되어, 의미적으로 동일한 입력을 유지하면서도 입력 형식 간 모델 행동을 직접 비교할 수 있도록 한다.
  • 기존의 BBQ 예제를 NLI 형식으로 변환(BBQ → NLI)하고, 반대로 BBNLI → QA로의 역방향 벤치마크를 제작하여 입력 형식 간 균형 잡힌 비교를 확보한다.
  • 편향은 두 형식 모두에서 스테레오타입적 대비 반스테레오타입적 출력에 대한 모델의 선호도를 계산하여 측정한다.
  • 모든 코드와 데이터셋은 https://github.com/feyzaakyurek/bbnli 에 공개되어 재현성과 향후 연구를 지원한다.

실험 결과

연구 질문

  • RQ1예를 들어 질문-답변 형식과 전제-가설 형식 간의 입력 형식이, 내용과는 별개로 다중 작업 언어 모델에서 사회적 편향 수준에 영향을 미치는가?
  • RQ2훈련 데이터에 존재한 형식(예: QA)과 존재하지 않은 형식(예: NLI) 간의 편향 수준는 어떻게 비교되는가?
  • RQ3동일한 의미적 입력이 다른 프롬프트 템플릿으로 재구성될 경우, 모델의 행동은 어느 정도 변화하는가?
  • RQ4새로운 자연어 추론 벤치마크(BBNLI)가 다중 작업 모델에서 인지적 및 사회적 편향을 효과적으로 캡처하고 측정할 수 있는가?
  • RQ5모델 성능을 손상시키지 않고도 대체 입력 형식이 편향을 줄일 수 있는가?

주요 결과

  • T0는 의미적으로 동일한 내용을 가진 경우에도 질문-답변(QA) 형식에서 자연어 추론(NLI) 형식보다 유의미하게 더 높은 사회적 편향을 보인다.
  • 편향의 차이는 성능 저하 때문이 아니며, 두 입력 형식 간에 모델 정확도가 안정적으로 유지됨을 확인하였다.
  • 모델이 QA 형식에서 더 강한 편향을 보이는 것은 훈련 데이터 패턴과 일치하기 때문이며, 이는 훈련 데이터 분포가 편향에 대한 민감도를 결정짓는다는 것을 시사한다.
  • BBNLI 벤치마크는 세 가지 도메인에 걸쳐 복잡한 스킵-로직을 포함한 16개의 해로운 사회적 스테레오타입을 성공적으로 캡처하였다.
  • 이 연구는 입력 형식이 편향 완화의 수단이 될 수 있음을 입증하였으며, 훈련 데이터에 포함되지 않은 NLI 형식은 T0에서 편향을 감소시키는 데 기여한다.
  • BBNLI와 관련 데이터셋의 공개는 향후 다중 작업 및 제로샷 일반화 설정에서의 편향 연구를 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.