Skip to main content
QUICK REVIEW

[논문 리뷰] Adding guardrails to advanced chatbots

Yanchen Wang, Lisa Singh|arXiv (Cornell University)|2023. 06. 13.
Artificial Intelligence in Healthcare and Education인용 수 6
한 줄 요약

이 논문은 직업 관련 질의에서 ChatGPT의 공정성에 대해 평가하며, 검색 엔진으로서는 잘 기능하지만 텍스트 및 코드 생성에서 인구 통계적 편향을 보임을 발견한다. 편향 보정을 위한 프롬프트 및 응답 수정, 응답 금지 조치, 그리고 독립적인 자문위원회를 제안하며, 투명하지 않은 대규모 언어 모델에 윤리적 보호 장치가 급히 필요하다고 강조한다.

ABSTRACT

Generative AI models continue to become more powerful. The launch of ChatGPT in November 2022 has ushered in a new era of AI. ChatGPT and other similar chatbots have a range of capabilities, from answering student homework questions to creating music and art. There are already concerns that humans may be replaced by chatbots for a variety of jobs. Because of the wide spectrum of data chatbots are built on, we know that they will have human errors and human biases built into them. These biases may cause significant harm and/or inequity toward different subpopulations. To understand the strengths and weakness of chatbot responses, we present a position paper that explores different use cases of ChatGPT to determine the types of questions that are answered fairly and the types that still need improvement. We find that ChatGPT is a fair search engine for the tasks we tested; however, it has biases on both text generation and code generation. We find that ChatGPT is very sensitive to changes in the prompt, where small changes lead to different levels of fairness. This suggests that we need to immediately implement "corrections" or mitigation strategies in order to improve fairness of these systems. We suggest different strategies to improve chatbots and also advocate for an impartial review panel that has access to the model parameters to measure the levels of different types of biases and then recommends safeguards that move toward responses that are less discriminatory and more accurate.

연구 동기 및 목표

  • 평균 급여, 직무 설명, 교육 요구사항과 같은 다양한 직업 관련 질의에서 ChatGPT의 응답 공정성을 평가하기 위해.
  • 프롬프트 변형이 응답의 공정성에 미치는 영향을 파악하고 입력 프레임워크에 대한 민감도를 탐지하기 위해.
  • ChatGPT의 코드 생성 및 텍스트 생성 출력에서 발생하는 편향을 조사하기 위해.
  • 대규모 언어 모델에서 인구 통계적 및 윤리적 편향을 줄이기 위한 실천 가능한 보완 전략을 제안하기 위해.
  • 모델 파rameter에 접근할 수 있는 독립적인 심의 위원회를 통해 편향에 대비한 보호 조치를 측정하고 권고하기 위해.

제안 방법

  • 정확성과 공정성 측면에서 공식 기관(노무국, Glassdoor)의 자료와 비교하여 ChatGPT의 응답을 분석하였다.
  • 유사한 질의를 재구성함으로써 프롬프트 민감도를 평가하여 응답의 공정성과 내용 변화를 분석하였다.
  • NLP 기법(예: BERT 기반의 독성 탐지)을 사용해 편향된 프롬프트를 탐지하고 재구성하는 알고리즘을 통해 사전 처리 단계에서의 편향 보정을 제안하였다.
  • 마스크된 단어 교체 및 성 중립적 대체어를 사용해 성별에 치중되거나 인구 통계적 편향이 있는 언어를 중립화하는 후처리 응답 보정 기법을 제안하였다.
  • 모델의 내재적 안정성이 향상될 때까지 윤리적으로 민감하거나 해로운 질의에 대한 응답 금지를 시행할 것을 제안하였다.
  • 편향을 감시하고 보호 조치를 권고하기 위해 연구자, 윤리학자, 법학자로 구성된 공정한 자문위원회의 운영을 주장하였다.
Figure 1: Experiment setup to explore bias in text generation from ChatGPT
Figure 1: Experiment setup to explore bias in text generation from ChatGPT

실험 결과

연구 질문

  • RQ1공식 기관의 자료와 비교했을 때, ChatGPT는 평균 급여, 직무 설명, 교육 요구사항과 같은 직업 관련 질의에 얼마나 공정하게 응답하는가?
  • RQ2소규모 프롬프트 재구성으로 인해 ChatGPT의 응답 공정성과 인구 통계적 중립성에 어떤 정도의 영향을 미치는가?
  • RQ3ChatGPT의 코드 생성 및 텍스트 생성 출력에서 나타나는 편향의 유형은 무엇이며, 이는 훈련 데이터의 편향을 어떻게 반영하는가?
  • RQ4프롬프트 및 응답 보정 기법은 대규모 언어 모델 출력의 인구 통계적 편향을 얼마나 효과적으로 줄이는가?
  • RQ5독립적인 자문위원회와 같은 기관적 메커니즘은 생성형 AI 시스템에서 윤리적 감시와 지속적인 편향 완화를 보장하기 위해 얼마나 필요한가?

주요 결과

  • ChatGPT는 사실적 질의에 대해 검색 엔진과 유사한 성능을 보이며, 근거를 제시한 바에 따라 평균 급여와 직무 요구사항을 정확히 보고한다.
  • 강력한 사실적 성능에도 불구하고, ChatGPT는 텍스트 및 코드 생성에서 인구 통계적 편향을 보이며, 특히 편향되거나 모호한 입력이 주어졌을 경우 두드러진다.
  • 소규모 프롬프트 재구성이 응답의 공정성에 중대한 영향을 미치며, 입력 프레임워킹에 대한 높은 민감도와 모델의 취약성을 보여준다.
  • 모델는 확증 편향을 보이며, 훈련 데이터에 존재하는 기존의 스테레오타입과 선호도를 강화한다. 특히 성별 언어와 역할에 대한 가정에서 두드러진다.
  • 윤리적으로 민감하거나 해로운 질의에 대한 응답 금지는 모델의 신뢰성 향상 전까지 차별적 콘텐츠의 확산을 방지하기 위해 필수적이다.
  • 모델 파rameter에 접근할 수 있는 독립적인 자문위원회가 편향 유형을 측정하고 효과적이고 투명한 보호 조치를 권고하기 위해 필수적이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.