Skip to main content
QUICK REVIEW

[논문 리뷰] Fairness of ChatGPT and the Role Of Explainable-Guided Prompts

Yashar Deldjoo|arXiv (Cornell University)|2023. 07. 14.
Artificial Intelligence in Healthcare and Education인용 수 13
한 줄 요약

본 논문은 프롬프트 엔지니어링과 도메인 지식을 활용한 OpenAI의 GPT를 신용 위험 평가에 적용하는 것을 조사하며, 훨씬 적은 데이터로도 전통 ML과 경쟁력 있는 결과를 보여주고 남녀 간 공정성에 대한 시사점을 제시한다.

ABSTRACT

Our research investigates the potential of Large-scale Language Models (LLMs), specifically OpenAI's GPT, in credit risk assessment-a binary classification task. Our findings suggest that LLMs, when directed by judiciously designed prompts and supplemented with domain-specific knowledge, can parallel the performance of traditional Machine Learning (ML) models. Intriguingly, they achieve this with significantly less data-40 times less, utilizing merely 20 data points compared to the ML's 800. LLMs particularly excel in minimizing false positives and enhancing fairness, both being vital aspects of risk analysis. While our results did not surpass those of classical ML models, they underscore the potential of LLMs in analogous tasks, laying a groundwork for future explorations into harnessing the capabilities of LLMs in diverse ML tasks.

연구 동기 및 목표

  • 챗GPT와 같은 대형 언어 모델이 제한된 데이터로 신용 위험 분류를 수행할 수 있는지 조사한다.
  • 프롬프트 설계와 도메인 지식이 예측 정확도에 어떤 영향을 미치는지 평가한다.
  • 부트스트랩 기반 TPR 비교 및 통계 검정을 통한 성별 공정성 여부를 검토한다.
  • 도메인 지식과 프롬프트 전략을 ML 작업에 LLM을 활용하여 개선하기 위한 지침을 제공한다.

제안 방법

  • ChatGPT-3.5-Turbo를 이용해 신용 위험 작업을 채팅 기반 예측 문제로 전환한다.
  • 작업 지시, 인-컨텍스트 예시, 속성 설명, 도메인 지식, 문제 공식화 등을 포함하는 다부분 프롬프트를 설계한다.
  • MLFI(ML-derived feature importance) 및 그 정렬형 변형(MLFI-ord)을 통해 도메인 지식을 도입한다.
  • 독일 신용 데이터셋에 대해 5-fold 교차 검증으로 고전 ML 모델과 OpenAI 기반 모델의 성능을 평가한다.
  • 부트스트랩 샘플링(1000회 재샘플링)을 사용하여 진양성률 차이를 통한 성별 공정성을 평가한다.
  • 모델 간 정확도, 정밀도, 재현율, F1, 거짓 양성/거짓 음성 비용을 비교한다.
Figure 1 : Flowchart illustrating the conceptual framework of the paper
Figure 1 : Flowchart illustrating the conceptual framework of the paper

실험 결과

연구 질문

  • RQ1프롬프트와 도메인 지식이 잘 설계된 경우, 클래식 ML에 비해 훨씬 적은 데이터로도 ChatGPT가 신용 위험 예측에서 경쟁력을 가질 수 있는가?
  • RQ2프롬프트 설계(도메인 지식 및 특징 순서 포함)가 OpenAI 기반 예측의 정확도와 공정성에 어떤 영향을 미치는가?
  • RQ3OpenAI 기반 모델은 신용 위험 평가에서 전통 ML 모델과 비교해 성별 공정성 특성이 다르게 나타나는가?
  • RQ4LLM과 함께 프롬프트 엔지니어링 및 도메인 지식을 통합하여 ML 작업을 개선하기 위한 실용적 지침은 무엇인가?

주요 결과

  • OpenAI 기반 모델은 전통 ML 모델의 학습 데이터 800개에 비해 단 20개의 훈련 샘플만으로도 경쟁력 있는 결과를 달성한다.
  • MLFI 프롬프트를 활용한 AdaBoost 구성이 OpenAI 기반 설정 중 높은 정밀도, 재현율, F1(0.7305)을 보인다.
  • 전통 ML 모델은 평균 정확도 지표에서 OpenAI 기반 모델보다 우수한 경향을 보이며(정확도 0.7792 대 0.7129; 재현율 0.8822 대 0.6078; F1 0.8302 대 0.6528), 성능 차이가 나타난다.
  • OpenAI 모델은 전통 ML 모델에 비해 거짓 양성 비용이 낮아 신용 승인에 더 신중한 경향을 보인다.
  • 공정성 분석에서 특정 프롬프트(Prompt-5, Prompt-7 등)는 비유의적 성별 차이를 보이는 반면, 다른 프롬프트는 유의한 차이를 보이며, 전통 모델은 일반적으로 공정성 영가설을 기각하는 경향을 보인다.
  • 프롬프트 기반의 공정성 고려가 ML 작업에서 공정성을 촉진할 수 있음을 시사하며, LLM 보조 ML 작업에서 프롬프트 전략의 공정성 활용 가능성을 강조한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.