Skip to main content
QUICK REVIEW

[논문 리뷰] Can we trust the evaluation on ChatGPT?

Rachith Aiyappa, Jisun An|arXiv (Cornell University)|2023. 03. 22.
Topic Modeling참고 문헌 23인용 수 6
한 줄 요약

이 논문은 ChatGPT와 같은 닫힌 구조이자 지속적으로 업데이트되는 대규모 언어 모델의 평가에서 데이터 오염의 위험을 조사한다. 특히 자세한 태도 탐지 사례를 통해, 모델의 닫힌 구조성과 사용자 입력을 통한 강화학습 기반 훈련(Reinforcement Learning from Human Feedback, RLHF)으로 인해 평가 결과가 인위적으로 과대평가될 수 있음을 보여주며, 이러한 모델에 대한 성능 벤치마크의 신뢰성과 공정성에 심각한 우려를 제기한다.

ABSTRACT

ChatGPT, the first large language model (LLM) with mass adoption, has demonstrated remarkable performance in numerous natural language tasks. Despite its evident usefulness, evaluating ChatGPT's performance in diverse problem domains remains challenging due to the closed nature of the model and its continuous updates via Reinforcement Learning from Human Feedback (RLHF). We highlight the issue of data contamination in ChatGPT evaluations, with a case study of the task of stance detection. We discuss the challenge of preventing data contamination and ensuring fair model evaluation in the age of closed and continuously trained models.

연구 동기 및 목표

  • ChatGPT의 NLP 평가에서 높은 성능이 사용자가 제공한 테스트 입력에서 비롯된 데이터 오염으로 인한 것인지 조사하기.
  • 닫혀 있고 지속적으로 업데이트되는 대규모 언어 모델에서 훈련-테스트 데이터 유출의 부재를 확인하는 데 있어 근본적인 과제를 부각하기.
  • 태도 탐지 사례 연구를 통해 RLHF 과정에서 평가 데이터에 노출된 결과로 인해 모델 성능이 인위적으로 과대평가될 수 있음을 보여주기.
  • 향후 대규모 언어 모델 평가에서 데이터 오염을 탐지하고 방지하기 위한 개선된 투명성 및 메커니즘 도입을 촉구하기.

제안 방법

  • 1월 30일 버전을 사용하여 SemEval 2016 Task 6 데이터셋의 ChatGPT 응답에서 수작업으로 태도 레이블을 추출하였다.
  • 마이크로- 및 매크로-F1 스코어를 모두 사용하여 재평가하였으며, F1-m를 마이크로-평균, F1-avg를 매크로-평균으로 간주하여 최악의 경우를 반영하였다.
  • 이전 연구(Zhang et al., 2021)와의 비교를 통해 일관성 여부를 평가하고 스코어 정의 및 보고된 값의 이질성을 식별하였다.
  • 세션 기반 컨텍스트 누적 및 레이트 리밋 영향을 분석하여 여러 세션과 시간 간격 동안의 응답 패턴을 분석함으로써 고려하였다.
  • 2월 13일 ChatGPT Plus 버전의 오픈소스 API를 사용하여 세션 격리 및 컨텍스트 이월 효과를 최소화하였다.
  • 이전 벤치마크 연구에서 발견된 잠재적 문제들, 즉 모델 스코어의 잘못된 레이블링 및 F1 정의의 일관성 없는 사용을 식별하였다.

실험 결과

연구 질문

  • RQ1ChatGPT의 NLP 벤치마크 성능 중 얼마나 많은 비중이 사용자가 제공한 테스트 입력에서 비롯된 데이터 오염으로 인한 것인가?
  • RQ2ChatGPT의 닫힌 구조와 지속적인 업데이트 성격이 표준 평가 프로토콜의 타당성을 어떻게 손상시키는가?
  • RQ3레이블 노출 없이도 동일 도메인의 입력 텍스트에 노출될 뿐만으로도 데이터 유출가능성이 존재하는가?
  • RQ4공개된 벤치마크 결과에서 스코어 정의의 모호하거나 일관되지 않은 사례가 모델 평가에 어떤 영향을 미치는가?
  • RQ5연구자들은 닫힌 소스이자 RLHF로 최적화된 대규모 언어 모델의 공정하고 신뢰할 수 있는 평가를 어떻게 확보할 수 있는가?

주요 결과

  • 이 연구는 SemEval 2016 태도 탐지 작업에서 ChatGPT의 성능이 기준 모델보다 유의미하게 높게 나타났지만, 이는 RLHF 과정에서 사용자 입력으로 인한 데이터 오염으로 인한 것일 수 있음을 발견하였다.
  • 1월 30일 버전에서 2월 13일 버전로의 성능 저하가 관찰되어, 지속적인 재훈련으로 인한 치명적인 기억 상실 또는 모델 행동의 변화가 발생했을 가능성이 있음을 시사하였다.
  • 이전의 벤치마크 연구에서 오류가 발견되었으며, F1 스코어의 잘못된 레이블링 및 F1-m와 F1-avg의 정의가 일관되지 않아 비교 가능성에 영향을 미쳤다.
  • ChatGPT 응답에서 수작업으로 레이블을 추출한 결과, 응답의 뻥튀기 정도와 세션 컨텍스트가 특히 레이트 리밋 근처에서 크게 변동하여 결과의 일관성에 영향을 주었다.
  • 이 연구는 닫힌 모델인 ChatGPT에서 데이터 오염이 명백히 배제될 수 없다는 결론을 내리며, 표준 평가 결과가 잠재적으로 신뢰할 수 없을 수 있음을 강조하였다.
  • 저자들은 모델 제작자가 사용자 피드백이 포함된 RLHF 파이프라인에서 데이터 유출을 탐지하고 방지하기 위한 개선된 메커니즘을 도입해야 한다고 주장한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.