[논문 리뷰] Exploring ChatGPT's Ability to Rank Content: A Preliminary Study on Consistency with Human Preferences
본 논문은 ChatGPT의 제로샷 능력이 모델이 생성한 콘텐츠를 순위 매기는 능력을 평가하고, 다양한 프롬프트와 모델에 걸쳐 인간 선호도와의 순위 일치 여부를 비교한다.
As a natural language assistant, ChatGPT is capable of performing various tasks, including but not limited to article generation, code completion, and data analysis. Furthermore, ChatGPT has consistently demonstrated a remarkable level of accuracy and reliability in terms of content evaluation, exhibiting the capability of mimicking human preferences. To further explore ChatGPT's potential in this regard, a study is conducted to assess its ability to rank content. In order to do so, a test set consisting of prompts is created, covering a wide range of use cases, and five models are utilized to generate corresponding responses. ChatGPT is then instructed to rank the responses generated by these models. The results on the test set show that ChatGPT's ranking preferences are consistent with human to a certain extent. This preliminary experimental finding implies that ChatGPT's zero-shot ranking capability could be used to reduce annotation pressure in a number of ranking tasks.
연구 동기 및 목표
- ChatGPT가 여러 모델의 응답을 인간의 선호도에 따라 순위 매길 수 있는지 평가한다.
- 다양한 사용 사례에서 ChatGPT 기반 순위와 인간 주석 간의 일관성을 평가한다.
- ChatGPT의 순위 능력이 순위 태스크의 주석 작업을 줄일 수 있는지 조사한다.
제안 방법
- NLP 작업, 아이디어 발상, 생성, 개방형 QA, 수학, 코드에 걸친 프롬프트의 테스트 세트를 구성한다.
- 각 프롬프트당 Bloomz 변형, Text-davinci-003, ChatGPT, InstrLLM를 포함해 다섯 모델의 응답을 생성한다.
- 하나씩 프롬프트와 전체 프롬프트를 이용해 다섯 응답의 순위를 ChatGPT에 요청한다.
- 129명의 주석가가 프롬프트별 응답을 순위 매기게 하여 주석을 수집하고 순위를 평균화한다.
- ChatGPT와 인간의 순위 간의 스피어만 상관계수 및 상위 1 일관성 비율로 일치를 측정한다.
- 사용 사례와 프롬프트를 통해 모델 간 비교를 분석하여 강점과 한계를 파악한다.
실험 결과
연구 질문
- RQ1ChatGPT가 인간 선호도와 일치하는 방식으로 여러 모델의 출력물을 순위 매길 수 있는가?
- RQ2일대일 프롬프트 vs 전체 프롬프트에서의 순위 성능 차이는 어떤가?
- RQ3어떤 사용 사례(NLP 작업, 아이디어 발상, 생성, 개방형 QA, 수학, 코드)가 인간 판단과 더 높은 또는 낮은 정렬을 보이는가?
- RQ4다른 모델들(ChatGPT, Text-davinci-003, Bloomz 변형, InstrLLM)이 ChatGPT의 관점에서 순위 품질에서 어떻게 비교되는가?
주요 결과
- ChatGPT의 순위는 프롬프트 전반에 걸쳐 인간 선호도와 비자명한 수준의 일치를 보인다.
- 일대일 프롬 prompting은 일반적으로 전체 프롬 prompting보다 인간 선호도와의 정합성이 더 높다.
- 아이디어 발상과 생성 프롬프트에서 더 높은 정합성을 보이는 반면, NLP 작업 및 개방형 QA와 같은 다른 사용 사례는 개선의 여지가 있다.
- ChatGPT는 전체 순위에서 Bloomz 변형을 포함한 여러 기준선보다 우수한 성능을 보이나 코드 및 수학 프롬프트에서 일부 간극이 있다.
- InstrLLM은 아이디어 발상, 생성, 수학에서 일부 기준선을 상회하지만 NLP 작업에서는 뒤처진다.
- ChatGPT가 RLHF의 부트스트랩 주석에 유용할 수 있으며 성능이 약한 사용 사례를 식별하는 데 도움을 줄 수 있다는 증거가 있다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.