Skip to main content
QUICK REVIEW

[논문 리뷰] ChatGPT vs State-of-the-Art Models: A Benchmarking Study in Keyphrase Generation Task

Roberto Martínez-Cruz, Alvaro J. López-López|arXiv (Cornell University)|2023. 04. 27.
Advanced Text Analysis Techniques인용 수 5
한 줄 요약

이 연구는 과학적 및 뉴스 분야의 짧고 긴 문서를 포함한 여섯 개의 공개 데이터셋에서 상태의 최고 수준 모델인 KeyBART와 ChatGPT의 关键어 생성 성능을 비교 평가한다. ChatGPT는 모든 설정에서 모든 기준 모델을 능가하며, 더 넓은 컨텍스트 창과 다중 작업 미리 훈련 덕분에 개괄적 관점의 关键어 생성, 도메인 적응, 긴 문서 처리에서 뛰어난 성능을 보인다.

ABSTRACT

Transformer-based language models, including ChatGPT, have demonstrated exceptional performance in various natural language generation tasks. However, there has been limited research evaluating ChatGPT's keyphrase generation ability, which involves identifying informative phrases that accurately reflect a document's content. This study seeks to address this gap by comparing ChatGPT's keyphrase generation performance with state-of-the-art models, while also testing its potential as a solution for two significant challenges in the field: domain adaptation and keyphrase generation from long documents. We conducted experiments on six publicly available datasets from scientific articles and news domains, analyzing performance on both short and long documents. Our results show that ChatGPT outperforms current state-of-the-art models in all tested datasets and environments, generating high-quality keyphrases that adapt well to diverse domains and document lengths.

연구 동기 및 목표

  • 다양한 도메인과 문서 길이, 특히 기존 모델이 성능을 낮추는 긴 문서에서 ChatGPT의 关键어 생성 성능을 평가하는 것.
  • ChatGPT가 다중 작업, 다중 도메인 미리 훈련을 통해 도메인 적응 과제를 극복할 수 있는지 평가하는 것.
  • ChatGPT의 더 넓은 컨텍스트 창(최대 KeyBART의 4배 길이)이 긴 문서에서의 关键어 생성 성능 향상에 기여하는 정도를 조사하는 것.
  • 과학적 및 뉴스 도메인의 여섯 개 벤치마크 데이터셋에서 현재의 최고 수준 모델인 KeyBART와 ChatGPT의 성능을 비교하는 것.
  • 다양한 입력 유형에서 정확하고 맥락에 부합하는 关键어를 생성할 수 있는 능력을 보여주는 실제 사례 연구를 제공하는 것.

제안 방법

  • 연구는 과학 논문과 뉴스 기사에서 유래한 여섯 개의 공개 데이터셋을 사용하며, 짧고 긴 문서 모두 포함된다.
  • ChatGPT는 표준화된 프롬프트를 사용한 제로샷 텍스트-투-텍스트 생성 방식으로 사용되며, 프롬프트는 '다음 텍스트의 关键어를 생성하세요:'로 시작하고 그 다음에 입력 문서가 이어진다.
  • 성능 평가는 표준 지표인 정밀도, 재현도, 상위-k 개의 关键어에서의 F1 점수(k=3, 5, 10)를 사용한다.
  • 모든 데이터셋에서 동일한 평가 프rotocol를 적용하여 KeyBART, 현재의 최고 수준 모델과의 비교를 수행한다.
  • DUC2001 뉴스 데이터셋과 과학 논문에서 대표적인 샘플을 선정하여 정성적 성능 및 추론 분석을 위한 사례 연구를 수행한다.
  • ChatGPT의 지식과 추론 능력을 직접적으로 점검하기 위해 추가 질문을 제기하여 사실 기반성과 맥락 인식 능력을 평가한다.
Figure 1: Example prompt used to generate keyphrases with ChatGPT
Figure 1: Example prompt used to generate keyphrases with ChatGPT

실험 결과

연구 질문

  • RQ1기존 모델이 어려움을 겪는 비과학적 및 뉴스 도메인을 포함한 다양한 도메인에서 ChatGPT가 고품질의 关键어를 생성할 수 있는가?
  • RQ2긴 문서에서 ChatGPT의 关键어 생성 성능은 최고 수준 모델인 KeyBART와 비교해 어떻게 되는가?
  • RQ3ChatGPT의 넓은 컨텍스트 창(최대 KeyBART의 4배 길이)이 긴 문서에서의 关键어 생성 성능 향상에 어느 정도 영향을 미치는가?
  • RQ4테스트 시 도메인 외부 텍스트를 다룰 때, ChatGPT는 Fine-tuned 모델인 KeyBART보다 더 뛰어난 도메인 적응 능력을 보여주는가?
  • RQ5특정 경우에서 ChatGPT의 성능 저하 원인은 무엇이며, 입력 품질이나 맥락의 제약을 스스로 식별할 수 있는가?

주요 결과

  • ChatGPT는 여섯 개의 모든 벤치마크 데이터셋에서 KeyBART를 능가하며, 추출적 및 개괄적 관점의 关键어 생성 모두에서 더 높은 F1 점수를 기록한다.
  • 뉴스 도메인(DUC2001)에서, KeyBART가 완전히 실패하여 도메인에 부적절한 개괄적 어휘만 생성하는 동안 ChatGPT는 사례 연구에서 모든 关键어를 정확히 식별한다.
  • 긴 과학 문서에서 ChatGPT는 높은 성능을 유지하지만, 제한된 컨텍스트 창으로 인해 KeyBART의 성능은 심각하게 저하된다.
  • ChatGPT는 강력한 도메인 일반화 능력을 보이며, 항공 및 군사 뉴스에서의 关键어를 정확히 식별하지만, 해당 데이터로 미세조정되지 않은 상태에서도 성능을 유지한다.
  • 실패에 대해 질문을 던졌을 때, ChatGPT는 성능 저하의 원인을 명확한 초점 부족, 제한된 맥락, 풍부한 어휘 부족으로 정확히 지목하여 입력 제약 조건에 대한 자기 인식을 보인다.
  • 실제 사건(예: 유명인 뉴스)에 대한 ChatGPT의 지식은 높은 수준에서 정확하지만, 종종 금액이나 위치와 같은 특정 세부 정보를 놓치는 경우가 있다.
Figure 2: Case Study 1.1: Short Scientific Document from Inspec Test Dataset
Figure 2: Case Study 1.1: Short Scientific Document from Inspec Test Dataset

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.