Skip to main content
QUICK REVIEW

[논문 리뷰] Zero-shot Temporal Relation Extraction with ChatGPT

Chenhan Yuan, Qianqian Xie|arXiv (Cornell University)|2023. 04. 11.
Topic Modeling인용 수 5
한 줄 요약

이 논문은 세 가지 프롬프트 전략인 제로샷, 이벤트 순서 정렬, 체인 오브 토우트(CoT) 프롬프팅을 사용하여 ChatGPT의 제로샷 능력에 대해 시간 관계 추출을 평가한다. 지도 학습 모델과 비교해 상당한 성능 격차가 존재하지만, CoT 프롬프팅은 성능을 크게 향상시킨다. 그러나 ChatGPT는 일관성과 장거리 의존성 추론에서 심각한 결함을 보인다.

ABSTRACT

The goal of temporal relation extraction is to infer the temporal relation between two events in the document. Supervised models are dominant in this task. In this work, we investigate ChatGPT's ability on zero-shot temporal relation extraction. We designed three different prompt techniques to break down the task and evaluate ChatGPT. Our experiments show that ChatGPT's performance has a large gap with that of supervised methods and can heavily rely on the design of prompts. We further demonstrate that ChatGPT can infer more small relation classes correctly than supervised methods. The current shortcomings of ChatGPT on temporal relation extraction are also discussed in this paper. We found that ChatGPT cannot keep consistency during temporal inference and it fails in actively long-dependency temporal inference.

연구 동기 및 목표

  • 대규모 언어 모델인 ChatGPT가 미세조정 없이 제로샷 시간 관계 추출을 수행할 수 있는지 조사하기 위해.
  • 제로샷, 이벤트 순서 정렬, 체인 오브 토우트(CoT)와 같은 다양한 프롬프트 엔지니어링 기법의 효과를 ChatGPT의 성능에 대해 평가하기 위해.
  • 특히 일관성과 장거리 의존성 추론 측면에서 ChatGPT의 시간 추론 능력에 한계가 있는지 규명하기 위해.
  • 저자원(작은) 시간 관계 클래스에서 ChatGPT의 성능을 지도 학습 모델과 비교하기 위해.
  • LLM이 제로샷 시간 관계 추출에서 지도 학습 방법의 실질적인 대안이 될 수 있는지 평가하기 위해.

제안 방법

  • 사전 정의된 목록에서 두 이벤트 간의 시간 관계를 분류하도록 직접 요청하는 제로샷 프롬프트를 설계하였다.
  • 이벤트 순서 정렬 프롬프트를 구현하여, 주어진 이벤트 트리거 이전이나 이후에 발생한 이벤트들을 나열하도록 ChatGPT에 요청하였다.
  • 시간 관계 추출 작업을 이진 분류 단계로 분해하는 체인 오브 토우트(CoT) 프롬프팅 전략을 제안하였다: 먼저 특정 관계(예: BEFORE)가 성립하는지 확인한 후, 선택지를 보완하였다.
  • CoT 접근 방식을 사용하여 단계별 추론을 유도함으로써 중간 추론 상태를 활용해 자신감과 정확도를 향상시켰다.
  • 표준 시간 관계 추출 데이터셋을 사용하여 표준 메트릭(예: F1, 정밀도/재현율)을 사용해 모든 프롬프트를 평가하였다.
  • 프롬프트 유형 간 성능 비교를 위한 분석 및 일관성과 장거리 의존성 문제 분석을 위한 실패 케이스 분석을 수행하였다.
Figure 1: The proposed prompts.
Figure 1: The proposed prompts.

실험 결과

연구 질문

  • RQ1ChatGPT는 미세조정 없이도 제로샷 시간 관계 추출을 효과적으로 수행할 수 있는가?
  • RQ2프롬프트 엔지니어링—특히 제로샷, 이벤트 순서 정렬, 체인 오브 토우트(CoT) 프롬프트—는 ChatGPT의 시간 관계 추출 성능에 어떤 영향을 미치는가?
  • RQ3전반적인 성능이 낮음에도 불구하고, ChatGPT는 저자원(희귀) 시간 관계 클래스에서 지도 학습 모델을 초월할 수 있는가?
  • RQ4동일한 입력을 여러 번 다른 질문 어휘로 제시했을 때, ChatGPT는 시간 추론에서 얼마나 일관성을 유지하는가?
  • RQ5ChatGPT는 장거리 의존성 시간 관계와 모호한 시간 신호를 처리하는 데 있어 핵심적인 한계가 무엇인가?

주요 결과

  • ChatGPT는 지도 학습 모델보다 상당히 떨어지며, Bi-LSTM와 같은 전통적인 신경망 모델과 비교해도 성능 격차가 크거나 더 악화된 편이다.
  • 체인 오브 토우트(CoT) 프롬프팅 전략은 모든 데이터셋에서 제로샷 및 이벤트 순서 정렬 프롬프트를 일관되게 능가하며, 프롬프팅에서 구조화된 추론의 중요성을 입증한다.
  • ChatGPT는 낮은 빈도의 시간 관계 클래스(예: 'VAGUE', 'EQUAL')에서 지도 학습 모델보다 더 좋은 성능을 보이며, 희귀 관계에 대한 제로샷 일반화 능력에서 잠재적인 이점이 있음을 시사한다.
  • ChatGPT는 시간 추론에서 심각한 일관성 결함을 보인다: 동일한 문서에서 논리적으로 동일한 질문이지만 다른 표현 방식으로 제시되었을 때, 서로 모순되는 시간 관계를 도출할 수 있으며, 불확실성을 주장한 후 84%의 경우에서 모순된 답변을 내놓는다.
  • ChatGPT는 장거리 의존성 시간 관계를 효과적으로 처리하지 못하며, 더 긴 범위에서 시간적 맥락을 유지하는 데 한계가 있음을 시사한다.
  • CoT 프롬프팅에서 ChatGPT는 불확실할 경우 자주 'vague'를 반환하지 않으며, 대신 'Cannot determine'이나 'Unknown'과 같은 표현을 출력한다. 평가 과정에선 이 표현들이 'vague'로 간주되지만, 다단계 추론에서 여전히 일관성 없는 최종 분류를 유도한다.
Figure 2: Prompts generated by ChatGPT.
Figure 2: Prompts generated by ChatGPT.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.