Skip to main content
QUICK REVIEW

[논문 리뷰] GPT3-to-plan: Extracting plans from text using GPT-3

Alberto Olmo Hernandez, Sarath Sreedharan|arXiv (Cornell University)|2021. 06. 14.
Natural Language Processing Techniques참고 문헌 9인용 수 27
한 줄 요약

본 논문은 GPT-3를 사용하여 자연어 텍스트에서 구조화된 행동 시퀀스를 추출하고, 세 가지 데이터셋에서 태스크 특화 계획 추출 방법과 성능을 비교한다.

ABSTRACT

Operations in many essential industries including finance and banking are often characterized by the need to perform repetitive sequential tasks. Despite their criticality to the business, workflows are rarely fully automated or even formally specified, though there may exist a number of natural language documents describing these procedures for the employees of the company. Plan extraction methods provide us with the possibility of extracting structure plans from such natural language descriptions of the plans/workflows, which could then be leveraged by an automated system. In this paper, we investigate the utility of generalized language models in performing such extractions directly from such texts. Such models have already been shown to be quite effective in multiple translation tasks, and our initial results seem to point to their effectiveness also in the context of plan extractions. Particularly, we show that GPT-3 is able to generate plan extraction results that are comparable to many of the current state of the art plan extraction methods.

연구 동기 및 목표

  • 일반 목적의 언어 모델(GPT-3)이 자연어 텍스트에서 계획과 유사한 행동 시퀀스를 추출할 수 있는지 평가한다.
  • 표준 데이터셋에서 GPT-3의 성능을 태스크 특화된 계획 추출 방법과 비교한다.
  • GPT-3의 few-shot 학습 능력이 행동 이름과 인수 추출에 미치는 영향을 평가한다.
  • 텍스트로부터 계획의 순서를 추론하는 GPT-3의 능력을 검토하고 계획 적용에 대한 실용적 함의를 논의한다.

제안 방법

  • 자연어 설명을 구조화된 계획 표현으로 매핑하기 위해 4개의 엔진(Davinci, Curie, Babbage, Ada)을 사용하는 GPT-3과 few-shot 예제를 활용한다.
  • 실행 가능한 계획 표기법으로 레이블링된 자연어 텍스트로 훈련 예제를 제공하고, 테스트 텍스트는 특정 태그 뒤에 기대되는 계획 출력을 따른다.
  • 핵심/배제/선택적 행동 유형 분류를 따른 실지 정답 주석과의 정밀도, 재현율, F1 점수를 사용하여 평가한다.
  • 세 가지 데이터셋(WHS, WHG, CT)에서 GPT-3의 출력과 최첨단 태스크 특화 모델(EAD, BLCC, STFC, EASDRL, cEASDRL)을 비교한다.
  • 1–4-shot 프롬프트를 실험하여 few-shot 학습이 F1 점수에 미치는 영향을 평가한다.

실험 결과

연구 질문

  • RQ1GPT-3가 절차의 자연어 설명에서 구조화된 행동 시퀀스를 추출할 수 있는가?
  • RQ2표준 데이터셋에서 GPT-3가 최첨단 태스크 특화 계획 추출 방법과 어떻게 비교되는가?
  • RQ3GPT-3와 같은 일반 언어 모델이 텍스트로부터 계획의 동작 순서를 포착하는가?
  • RQ4GPT-3의 계획 추출 성능에 대한 few-shot 프롬프트의 영향은 무엇인가?
  • RQ5GPT-3의 인수 추출 및 더 다양한 계획 설명에 대한 한계가 있는가?

주요 결과

  • GPT-3은 특히 Davinci 엔진이 행동 이름에서 최첨단 태스크 특화 추출기들과 경쟁력 있는 F1 점수를 달성한다.
  • Davinci는 WHS, WHG, CT 데이터셋에서 행동 이름 추출에 있어 여러 태스크 특화 모델보다 우수하다.
  • GPT-3는 인수 추출에서 전문 메소드에 비해 성능이 다소 떨어지지만 여전히 무작위 기준선보다 높다.
  • 모델은 텍스트에서 계획의 순서를 추론하는 일부 능력을 보여주며, 선행 방법들이 종종 고정된 문장 순서를 가정하는 영역이다.
  • few-shot 예제를 늘리면 일반적으로 더 큰 엔진에서 성능이 향상되며, Davinci는 WHS에서 80%를 넘는 F1을 달성한다.
  • 가장 잘 알려진 설정에서 Davinci의 행동 이름 F1 점수는 86.32 (WHS), 58.14 (CT), 43.36 (WHG) 이고 행동 인수 F1 점수는 22.90 (WHS), 29.63 (CT), 22.25 (WHG)이다.
  • Curie 및 더 작은 엔진은 수익 감소를 보이고 Davinci의 성능에 도달하려면 더 많은 예제가 필요하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.