[논문 리뷰] ChatIE: Zero-Shot Information Extraction via Chatting with ChatGPT
ChatIE는 제로샷 IE를 ChatGPT에서의 다중 턴 QA 태스크와 두 단계 프레임워크로 재정의하며, 미세 조정 없이 엔티티 관계, 엔티티 및 이벤트를 추출하고 여러 데이터셋에서 강력한 성과를 달성한다.
Zero-shot information extraction (IE) aims to build IE systems from the unannotated text. It is challenging due to involving little human intervention. Challenging but worthwhile, zero-shot IE reduces the time and effort that data labeling takes. Recent efforts on large language models (LLMs, e.g., GPT-3, ChatGPT) show promising performance on zero-shot settings, thus inspiring us to explore prompt-based methods. In this work, we ask whether strong IE models can be constructed by directly prompting LLMs. Specifically, we transform the zero-shot IE task into a multi-turn question-answering problem with a two-stage framework (ChatIE). With the power of ChatGPT, we extensively evaluate our framework on three IE tasks: entity-relation triple extract, named entity recognition, and event extraction. Empirical results on six datasets across two languages show that ChatIE achieves impressive performance and even surpasses some full-shot models on several datasets (e.g., NYT11-HRL). We believe that our work could shed light on building IE models with limited resources.
연구 동기 및 목표
- 레이블링 노력과 시간을 줄이기 위해 제로샷 정보 추출의 필요성을 제기한다.
- 대형 언어 모델이 미세 조정 없이 프롬프팅 기반의 통합 IE 시스템을 구성할 수 있는지 탐구한다.
- 복잡한 IE 태스크를 더 단순한 하위 태스크로 분해하는 두 단계의 채팅 기반 파이프라인을 개발한다.
제안 방법
- 제로샷 IE를 ChatGPT를 활용한 다중 턴 질문-응답 프로세스로 변환한다.
- Stage I은 문장 안의 기존 요소 유형(예: 엔티티 유형, 관계, 이벤트 유형)을 식별한다.
- Stage II는 식별된 유형들에 대해 연결된 추출을 수행하여 하위 태스크 간의 의존성을 허용한다.
- 작업 특화 템플릿을 사용하여 프롬트를 생성하고 구조화된 출력을 위해 표 또는 목록 형식의 ChatGPT 응답을 요구한다.
- Turn 수준의 출력을 최종 구조화된 데이터(RE 트리플, NER 엔티티, EE 인수)로 구성한다.
- RE, NER, EE를 대상으로 영어와 중국어의 여섯 개 데이터셋에서 평가한다.
실험 결과
연구 질문
- RQ1두 단계의 채팅 기반 프롬프팅 프레임워크가 여러 IE 태스크에 걸친 제로샷 IE를 가능하게 할 수 있는가?
- RQ2다양한 데이터셋에서 RE, NER, EE에 대해 ChatIE의 성능이 full-shot 및 few-shot 베이스라인과 비교해 어떤가?
- RQ3IE를 다중 턴 하위 태스크로 분해하는 것이 추출 정확도와 로버스트니스에 미치는 영향은 무엇인가?
주요 결과
- 단일 턴 프롬프트를 사용하는 Vanilla ChatGPT는 IE 태스크에서 성능이 낮다.
- ChatIE의 두 단계 프레임워크는 큰 개선을 나타내며, six datasets에서 F1이 평균 약 18.98 포인트 향상된다.
- ChatIE는 여러 데이터셋에서 (예: NYT11-HRL, DuIE2.0, DuEE1.0) 미세 조정 없이도 몇몇 full-shot 모델과 일치하거나 능가한다.
- 일부 벤치마크에서 ChatIE가 NYT11-HRL에서 FCM, MultiR와 같은 감독 학습 모델보다 우수하여 데이터 레이블링 필요성이 감소함을 강조한다.
- 파라미터 업데이트나 미세 조정을 피하므로 계산량이 적으면서도 경쟁력 있는 결과를 제공한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.