Skip to main content
QUICK REVIEW

[논문 리뷰] Aligning Instruction Tasks Unlocks Large Language Models as Zero-Shot Relation Extractors

Kai Zhang, Bernal Jiménez Gutiérrez|arXiv (Cornell University)|2023. 05. 18.
Natural Language Processing Techniques인용 수 6
한 줄 요약

이 논문은 지시 테이닝 데이터셋에서 QA 작업의 높은 발생 빈도를 활용하기 위해 관계 추출(RE)을 다중 선택형 질의응답으로 재구성하는 QA4RE 프레임워크를 제안한다. RE를 QA와 통합함으로써, 텍스트-다빈치-003 및 FLAN-T5-XXL와 같은 지시 테이닝된 LLM이 소형 언어 모델 기반 SoTA 방법을 능가하는 최신의 제로샷 RE 성능을 달성할 수 있게 되었으며, 절대 F1 향상 폭이 최대 8.6%에 이르렀다.

ABSTRACT

Recent work has shown that fine-tuning large language models (LLMs) on large-scale instruction-following datasets substantially improves their performance on a wide range of NLP tasks, especially in the zero-shot setting. However, even advanced instruction-tuned LLMs still fail to outperform small LMs on relation extraction (RE), a fundamental information extraction task. We hypothesize that instruction-tuning has been unable to elicit strong RE capabilities in LLMs due to RE's low incidence in instruction-tuning datasets, making up less than 1% of all tasks (Wang et al., 2022). To address this limitation, we propose QA4RE, a framework that aligns RE with question answering (QA), a predominant task in instruction-tuning datasets. Comprehensive zero-shot RE experiments over four datasets with two series of instruction-tuned LLMs (six LLMs in total) demonstrate that our QA4RE framework consistently improves LLM performance, strongly verifying our hypothesis and enabling LLMs to outperform strong zero-shot baselines by a large margin. Additionally, we provide thorough experiments and discussions to show the robustness, few-shot effectiveness, and strong transferability of our QA4RE framework. This work illustrates a promising way of adapting LLMs to challenging and underrepresented tasks by aligning these tasks with more common instruction-tuning tasks like QA.

연구 동기 및 목표

  • 지시 테이닝된 대규모 언어 모델이 다른 NLP 작업에서는 강력한 제로샷 능력을 보임에도 불구하고 관계 추출에서 성능이 열등한 이유를 탐구하는 것.
  • 지시 테이닝 데이터셋에서 RE 작업의 발생 빈도가 매우 낮음(1% 미만)으로 인해 LLM의 성능이 저하되는 근본 원인을 규명하는 것.
  • RE와 같이 낮은 발생 빈도를 가지는 작업을 QA와 같이 높은 발생 빈도를 가지는 지시 테이닝 작업과 통합하여 성능 향상을 이끌어내는 프레임워크를 개발하는 것.
  • 다양한 크기의 지시 테이닝된 LLM에 대해 제안된 방법의 강건성, 소수 샘플 효과성, 그리고 일반화 능력을 평가하는 것.
  • LLM이 더 흔한 지시 형식을 사용해 작업을 재구성함으로써 이전의 SoTA 제로샷 RE 방법을 뛰어넘을 수 있음을 입증하는 것.

제안 방법

  • 각 입력 문장을 질문으로 변환하고, 가능한 관계를 선택지로 제시함으로써 관계 추출을 다중 선택형 질의응답 작업으로 재구성한다.
  • 微fine-tuning 없이 기존의 지시 테이닝된 LLM을 사용하며, 프롬프트 엔지니어링을 통해 RE 작업에 대한 QA 행동을 유도한다.
  • 엔티티 쌍과 후보 관계를 구조화된 QA 형식으로 매핑하는 프롬프트를 설계하여, 모델이 적절한 선택지를 선택함으로써 올바른 관계 유형을 선택하도록 유도한다.
  • 지시 테이닝 데이터셋에서 QA 작업의 높은 빈도(12–15%)를 활용하여, RE와 같이 낮은 빈도의 작업에 대한 모델 일반화 능력과 성능 향상을 도모한다.
  • GPT-3.5 및 FLAN-T5 두 시리즈의 여섯 개의 지시 테이닝된 LLM을 사용하여 네 개의 실세계 RE 데이터셋에서 프레임워크를 평가한다.
  • 프롬프트 설계의 다양성에 대한 탄력성과 일반화 능력을 평가하기 위해 아블레이션 스터디와 프롬프트 변형 분석을 수행한다.

실험 결과

연구 질문

  • RQ1지시 테이닝된 LLM이 다른 NLP 작업에서는 강력한 제로샷 능력을 보임에도 불구하고 관계 추출에서 성능이 열등한 이유는 무엇인가?
  • RQ2지시 테이닝 데이터셋에서 관계 추출의 낮은 발생 빈도가 LLM의 이 작업에서의 성능에 얼마나 큰 제약을 끼치는가?
  • RQ3RE를 다중 선택형 QA와 같은 높은 발생 빈도의 작업과 통합함으로써 LLM의 제로샷 RE 성능을 크게 향상시킬 수 있는가?
  • RQ4QA4RE 프레임워크는 프롬프트 설계의 변화에 대해 얼마나 강건한가?
  • RQ5QA4RE 프레임워크는 소형 및 초대형 모델을 포함한 다양한 크기의 LLM에 대해 일반화되는가?

주요 결과

  • QA4RE는 텍스트-다빈치-003에서 기존의 단순 RE 프롬프트 대비 절대 F1 점수 8.2% 향상시켜 이전의 SoTA 제로샷 RE 방법을 능가한다.
  • FLAN-T5-XXL의 경우 QA4RE로 인해 절대 F1 점수 8.6% 향상되었으며, 이는 LLM이 소형 언어 모델 기반 SoTA를 제압한 최초의 사례이다.
  • 이 프레임워크는 80M에서 175B 파라미터에 이르는 여섯 개의 지시 테이닝된 LLM 전반에서 일관되게 성능 향상을 이끌어내어 강력한 일반화 능력을 입증한다.
  • 가장 작은 모델인 FLAN-T5-Small(80M) 역시 절대 F1 점수 5.6% 향상으로, 다양한 모델 크기에서의 효과성을 확인한다.
  • 프롬프트 변형에 대해 강건성을 보이며 소수 샘플 효과성 역시 높지만, FLAN-T5보다 더 큰 GPT-3.5 모델에서는 성능 향상 폭이 약간 감소한다.
  • 결과는 지시 테이닝 데이터에서 작업 빈도가 낮을수록 LLM의 성능이 부족한 작업(예: RE)에서 성능 저하가 발생한다는 가설을 검증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.