Skip to main content
QUICK REVIEW

[논문 리뷰] ICL-D3IE: In-Context Learning with Diverse Demonstrations Updating for Document Information Extraction

Jiabang He, Lei Wang|arXiv (Cornell University)|2023. 03. 09.
Topic Modeling인용 수 7
한 줄 요약

ICL-D3IE는 다양한, 반복적으로 업데이트되는 예시를 활용하여 대규모 언어 모델(Large Language Models, LLMs)이 문서 정보 추출(Document Information Extraction, DIE)을 수행할 수 있도록 하는 새로운 인라인 학습 프레임워크이다. 이는 하드, 레이아웃 인지형, 포맷 기반 예시를 사용함으로써 피인식 모델보다 성능을 향상시키며, SROIE, FUNSD, CORD에서 최신 기술 수준의 성능을 달성한다. 특히 내부 분포 및 외부 분포 설정 모두에서 LayoutLMv3를 뛰어넘는다.

ABSTRACT

Large language models (LLMs), such as GPT-3 and ChatGPT, have demonstrated remarkable results in various natural language processing (NLP) tasks with in-context learning, which involves inference based on a few demonstration examples. Despite their successes in NLP tasks, no investigation has been conducted to assess the ability of LLMs to perform document information extraction (DIE) using in-context learning. Applying LLMs to DIE poses two challenges: the modality and task gap. To this end, we propose a simple but effective in-context learning framework called ICL-D3IE, which enables LLMs to perform DIE with different types of demonstration examples. Specifically, we extract the most difficult and distinct segments from hard training documents as hard demonstrations for benefiting all test instances. We design demonstrations describing relationships that enable LLMs to understand positional relationships. We introduce formatting demonstrations for easy answer extraction. Additionally, the framework improves diverse demonstrations by updating them iteratively. Our experiments on three widely used benchmark datasets demonstrate that the ICL-D3IE framework enables Davinci-003/ChatGPT to achieve superior performance when compared to previous pre-trained methods fine-tuned with full training in both the in-distribution (ID) setting and in the out-of-distribution (OOD) setting. Code is available at https://github.com/MAEHCM/ICL-D3IE.

연구 동기 및 목표

  • 대규모 언어 모델(LLMs)을 문서 정보 추출(DIE)에 적용할 때 발생하는 모odal 및 작업 갭을 해결하기 위해, LLMs가 시각적 및 레이아웃 정보에 직접 액세스할 수 없음을 고려한다.
  • 일반화, 레이아웃 이해, 답변 추출 가능성 등의 핵심 과제를 해결하기 위해 다양한 예시 유형을 설계하여 인라인 학습 성능을 향상시키기 위한 것이다.
  • 학습 데이터에 대한 예측에서 유도된 피드백을 사용하여 하드 예시를 반복적으로 업데이트함으로써, 테스트 인스턴스 전반에 걸친 모델 일반화 능력을 향상시키기 위한 것이다.
  • 내부 분포 및 외부 분포 설정 모두에서 프레임워크의 효과성을 평가하여, 표준 피인식 보조 기반 모델을 뛰어넘는 강건성을 입증하기 위한 것이다.

제안 방법

  • LLMs가 정확히 예측하기 어려운 가장 어려운 유형이자 특징적인 세그먼트를 학습 문서에서 식별하여 하드 예시를 추출한다.
  • LLMs에 텍스트 콘텐츠 박스 간의 위치 관계를 기술하도록 프롬프트하여, 공간적 추론 능력을 향상시키는 레이아웃 인지형 예시를 구성한다.
  • 랜덤으로 선택된 학습 세그먼트를 사용하여, LLMs가 쉽게 추출할 수 있는 구조적이고 기계로 판독 가능한 형식으로 레이블을 예측하도록 유도하는 포맷 기반 예시를 설계한다.
  • LLM이 학습 데이터에 대한 자신의 예측을 기반으로 하드 예시를 반복적으로 개선함으로써, 여러 라운드에 걸쳐 예시를 업데이트하는 반복적 예시 업데이트를 구현한다.
  • LLMs의 훈련 분포와 더 잘 호환되는 용어로 모호하거나 자연스럽지 않은 엔티티 레이블을 변환하기 위해 레이블 매핑을 적용한다.
  • 최종 프롬프트를 구성할 때, 레이블 매핑, 하드, 레이아웃 인지형, 포맷 기반의 특정 순서를 따름으로써 인라인 학습 효과를 극대화한다.
Figure 1 : Two approaches for solving the DIE task: (a) previous pre-trained document understanding models [ 15 , 42 ] fine-tuned with full training examples, and (b) in-context learning over LLMs with a few examples.
Figure 1 : Two approaches for solving the DIE task: (a) previous pre-trained document understanding models [ 15 , 42 ] fine-tuned with full training examples, and (b) in-context learning over LLMs with a few examples.

실험 결과

연구 질문

  • RQ1다양하고 작업에 특화된 예시를 사용한 인라인 학습이 문서 정보 추출에서 피인식 비전-언어 모델보다 우수한 성능을 낼 수 있는가?
  • RQ2레이아웃 인지형 예시의 포함 여부가 LLMs의 문서 구조 이해 능력과 엔티티 예측 정확도에 어떤 영향을 미치는가?
  • RQ3인라인 피드백을 사용하여 하드 예시를 반복적으로 업데이트하는 것이 테스트 인스턴스 전반에 걸친 모델 일반화에 어떤 영향을 미치는가?
  • RQ4다양한 예시 유형의 순서가 DIE 작업에서 인라인 학습 성능에 어떤 영향을 미치는가?
  • RQ5ICL-D3IE 프레임워크는 피인식 모델 대비 외부 분포 설정에서도 뛰어난 성능을 유지하는가?

주요 결과

  • Davinci-003를 사용한 ICL-D3IE는 SROIE에서 97.88% F1을 기록하여 내부 분포 설정에서 LayoutLMv3 base(96.89%)를 뛰어넘었다.
  • CORD에서 ICL-D3IE(Davinci-003)는 95.12% F1을 달성하여 LayoutLMv3 base(92.45%)를 크게 앞서며, 외부 분포 설정에서도 강력한 일반화 능력을 보였다.
  • 모든 예시 수(1~12)에서 피인식된 LayoutLMv3를 일관되게 능가하였으며, 특히 저샷 설정에서 더 큰 격차를 보였다.
  • 하드 예시의 반복적 업데이트가 성능 향상에 기여하였으며, 최적의 결과는 20회의 반복 후에 관찰되어 피드백 기반 개선이 일반화 능력을 향상시킨다는 것을 시사한다.
  • M-H-L-F 순서(레이블 매핑, 하드, 레이아웃 인지형, 포맷 기반)가 모든 데이터셋에서 M-L-H-F 순서를 능가하여, 예시 유형의 순서가 인라인 학습 성공에 핵심적임을 확인하였다.
  • 사례 연구 결과, ICL-D3IE는 위치 관계를 정확히 기술하고 엔티티를 올바르게 예측(예: '질문' vs. '헤더')하는 데 성공하였으며, 표준 인라인 학습은 이를 실패하였다. 이는 레이아웃 인지형 및 하드 예시의 가치를 입증한다.
Figure 2 : A detailed illustration of ICL-D3IE framework, including obtaining nearest neighbor documents for test samples from the training dataset, constructing iteratively updated diverse demonstrations, and performing inference.
Figure 2 : A detailed illustration of ICL-D3IE framework, including obtaining nearest neighbor documents for test samples from the training dataset, constructing iteratively updated diverse demonstrations, and performing inference.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.