Skip to main content
QUICK REVIEW

[논문 리뷰] ANLS* -- A Universal Document Processing Metric for Generative Large Language Models

David Peer, Philemon Schöpf|arXiv (Cornell University)|2024. 02. 06.
Natural Language Processing Techniques인용 수 4
한 줄 요약

이 논문은 문서 처리 작업에서 생성형 대규모 언어 모델(GLLMs)을 평가하기 위한 유니버설 평가 지표인 ANLS*를 소개한다. ANLS 지표를 확장하여 딕셔너리와 리스트와 같은 구조화된 출력을 처리하면서도 이전 버전과의 호환성을 유지한다. ANLS*는 정보 추출 및 분류와 같은 다양한 작업 간 일관된 평가를 가능하게 하며, 새로운 프롬프팅 기법(SFT)을 통해 기존 방법들보다 21개의 케이스 중 15개에서 뛰어난 성능을 보이며 최대 15%p의 향상을 기록한다.

ABSTRACT

Traditionally, discriminative models have been the predominant choice for tasks like document classification and information extraction. These models make predictions that fall into a limited number of predefined classes, facilitating a binary true or false evaluation and enabling the direct calculation of metrics such as the F1 score. However, recent advancements in generative large language models (GLLMs) have prompted a shift in the field due to their enhanced zero-shot capabilities, which eliminate the need for a downstream dataset and computationally expensive fine-tuning. However, evaluating GLLMs presents a challenge as the binary true or false evaluation used for discriminative models is not applicable to the predictions made by GLLMs. This paper introduces a new metric for generative models called ANLS* for evaluating a wide variety of tasks, including information extraction and classification tasks. The ANLS* metric extends existing ANLS metrics as a drop-in-replacement and is still compatible with previously reported ANLS scores. An evaluation of 7 different datasets, and more than 20 different GLLMs together with 3 different prompting methods using the ANLS* metric is also provided, demonstrating the importance of the proposed metric. We also benchmark a novel approach to generate prompts for documents, called SFT, against other prompting techniques such as LATIN. In almost all cases, SFT outperforms other techniques and improves the state-of-the-art, sometimes by as much as $10$ percentage points. Sources are available at https://github.com/deepopinion/anls_star_metric

연구 동기 및 목표

  • 생성형 LLM의 문서 처리 작업에 대한 통합 평가 지표 부족 문제를 해결하기 위해, 특히 구조화되고 복잡한 출력에 대해.
  • 기존 ANLS 지표를 확장하여 정보 추출에서 흔히 나타나는 딕셔너리, 리스트, 혼합형 출력을 지원하기 위해.
  • 단일이고 일관된 지표를 통해 분류 모델과 생성 모델 간 직접 비교를 가능하게 하기 위해.
  • SFT와 같은 고급 프롬프팅 전략의 효과성을 LATIN과 같은 기존 방법과 비교하여 평가하기 위해.
  • ANLS*를 사용하여 7개의 데이터셋과 4개의 GLLM에서 재현 가능한 결과를 제공하는 공개 벤치마크를 제공하기 위해.

제안 방법

  • ANLS*는 레벤슈타인 기반 유사도를 확장하여, 각 레벨에서 정규화된 문자열 유사도를 사용해 중첩된 구조(예: 딕셔너리, 리스트)를 재귀적으로 비교한다.
  • 복잡한 출력 객체 내에서 비교 가능한 모든 요소 간의 유사도를 계산하기 위해 재귀적 정규화 전략을 적용하며, 의미적 구조를 유지한다.
  • ANLS와의 후행 호환성을 유지하여, ANLS*를 사용할 경우 이전에 보고된 ANLS 점수에 영향을 주지 않는다.
  • 저자는 ANLS*를 모듈러한 방식으로 구현하여 기존 평가 파이프라인에서 ANLS의 즉각적인 대체로 사용할 수 있도록 한다.
  • GLLM의 출력을 정답과 일치시키기 위해 작업별로 구조화된 프롬프트를 생성하는 새로운 프롬프팅 기법인 SFT(구조화된 피팅 튜닝 프롬프팅)를 도입한다.
  • 7개의 다양한 문서 처리 데이터셋을 사용하여 4개의 GLLM을 대상으로 평가를 수행하였으며, ANLS*를 사용해 분류, 질의응답, 정보 추출 작업의 성능을 측정하였다.
(a) Ground truth.
(a) Ground truth.

실험 결과

연구 질문

  • RQ1ANLS*는 구조화된 출력과 비구조화된 출력을 포함한 다양한 문서 처리 작업에서 생성형 LLM에 대한 유니버설 평가 지표로 기능할 수 있는가?
  • RQ2복잡한 출력 유형에서 ANLS*는 원본 ANLS 지표와 비교해 호환성과 성능 면에서 어떻게 다를까?
  • RQ3제안된 SFT 프롬프팅 기법은 LATIN과 같은 기존 프롬프팅 전략보다 정확하고 구조화된 출력을 생성하는 데서 뚜렷한 성능 향상을 보일까?
  • RQ4실제 문서 데이터셋에서 다양한 GLLM이 ANLS*로 평가되었을 때 성능에 얼마나 큰 격차가 존재하는가?
  • RQ5ANLS*는 단일 평가 프레임워크를 통해 분류 모델과 생성 모델 간 공정하고 직접적인 비교를 가능하게 할 수 있는가?

주요 결과

  • SFT는 평가된 21개 케이스 중 15개에서 LATIN 프롬프팅 기법을 능가했으며, DocVQA 데이터셋에서 최대 15%p의 향상을 기록했다.
  • GPT-3.5-turbo-16k는 DocVQA와 SROIE 두 데이터셋에서 GPT-4-turbo를 앞서며, 모델 버전 관리와 프롬프트 엔지니어링의 중요성을 입증했다.
  • Gemini-Pro는 일부 작업에서 심각한 성능 저하를 보였으며, GPT 모델 대비 최대 60.5%p의 점수 하락을 보였다. 이는 보안 필터링 때문일 가능성이 높다.
  • Mistral-large는 레이아웃 의존적인 작업에서 문서 처리에 어려움을 겪었으며, 2차원 문서 구조를 처리하는 데 한계를 드러냈다.
  • ANLS*는 중첩된 딕셔너리와 리스트를 포함한 복잡한 출력도 성공적으로 평가하여, 단순 문자열 매칭을 넘는 유연성을 입증했다.
  • 저자는 ANLS*가 ANLS와 완전히 후행 호환됨을 확인하여 이전 벤치마크 작업과의 일관성을 유지함을 입증했다.
(b) Prediction with $\text{ANLS*}=1.0$ .
(b) Prediction with $\text{ANLS*}=1.0$ .

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.