Skip to main content
QUICK REVIEW

[논문 리뷰] FABLES: Evaluating faithfulness and content selection in book-length summarization

Yekyung Kim, Yapei Chang|arXiv (Cornell University)|2024. 04. 01.
Natural Language Processing Techniques인용 수 4
한 줄 요약

이 논문은 장문의 LLM을 사용한 책 수준 요약에서 신뢰성과 내용 선택에 대한 첫 번째 대규모 인간 평가인 FABLES를 소개한다. 26권의 최근에 출간된 소설을 평가하고, 3,158개의 주장 수준 평가를 수집하여 Claude-3-Opus가 다른 모델들보다 신뢰성에서 뚜렷이 뛰어나다는 것을 발견했으며, LLM 기반 자동 평가 모델은 인간 평가와 강한 상관관계를 보이지 않아, 장문의 NLP 분야에서 보다 나은 신뢰성 평가 기준이 필요하다는 점을 드러냈다.

ABSTRACT

While long-context large language models (LLMs) can technically summarize book-length documents (>100K tokens), the length and complexity of the documents have so far prohibited evaluations of input-dependent aspects like faithfulness. In this paper, we conduct the first large-scale human evaluation of faithfulness and content selection on LLM-generated summaries of fictional books. Our study mitigates the issue of data contamination by focusing on summaries of books published in 2023 or 2024, and we hire annotators who have fully read each book prior to the annotation task to minimize cost and cognitive burden. We collect FABLES, a dataset of annotations on 3,158 claims made in LLM-generated summaries of 26 books, at a cost of $5.2K USD, which allows us to rank LLM summarizers based on faithfulness: Claude-3-Opus significantly outperforms all closed-source LLMs, while the open-source Mixtral is on par with GPT-3.5-Turbo. An analysis of the annotations reveals that most unfaithful claims relate to events and character states, and they generally require indirect reasoning over the narrative to invalidate. While LLM-based auto-raters have proven reliable for factuality and coherence in other settings, we implement several LLM raters of faithfulness and find that none correlates strongly with human annotations, especially with regard to detecting unfaithful claims. Our experiments suggest that detecting unfaithful claims is an important future direction not only for summarization evaluation but also as a testbed for long-context understanding. Finally, we move beyond faithfulness by exploring content selection errors in book-length summarization: we develop a typology of omission errors related to crucial narrative elements and also identify a systematic over-emphasis on events occurring towards the end of the book.

연구 동기 및 목표

  • 장문의 LLM 요약에서의 신뢰성과 내용 선택에 대한 첫 번째 대규모 인간 평가를 수행하여 장문의 NLP 평가 분야에서 중요한 격차를 해소한다.
  • 목표 책을 사전에 읽은 바 있는 평가자들을 고용하여 데이터 오염과 인지적 부담을 완화한다 (2023년 또는 2024년에 출간된 책).
  • 3,158개의 주장 수준의 신뢰성 평가를 포함한 FABLES 데이터셋을 개발하고 공개한다. 이 데이터셋에는 근거와 자유형 코멘트가 포함되어 있다.
  • 신뢰성 평가에 대해 LLM 기반 자동 평가 모델의 신뢰도를 평가하고 인간 평가와 비교하여 주요 한계를 규명한다.
  • 신뢰성 외의 내용 선택 오류를 분석하며, 포함되지 않은 요소의 패atters와 후반부 책의 사건에 대한 과도한 강조를 포함한다.

제안 방법

  • 5개의 LLM 설정(기본 모델과 청크 크기의 조합)을 사용한 계층적 요약 파이프라인을 적용하여 26권의 최근에 출간된 소설의 요약을 생성한다.
  • GPT-4 프롬프팅을 활용해 각 요약을 맥락 제거된 주장들로 분해함으로써 세밀한 평가를 가능하게 한다.
  • 3,158개의 주장에 대해 인간 평가를 수행하여 평가자가 소스 텍스트와 대조하여 각 주장을 확인하고 근거를 제시하고 레이블을 정당화하도록 한다.
  • 주장 수준과 요약 수준에서 자유형 코멘트를 수집하여 체계적인 누락과 내용 선택 오류를 식별한다.
  • 전체 책(EB)과 BM25로 검색된 문장 조각을 프롬프팅한 LLM 기반 자동 평가 모델 여러 종류를 평가하여 인간 평가와의 상관관계를 분석한다.
  • 요약 수준의 코멘트를 분석하여 코딩 기반의 누락 오류 분류 체계를 개발하였으며, 사건, 인물 상태, 주제와 같은 핵심 서사 요소에 집중한다.

실험 결과

연구 질문

  • RQ1어떤 LLM이 가장 높은 수준의 책 수준 요약을 생성하며, 그들의 신뢰성과 내용 선택 능력은 어떻게 비교되는가?
  • RQ2LLM 기반 요약에서 가장 흔한 신뢰성 오류 유형(예: 사건 오인, 인물 상태 오류 등)은 무엇인가?
  • RQ3LLM 기반 자동 평가 모델은 책 수준 요약에서 불신뢰성 있는 주장을 신뢰성 있게 탐지할 수 있는가, 특히 다단계 추론이 필요한 경우에 한해?
  • RQ4LLM 요약 생성기가 보이는 체계적인 내용 선택 오류는 무엇인가? (예: 후반부 책의 사건에 대한 과도한 강조, 핵심 주제의 누락 등)
  • RQ5전체 책을 프롬프팅하거나 검색된 문장 조각을 사용할 때, 인간 평가자들이 내린 신뢰성 판단과 LLM 기반 평가 모델의 예측 간 비교는 어떻게 이루어지는가?

주요 결과

  • Claude-3-Opus는 모든 폐쇄형 LLM보다 신뢰성에서 뚜렷이 뛰어나며, 전체 책 프롬프팅 설정(EB)에서 전체 책 기준으로 재현율(recall)이 0.970을 기록했고, 오직 1개의 불신뢰성 주장만 잘못 분류되었다.
  • GPT-4-Turbo는 두 번째로 높은 성능을 보였으며, 재현율(recall)이 0.963이었다. GPT-3.5-Turbo와 Mixtral은 유사한 성능을 보였고, 일부 지표에서는 Mixtral이 GPT-3.5-Turbo보다 略로 뛰어난 성능을 보였다.
  • 모든 LLM 기반 평가 모델이 인간 평가와 강한 상관관계를 보이지 않았으며, 특히 불신뢰성 주장 탐지에서 뚜렷한 한계를 보였다. GPT-4-Turbo는 EB 설정에서 F1 점수 0.354에 머물렀다.
  • 대부분의 불신뢰성 주장은 사건이나 인물 상태와 관련되었으며, 일반적으로 다단계 추론을 통해 서사 근거를 분석해야만 부정됨을 입증할 수 있었고, 이는 매우 높은 복잡성을 반영한다.
  • 모든 LLM이 체계적인 내용 선택 오류를 보였다: 핵심 사건, 인물의 성장 궤적, 주제가 자주 누락되었고, 책의 마지막 세 분면에 있는 내용에 대해 일관되게 과도하게 강조했다.
  • 인간 평가의 비용은 26권에 대해 총 $5.2K였으며, 전체 책을 프롬프팅하는 것은 비용이 너무 많이 들었고, 예를 들어 Claude-3-Opus가 7권에 대해 $1,070이 소요되었으며, 이는 인간 평가의 확장성 문제를 강조한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.