Skip to main content
QUICK REVIEW

[논문 리뷰] ODSum: New Benchmarks for Open Domain Multi-Document Summarization

Yijie Zhou, Kejian Shi|arXiv (Cornell University)|2023. 09. 16.
Topic ModelingComputer Science인용 수 3
한 줄 요약

이 논문은 실용적이고 질의 중심인 데이터셋이 부족한 문제를 해결하기 위해 오픈 도메인 다중 문서 요약(ODMDS)을 위한 새로운 벤치마크인 ODSum을 소개한다. 기존의 질의 중심 MDS 데이터셋을 ODMDS 데이터셋으로 변환하기 위한 규칙 기반 방법을 제안하여, 종단 간 검색-요약 파이프라인의 평가를 가능하게 한다. 주요 발견은 LLM의 성능 저하가 검색 오류로 인해 심각하게 발생하며, 검색 품질과 요약 효과성 간의 핵심적 의존성이 있음을 시사하며, G-Eval을 통해 요약 모델 간 성능 변동성이 높음을 확인한다.

ABSTRACT

Open-domain Multi-Document Summarization (ODMDS) is a critical tool for condensing vast arrays of documents into coherent, concise summaries. With a more inter-related document set, there does not necessarily exist a correct answer for the retrieval, making it hard to measure the retrieving performance. We propose a rule-based method to process query-based document summarization datasets into ODMDS datasets. Based on this method, we introduce a novel dataset, ODSum, a sophisticated case with its document index interdependent and often interrelated. We tackle ODMDS with the extit{retrieve-then-summarize} method, and the performance of a list of retrievers and summarizers is investigated. Through extensive experiments, we identify variances in evaluation metrics and provide insights into their reliability. We also found that LLMs suffer great performance loss from retrieving errors. We further experimented methods to improve the performance as well as investigate their robustness against imperfect retrieval. We will release our data and code at https://github.com/yale-nlp/ODSum.

연구 동기 및 목표

  • 실제 세계 지식 추출에 필수적인, 현실적이고 질의 중심인 오픈 도메인 다중 문서 요약(ODMDS)을 위한 벤치마크의 부족 문제를 해결하기 위해.
  • 이전의 ODMDS 연구에서의 한계, 예를 들어 가짜 질의 생성 및 최적화되지 않은 문서 데이터베이스 설계 문제를 해결하기 위해.
  • 실제 도메인 과제를 반영하는 데이터셋을 구축하기 위해: 대규모 주로 관련성이 없는 컬렉션에서 관련 문서를 검색하고, 이를 일관성 있게 요약하는 것.
  • 다양한 검색 모델과 요약 모델이 실제 ODMDS 환경에서, 특히 완벽하지 않은 검색 조건 하에서 어떻게 성능을 내는지 평가하기 위해.
  • 평가 지표의 신뢰성과 LLM 기반 요약 파이프라인의 강건성에 대한 통찰을 제공하기 위해.

제안 방법

  • 기존의 질의 중심 다중 문서 요약 데이터셋(SQuALITY 및 QMSum)을 참조 요약에서 유저 유사 질의를 추출함으로써 ODMDS 호환 데이터셋으로 변환하는 규칙 기반 데이터 변환 파이프라인을 제안한다.
  • 결과로 생성된 ODSum 데이터셋은 상호의존적인 문서 인덱스와 현실적인 사용자 정보 필요성을 갖추고 있어, 실제 검색 과제를 시뮬레이션한다.
  • 표준 검색-요약 파이프라인을 활용하며, 먼저 검색 모델이 대규모 코퍼스에서 관련 문서를 식별하고, 그 다음 개괄적 요약을 수행한다.
  • 다양한 검색 모델(예: 밀도 기반 검색기, BM25)과 요약 모델(예: 미세조정된 BART, GPT-3.5 및 Llama와 같은 LLM)을 벤치마크에서 평가한다.
  • ROUGE, G-Eval 등 다양한 지표를 사용하여 추출적 요약과 개괄적 요약의 품질을 평가한다.
  • 통제된 검색 오류를 도입하여 요약 성능에 미치는 영향을 분석함으로써 강건성 분석을 수행한다.

실험 결과

연구 질문

  • RQ1검색 모델의 성능이 오픈 도메인 다중 문서 요약에서 후행 요약 품질에 어떻게 영향을 미치는가?
  • RQ2불완전하거나 노이즈가 있는 검색 결과가 제공될 경우, LLM 기반 요약 모델의 성능은 어느 정도 저하되는가?
  • RQ3다양한 검색 조건 하에서 요약 품질을 측정하는 데 있어 표준 평가 지표(예: ROUGE, G-Eval)의 신뢰성은 어느 정도인가?
  • RQ4향상된 검색 전략이 LLM 기반 요약 파이프라인의 성능 저하를 완화할 수 있는가?
  • RQ5다양하고 상호연결된 문서 세트에 직면했을 때, 다양한 요약 모델 간 강건성과 일관성 측면에서의 성능 비교는 어떻게 이루어지는가?

주요 결과

  • 검색 결과가 정확하지 않을 경우 LLM의 성능 저하가 심각하게 발생하며, 이는 검색과 요약 품질 간의 강력한 의존성을 시사한다.
  • G-Eval은 다양한 모델 간 요약 품질에 큰 변동성을 드러내어, 평가 지표 선택이 모델 성능 평가에 중대한 영향을 미칠 수 있음을 시사한다.
  • 제안된 규칙 기반 방법은 기존 qMDS 데이터셋을 현실적인 ODMDS 벤치마크로 성공적으로 변환하였으며, 사용자 유사 질의와 상호의존적인 문서 세트를 포함한다.
  • 검색 오류는 종단 간 ODMDS 파이프라인의 주요 병목 요소이며, 작은 검색 실패조차도 요약 품질에 큰 하락을 초래한다.
  • BART와 같은 미세조정된 개괄적 모델이, 특히 검색이 완벽하지 않은 상황에서 일관성과 사실적 일관성 측면에서 제로샷 LLM보다 뛰어난 성능을 보인다.
  • ODSum 벤치마크는 현재 평가 관행의 심각한 약점을 드러내며, 특히 사실 정확성이나 일관성 요소를 고려하지 않고 ROUGE에 과도하게 의존하는 경향을 지적한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.