Skip to main content
QUICK REVIEW

[論文レビュー] Open Domain Multi-document Summarization: A Comprehensive Study of Model Brittleness under Retrieval

John Giorgi, Luca Soldaini|arXiv (Cornell University)|Dec 20, 2022
Topic Modeling被引用数 4
ひとこと要約

本稿は、ゴールスタンダードの文書セットではなく、取得された文書から要約を生成する必要があるオープンドメイン多文書要約(MDS)を調査している。最先端の要約生成モデルは、不完全な検索条件下で顕著な性能低下を示すが、特に不適切な文書の影響が顕著である。一方、オープンドメインデータでのファインチューニングにより性能が向上する。本研究では、実世界のMDS応用における検索長さと誤り耐性に関する実用的ガイドラインを提供する。

ABSTRACT

Multi-document summarization (MDS) assumes a set of topic-related documents are provided as input. In practice, this document set is not always available; it would need to be retrieved given an information need, i.e. a question or topic statement, a setting we dub "open-domain" MDS. We study this more challenging setting by formalizing the task and bootstrapping it using existing datasets, retrievers and summarizers. Via extensive automatic and human evaluation, we determine: (1) state-of-the-art summarizers suffer large reductions in performance when applied to open-domain MDS, (2) additional training in the open-domain setting can reduce this sensitivity to imperfect retrieval, and (3) summarizers are insensitive to the retrieval of duplicate documents and the order of retrieved documents, but highly sensitive to other errors, like the retrieval of irrelevant documents. Based on our results, we provide practical guidelines to enable future work on open-domain MDS, e.g. how to choose the number of retrieved documents to summarize. Our results suggest that new retrieval and summarization methods and annotated resources for training and evaluation are necessary for further progress in the open-domain setting.

研究の動機と目的

  • 検索が必要なオープンドメイン多文書要約(MDS)を形式化し、その分析を実施すること。
  • ゴールスタンダードの文書セットではなく、取得された文書セットを用いた場合の最先端要約生成モデルの性能低下を評価すること。
  • 要約品質に最も深刻な影響を与える検索エラーの種別を特定すること。
  • オープンドメインデータでのファインチューニングが、検索エラーに対する感受性を低減するかを評価すること。
  • 今後の研究およびオープンドメインMDSの実装における実用的かつデータ駆動のガイドラインを提供すること。

提案手法

  • クエリと大規模な文書インデックスを用いて、検索→要約のパイプラインとしてオープンドメインMDSを形式化した。
  • 既存のデータセット(例:Multi-News, Cochrane, WCEP-10)、事前学習済みの検索モデル(例:BM25, DPR)、および要約モデル(例:PEGASUS, PRIMERA, LSG-BART)を用いて、タスクをブートストラップした。
  • ランダム置換、削除、重複、逆翻訳などの制御された摂動を入力文書セットに適用し、検索エラーを模擬した。
  • 自動評価(ROUGE, BERTScore)と被験者による評価(カバレッジと情報量の指標)を併用した。
  • 検索ノイズ下での耐性向上を評価するために、要約モデルをオープンドメインデータでファインチューニングした。
  • 二項検定とアノテーター間整合性(kappa > 0.21)を用いて、被験者評価の妥当性を検証した。

実験結果

リサーチクエスチョン

  • RQ1最先端の要約生成モデルは、ゴールスタンダードの文書セットではなく、取得された文書セットを用いた場合に、どの程度性能が低下するか?
  • RQ2不適切な文書、重複、順序入れ替えなどの検索エラーのうち、どのタイプが要約品質に最も顕著に悪影響を及えるか?
  • RQ3オープンドメインデータでファインチューニングすることで、要約モデルの不完全な検索に対する感受性を低減できるか?
  • RQ4取得された文書数が、要約品質と耐性にどのように影響するか?
  • RQ5要約モデルは文書の順序や重複に対して感受性を示すのか、それとも主に不適切な文書の影響で失敗するのか?

主な発見

  • 最先端の要約生成モデルは、オープンドメインMDSにおいて顕著な性能低下を示し、不完全な検索下では平均でROUGE-F1が最大20%低下した。
  • 要約モデルは、不適切な文書の検索に対して極めて感受性が高く、これが性能低下の主因である。
  • 要約モデルは文書の重複や順序変更に対して低感受性を示しており、これらのエラーに対しては耐性があることが示された。
  • オープンドメインデータでファインチューニングすることで、要約モデルの検索エラーに対する感受性が顕著に低下し、耐性が向上した。
  • 被験者評価により、ゴールスタンダード入力が取得された入力よりも統計的に有意に好まれることが確認され、中程度のアノテーター間整合性(kappa > 0.21)が得られた。
  • 本研究では、要約品質を維持するには、取得された文書の60–80%が関連している必要があることが判明し、最適な検索長さが極めて重要であると示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。