Skip to main content
QUICK REVIEW

[論文レビュー] GupShup: An Annotated Corpus for Abstractive Summarization of Open-Domain Code-Switched Conversations

Laiba Mehnaz, Debanjan Mahata|arXiv (Cornell University)|Apr 17, 2021
Natural Language Processing Techniques参考文献 49被引用数 8
ひとこと要約

本稿では、6,800件を超える会話と、人間がアノテートした英語およびヒンディー語-英語要約を含む、オープンドメインのヒンディー語-英語混合会話の要約のための最初のスケールの大きなアノテート済みコーパス「GupShup」を紹介する。多言語 mBART およびマルチビュー seq2seq モデルが英語要約生成において最高のパフォーマンスを示したが、ヒンディー語-英語要約では著しく性能が低下し、現在のモデルが混合言語テキストを理解する能力に深刻なギャップを有していることを示している。

ABSTRACT

Code-switching is the communication phenomenon where speakers switch between different languages during a conversation. With the widespread adoption of conversational agents and chat platforms, code-switching has become an integral part of written conversations in many multi-lingual communities worldwide. This makes it essential to develop techniques for summarizing and understanding these conversations. Towards this objective, we introduce abstractive summarization of Hindi-English code-switched conversations and develop the first code-switched conversation summarization dataset - GupShup, which contains over 6,831 conversations in Hindi-English and their corresponding human-annotated summaries in English and Hindi-English. We present a detailed account of the entire data collection and annotation processes. We analyze the dataset using various code-switching statistics. We train state-of-the-art abstractive summarization models and report their performances using both automated metrics and human evaluation. Our results show that multi-lingual mBART and multi-view seq2seq models obtain the best performances on the new dataset

研究の動機と目的

  • リアルなチャットアプリケーションにおける、要約のための高品質で多言語対応のデータセットが不足している問題に対処すること。
  • 英語およびヒンディー語-英語の要約が付随する、ヒンディー語-英語混合会話のスケールの大きな人間によるアノテート済みデータセットを構築すること。
  • 最先端の抽象的要約モデルを混合言語テキストに対して評価し、自動評価指標および人間評価指標を用いてそのパフォーマンスを測定すること。
  • 自然言語処理における混合言語現象、特に要約処理における課題を調査し、混合言語入力を処理する際のモデルの限界を特定すること。
  • 今後の多言語的・混合言語的会話理解および要約分野の研究のためのベンチマークとして、GupShup を確立すること。

提案手法

  • データセットは、単一言語の SAMSum コーパスの一部の会話と要約を、自然な混合言語パターンを保ったままヒンディー語-英語に手動で翻訳することで構築された。
  • データ収集プロセスには複数のアノテーターが関与し、言語的多様性と一貫性を確保するための厳密なガイドラインを設けた。要約および混合言語化のガイドラインが明確に定義された。
  • 最終的なコーパスには、6,831件の会話(76,330発話)が含まれ、並列に英語およびヒンディー語-英語の要約が付随しており、並列な単一言語および混合言語コーパスを形成している。
  • 最先端の抽象的要約モデル(mBART、PEGASUS、BART、およびマルチビュー seq2seq モデル)を英語要約で微調整し、自動評価指標(ROUGE、BLEURT)および人間評価を用いて評価した。
  • 人間評価は、100件のランダムに抽出された要約を対象とし、一貫性、整合性、流暢さ、関連性の4つの基準に基づき、1〜5段階のスケールで評価した。
  • 自動評価指標と人間の判断との間のスピアマン順位相関を計算し、ROUGE や BLEURT などの指標が混合言語要約評価において信頼性があるかどうかを検証した。

実験結果

リサーチクエスチョン

  • RQ1既存の抽象的要約モデルは、ヒンディー語-英語混合会話の要約生成においてどの程度効果的か?
  • RQ2特にヒンディー語-英語要約生成において、単一言語要約と混合言語要約の間でパフォーマンスのギャップはどの程度か?
  • RQ3混合言語要約の文脈において、自動評価指標の中で人間の判断と最も相関が高いのはどれか?
  • RQ4マルチタスク学習やマルチビュー学習は、混合言語データにおける要約パフォーマンスの向上に寄与するか?
  • RQ5mBART などの多言語モデルは、単一言語モデルと比較して、混合言語入力をどのように処理するか?

主な発見

  • 多言語 mBART およびマルチビュー seq2seq モデルが、英語要約生成において最高のパフォーマンスを示し、自動評価および人間評価の両方で他のモデルを上回った。
  • ヒンディー語-英語要約生成では、すべてのモデルで著しくパフォーマンスが低下し、混合言語テキストへの一般化能力が低いことが示された。
  • mBART は25ヶ国の言語で事前学習されているにもかかわらず、英語要約よりもヒンディー語-英語要約で性能が悪く、多言語的耐性の期待とは反対の結果となった。
  • BLEURT およびリ콜ベースの指標(例:ROUGE)が人間の判断と最も強い相関を示し、混合言語要約評価において信頼性があることが示唆された。
  • 人間評価の結果、マルチビューおよび PEGASUS モデルが一貫性と構造的質において最高のスコアを記録した一方、mBART およびマルチビューは事実の整合性と関連性において優れたパフォーマンスを示した。
  • 本データセットは、74,798対の文の並列単一言語および混合言語コーパスを提供しており、今後の翻訳および混合言語 NLP におけるデータ拡張研究を可能にする。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。