Skip to main content
QUICK REVIEW

[論文レビュー] A Sliding-Window Approach to Automatic Creation of Meeting Minutes

Jia Jin Koay, Alexander Roustai|arXiv (Cornell University)|Apr 26, 2021
Topic Modeling参考文献 38被引用数 4
ひとこと要約

本稿では、スライディングウィンドウ手法を用い、微調整されたBART要約モデルを活用して、会議の会話トランスクリプトから自動的に会議議事録を生成する手法を提案する。トランスクリプトを重複するウィンドウで処理し、重要な内容を抽出することで、人間によるトランスクリプトおよび自動トランスクリプトの両方で優れた性能を達成し、抽出要約のベースラインを上回り、アノテーション付き学習データを必要としない文脈に配慮した一貫性のある要約を生成する。

ABSTRACT

Meeting minutes record any subject matters discussed, decisions reached and actions taken at meetings. The importance of minuting cannot be overemphasized in a time when a significant number of meetings take place in the virtual space. In this paper, we present a sliding window approach to automatic generation of meeting minutes. It aims to tackle issues associated with the nature of spoken text, including lengthy transcripts and lack of document structure, which make it difficult to identify salient content to be included in the meeting minutes. Our approach combines a sliding window and a neural abstractive summarizer to navigate through the transcripts to find salient content. The approach is evaluated on transcripts of natural meeting conversations, where we compare results obtained for human transcripts and two versions of automatic transcripts and discuss how and to what extent the summarizer succeeds at capturing salient content.

研究の動機と目的

  • バーチャル会議で一般的に見られる長大で非構造的な会話トランスクリプトから正確な会議議事録を生成する課題に対処すること。
  • 神経的抽象的要約モデルが会話会議データに適用される際の、位置バイアスや文脈長制限といった制限を克服すること。
  • スライディングウィンドウ戦略が、人間によるトランスクリプトおよび自動音声認識(ASR)出力を含む多様なトランスクリプトタイプにおいて、顕著な内容を特定する有効性を評価すること。
  • 自動評価指標および人間評価指標の両面から、提案手法を抽出的要約および教師あり抽象的要約のベースラインと比較すること。

提案手法

  • 本手法は、設定可能なウィンドウサイズ(W)とストライド(S)を用いて、会議トランスクリプトにスライディングウィンドウを適用し、トランスクリプトの局所的セグメントを処理する。
  • 各ウィンドウに対して、微調整済みのBART-large-cnnモデルが局所的コンテンツの抽象的要約を生成し、顕著な発話文を特定する。
  • 重複するウィンドウを用いることで、ウィンドウ境界による顕著な内容の漏れを防ぎ、最適な再現率と適合率を達成するように、ウィンドウサイズとストライドを調整する。
  • 局所的要約は、ウィンドウ間で選択された発話文を統合・重複除去することで、最終的な会議レベルの要約に統合する。
  • 本手法は、ICSI会議コーパスのトランスクリプト(人間によるトランスクリプトおよびAMI ASRとGoogle Cloud Speech-to-Textによる2種類の自動トランスクリプト)を用いて評価された。
  • 本手法は、アノテーション付き学習データを一切必要としないため、多様な会議分野やタイプに柔軟に適応可能である。

実験結果

リサーチクエスチョン

  • RQ1会話会議トランスクリプトにおける顕著性検出に効果的な最適なウィンドウサイズとストライドサイズは何か?
  • RQ2神経的抽象的要約モデルは、会話トランスクリプトの局所的ウィンドウ内で顕著な内容を効果的に特定できるか?
  • RQ3重複するウィンドウからの局所的要約を、一貫性があり高品質な会議レベルの要約に統合するにはどうすればよいか?
  • RQ4自動評価および人間評価の観点から、スライディングウィンドウ手法は抽出的要約および教師あり抽象的要約のベースラインと比べてどのように差がつくか?

主な発見

  • W=1024、S=128のスライディングウィンドウ手法が、トレーニングセットで最高のFスコア(0.455)を達成し、適合率と再現率のバランスが取れた。
  • 小さなウィンドウとストライド(W=128、S=128)は高い再現率(1会議あたり30%の発話文が選択)を示したが、適合率は低かった。一方、大きなウィンドウは適合率を向上させた。
  • 本手法はTextRankを上回り、人間評価では教師ありBERT要約モデルと同等の性能を示し、67%の発話文が「非常に関連性がある」または「関連性がある」と評価された。
  • スライディングウィンドウ要約は、教師ありBERTモデルの要約よりも一貫性が高く文脈的につながっていると評価され、連続する発話文が同じ発話者またはトピックを共有する確率が高かった。
  • Google Cloud Speech-to-Textのトランスクリプトは、人間およびAMI ASRのトランスクリプトとは異なる発話文の分割行動を示し、要約の一貫性に影響を与えた。
  • 本手法は、BARTの入力長制限を超えるトランスクリプトを重複ウィンドウで処理することで、切り出しなしにエンド・ツー・エンドの要約処理を実現した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。