[논문 리뷰] A Sliding-Window Approach to Automatic Creation of Meeting Minutes
이 논문은 인간 요약가와 자동 요약가 평가에서 모두 뛰어난 성능을 보이며, 애초에 애너테이션된 학습 데이터가 필요로 하지 않는, 음성 전사본에서 자동으로 회의록을 생성하기 위해 보정된 BART 요약 모델을 사용하는 슬라이딩 윈도우 방법을 제안한다. 전사본을 겹치는 윈도우로 처리하고 핵심 내용을 추출함으로써, 가상 회의에서 흔히 볼 수 있는 긴 비정형 음성 전사본에서 정확한 요약을 생성한다.
Meeting minutes record any subject matters discussed, decisions reached and actions taken at meetings. The importance of minuting cannot be overemphasized in a time when a significant number of meetings take place in the virtual space. In this paper, we present a sliding window approach to automatic generation of meeting minutes. It aims to tackle issues associated with the nature of spoken text, including lengthy transcripts and lack of document structure, which make it difficult to identify salient content to be included in the meeting minutes. Our approach combines a sliding window and a neural abstractive summarizer to navigate through the transcripts to find salient content. The approach is evaluated on transcripts of natural meeting conversations, where we compare results obtained for human transcripts and two versions of automatic transcripts and discuss how and to what extent the summarizer succeeds at capturing salient content.
연구 동기 및 목표
- 가상 회의에서 흔히 볼 수 있는 긴 비정형 음성 전사본에서 정확한 회의록을 생성하는 데 도전하는 것.
- 신경망 추상적 요약 모델이 음성 회의 데이터에 적용될 때 발생하는 위치 편향 및 입력 길이 제약 등의 한계를 극복하는 것.
- 다양한 전사 유형(인간 전사 및 자동 전사 포함)에서 핵심 내용을 식별하는 데 슬라이딩 윈도우 전략의 효과를 평가하는 것.
- 자동 평가 지표와 인간 평가 지표를 바탕으로 제안된 방법을 추출적 요약 및 감독 학습 기반 추상적 요약 기준 모델과 비교하는 것.
제안 방법
- 방법은 설정 가능한 윈도우 크기(W)와 스텝 크기(S)를 가진 슬라이딩 윈도우를 사용하여 전사본의 국소 세그먼트를 처리한다.
- 각 윈도우에 대해 보정된 BART-large-cnn 모델이 국소 콘텐츠의 추상적 요약을 생성하며, 핵심 대화를 식별한다.
- 핵심 콘텐츠가 윈도우 경계로 인해 놓치지 않도록 겹치는 윈도우를 사용하며, 최적의 재현율과 정밀도를 확보하기 위해 윈도우 크기와 스텝 크기를 조정한다.
- 윈도우 간에 선택된 대화문을 통합하고 중복 제거하여 최종 회의 수준의 요약을 구성한다.
- ICS I 회의 코퍼스의 전사본(인간 전사 및 AMI ASR, Google Cloud Speech-to-Text에서 생성된 자동 전사 포함)을 대상으로 시스템을 평가한다.
- 이 방법은 어떤 애너테이션된 학습 데이터도 필요로 하므로, 다양한 회의 분야와 유형에 쉽게 적용 가능하다.
실험 결과
연구 질문
- RQ1말하기 회의 전사본에서 효과적인 핵심성 탐지에 가장 적합한 윈도우 크기와 스텝 크기는 무엇인가?
- RQ2신경망 추상적 요약 모델이 말하기 전사본의 국소 윈도우 내에서 핵심 콘텐츠를 효과적으로 식별할 수 있는가?
- RQ3겹치는 윈도우에서 생성된 국소 요약을 어떻게 통합하여 일관되고 고품질의 회의 수준 요약으로 만들 수 있는가?
- RQ4자동 평가 및 인간 평가 측면에서 슬라이딩 윈도우 접근법이 추출적 요약 및 감독 학습 기반 추상적 요약 기준 모델보다 어떻게 성능을 냈는가?
주요 결과
- W=1024, S=128로 설정한 슬라이딩 윈도우 방법이 훈련 세트에서 가장 높은 F-스코어(0.455)를 기록하여 정밀도와 재현율을 균형 있게 확보했다.
- 작은 윈도우와 스텝 크기(W=128, S=128)는 높은 재현율(회의당 30%의 대화문 선택)을 보였지만 정밀도가 낮았고, 더 큰 윈도우 크기는 정밀도를 향상시켰다.
- TextRank와 비교해 성능이 뛰어나며, 인간 평가에서 감독 학습 기반 BERT 요약 모델과 유사한 성능을 보였고, 67%의 대화문이 매우 관련성 있거나 관련성이 있다고 평가되었다.
- 슬라이딩 윈도우 요약은 감독 학습 기반 BERT 모델의 요약보다 더 일관되고 맥락적으로 연결된 것으로 평가되었으며, 연속된 대화문이 같은 화자 또는 주제를 공유할 가능성이 더 높았다.
- Google Cloud Speech-to-Text 전사본은 인간 전사본과 AMI ASR 전사본과는 다른 대화문 분할 행동을 보였으며, 이는 요약 일관성에 영향을 주었다.
- BART의 입력 길이 제약을 초월하는 전사본을 겹치는 윈도우로 처리함으로써, 자르기 없이 종단 간 요약을 가능하게 하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.