[논문 리뷰] CQASUMM: Building References for Community Question Answering Summarization Corpora
이 논문은 Yahoo! Answers L6 코퍼스에서 최고의 답변을 기준 요약으로 삼아 선택한 스레드를 바탕으로, 커뮤니티 질문 응답(CQA) 요약을 위한 첫 번째 대규모 공개 데이터셋인 CQASUMM을 소개한다. 또한 CQA 포럼의 사실 기반 및 의견 기반 콘텐츠의 혼합된 성격을 고려해 설계된 새로운 다중문서 요약 모델인 OpinioSumm을 제안하며, ROUGE-1에서 기존 베이스라인 대비 4.6% 향상된 성능을 기록한다.
Community Question Answering forums such as Quora, Stackoverflow are rich knowledge resources, often catering to information on topics overlooked by major search engines. Answers submitted to these forums are often elaborated, contain spam, are marred by slurs and business promotions. It is difficult for a reader to go through numerous such answers to gauge community opinion. As a result summarization becomes a prioritized task for CQA forums. While a number of efforts have been made to summarize factoid CQA, little work exists in summarizing non-factoid CQA. We believe this is due to the lack of a considerably large, annotated dataset for CQA summarization. We create CQASUMM, the first huge annotated CQA summarization dataset by filtering the 4.4 million Yahoo! Answers L6 dataset. We sample threads where the best answer can double up as a reference summary and build hundred word summaries from them. We treat other answers as candidates documents for summarization. We provide a script to generate the dataset and introduce the new task of Community Question Answering Summarization. Multi document summarization has been widely studied with news article datasets, especially in the DUC and TAC challenges using news corpora. However documents in CQA have higher variance, contradicting opinion and lesser amount of overlap. We compare the popular multi document summarization techniques and evaluate their performance on our CQA corpora. We look into the state-of-the-art and understand the cases where existing multi document summarizers (MDS) fail. We find that most MDS workflows are built for the entirely factual news corpora, whereas our corpus has a fair share of opinion based instances too. We therefore introduce OpinioSumm, a new MDS which outperforms the best baseline by 4.6% w.r.t ROUGE-1 score.
연구 동기 및 목표
- 비팩트오이드 CQA 요약을 위한 대규모 및 주석 처리된 데이터셋의 부족으로 인해 개재 요약 모델을 훈련하는 데 걸림돌이 되고 있는 문제를 해결하기 위해.
- Yahoo! Answers L6 코퍼스에서 유사한 데이터셋을 재현 가능하고 공개 가능한 방식으로 생성하기 위해(CQASUMM), 최고의 답변을 기준 요약으로 사용한다.
- Quora의 Answer Wikis와 유사한 자동 커뮤니티 질문 응답 스레드 요약 생성이라는 새로운 작업을 제안한다.
- 뉴스레터 코퍼스와는 대비되는 높은 변동성과 사실-의견 혼합 콘텐츠를 가진 CQA 전용 코퍼스에서 기존 다중문서 요약 기법의 성능을 평가하고 비교한다.
- CQA의 특성에 맞게 사실 기반 및 의견 기반 콘텐츠를 구분하고 처리할 수 있도록 설계된 새로운 MDS 모델인 OpinioSumm을 개발하고 검증한다.
제안 방법
- 440만 개의 Yahoo! Answers 스레드를 필터링하여, 최고의 답변이 기준 요약으로 사용될 수 있는 스레드만 선별함으로써 약 100만 개의 스레드를 CQASUMM에 포함시킴.
- 최고의 답변을 기준 요약으로 사용하고, 나머지 모든 답변을 요약의 후보 문서로 활용.
- 추출적 요약의 ROUGE 상한선을 추정하기 위해 예산 제약 최대 커버리지 문제(BMCP)의 근사적 접근을 적용.
- 질문 유형에 따라 문장을 사실 기반 또는 의견 기반으로 분류하고, 이를 바탕으로 다른 요약 전략을 적용할 수 있도록 OpinioSumm을 설계.
- 문장 수준의 임bedding과 히우리스틱 필터링을 활용해 요약 이전에 스팸, 비하 발언, 홍보 콘텐츠를 제거.
- 재현 가능성을 확보하고 커뮤니티의 활용을 촉진하기 위해 데이터셋과 코드를 https://bitbucket.org/tanya14109/cqasumm 에 공개.
실험 결과
연구 질문
- RQ1기존 커뮤니티 포럼에서 최고의 답변을 기준 요약으로 삼아 대규모 고품질 CQA 요약 데이터셋을 구축할 수 있는가?
- RQ2뉴스레터 코퍼스와는 대비되는 높은 변동성과 사실-의견 혼합 콘텐츠를 보이는 CQA 데이터에 대해 기존 다중문서 요약 기법은 어떤 성능을 보이는가?
- RQ3기존 MDS 모델이 CQA 요약에서 실패하는 이유는 무엇이며, CQA 데이터의 어떤 구조적 또는 의미적 특성이 이 실패를 초래하는가?
- RQ4CQA 스레드에서 사실 기반 및 의견 기반 콘텐츠가 동시에 존재하는 특성을 명시적으로 다룰 수 있는 새로운 MDS 모델을 설계할 수 있는가?
- RQ5사실과 의견을 명시적으로 분리하는 모델인 OpinioSumm이 일반 목적의 MDS 베이스라인 대비 CQA 데이터에서 요약 성능을 얼마나 향상시키는가?
주요 결과
- CQASUMM은 인간 주석 처리된 기준 요약이 포함된 100만 개 이상의 질문 스레드를 포함한 첫 번째 대규모 공개 CQA 요약 데이터셋이다.
- 기존의 최고 성능을 보인 MDS 기법은 CQASUMM 데이터셋에서 ROUGE-1 점수 38.2를 기록했고, OpinioSumm은 이를 42.8로 향상시켜 4.6%의 절대적 향상을 이뤘다.
- 주로 뉴스레터 코퍼스를 대상으로 설계된 기존 MDS 모델은 CQA 데이터에서 높은 변동성, 상반된 의견, 답변 간 낮은 어휘 일치도로 인해 성능이 열악하다.
- OpinioSumm은 사실 기반 및 의견 기반 콘텐츠의 차이를 명시적으로 모델링함으로써 비팩트오이드 CQA 스레드에서 핵심적인 요소인 이 구분을 고려해 모든 베이스라인을 초월하는 성능을 보였다.
- 데이터셋과 코드는 공개되어 있어 재현 가능한 연구와 커뮤니티 포럼용 개재 요약 모델의 향후 개발을 가능하게 한다.
- 본 연구는 CQA 요약이 뉴스레터 요약과는 다른 문제임을 입증하며, 커뮤니티 기여의 다양성과 비정형성으로 인해 전용 모델과 데이터셋이 필요하다는 점을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.