Skip to main content
QUICK REVIEW

[논문 리뷰] APRIL: Interactively Learning to Summarise by Combining Active Preference Learning and Reinforcement Learning

Yang Gao, Christian M. Meyer|arXiv (Cornell University)|2018. 08. 29.
Topic Modeling참고 문헌 27인용 수 6
한 줄 요약

APRIL은 참조 요약문이 없이 추출형 다중문서 요약을 수행하기 위해 주도적 선호도 학습과 강화 학습을 결합한 새로운 상호작용 학습 프레임워크를 제안한다. 활성 선호도 학습 단계와 강화 학습 단계로 과정을 분리함으로써 APRIL은 샘플 복잡도를 감소시키고 시뮬레이션 및 인간 평가에서 기존 방법보다 뚜렷이 뛰어나며, 사용자들은 항상 APRIL이 생성한 요약을 SPPI의 요약보다 선호한다.

ABSTRACT

We propose a method to perform automatic document summarisation without using reference summaries. Instead, our method interactively learns from users' preferences. The merit of preference-based interactive summarisation is that preferences are easier for users to provide than reference summaries. Existing preference-based interactive learning methods suffer from high sample complexity, i.e. they need to interact with the oracle for many rounds in order to converge. In this work, we propose a new objective function, which enables us to leverage active learning, preference learning and reinforcement learning techniques in order to reduce the sample complexity. Both simulation and real-user experiments suggest that our method significantly advances the state of the art. Our source code is freely available at https://github.com/UKPLab/emnlp2018-april.

연구 동기 및 목표

  • 자연어 처리 분야에서 선호도 기반 상호작용 학습의 높은 샘플 복잡도 문제를 해결하기 위해.
  • 비용이 많이 드는 참조 요약문에 의존하지 않고 사용자 선호도로부터 직접 학습함으로써 이를 제거하기 위해.
  • 활성 선호도 학습과 강화 학습 단계를 분리하는 새로운 목적 함수를 통해 상호작용 요약의 효율성과 강건성을 향상시키기 위해.
  • 모의 환경과 실제 사용자 설정에서 프레임워크를 평가하여 SPPI와 같은 기존 방법보다 뛰어난 성능을 입증하기 위해.
  • 최소한의 인간 상호작용으로도 실용적인 상호작용 요약 시스템의 구현을 가능하게 하기 위해.

제안 방법

  • APRIL은 학습 과정을 두 단계로 나누는 새로운 목적 함수를 도입한다: 활성 선호도 학습(APL) 및 강화 학습(RL).
  • APL 단계에서는 사용자 비교를 위해 가장 정보량이 많은 문장 쌍을 체계적으로 선택함으로써 필요로 하는 선호도 질의 수를 최소화한다.
  • RL 단계에서는 수집된 선호도 정보를 희소 보상으로 사용하여 요약 정책을 훈련시키며, 길이 제약 조건 하에 요약 품질을 최적화한다.
  • 이 프레임워크는 다양한 APL 및 RL 기법의 통합을 지원하여 더 유연하고 효율적인 학습을 가능하게 한다.
  • APRIL은 ROUGE 점수 대신 랭킹 기반 보상 메커니즘을 사용하여 신경 강화 학습 모델과 호환성을 확보한다.
  • 시스템은 노이즈 수준이 다양한 모의 오라클과 실제 인간 사용자를 대상으로 한 통제된 비교 실험을 통해 평가된다.

실험 결과

연구 질문

  • RQ1참조 요약문이 없는 추출형 다중문서 요약에서 선호도 기반 상호작용 학습 프레임워크가 샘플 복잡도를 감소시킬 수 있는가?
  • RQ2활성 선호도 학습과 강화 학습을 분리함으로써 학습 효율성과 강건성이 어떻게 향상되는가?
  • RQ3APRIL은 자동 평가 지표와 인간 평가 모두에서 최신 기술인 SPPI 프레임워크를 능가할 수 있는가?
  • RQ4노이즈가 있거나 완벽하지 않은 사용자 피드백 조건 하에서 APRIL은 어떻게 성능을 유지하는가?
  • RQ5실제 사용자가 기존 상호작용 시스템의 요약과 비교해 APRIL이 생성한 요약을 어느 정도 선호하는가?

주요 결과

  • 모의 실험에서 APRIL은 높은 노이즈 수준의 오라클 조건에서도 단지 10라운드의 상호작용만으로 SPPI보다 훨씬 높은 요약 품질을 달성했다.
  • 실제 사용자 평가에서 DUC 데이터셋의 세 가지 서로 다른 주제에서 일곱 명의 사용자 전원이 APRIL이 생성한 요약을 SPPI의 요약보다 선호했다.
  • 5점 리커트 척도에서 APRIL이 생성한 요약은 일관되게 높은 평점을 받았으며, 실제 사용자 환경에서의 뛰어난 품질을 확인시켰다.
  • 프레임워크는 높은 노이즈 내성 강건성을 보였으며, 사용자 피드백에 오류나 일관성 없는 요소가 포함되어 있어도 높은 성능을 유지했다.
  • APL과 RL 단계의 분리로 더 효과적인 질의 선택과 보상 활용이 가능해져 필요한 상호작용 횟수가 감소했다.
  • APRIL은 DUC’04에서 ROUGE-2 상한선 .212를 초월했으며, 이론적 최대치에 상당히 가까워졌다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.