Skip to main content
QUICK REVIEW

[논문 리뷰] Privacy Policy Question Answering Assistant: A Query-Guided Extractive Summarization Approach

Moniba Keymanesh, Micha Elsner|arXiv (Cornell University)|2021. 09. 29.
Topic Modeling참고 문헌 37인용 수 4
한 줄 요약

이 논문은 사용자 질문과 개인정보 정책 언어 간의 의미적 및 스타일적 불일치를 해결하기 위해 질의 복제화 및 미세조정된 트랜스포머 모델을 활용하여 사용자 질문을 개인정보 정책 언어와 정렬하는 질의 유도형 추출 요약 파이프라인을 제안한다. 이 시스템은 복제화된 질문에 대한 관련성 및 정보성 점수를 결합하여 PrivacyQA 데이터셋에서 89%의 커버리지로 관련 답변을 검색한다.

ABSTRACT

Existing work on making privacy policies accessible has explored new presentation forms such as color-coding based on the risk factors or summarization to assist users with conscious agreement. To facilitate a more personalized interaction with the policies, in this work, we propose an automated privacy policy question answering assistant that extracts a summary in response to the input user query. This is a challenging task because users articulate their privacy-related questions in a very different language than the legal language of the policy, making it difficult for the system to understand their inquiry. Moreover, existing annotated data in this domain are limited. We address these problems by paraphrasing to bring the style and language of the user's question closer to the language of privacy policies. Our content scoring module uses the existing in-domain data to find relevant information in the policy and incorporates it in a summary. Our pipeline is able to find an answer for 89% of the user queries in the privacyQA dataset.

연구 동기 및 목표

  • 사용자 질문과 개인정보 정책의 법적 언어 간의 의미적 및 스타일적 불일치 문제를 해결하기 위해.
  • 제한된 도메인 내 애너테이션 데이터를 활용하여 자원이 부족한 환경에서의 답변 검색 성능을 향상시키기 위해.
  • 사용자 이해를 향상시키기 위해 개인화된, 질의 기반의 개인정보 정책 요약을 가능하게 하기 위해.
  • 질의 확장 및 콘텐츠 점수 기반의 답변 가능성 향상 효과를 평가하기 위해.

제안 방법

  • 파이프라인은 사용자 질문의 어휘 교체 및 역번역을 통해 복제화된 질문 버전을 생성하여 질문 언어를 개인정보 정책 텍스트와 정렬한다.
  • 미세조정된 트랜스포머 모델이 확장된 질문에 대해 각 정책 세그먼트에 대해 관련성 점수와 정보성 점수를 계산한다.
  • 이 점수들은 답변 가능성 점수로 조합되어 요약을 위한 정책 세그먼트 순위를 매긴다.
  • 시스템은 각 사용자 질문에 대해 상위 순위의 세그먼트를 검색하고 요약으로 제시한다.
  • 검색 메트릭스인 F@k, MRR, 정밀도를 사용하여 PrivacyQA 데이터셋에서 접근법을 평가한다.
  • 제거 분석을 통해 질의 확장 및 답변 탐지기 모듈의 기여를 고립하여 분석한다.

실험 결과

연구 질문

  • RQ1도메인 특화 언어의 차이가 있는 상황에서도 질의 복제화가 개인정보 정책 질의 응답의 검색 성능을 향상시킬 수 있는가?
  • RQ2관련성과 정보성을 조합한 하이브리드 점수 기반 접근법이 답변 관련 정책 세그먼트를 식별하는 데 얼마나 효과적인가?
  • RQ3외부 도메인 방법 대비 도메인 내 미세조정을 사용할 경우 성능 향상 정도는 어느 정도인가?
  • RQ4질의 확장 및 답변 탐지 기능이 검색 재현율과 정밀도에 어떤 영향을 미치는가?

주요 결과

  • PrivacyQA 데이터셋에서 상위 10개 결과를 고려할 때, 시스템은 89%의 질의에 대해 관련 답변을 성공적으로 검색한다.
  • MRR가 0.59를 기록하여, 평균적으로 첫 번째 관련 세그먼트가 상위 두 번째 이내로 순위가 매겨졌음을 나타낸다.
  • F@5는 80.6%로, 80.6%의 질의에서 상위 5개 결과 내에 적어도 하나의 관련 스니펫이 포함되어 있음을 의미한다.
  • 질의 확장 모듈은 성능을 약간 향상시키며, 기준 모델 대비 F@5는 0.4% 향상되고 F@10은 1.1% 향상된다.
  • 답변 탐지기 모듈을 제거하면 F@5와 F@10는 감소하지만 정밀도와 MRR는 향상되어, 재현율과 순위 품질 간의 상충 관계가 있음을 시사한다.
  • 도메인 기반 규칙 기반 복제화가 이 작업에서 질문 정렬을 위해 외부 도메인 NMT 기반 방법보다 성능이 뛰어나다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.