Skip to main content
QUICK REVIEW

[논문 리뷰] Modeling Language Vagueness in Privacy Policies using Deep Neural Networks

Fei Liu, Nicole Lee Fella|arXiv (Cornell University)|2018. 05. 25.
Internet Traffic Analysis and Secure E-voting참고 문헌 27인용 수 8
한 줄 요약

이 논문은 이중 작업 신경망을 사용하여 밀도 있는 단어 표현을 학습함으로써 웹사이트 개인정보 정책의 언어 모호성 모델링을 위한 딥러닝 접근법을 제안한다. 이 방법은 다음 단어 예측과 모호어 표현 분류를 동시에 수행하며, LSTMVis를 통해 학습된 표현을 시각화하여 의미적·문맥적으로 관련된 모호한 표현을 탐색함으로써 개인정보 정책 텍스트 내 미묘한 언어 패턴을 식별할 잠재력을 입증한다.

ABSTRACT

Website privacy policies are too long to read and difficult to understand. The over-sophisticated language makes privacy notices to be less effective than they should be. People become even less willing to share their personal information when they perceive the privacy policy as vague. This paper focuses on decoding vagueness from a natural language processing perspective. While thoroughly identifying the vague terms and their linguistic scope remains an elusive challenge, in this work we seek to learn vector representations of words in privacy policies using deep neural networks. The vector representations are fed to an interactive visualization tool (LSTMVis) to test on their ability to discover syntactically and semantically related vague terms. The approach holds promise for modeling and understanding language vagueness.

연구 동기 및 목표

  • 사용자 이해도와 신뢰를 저해하는 개인정보 정책의 언어 모호성 문제를 해결하기 위해.
  • 딥러닝 신경망을 활용하여 개인정보 정책 언어 내 모호어 표현을 식별하고 모델링하는 계산적 방법을 개발하기 위해.
  • 학습된 단어 벡터 표현이 통제된 도메인 내 모호성과 관련된 의미적·문법적 패턴을 포착할 수 있는지 탐색하기 위해.
  • 연구자들이 모호어 표현의 벡터 표현을 시각화하여 개인정보 정책에 대한 지식 탐색을 수행할 수 있도록 지원하기 위해.

제안 방법

  • 40개의 모호어 표현을 사전 정의한 리스트를 기반으로, 문맥 내 다음 단어 예측과 단어가 모호한지 여부를 분류하는 작업을 동시에 수행하는 딥러닝 신경망을 훈련한다.
  • 다음 단어 예측 및 모호어 표현 분류 작업에서의 성능 최적화를 위해 반복적인 과정을 통해 단어 임베딩을 학습한다.
  • 200차원의 벡터 표현은 LSTMVis를 통해 시각화되며, 이는 순환 신경망의 은닉 상태 동역학을 탐색하는 데 사용되는 상호작용 도구이다.
  • 시각화 인터페이스를 통해 사용자는 구절을 선택하고, 해당 구절과 그 맥락 간에 공통된 벡터 차원을 식별하여 구절 고유의 특징을 분리할 수 있다.
  • 선택된 구절과 그 주변 맥락 간에 활성화된 벡터 차원의 교차점을 중심으로 분석하여, 모호한 의미를 인코딩하는 특징을 식별한다.
  • 공통된 활성화된 차원을 기반으로 유사한 구절들을 정렬하고, 최소한의 추가 활성화를 보이는 방식으로 의미적·문법적으로 유사한 모호한 표현을 강조한다.

실험 결과

연구 질문

  • RQ1딥러닝 신경망은 개인정보 정책의 언어 모호성 특성을 인코딩하는 벡터 표현을 학습할 수 있는가?
  • RQ2다양한 표면 형태를 가진 모호어 표현 간의 문법적·의미적 관계가 학습된 단어 벡터에 포착되는가?
  • RQ3벡터 표현의 상호작용적 시각화가 개인정보 정책 텍스트 내 의미적으로 유사한 모호한 표현 군집을 드러낼 수 있는가?
  • RQ4공통된 벡터 차원을 기반으로, 모호어 표현의 대체어(예: '필요에 따라'와 '합리적으로 실현 가능한 방식으로')를 얼마나 잘 식별할 수 있는가?
  • RQ5대규모 애너테이션 데이터셋이 필요 없이도, 벡터 기반의 시각화를 활용해 개인정보 정책 텍스트에서 지식 탐색을 지원하는 것이 가능한가?

주요 결과

  • 시각화 도구는 '필요에 따라'와 의미적·문법적으로 유사한 여러 표현, 즉 '적절한 방식으로', '아래에 기재된 바와 같이', '합리적으로 실현 가능한 방식으로' 등을 성공적으로 식별하였다.
  • 모델은 공통된 벡터 차원을 통해 유사한 의미를 전달하는 다양한 형태의 모호한 표현을 포착하여, 임베딩이 미묘한 의미적 관계를 인코딩하고 있음을 시사한다.
  • 대상 구절과 그 맥락 간의 활성화된 벡터 차원 교차점은 구절 고유의 특징을 효과적으로 분리함으로써, 모호어 표현에 대한 집중적 분석을 지원한다.
  • 이 방법은 모호어 표현의 대체어를 군집화하는 능력을 보이며, 벡터 표현이 표면 형태를 초월해 개념적 유사성을 인코딩하고 있음을 시사한다.
  • 이 접근법은 개인정보 정책이 동일한 모호한 개념을 표현하기 위해 광범위한 어휘 변형을 사용함으로써 종합적인 용어 목록 작성의 곤란함을 드러냈다.
  • 결과적으로, 딥러닝 기반의 벡터 표현은 법적 및 개인정보 정책 텍스트 내 모호성의 자동 탐지 및 분석 기반으로 기능할 수 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.