Skip to main content
QUICK REVIEW

[논문 리뷰] Automated detection of dark patterns in cookie banners: how to do it poorly and why it is hard to do it any other way

Than Htut Soe, Cristiana Santos|arXiv (Cornell University)|2022. 04. 21.
Digital Media Forensic Detection인용 수 17
한 줄 요약

이 논문은 수작업 레이블이 부여된 300개의 뉴스 웹사이트 데이터셋을 사용하여 쿠키 배너에서 다섯 가지 유형의 다크 패턴을 자동으로 탐지하기 위한 지도 학습 기반 접근법을 제시한다. 높은 정확도를 달성했지만 개선 여지가 있으며, 연구는 특성 공학, 데이터셋 품질, 다크 패턴의 인지적 복잡성과 관련된 주요 다학제적 과제를 드러내며, 특히 시각적 요소와 텍스트를 위한 코어티드 데이터셋을 갖춘 도메인 특화의 다중 모odal 탐지 파이프라인 개발을 권장한다.

ABSTRACT

Cookie banners, the pop ups that appear to collect your consent for data collection, are a tempting ground for dark patterns. Dark patterns are design elements that are used to influence the user's choice towards an option that is not in their interest. The use of dark patterns renders consent elicitation meaningless and voids the attempts to improve a fair collection and use of data. Can machine learning be used to automatically detect the presence of dark patterns in cookie banners? In this work, a dataset of cookie banners of 300 news websites was used to train a prediction model that does exactly that. The machine learning pipeline we used includes feature engineering, parameter search, training a Gradient Boosted Tree classifier and evaluation. The accuracy of the trained model is promising, but allows a lot of room for improvement. We provide an in-depth analysis of the interdisciplinary challenges that automated dark pattern detection poses to artificial intelligence. The dataset and all the code created using machine learning is available at the url to repository removed for review.

연구 동기 및 목표

  • 지도 학습 기반 기계 학습 기법을 활용해 쿠키 배너 내 다크 패턴 탐지의 가능성을 탐색하는 것.
  • AI를 활용한 다크 패턴 탐지 자동화 과정에서 발생하는 다학제적 과제를 특정하고 분석하는 것.
  • 수작업 레이블이 부여된 쿠키 배너 데이터셋에 대해 기울기 부스팅 트리 분류기의 성능을 평가하는 것.
  • 신뢰할 수 있는 자동 탐지에 있어 현재 데이터셋과 특성 공학의 한계를 부각하는 것.
  • 미래 연구를 위한 로드맵 제시 — 도메인 특화의 다중 모달 탐지 파이프라인 포함.

제안 방법

  • 뉴스 웹사이트에서 수집한 300개의 쿠키 배너 데이터셋을 사용하였으며, 각 배너는 15개의 가능한 다크 패턴 카테고리(5가지 유형 × 3단계 신뢰도) 중 하나로 레이블링되었다.
  • 구조적이고 텍스트 기반의 특성 공학을 적용하여 위치, 텍스트 볼륨, 버튼 수, UI 디자인 요소 등의 특성을 추출하였다.
  • 모델 성능 최적화를 위해 그리드 서치를 통한 초모수 튜닝을 수행한 기울기 부스팅 트리 분류기를 훈련시켰다.
  • 표준 평가 지표를 사용하여 모델 평가를 수행하였으며, 결과적으로 중간 정도의 정확도를 기록했으나 향상 여지가 크다는 점을 확인하였다.
  • 각 쿠키 배너를 수치형, 범주형, 텍스트형 특성의 조합으로 구성된 벡터로 표현하는 방식을 취하였다.
  • 본 연구는 특히 시각적 및 언어적 신호를 고려한 도메인 특화의 다중 모달 파이프라인의 필요성을 강조하며, 현재의 단일 모달 모델을 뛰어넘는 필요성을 제기한다.

실험 결과

연구 질문

  • RQ1지속적인 기계 학습 기반 기법이 쿠키 배너 내 다크 패턴을 대규모로 효과적으로 탐지할 수 있는가?
  • RQ2다크 패턴 탐지의 신뢰할 수 있는 학습 데이터셋을 구축하는 데 있어 핵심 과제는 무엇인가?
  • RQ3특성 공학과 데이터 품질이 다크 패턴 탐지에 있어 기계 학습 모델의 성능에 미치는 영향는 어떠한가?
  • RQ4심지어 최첨단 AI 기법을 사용하더라도 다크 패턴의 자동 탐지가 왜 본질적으로 어려운가?
  • RQ5미래의 자동 다크 패턴 탐지 시스템 개발을 위한 가장 유망한 방향은 무엇인가?

주요 결과

  • 훈련된 기울기 부스팅 트리 모델은 유망한 성능를 보였지만 최적의 정확도는 아니었으며, 이는 현재의 접근법이 실세계 적용에 아직 충분히 견고하지 않음을 시사한다.
  • 사용된 데이터셋은 크기가 작고 불균형했으며, 다양한 다크 패턴 유형의 빈도가 상이하여 모델의 일반화 능력에 심각한 영향을 미쳤다.
  • 특성 공학 과정에서 큰 도전이 있었으며, 원본 데이터셋이 특정 다크 패턴 유형을 구분하도록 설계되어 있지 않아 모델의 분류 능력이 제한되었다.
  • 데이터셋 내 특성 공학의 부재로 인해 다크 패턴을 신뢰성 있게 분리할 수 있는 명확한 특성이 발견되지 않았다.
  • 저자들은 다크 패턴 탐지가 인간-컴퓨터 상호작용 및 인지 과학 전문 지식이 필요한 복잡한 인지 과제이지, 단순히 기술적 AI 기법만으로는 충분하지 않음을 결론 내렸다.
  • 미래 연구는 특히 시각적 요소와 텍스트를 위한 코어티드 도메인 특화 데이터셋을 구축하고, 특정 다크 패턴 유형을 탐지할 수 있도록 특성을 공학화하는 데 초점을 맞춰야 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.