Skip to main content
QUICK REVIEW

[논문 리뷰] DOBBS: Towards a Comprehensive Dataset to Study the Browsing Behavior of Online Users

Christian von der Weth, Manfred Hauswirth|arXiv (Cornell University)|2013. 07. 05.
Spam and Phishing Detection인용 수 3
한 줄 요약

DOBBS는 사용자의 브라우저 행동 데이터를 종합적이고 세밀하게 수집하는 프라이버시 보장형 브라우저 애드온을 제안한다. 이는 창/탭 활동, 세션 지속 시간, 페이지 뷰 시간 등을 포함하며, 패assing 소비 및 병렬 브라우징과 같은 현대 브라우징 패턴을 더 깊이 있게 분석할 수 있도록 한다. 주요 기여는 기존 서버 로그를 초월한 통찰을 제공하는 공개된 익명화된 데이터셋을 제공하는 것이다.

ABSTRACT

The investigation of the browsing behavior of users provides useful information to optimize web site design, web browser design, search engines offerings, and online advertisement. This has been a topic of active research since the Web started and a large body of work exists. However, new online services as well as advances in Web and mobile technologies clearly changed the meaning behind "browsing the Web" and require a fresh look at the problem and research, specifically in respect to whether the used models are still appropriate. Platforms such as YouTube, Netflix or last.fm have started to replace the traditional media channels (cinema, television, radio) and media distribution formats (CD, DVD, Blu-ray). Social networks (e.g., Facebook) and platforms for browser games attracted whole new, particularly less tech-savvy audiences. Furthermore, advances in mobile technologies and devices made browsing "on-the-move" the norm and changed the user behavior as in the mobile case browsing is often being influenced by the user's location and context in the physical world. Commonly used datasets, such as web server access logs or search engines transaction logs, are inherently not capable of capturing the browsing behavior of users in all these facets. DOBBS (DERI Online Behavior Study) is an effort to create such a dataset in a non-intrusive, completely anonymous and privacy-preserving way. To this end, DOBBS provides a browser add-on that users can install, which keeps track of their browsing behavior (e.g., how much time they spent on the Web, how long they stay on a website, how often they visit a website, how they use their browser, etc.). In this paper, we outline the motivation behind DOBBS, describe the add-on and captured data in detail, and present some first results to highlight the strengths of DOBBS.

연구 동기 및 목표

  • 기존의 서버 로그나 검색 엔진 거래 로그와 같은 전통적 데이터 소스가 YouTube, Netflix 등의 스트리밍 플랫폼, Ajax, WebSockets, 모바일 브라우징과 같은 신기술에 의해 영향을 받는 현대적 브라우징 행동(예: 패assing 미디어 소비, 탭 기반 멀티태스킹)을 포착하지 못하는 한계를 해결하기 위해.
  • 스트리밍 플랫폼(예: YouTube, Netflix), Ajax, WebSockets, 모바일 브라우징과 같은 신기술이 유도하는 브라우징 행동의 변화를 연구하기 위해.
  • 사용자 익명성에 해를 끼치지 않으면서도 세밀한 수준에서 사용자 활동을 포괄적으로 기록하는 프라이버시 보장형 데이터셋을 구축하기 위해.
  • 단순한 페이지 방문 수를 넘어서 실제 시청 시간, 여러 창과 탭을 통한 세션 패턴과 같은 사용자 행동 메트릭스를 연구할 수 있도록 하기 위해.
  • 오픈소스 배포와 투명한 프라이버시 정책(익명 피드백 메커니즘 포함)을 통해 광범위한 참여를 장려하기 위해.

제안 방법

  • 성능에 영향을 주지 않도록 배경에서 조용히 사용자 브라우저 이벤트를 로깅하는 Firefox 전용 브라우저 애드온을 배포하기 위해.
  • 세 가지 주요 이벤트 유형을 캡처하기 위해: 창 이벤트(창 및 탭의 열기/닫기), 세션 이벤트(브라우징 세션의 시작/종료 및 활동 변화), 브라우징 이벤트(페이지 로드 및 뷰어 시간).
  • 재식별이 불가능한 무작위로 생성된 사용자 ID를 사용하여 완전한 익명화를 보장하기 위해.
  • 전송 또는 저장 전에 모든 민감한 데이터를 로컬에서 암호화하여 프라이버시를 유지하기 위해.
  • 사용자 브라우징 이력의 그래프 재구성 가능성을 보장하기 위해 구조화된 형식으로 데이터를 저장하기 위해.
  • DOBBS 프로젝트 웹사이트를 통해 데이터셋을 공개 배포하며, BSD 라이선스 하에 오픈소스 코드를 제공하여 투명성과 재사용을 장려하기 위해.

실험 결과

연구 질문

  • RQ1YouTube나 last.fm과 같은 플랫폼에서의 패assing 미디어 소비와 같은 현대 브라우징 행동은 기존의 활동적이고 링크 기반의 탐색 방식과 어떻게 다를까?
  • RQ2사용자들이 얼마나 자주 병렬 브라우징을 수행하며(여러 브라우저 창과 탭을 동시에 사용), 이러한 활동을 어떻게 관리하는가?
  • RQ3페이지 로드 시간, 표시 시간, 실제 사용자 시청 시간의 차이를 어떻게 활용하면 웹 페이지 인기 측정의 새로운 정확한 메트릭스를 도출할 수 있는가?
  • RQ4브라우징 세션 중 사용자의 비활동 상태와 집중 상태의 패턴은 무엇이며, 이는 기록된 데이터의 해석에 어떻게 영향을 미치는가?
  • RQ5기록된 이벤트로부터 사용자 브라우징 이력을 정확히 재구성할 수 있는가? 이는 행동 모델링에 어떤 통찰을 제공하는가?

주요 결과

  • 병렬 브라우징은 흔하며, 사용자들은 자주 여러 브라우저 창과 탭을 동시에 관리하지만, 이러한 전략은 개인 간에 상당한 차이를 보인다.
  • 사용자가 상호작용하지 않고도 페이지를 열어두는 패assing 브라우징(예: 다른 작업을 하면서 온라인 라디오를 듣는 것)은 매우 빈번하게 발생하며 주요 브라우징 패턴 중 하나이다.
  • 페이지 로드 시간, 표시 시간, 실제 사용자 시청 시간의 차이를 고려함으로써, 단순한 방문 빈도를 넘어서 더 정확한 웹 페이지 인기 측정 메트릭스를 새롭게 정의할 수 있다.
  • 이 데이터셋을 통해 사용자 브라우징 이력의 매우 정확한 재구성이 가능하며, 이를 브라우징 그래프로 시각화하여 복잡한 탐색 행동을 모델링할 수 있다.
  • 수집된 데이터는 기존의 서버 접근 로그가 뒤처지는 중요한 현대 브라우징 요소, 예를 들어 배경에서 미디어 소비나 여러 탭에 걸친 세션 분할을 포착하지 못한다는 점을 드러낸다.
  • 기술적 제약과 해석의 모호함(예: 포커스가 없는 창이 시청된 것으로 간주되는지 여부)에도 불구하고, 이 데이터셋은 기존 대안들보다 더 풍부하고 세밀한 사용자 행동의 시각을 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.