Skip to main content
QUICK REVIEW

[논문 리뷰] Improving the quality of individual-level online information tracking: challenges of existing approaches and introduction of a new content- and long-tail sensitive academic solution

Silke Adam, Mykola Makhortykh|arXiv (Cornell University)|2024. 03. 05.
Web visibility and informetrics인용 수 4
한 줄 요약

이 논문은 기존 桌面 기반 추적 도구의 한계를 극복하기 위해 세부적인 콘텐츠 노출을 기록함으로써, 개인 수준의 온라인 정보 추적을 위한 오픈소스이며 콘텐츠 및 장꼬리 콘텐츠에 민감한 학술 도구인 WebTrack를 소개한다. 1,185명의 참가자 데이터를 바탕으로 WebTrack는 자동화된 콘텐츠 분석을 통해 정치 관련 정보 소비를 더 정확하게 탐지할 수 있게 하여 데이터 품질을 크게 향상시키고, 사회과학 연구에서 새로운 분석적 통찰을 가능하게 한다.

ABSTRACT

This article evaluates the quality of data collection in individual-level desktop information tracking used in the social sciences and shows that the existing approaches face sampling issues, validity issues due to the lack of content-level data and their disregard of the variety of devices and long-tail consumption patterns as well as transparency and privacy issues. To overcome some of these problems, the article introduces a new academic tracking solution, WebTrack, an open source tracking tool maintained by a major European research institution. The design logic, the interfaces and the backend requirements for WebTrack, followed by a detailed examination of strengths and weaknesses of the tool, are discussed. Finally, using data from 1185 participants, the article empirically illustrates how an improvement in the data collection through WebTrack leads to new innovative shifts in the processing of tracking data. As WebTrack allows collecting the content people are exposed to on more than classical news platforms, we can strongly improve the detection of politics-related information consumption in tracking data with the application of automated content analysis compared to traditional approaches that rely on the list-based identification of news.

연구 동기 및 목표

  • 기존 데스크톱 기반 개인 수준 온라인 정보 추적 도구의 핵심 결함을 특정화하는 것, 특히 표본 편향, 콘텐츠 수준 데이터 부족, 장꼬리 콘텐츠 및 기기 다양성 무시 문제에 중점을 두어.
  • 현재 사회과학 연구에서 사용되는 추적 방법론의 유효성, 투명성 및 개인정보 보호 문제를 해결하는 것.
  • 다양한 온라인 플랫폼에서 세부적인 콘텐츠 노출을 기록하는 새로운 학술 추적 솔루션—WebTrack—을 개발하고 평가하는 것.
  • WebTrack를 통한 향상된 데이터 수집이 정치 관련 정보 소비 탐지에 더 정확하고 혁신적인 처리 방법을 가능하게 하여, 특히 정치 관련 정보 소비 탐지에 초점을 맞추는 것.

제안 방법

  • 클라이언트 측 브라우저 확장 프로그램과 보안 서버 기반 백엔드를 갖춘 데스크톱 기반 추적 도구로 WebTrack를 설계하는 것.
  • 콘텐츠 수준 로깅을 구현하여 전체 URL, 페이지 제목 및 원시 HTML 콘텐츠를 기록함으로써 자동화된 콘텐츠 분석을 가능하게 하는 것.
  • 기기 및 플랫폼에 관계없이 추적하는 기능을 통합하여 비전통적 뉴스 소스를 포함한 장꼬리 콘텐츠 소비 패턴을 반영하는 것.
  • NLP 기반 분류 모델을 활용해 주제, 특히 정치 주제로 분류된 추적 콘텐츠를 분석하는 자동화된 콘텐츠 분석 기법을 적용하는 것.
  • 익명화, 사용자 동의 메커니즘, 오픈소스 코드 공개를 통해 개인정보 보호 및 투명성을 확보하는 것.
  • 1,185명의 참가자들이 다양한 온라인 행동을 보이는 대규모 실증 연구를 통해 도구의 성능과 데이터 품질을 검증하는 것.

실험 결과

연구 질문

  • RQ1기존 개인 수준 온라인 추적 도구는 콘텐츠 다양성과 장꼬리 소비 패턴을 어떻게 실패로 이끌는가?
  • RQ2WebTrack는 리스트 기반 추적 방법에 비해 정치 관련 정보 노출 탐지 정확도를 어느 정도 향상시키는가?
  • RQ3학술 연구에서 콘텐츠 민감성과 장꼬리 인식 기능을 갖춘 추적 시스템을 구현할 때의 주요 기술적 및 윤리적 과제는 무엇인가?
  • RQ4세부적인 콘텐츠 데이터 포함이 온라인 정보 노출 처리에서 새로운 분석 기능을 어떻게 가능하게 하는가?

주요 결과

  • WebTrack는 전통적인 뉴스 목록을 넘어서, 비전통적 뉴스 소스를 포함한 다양한 플랫폼에서의 콘텐츠 노출을 성공적으로 기록하여, 기존의 정보 소비 범위를 크게 확장한다.
  • WebTrack에 자동화된 콘텐츠 분석을 통합함으로써 정치 관련 콘텐츠의 정밀한 식별이 가능해져, 잠재적으로 부정확한 리스트 기반 분류에 의존하는 것을 줄일 수 있다.
  • 1,185명의 참가자로부터 확보한 실증 데이터는 WebTrack가 담론적 및 장꼬리 콘텐츠에 특히 풍부하고 더 대표적인 온라인 미디어 노출 데이터를 수집할 수 있음을 입증한다.
  • 기기 다양성과 사용자 고유의 브라우징 행동을 고려함으로써 WebTrack는 기존 추적 접근 방식에 내재된 표본 편향을 줄여 데이터 유효성을 향상시킨다.
  • 오픈소스 설계, 사용자 동의 워크플로우, 안전한 데이터 처리를 통해 WebTrack는 투명성과 개인정보 보호를 강화하여 추적 연구의 핵심 윤리적 우려를 해결한다.
  • 향상된 데이터 품질 덕분에 기존 방법으로는 감지할 수 없었던 미세한 정치 콘텐츠 노출 패턴을 식별하는 등 새로운 분석적 전환을 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.