[논문 리뷰] The Klarna Product Page Dataset: Web Element Nomination with Graph Neural Networks and Large Language Models
이 논문은 8개의 지리적 지역에서 8,175개의 웹사이트에서 온 51,701개의 실제 전자상거래 제품 페이지를 포함하는 대규모이며 다국어인 Klarna Product Page Dataset을 소개한다. 각 페이지는 다섯 가지 핵심 요소로 수동 레이블링되어 있으며, 초기 요소 노티피케이션을 위한 단순한 GCN과 예측을 정밀하게 보정하기 위한 제로샷 대규모 언어 모델(LLM)을 조합한 하이브리드 방법을 제안한다. 이 방법은 파인튜닝 없이도 정확도를 16.8%p 향상시키며, 복잡한 실제 웹페이지에서 성능을 향상시키는 데 기여하는 새로운 학습 절차도 도입한다.
Description The Klarna Product Page Dataset is a dataset of publicly available pages corresponding to products sold online on various e-commerce websites. The dataset contains offline snapshots of 51,701 product pages collected from 8,175 distinct merchants across 8 different markets (US, GB, SE, NL, FI, NO, DE, AT) between 2018 and 2019. On each page, analysts labelled 5 elements of interest: the price of the product, its image, its name and the add-to-cart and go-to-cart buttons (if found). These labels are present in the HTML code as an attribute called klarna-ai-label taking one of the values: Price, Name, Main picture, Add to cart and Cart. The snapshots are available in 3 formats: as MHTML files (~24GB), as WebTraversalLibrary (WTL) snapshots (~7.4GB), and as screeshots (~8.9GB). The MHTML format is less lossy, a browser can render these pages though any Javascript on the page is lost. The WTL snapshots are produced by loading the MHTML pages into a chromium-based browser. To keep the WTL dataset compact, the screenshots of the rendered MTHML are provided separately; here we provide the HTML of the rendered DOM tree and additional page and element metadata with rendering information (bounding boxes of elements, font sizes etc.). The folder structure of the screenshot dataset is identical to the one the WTL dataset and can be used to complete the WTL snapshots with image information. For convenience, the datasets are provided with a train/test split in which no merchants in the test set are present in the training set. Corresponding Publication For more information about the contents of the datasets (statistics etc.) please refer to the following TMLR paper. GitHub Repository The code needed to re-run the experiments in the publication accompanying the dataset can be accessed here. Citing If you found this dataset useful in your research, please cite the paper as follows: @article{hotti2024the, title={The Klarna Product Page Dataset: Web Element Nomination with Graph Neural Networks and Large Language Models}, author={Alexandra Hotti and Riccardo Sven Risuleo and Stefan Magureanu and Aref Moradi and Jens Lagergren}, journal={Transactions on Machine Learning Research}, issn={2835-8856}, year={2024}, url={https://openreview.net/forum?id=zz6FesdDbB}, note={} }
연구 동기 및 목표
- 웹 요소 노티피케이션을 위한 대규모이자 현실적이고 다양한 웹 페이지 데이터셋의 부족을 해결하기 위해.
- 실제 웹 환경에서의 웹 요소 노티피케이션 작업에 대해 그래프 신경망(GNNs)의 성능을 평가하기 위해.
- GNN과 대규모 언어 모델(LLMs)의 통합을 통해 노티피케이션 정확도를 향상시키기 위해.
- 복잡한 실제 웹페이지에서의 노티피케이션 성능을 향상시키는 데 기여하는 새로운 학습 절차를 개발하기 위해.
- 향후 웹 자동화 및 LLM 기반 웹 상호작용 연구의 기초를 마련하기 위해.
제안 방법
- Klarna Product Page Dataset은 8개 국가에서 온 8,175개의 전자상거래 웹사이트에서 온 51,701개의 실제 제품 페이지로 구성되며, 각 페이지당 다섯 가지 수동 레이블링된 요소가 포함되어 있다.
- DOM 트리 내 국소적 이웃 정보를 기반으로 초기 노티피케이션을 생성하기 위해 단순한 GCN-Mean 모델을 사용한다.
- GCN 예측에서 고신뢰도이자 관련성이 높은 요소의 부분집합을 선별하여 제로샷 대규모 언어 모델(LLM)에 전달하여 최종 노티피케이션을 수행한다.
- 학습 과정에서 어려운 예제를 식별하고 학습 세트에 추가하여 모델의 신뢰도와 순위 정렬 품질을 향상시키는 학습 보완 절차를 적용한다.
- 노티피케이션 목표를 직접 최적화하는 데 초점을 맞춘 새로운 도전적 노티피케이션 학습 절차(Challenge Nomination Training Procedure)를 도입한다.
- 미래의 컴퓨터 비전 기반 웹 분석을 지원하기 위해 렌더링된 페이지 스크린샷을 보조 데이터셋으로 활용한다.
실험 결과
연구 질문
- RQ1실제로 다양하고 다양한 웹 페이지에서 단순한 GCN이 복잡한 최신 기술의 노티피케이션 방법보다 우수한 성능을 낼 수 있는가?
- RQ2파인튜닝 없이도 제로샷 대규모 언어 모델(LLM)이 GCN 예측 후보에 적용되었을 때 노티피케이션 정확도를 얼마나 향상시킬 수 있는가?
- RQ3어려운 예제 보완의 시기와 빈도가 모델 수렴과 노티피케이션 성능에 어떤 영향을 미치는가?
- RQ4노티피케이션 목표에 최적화된 학습 절차(Challenge Nomination Training Procedure)가 기존 학습 방식보다 측정 가능한 성능 향상을 이끌어내는가?
- RQ5다국어 및 지리적으로 다양한 데이터는 웹 요소 노티피케이션 모델의 일반화 능력과 견고성에 어떤 영향을 미치는가?
주요 결과
- 단순한 GCN-Mean 모델이 Klarna Product Page Dataset에서 FreeDOM 및 DOM-Q-NET과 같은 더 복잡한 최신 기술보다도 뛰어난 성능을 보였다.
- 하이브리드 GCN-LLM 접근법은 LLM의 파인튜닝 없이도 노티피케이션 정확도를 16.8%p 향상시켰다.
- 학습 중 어려운 예제 보완은 신뢰도 갭의 점진적 향상을 이끌어내어 더 나은 순위 정렬 품질과 노티피케이션 목표에의 정렬을 의미한다.
- Challenge Nomination Training Procedure는 추가로 노티피케이션 정확도를 향상시켜 목표에 특화된 학습 전략의 가치를 입증한다.
- 보완의 시기에는 최종 정확도에 미미한 영향을 미치며, 이는 초기에 핵심 어려운 예제를 식별하는 것이 모델 성능 향상에 크게 기여함을 시사한다.
- 데이터셋의 다국어 및 지리적으로 다양한 특성 덕분에 실제 웹 레이아웃과 언어 다양성을 반영한 학습이 가능해져 모델의 견고성이 향상되었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.