[논문 리뷰] DOM-Q-NET: Grounded RL on Structured Language
DOM-Q-NET은 구조적 언어를 사용한 웹 내비게이션을 위한 그래프 신경망과 목표-어텐션을 통합한 인과적 Q-네트워크 아키텍처를 제안한다. 이는 샘플 효율적이며 전문가가 필요 없는 강화학습을 가능하게 하며, MiniWoB 벤치마크에서 최고 성능을 기록한다. 별도의 MLP 헤드와 계층적 DOM 표현을 통해 클릭, 입력, 모드 동작을 동시에 학습함으로써 다중작업 학습에서 2배의 샘플 효율성 향상을 달성한다.
Building agents to interact with the web would allow for significant improvements in knowledge understanding and representation learning. However, web navigation tasks are difficult for current deep reinforcement learning (RL) models due to the large discrete action space and the varying number of actions between the states. In this work, we introduce DOM-Q-NET, a novel architecture for RL-based web navigation to address both of these problems. It parametrizes Q functions with separate networks for different action categories: clicking a DOM element and typing a string input. Our model utilizes a graph neural network to represent the tree-structured HTML of a standard web page. We demonstrate the capabilities of our model on the MiniWoB environment where we can match or outperform existing work without the use of expert demonstrations. Furthermore, we show 2x improvements in sample efficiency when training in the multi-task setting, allowing our model to transfer learned behaviours across tasks.
연구 동기 및 목표
- 딥 강화학습을 사용한 웹 내비게이션에서 큰 변동성이 있는 행동 공간과 희박한 보상 문제를 해결하기 위해.
- DOM 트리로 구조화된 웹 인터페이스를 모델링함으로써 전문가 지시 없이 엔드 투 엔드 학습을 가능하게 하기 위해.
- 다중작업 학습을 통해 다양한 웹 작업 간의 전이 학습을 향상시키고 샘플 효율성을 개선하기 위해.
- 웹 상호작용을 위한 상태, 행동, 목표 표현을 동시에 최적화하는 완전히 미분 가능한 아키텍처를 개발하기 위해.
- 실세계 웹 환경에서 클릭, 입력, 모드 동작에 대한 인과적 Q-함수 파arametrization의 효과를 입증하기 위해.
제안 방법
- 웹 페이지의 트리 구조적 DOM을 인코딩하기 위해 그래프 신경망(GNN)을 사용하여 국소적, 이웃, 전역 표현을 캡처한다.
- 클릭, 입력, 모드 동작와 같은 별도의 행동 유형을 위한 Q-함수를 파arametrization하기 위해 세 개의 별도 다층 퍼셉트론(MLP)을 활용한다.
- 작업 목표에 기반해 관련 있는 DOM 요소에 동적으로 어텐션을 집중시키기 위해 목표-어텐션을 통합하여 다중작업 설정에서 일반화 능력을 향상시킨다.
- 신경 메시지 전달 및 리더아웃 메커니즘을 적용하여 DOM 트리 전반에서 노드 특징을 집계하여 상태 표현을 생성한다.
- 경험 재생 및 우선순위 기반 경험 재생을 사용한 딥 강화학습을 통해 전체 아키텍처를 엔드 투 엔드로 학습시킨다.
- 학습 속도를 향상시키기 위해 효율적인 우선순위 기반 경험 재생을 위한 세그먼트 트리를 활용한다.
실험 결과
연구 질문
- RQ1딥 강화학습 에이전트가 전문가 지시 없이도 복잡한 웹 내비게이션 작업을 해결할 수 있는가?
- RQ2큰 행동 공간을 가진 웹 내비게이션에서 인과적 Q-함수 파arametrization은 샘플 효율성을 어떻게 향상시키는가?
- RQ3다중작업 학습은 다양한 웹 작업 간 행동 전이를 어느 정도 가능하게 하는가?
- RQ4목표-어텐션은 다양한 작업 목표 하에서 에이전트가 관련 있는 DOM 요소에 집중하도록 유도하는 데 얼마나 효과적인가?
- RQ5GNN 기반 DOM 인코딩에서 국소적, 이웃, 전역 표현의 기여도는 작업 성능에 어떤 영향을 미치는가?
주요 결과
- DOM-Q-NET은 어떤 전문가 지시도 사용하지 않고도 기존 방법과 동일하거나 이를 초월하는 성능을 달성한다.
- 다중작업 학습에서 단일작업 학습 대비 샘플 효율성이 2배 향상되었으며, 11개 작업에 대해 총 프레임 수를 477,000에서 319,000으로 감소시켰다.
- 제거 실험 결과, 이웃 모듈을 생략할 경우 클릭-체크박스와 같은 작업에서 오류가 발생함을 확인하여 이 모듈의 필수성을 입증했다.
- 목표-어텐션은 다중작업 설정에서 샘플 효율성을 크게 향상시키지만, 단일작업 환경에서는 성과가 다소 떨어져, 이는 교차 작업 일반화에 기여하는 역할을 확인한다.
- 에이전트는 작업 간 행동 전이를 성공적으로 학습하였으며, 간단한 작업에서 미리 훈련된 다중작업 에이전트가 어려운 작업(예: 소셜 미디어, 검색 엔진)을 더 효율적으로 해결하였다.
- 국소적 및 전역 GNN 모듈은 상호 보완적인 표현을 제공하며, 전역 모듈은 고수준 이해를 가능하게 하고 국소 모듈은 세부 사항을 캡처한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.