[論文レビュー] DOM-LM: Learning Generalizable Representations for HTML Documents
DOM-LM は、テキストと DOM ツリー構造を統合的に符号化することで、意味的および構造的意味を捉える、トランスフォーマーに基づく自己教師あり表現学習モデルを提案する。属性抽出、オープン情報抽出、質問応答のタスクにおいて、特に少サンプル(few-shot)およびゼロショット(zero-shot)設定で既存手法を上回り、実世界のウェブアプリケーションにおける強力な汎化性能を示している。
HTML documents are an important medium for disseminating information on the Web for human consumption. An HTML document presents information in multiple text formats including unstructured text, structured key-value pairs, and tables. Effective representation of these documents is essential for machine understanding to enable a wide range of applications, such as Question Answering, Web Search, and Personalization. Existing work has either represented these documents using visual features extracted by rendering them in a browser, which is typically computationally expensive, or has simply treated them as plain text documents, thereby failing to capture useful information presented in their HTML structure. We argue that the text and HTML structure together convey important semantics of the content and therefore warrant a special treatment for their representation learning. In this paper, we introduce a novel representation learning approach for web pages, dubbed DOM-LM, which addresses the limitations of existing approaches by encoding both text and DOM tree structure with a transformer-based encoder and learning generalizable representations for HTML documents via self-supervised pre-training. We evaluate DOM-LM on a variety of webpage understanding tasks, including Attribute Extraction, Open Information Extraction, and Question Answering. Our extensive experiments show that DOM-LM consistently outperforms all baselines designed for these tasks. In particular, DOM-LM demonstrates better generalization performance both in few-shot and zero-shot settings, making it attractive for making it suitable for real-world application settings with limited labeled data.
研究の動機と目的
- HTML ドキュメントを単なるテキストとして扱う既存手法や、計算コストの高いビジュアルレンダリングに依存する手法の限界を是正すること。
- DOM ツリーからのテキスト的コンテンツと構造的意味を両方捉える一般化可能な表現を学習すること。
- 最小限のラベル付きデータで、属性抽出、オープン情報抽出、質問応答などの下流タスクのパフォーマンスを向上させること。
- 限られたアノテーションしかない実世界のウェブアプリケーションにおいて、効果的な少サンプルおよびゼロショットの汎化を可能にすること。
- 従来のツリー符号化モデルが採用していたヒューリスティックな文脈構築の欠陥を克服し、文脈に適応したツリー表現を学習すること。
提案手法
- DOM-LM はトランスフォーマー・エンコーダーを用いて、トークンと DOM ツリーのノードを同時に符号化し、複数の位置埋め込みを用いて構造的情報を統合する。
- 事前学習中に個々のトークンと完全な DOM ノードの両方をマスクすることで、自己教師ありマスク言語モデリング(MLM)目的を適用する。
- スライディング・ウィンドウ機構を用いて DOM ツリーを処理し、関連する構造的文脈を保持する。各ステップで古いノードを削除し、新しいノードを追加する。
- 位置埋め込みは、DOM ツリー内の階層的および順序的関係をモデル化するように設計されており、構造に配慮した表現学習を可能にする。
- 最終的なノードおよびトークン表現は、属性抽出、OpenIE、質問応答などの下流タスクで微調整される。
- 直接的に生の HTML ソースを使用するため、レンダリングを回避し、ビジュアル特徴抽出と比較して効率的かつスケーラブルである。
実験結果
リサーチクエスチョン
- RQ1自己教師ありで構造に配慮した表現モデルは、テキストのみまたはビジュアルベースのベースラインと比較して、HTML ドキュメント理解タスクのパフォーマンスを向上させることができるか?
- RQ2多様な HTML ドキュメントで事前学習されたモデルは、未観測のウェブサイトに対して、少サンプルまたはゼロショット設定でどの程度汎化可能か?
- RQ3テキストと DOM ツリー構造を統合的にモデリングすることで、準構造的ウェブコンテンツ内の意味的および文法的関係をどの程度効果的に捉えることができるか?
- RQ4トランスフォーマー・エンコーダーに構造的位置埋め込みを用いることで、ヒューリスティックな文脈取得と比較して、DOM ノードの文脈化がどの程度向上するか?
- RQ5レンダリング済みビジュアル特徴に依存せずに、属性抽出や質問応答などのタスクで既存手法を上回ることができるか?
主な発見
- DOM-LM は、属性抽出、オープン情報抽出、質問応答の各タスクにおいて、すべてのベースラインを一貫して上回る。
- 少サンプルおよびゼロショット設定において優れた汎化性能を示し、未観測のウェブサイトやテンプレートへの転送性が強いことが示された。
- テキストと構造の両方を統合的に符号化することで、生のテキストのみを用いる場合に失われる要素間の関係を捉えることができる。
- ノードとトークンのマスク予測を用いた自己教師あり事前学習により、ラベル付きデータが不要な堅牢で一般化可能な表現が得られる。
- レンダリングやビジュアル特徴の保存にかかる計算コストを回避しながら、最先端のパフォーマンスを達成している。
- 特にリソースが限られた状況(低リソース環境)において、モデルの性能向上が顕著に現れ、限られたアノテーションしかない実世界の応用に適していることが検証された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。