[論文レビュー] Construction and Applications of Billion-Scale Pre-Trained Multimodal Business Knowledge Graph
本稿では、アリババグループの企業データから構築された10億規模のオープンビジネス知識グラフ「OpenBG」を紹介する。OpenBGは、テキスト、画像、表などのマルチモーダルな事実を統合し、100万のコアクラスと2,681種類の関係タイプを持つ細粒度のオントロジーを備えている。本稿では、OpenBGの事前学習がeコマースタスクに与える有効性を示し、コミュニティによるベンチマーク評価やコンペティションを可能にするために、すべてのデータとコードを公開している。KG中心的および知識強化型アプリケーションにおいて、強力な実証的結果を示している。
Business Knowledge Graphs (KGs) are important to many enterprises today, providing factual knowledge and structured data that steer many products and make them more intelligent. Despite their promising benefits, building business KG necessitates solving prohibitive issues of deficient structure and multiple modalities. In this paper, we advance the understanding of the practical challenges related to building KG in non-trivial real-world systems. We introduce the process of building an open business knowledge graph (OpenBG) derived from a well-known enterprise, Alibaba Group. Specifically, we define a core ontology to cover various abstract products and consumption demands, with fine-grained taxonomy and multimodal facts in deployed applications. OpenBG is an open business KG of unprecedented scale: 2.6 billion triples with more than 88 million entities covering over 1 million core classes/concepts and 2,681 types of relations. We release all the open resources (OpenBG benchmarks) derived from it for the community and report experimental results of KG-centric tasks. We also run up an online competition based on OpenBG benchmarks, and has attracted thousands of teams. We further pre-train OpenBG and apply it to many KG- enhanced downstream tasks in business scenarios, demonstrating the effectiveness of billion-scale multimodal knowledge for e-commerce. All the resources with codes have been released at \url{https://github.com/OpenBGBenchmark/OpenBG}.
研究の動機と目的
- ノイズが多く、複数のソースにまたがる企業データから大規模かつマルチモーダルなビジネス知識グラフを構築する課題に対処すること。
- 標準化され、ビジネス論理に整合したオントロジーを設計し、eコマースアプリケーション向けに細粒度の分類体系とハイパーリレーションラル事実をサポートすること。
- 26億の三元組、8,800万のエンティティ、100万のコアクラス/コンセプトを有する包括的かつオープンアクセスのビジネスKG「OpenBG」を構築し、公開すること。
- 推薦や検索などの下流ビジネスアプリケーションにおいて、大規模なマルチモーダルKGの事前学習がもたらす価値を実証すること。
- コミュニティ参加を促進するため、OpenBGのベンチマークを公開し、数千のチームが参加するオンラインコンペティションを主催すること。
提案手法
- W3C標準およびSKOSに基づくコアオントロジーを設計し、8つのコアクラス(例:カテゴリ、ブランド、場所)と2,681種類の関係タイプを定義することで、ビジネスの意味を構造化する。
- アリババのeコマースプラットフォームから得たマルチモーダルデータ(テキスト、画像、表)を、エンティティリンクと属性アライメントを用いて統一的な知識表現に統合する。
- 約4,000人日分のアノテーションと100倍のV100 GPUアクセラレーションを活用した、人間と自動化のハイブリッドパイプラインを採用し、データ処理のスケーリングを実現する。
- 下流のKG強化タスク用に、コンテキストに適した埋め込みを生成するためにOpenBG上で事前学習技術を適用する。
- 三元組の蓄積段階で反復的なオントロジーの最適化、事実の検証、一貫性チェックを含む品質管理メカニズムを実装する。
- OpenBGベンチマークを公開し、Tianchiプラットフォーム上でオンラインコンペティションを主催することで、モデル性能の検証とイノベーションの促進を図る。
実験結果
リサーチクエスチョン
- RQ1ノイズが多く、マルチモーダルかつ異種の企業データソースから、10億規模のビジネス知識グラフをどのように効果的に構築できるか?
- RQ2スケーラビリティ、保守性、現実世界のビジネス論理への整合性を高めるために、どのような設計原則とオントロジー構造が最適か?
- RQ3大規模なマルチモーダルビジネスKG上で事前学習を実施することで、推薦やリンク予測などの下流eコマースタスクのパフォーマンスはどの程度向上するか?
- RQ4高いデータボラティリティを示す継続的に進化する大規模KGにおいて、品質管理と一貫性をどのように維持できるか?
- RQ5大規模かつオープンなビジネスKGを公開することで、コミュニティ研究および産業応用開発にどのような実用的影響が生じるか?
主な発見
- OpenBGは2,603,046,837個の三元組、88,881,723個のエンティティ、1,131,579個のコアクラス/コンセプトを有しており、現時点で公開済みの最大のビジネス知識グラフである。
- 事前学習済みのOpenBGモデルは、リンク予測やエンティティ分類といった下流のKG中心タスクにおいて、OpenBGベンチマーク上で検証された結果、顕著なパフォーマンス向上を達成した。
- OpenBGを基盤とするオンラインコンペティションには数千のチームが参加し、ベンチマークの実用的価値とコミュニティの強い関心を示した。
- マルチモーダル事実(例:製品の画像と説明)の統合により、eコマースにおける知識強化型アプリケーションの正確性と耐障害性が向上した。
- 反復的な最適化プロセスと品質管理メカニズムにより、最終的なKGにおける重複や欠落した関係といった構造的欠陥が効果的に低減された。
- 本プロジェクトは、ビジネス論理、最小限の原則、継続的な品質管理に従うことで、実世界の企業システムにおいて大規模KGの構築が可能であることを実証した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。