[논문 리뷰] Construction and Applications of Billion-Scale Pre-Trained Multimodal Business Knowledge Graph
이 논문은 알리바바 그룹의 기업 데이터에서 유도된 빌리언 스케일 오픈 비즈니스 지식 그래프인 OpenBG를 제안한다. OpenBG는 텍스트, 이미지, 표 등 다중모달 사실을 통합하고, 100만 개의 핵심 클래스와 2,681종의 관계 유형을 가진 세밀한 온톨로지로 구성되어 있다. 이 논문은 OpenBG를 사전 훈련하여 최종 e커머스 작업에 효과적으로 활용할 수 있음을 입증하며, 커뮤니티 기반의 벤치마크와 경쟁을 가능하게 하기 위해 모든 데이터와 코드를 공개한다. 지식 그래프 중심 및 지식 강화 응용 분야에서 강력한 실험적 성과를 보였다.
Business Knowledge Graphs (KGs) are important to many enterprises today, providing factual knowledge and structured data that steer many products and make them more intelligent. Despite their promising benefits, building business KG necessitates solving prohibitive issues of deficient structure and multiple modalities. In this paper, we advance the understanding of the practical challenges related to building KG in non-trivial real-world systems. We introduce the process of building an open business knowledge graph (OpenBG) derived from a well-known enterprise, Alibaba Group. Specifically, we define a core ontology to cover various abstract products and consumption demands, with fine-grained taxonomy and multimodal facts in deployed applications. OpenBG is an open business KG of unprecedented scale: 2.6 billion triples with more than 88 million entities covering over 1 million core classes/concepts and 2,681 types of relations. We release all the open resources (OpenBG benchmarks) derived from it for the community and report experimental results of KG-centric tasks. We also run up an online competition based on OpenBG benchmarks, and has attracted thousands of teams. We further pre-train OpenBG and apply it to many KG- enhanced downstream tasks in business scenarios, demonstrating the effectiveness of billion-scale multimodal knowledge for e-commerce. All the resources with codes have been released at \url{https://github.com/OpenBGBenchmark/OpenBG}.
연구 동기 및 목표
- 노이즈가 많고 다중 소스의 기업 데이터로부터 대규모 다중모달 비즈니스 지식 그래프를 구축하는 데 도전하는 것.
- 표준화되고 비즈니스 로직에 부합하는 온톨로지 설계를 통해 e커머스 응용 분야에서 세밀한 분류 체계와 초관계적 사실을 지원하는 것.
- 26억 개의 삼중항, 8,800만 개의 실체, 100만 개의 핵심 클래스/개념을 포함한 포괄적이고 공개 접근이 가능한 비즈니스 지식 그래프인 OpenBG를 구축하고 공개하는 것.
- 대규모 다중모달 지식 그래프의 사전 훈련이 추천 및 검색과 같은 최종 비즈니스 응용 분야에서 성능 향상에 기여하는지를 입증하는 것.
- OpenBG 벤치마크를 공개하고 천 개가 넘는 팀이 참가하는 온라인 경쟁 대회를 개최하여 커뮤니티 참여를 촉진하는 것.
제안 방법
- W3C 표준과 SKOS를 기반으로 한 핵심 온톨로지 설계를 통해 8개의 핵심 클래스(예: 카테고리, 브랜드, 장소)와 2,681종의 관계 유형을 정의하여 비즈니스 의미를 체계화하는 것.
- 엔티티 연결 및 속성 정렬을 활용하여 알리바바 e커머스 플랫폼의 다중모달 데이터(텍스트, 이미지, 표)를 통합된 지식 표현으로 통합하는 것.
- 약 4,000인-일의 수작업 레이블링과 100배의 V100 GPU 가속을 활용한 하이브리드 수동 및 자동화된 파이프라인을 통해 데이터 처리 스케일링을 수행하는 것.
- OpenBG에서 사전 훈련 기법을 적용하여 최종 지식 그래프 강화 작업을 위한 맥락 기반 임베딩을 생성하는 것.
- 삼중항 누적 과정 중 반복적인 온톨로지 개선, 사실 검증, 일관성 검사를 포함한 품질 제어 메커니즘을 구현하는 것.
- OpenBG 벤치마크를 공개하고 천진 플랫폼에서 온라인 경쟁 대회를 개최하여 모델 성능을 검증하고 혁신을 장려하는 것.
실험 결과
연구 질문
- RQ1노이즈가 많고 다중모달, 이질적인 기업 데이터 소스에서 어떻게 빌리언 스케일 비즈니스 지식 그래프를 효과적으로 구축할 수 있는가?
- RQ2대규모 비즈니스 지식 그래프에서 확장성, 유지보수성, 실제 비즈니스 로직과의 일치를 지원하는 데 가장 적합한 설계 원칙과 온톨로지 구조는 무엇인가?
- RQ3대규모 다중모달 비즈니스 지식 그래프에서의 사전 훈련이 추천 및 링크 예측과 같은 최종 e커머스 작업의 성능 향상에 어느 정도 영향을 미치는가?
- RQ4높은 데이터 변동성과 지속적인 변화를 겪는 대규모 지식 그래프에서 품질 제어와 일관성을 어떻게 유지할 수 있는가?
- RQ5대규모 오픈 비즈니스 지식 그래프를 공개하는 것이 커뮤니티 연구 및 산업 응용 개발에 미치는 실질적 영향은 무엇인가?
주요 결과
- OpenBG는 2,603,046,837개의 삼중항, 88,881,723개의 실체, 1,131,579개의 핵심 클래스/개념을 포함하고 있으며, 현재까지 공개된 지식 그래프 중 가장 큰 규모이다.
- 사전 훈련된 OpenBG 모델은 OpenBG 벤치마크에서 검증된 바와 같이, 링크 예측 및 실체 분류와 같은 최종 지식 그래프 중심 작업에서 성능 향상을 크게 개선한다.
- OpenBG 기반 온라인 경쟁 대회에는 수천 명의 팀이 참가하여 커뮤니티의 높은 관심과 벤치마크의 실용적 유용성을 입증한다.
- 다중모달 사실(예: 제품 이미지 및 설명)의 통합은 e커머스 분야의 지식 강화 응용 분야에서 정확성과 내구성을 향상시킨다.
- 반복적인 개선 과정과 품질 제어 메커니즘은 최종 지식 그래프에서의 중복 또는 누락된 관계와 같은 구조적 결함을 성공적으로 감소시켰다.
- 비즈니스 로직, 최소성, 지속적인 품질 관리 원칙에 따라 지도된 경우, 실제 기업 시스템에서 대규모 지식 그래프 구축이 가능함을 입증하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.