[논문 리뷰] Answering Visual-Relational Queries in Web-Extracted Knowledge Graphs
이 논문은 14,870개의 실체, 1,330개의 관계, 829,931장의 이미지를 포함한 웹에서 추출한 시각적 관계 지식 그래프인 ImageGraph를 소개하고, 복합적인 시각적 관계 질의에 답하기 위해 컨volutional 네트워크와 지식 그래프 임베딩을 결합한 새로운 신경망 아키텍처를 제안한다. 주요 기여는 이미지를 지식 그래프의 일등 시민으로 간주함으로써 정확하고 효율적인 다중 관계 기반 이미지 검색 및 제로샷 시각적 관계 예측을 가능하게 하는 통합 모델로, 새로운 이미지 지문화에서 강력한 성능을 달성한다.
A visual-relational knowledge graph (KG) is a multi-relational graph whose entities are associated with images. We explore novel machine learning approaches for answering visual-relational queries in web-extracted knowledge graphs. To this end, we have created ImageGraph, a KG with 1,330 relation types, 14,870 entities, and 829,931 images crawled from the web. With visual-relational KGs such as ImageGraph one can introduce novel probabilistic query types in which images are treated as first-class citizens. Both the prediction of relations between unseen images as well as multi-relational image retrieval can be expressed with specific families of visual-relational queries. We introduce novel combinations of convolutional networks and knowledge graph embedding methods to answer such queries. We also explore a zero-shot learning scenario where an image of an entirely new entity is linked with multiple relations to entities of an existing KG. The resulting multi-relational grounding of unseen entity images into a knowledge graph serves as a semantic entity representation. We conduct experiments to demonstrate that the proposed methods can answer these visual-relational queries efficiently and accurately.
연구 동기 및 목표
- 실체가 이미지와 연관된 시각적 관계 지식 그래프에 대한 연구 부족을 해결하기 위해.
- 이미지를 지식 그래프의 일등 시민으로 간주하는 새로운 유형의 질의를 가능하게 하기 위해, 예를 들어 다중 관계 기반 이미지 검색 및 시각적 링크 예측과 같은 질의 유형을 지원하기 위해.
- 확률적 시각적 관계 추론을 위해 컨volutional 신경망과 지식 그래프 임베딩 방법을 통합한 공동 딥 러닝 프레임워크를 개발하기 위해.
- 기존 지식 그래프에 시각적 유사성과 관계 구조를 활용하여 미리 보지 않은 실체의 이미지를 지문화함으로써 제로샷 학습을 탐색하기 위해.
- 제안된 모델의 효과성을 도메인 내 및 제로샷 시각적 관계 질의 답변 작업 모두에서 평가하기 위해.
제안 방법
- 웹에서 수집한 대규모 웹 기반 시각적 관계 지식 그래프인 ImageGraph를 구축하여, 1,330종의 관계 유형, 14,870개의 실체, 829,931장의 이미지를 포함하였다.
- 이미지 임베딩을 사전 학습된 CNN에서 추출한 결과와 지식 그래프 임베딩 벡터를 결합하는 통합 신경망 아키텍처를 제안하였으며, 연결(concatenation, CAT) 및 원소별 곱셈과 같은 연산을 사용하였다.
- 학습된 연산을 사용하여 이미지 임베딩과 관계 전용 벡터를 조합하는 스코어링 함수를 설계하여, 사전에 계산된 이미지 임베딩을 통해 효율적인 질의 답변을 가능하게 하였다.
- 왜곡된 지식 그래프 분포에서의 훈련 안정성과 성능 향상을 위해 음성 샘플링과 시그모이드 활성화 함수를 최종 레이어에 적용하였다.
- 제로샷 학습을 시각적 지문화 문제로 공식화함: 추론 시점에 시각적 특징만을 사용하여, 새로운 이미지와 기존 지식 그래프 실체 간의 관계를 예측하기 위해.
- 특히 타겟 실체가 알려진 질의 유형(4)에서 다수의 이미지 샘플에 대한 평균 확률을 사용하여 제로샷 환경에서 강력한 관계 순위 매기기를 구현하였다.
실험 결과
연구 질문
- RQ1시각적 관계 지식 그래프는 이미지를 지식 그래프의 일등 시민으로 간주하는 확률적 질의 유형을 가능하게 할 수 있는가?
- RQ2통합된 CNN-KGE 모델은 기준 모델 대비 다중 관계 기반 이미지 검색 및 시각적 링크 예측 질의에 대해 얼마나 잘 성능을 내는가?
- RQ3딥 러닝 네트워크는 관계와 실체의 분포가 왜곡된 상황에서 새로운 이미지와 기존 지식 그래프 실체 간의 관계를 제로샷 환경에서 일반화하여 예측할 수 있는가?
- RQ4제안된 아키텍처는 실체와 관계 분포가 왜곡된 시각적 관계 질의에서 표준 링크 예측 기준 모델보다 얼마나 뛰어나게 성능을 내는가?
- RQ5다중 관계 링크를 통한 지식 그래프 내에서의 새로운 이미지의 시각적 지문화는 효과적인 제로샷 학습 전략이 될 수 있는가?
주요 결과
- 이미지 임베딩과 관계 임베딩을 연결한 후 시그모이드 활성화 함수를 적용한 CAT-SIG 모델이 모든 메트릭에서 최고의 성능을 보였으며, 중앙 순위와 hits@100에서 기준 모델을 능가하였다.
- 이미지 임베딩을 사전에 계산하고 질의 시점에만 스코어링을 수행함으로써, 단일 다중 관계 기반 이미지 검색 질의를 90ms 내로 처리하여, 613,138개의 개별 질의를 피하기에 성공하였다.
- 제로샷 관계 예측에서 CAT 모델은 기준 모델을 크게 능가하여, 관계와 실체의 분포가 왜곡되어 있음에도 불구하고 새로운 실체로의 일반화 능력을 입증하였다.
- 4개의 예제 질의 중 2개에서 정확한 관계를 상위 3위 이내로 순위 매기는데 성공하였고, 어려운 케이스 중 2개 중 1개에서는 최상위 관계를 정확히 식별하여, 시각적 지문화에서의 강건성을 보였다.
- 결과는 다중 관계 링크를 통한 시각적 지문화가 제로샷 학습을 위한 타당하고 효과적인 접근법임을 확인하였으며, 훈련 데이터 없이도 완전히 새로운 시각적 개념에 대한 추론을 가능하게 한다.
- 통합된 CNN-KGE 모델은 잘 일반화되어 있으며, 표준 관계 예측 성능과 유사한 성능을 달성함으로써 강력한 전이 학습 능력을 보여주었다 (표 2 참조).
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.