[논문 리뷰] Commonsense Knowledge in Wikidata
이 논문은 ConceptNet 및 ATOMIC과 같은 기존 자료와 보완되는 공통 지식을 Wikidata가 포함하고 있는지 조사한다. 일반 도메인 관계, 공통 개념, 비개체라는 세 가지 원칙을 적용하여 공통 지식 하위그래프(Wikidata-CS)를 추출하고, 이를 ConceptNet의 관계로 매핑하며, 공통 지식 지식 기반(CSKG)에 통합한다. 주요 발견 결과로는 Wikidata-CS가 새로운, 겹치지 않는 공통 지식 사실을 포함하고 있으나, 커버리지가 여전히 제한되어 있어, 지식 통합, 인스턴스 수준 사실의 일반화, 새로운 수식어와 관계를 통한 모델링 확장 등을 통한 Wikidata의 강화를 권고한다.
Wikidata and Wikipedia have been proven useful for reason-ing in natural language applications, like question answering or entitylinking. Yet, no existing work has studied the potential of Wikidata for commonsense reasoning. This paper investigates whether Wikidata con-tains commonsense knowledge which is complementary to existing commonsense sources. Starting from a definition of common sense, we devise three guiding principles, and apply them to generate a commonsense subgraph of Wikidata (Wikidata-CS). Within our approach, we map the relations of Wikidata to ConceptNet, which we also leverage to integrate Wikidata-CS into an existing consolidated commonsense graph. Our experiments reveal that: 1) albeit Wikidata-CS represents a small portion of Wikidata, it is an indicator that Wikidata contains relevant commonsense knowledge, which can be mapped to 15 ConceptNet relations; 2) the overlap between Wikidata-CS and other commonsense sources is low, motivating the value of knowledge integration; 3) Wikidata-CS has been evolving over time at a slightly slower rate compared to the overall Wikidata, indicating a possible lack of focus on commonsense knowledge. Based on these findings, we propose three recommended actions to improve the coverage and quality of Wikidata-CS further.
연구 동기 및 목표
- ConceptNet 및 ATOMIC과 같은 기존 공통 지식 기반과 보완되는 Wikidata의 공통 지식이 존재하는지 확인하는 것.
- 공통 지식과 일반 지식을 구분하는 데 사용할 수 있는 세 가지 원칙을 정의하고 구현하는 것: (1) 도메인에 관계없이 일반적인 관계, (2) 명시적 개체가 아닌 공통 개념, (3) 특정 개인이 아닌 비개체.
- 이 원칙들을 활용해 Wikidata에서 구조화된 공통 지식 하위그래프(Wikidata-CS)를 추출하고, 이를 ConceptNet의 관계로 매핑하여 통합하는 것.
- 기타 공통 지식 자료(예: ConceptNet, WordNet)와의 겹침, 신규성, 시간에 따른 변화를 평가하는 것.
- Wikidata 내 공통 지식의 커버리지와 표현력을 향상시키기 위한 실천 가능한 권고안을 제시하는 것.
제안 방법
- 공통 지식을 위한 세 가지 지침 원칙 정의: (1) 도메인 특화가 아닌 일반 도메인 관계, (2) 명시적 개체가 아닌 공통 개념, (3) 특정 개인이 아닌 비개체.
- 이 원칙들을 적용하여 Wikidata에서 기준을 충족하는 관계와 개체에 초점을 맞춰 공통 지식 하위그래프(Wikidata-CS)를 필터링 및 추출하는 것.
- 다국어 및 의미적 정렬 접근법을 사용해 Wikidata 관계를 ConceptNet 관계로 매핑하여 기존 공통 지식 기반(CSKG)에 통합할 수 있도록 하는 것.
- 이미 ConceptNet과 ATOMIC을 포함하고 있는 CSKG에 Wikidata-CS를 통합하여 통합된 공통 지식 기반을 형성하는 것.
- 2017년, 2018년, 2020년의 버전을 사용해 Wikidata-CS의 시간적 분석을 수행하여 전체 Wikidata 대비 변화와 성장률을 평가하는 것.
- 정성적 및 정량적 분석을 수행하여 Wikidata-CS의 특성 평가를 위한 겹침 계산(ConceptNet 및 WordNet 기준)을 수행하여 새로운 지식성과 보완성 평가.
실험 결과
연구 질문
- RQ1Wikidata는 ConceptNet 및 ATOMIC과 같은 기존 공통 지식 기반과 다른 공통 지식을 포함하고 있는가?
- RQ2Wikidata-CS와 다른 공통 지식 자료(예: ConceptNet, WordNet) 간 겹침은 어떻게 비교되며, 이는 지식 통합에 어떤 함의를 갖는가?
- RQ3Wikidata-CS의 크기와 구조는 시간이 지남에 따라 어떻게 변화했으며, 전체 Wikidata 지식 기반 대비 성장률은 어떠한가?
- RQ4Wikidata의 현재 모델링에서 공통 지식을 효과적으로 표현하는 데 방해가 되는 주요 제약 사항은 무엇인가?
- RQ5공통 지식의 포함 및 품질 향상을 위해 어떤 구체적 조치를 취할 수 있는가?
주요 결과
- Wikidata-CS는 크기가 작지만(위키데이터의 소수에 해당), 기존 자료와 보완되는 관련 있고 새로운 공통 지식 사실을 포함하고 있다.
- 이 하위그래프는 ConceptNet의 15개의 서로 다른 관계로 매핑되어 있어 의미적 일치 및 통합 가능성을 입증한다.
- Wikidata-CS와 다른 공통 지식 자료 간 겹침은 낮아, 상당한 보완 커버리지가 있음을 시사하며, 통합 노력의 타당성을 뒷받침한다.
- Wikidata-CS는 전체 Wikidata 지식 기반 대비 略로 느린 속도로 진화했으며, 커뮤니티가 공통 지식에 집중하지 않는다는 점을 시사한다.
- 본 연구는 향후 개선을 위한 세 가지 핵심 길을 규명하였다: (1) 기존 공통 지식 자료(예: ConceptNet, ATOMIC)를 Wikidata에 통합하는 것, (2) 인스턴스 수준 사실에서 일반화하여 공통 지식 성질을 유추하는 것, (3) 일반성, 목적, 상징성 등의 새로운 수식어와 관계를 통해 Wikidata 모델을 확장하는 것.
- 연구 결과는 모델링 및 기여 유인 조건을 개선하는 데 집중할 경우, Wikidata가 향후 공통 지식의 원천이 될 잠재력을 지닌다는 것을 뒷받침한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.