Skip to main content
QUICK REVIEW

[논문 리뷰] Recursive Feature Generation for Knowledge-based Learning

Lior Friedman, Shaul Markovitch|arXiv (Cornell University)|2018. 01. 31.
Text and Document Classification Technologies참고 문헌 30인용 수 4
한 줄 요약

이 논문은 지식 기반에서 외부 관계 지식을 주입함으로써 학습 알고리즘의 성능을 향상시키는 재귀적 특성 생성 방법인 FEAGURE를 제안한다. 특성 값들을 객체로 간주하고 배경 지식을 사용하여 이를 재귀적으로 분류기 학습함으로써 고수준의 일반화 가능한 특성을 생성함으로써 텍스트 분류 성능을 크게 향상시킨다.

ABSTRACT

When humans perform inductive learning, they often enhance the process with background knowledge. With the increasing availability of well-formed collaborative knowledge bases, the performance of learning algorithms could be significantly enhanced if a way were found to exploit these knowledge bases. In this work, we present a novel algorithm for injecting external knowledge into induction algorithms using feature generation. Given a feature, the algorithm defines a new learning task over its set of values, and uses the knowledge base to solve the constructed learning task. The resulting classifier is then used as a new feature for the original problem. We have applied our algorithm to the domain of text classification using large semantic knowledge bases. We have shown that the generated features significantly improve the performance of existing learning algorithms.

연구 동기 및 목표

  • 기존의 특성 생성 방법이 기존 특성의 조합에만 의존하여 복잡한 실제 상황에서는 일반화에 실패하는 데에 대비하기 위해.
  • 특히 Freebase와 YAGO와 같은 대규모이고 잘 구조화된 지식 기반에서 유래한 외부 배경 지식을 기계 학습 알고리즘에 활용할 수 있도록 하여 의미 있는 고수준 특성으로 변환하기 위해.
  • 기존의 인도적 알고리즘과 어떤 식으로든 통합될 수 있는 일반적이고 알고리즘에 종속되지 않는 방법을 개발하기 위해.
  • 희귀하거나 미리 보지 못한 특성 값(예: 특정 국가의 환자의 성씨)에 직면했을 때 학습 알고리즘이 일반화가 잘 되지 않는 문제를 해결하기 위해 이를 고수준의 의미론적 카테고리로 추상화하기 위해.

제안 방법

  • 각 입력 특성의 고유한 값(예: 성씨)을 객체로 간주하고, 관계 지식 기반의 사실을 특성으로 사용하여 이러한 값들에 대해 새로운 학습 문제를 구성한다.
  • 이러한 유도된 학습 문제 각각에 대해 인도적 알고리즘(예: 결정 트리)을 적용하여 새로운 작업에서 양성 및 음성 예제를 구분하는 분류기를 학습한다.
  • 결과로 도출된 분류기는 원래의 학습 문제에서 새로운 이진 특성으로 사용되며, 이를 위해 원래의 특성 값(예: 사람의 성씨에 대해 국적 분류기 적용)에 적용된다.
  • 이 과정은 재귀적으로 적용된다: 새로 생성된 특성들 자체가 후속 재귀적 특성 생성의 입력으로 사용될 수 있어 다중 수준의 추상화가 가능하다.
  • 지식 기반에서 더 표현력 있고 구체적인 특성 공식을 탐색하고 생성하기 위해 논리적 정밀화(예: 'CapitalOf(Y,Z)' 추가)를 사용한다.
  • 이 방법은 일반적이며 모든 인도적 알고리즘과 호환되며, 각 재귀 단계의 출력이 기계 학습 파이프라인에 블랙박스 입력으로 사용될 수 있는 훈련된 분류기이기 때문이다.

실험 결과

연구 질문

  • RQ1관계 지식 기반에서의 재귀적 특성 생성이 텍스트 분류 작업에서 기존 학습 알고리즘의 일반화 성능을 향상시키는가?
  • RQ2원래의 특성 세트에 직접적으로 포함되지 않은 고수준 의미론적 패턴(예: 지리적 지역)을 얼마나 효과적으로 포착하는가?
  • RQ3단일 수준의 특성 생성에 비해 특성 생성을 재귀적으로 적용했을 때 성능 향상 정도는 어느 정도인가?
  • RQ4추상화된 지식 기반 특성에 기반하여 기존에 보지 못한 특성 값(예: 알려진 국가의 새로운 성씨)에 일반화할 수 있는가?
  • RQ5단순한 특성 조합이나 언어 처리 전처리에 의존하는 기존 특성 생성 기법과 비교해 볼 때 이 방법의 성능는 어떠한가?

주요 결과

  • 제안된 재귀적 특성 생성 방법은 관계 지식 기반에서 외부 지식을 주입함으로써 기존 학습 알고리즘의 텍스트 분류 성능을 크게 향상시킨다.
  • Freebase와 YAGO와 같은 지식 기반의 사용은 원시 특성 값 이상의 의미 관계를 포착하는 추상적이고 일반화 가능한 특성(예: '동유럽에 위치함')을 생성할 수 있도록 했다.
  • 이 방법의 재귀적 적용은 더 나은 일반화를 이끌어내어, 훈련 데이터에 명시적으로 포함되지 않은 국가의 이전에 보지 못한 성씨를 처리할 수 있도록 했다.
  • 특히 희소하거나 비구별적인 특성(예: 성씨)을 다룰 경우, 원래 특성이나 단순한 특성 조합에 의존하는 기준 모델보다 이 방법이 성능에서 뛰어났다.
  • 생성된 특성이 분류기이므로 기계 학습 파이프라인에 블랙박스 입력으로 사용될 수 있기 때문에, 이 방법은 일반적이며 모든 인도적 알고리즘과 호환된다.
  • 원래 특성이 제한된 구별 능력을 지녔을 경우(예: 성씨), 지식 기반 추론을 통해 의미론적으로 유의미한 추상화로 변환함으로써 이 방법은 효과를 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.