Skip to main content
QUICK REVIEW

[논문 리뷰] Implementation of Rule Based Algorithm for Sandhi-Vicheda Of Compound Hindi Words

Priyanka Gupta, Vishal Goyal|ArXiv.org|2009. 09. 12.
Algorithms and Data Compression참고 문헌 11인용 수 6
한 줄 요약

이 논문은 음소 규칙을 활용하여 복합 히브리어 어절의 샌디-비체다(합성어 분리)를 수행하는 규칙 기반 알고리즘을 제시한다. 이 방법은 복합어를 구성 어절로 분해하는 데 성공적으로 활용되며, 규칙 커버리지에 따라 60–80%의 정확도를 달성한다. 이는 히브리어 언어 처리 및 교육 분야에서 체계적이고 계산적으로 효율적인 접근법을 제공한다.

ABSTRACT

Sandhi means to join two or more words to coin new word. Sandhi literally means `putting together' or combining (of sounds), It denotes all combinatory sound-changes effected (spontaneously) for ease of pronunciation. Sandhi-vicheda describes [5] the process by which one letter (whether single or cojoined) is broken to form two words. Part of the broken letter remains as the last letter of the first word and part of the letter forms the first letter of the next letter. Sandhi- Vicheda is an easy and interesting way that can give entirely new dimension that add new way to traditional approach to Hindi Teaching. In this paper using the Rule based algorithm we have reported an accuracy of 60-80% depending upon the number of rules to be implemented.

연구 동기 및 목표

  • 복합 히브리어 어절의 샌디 접합부에서 분리를 수행하는 체계적인 계산 방법을 개발하기 위해.
  • 통계적 또는 코퍼스 기반 방법 대신 규칙 기반 접근법을 사용하여 자동 샌디-비체다의 정확도를 향상시키기 위해.
  • 복합어 형성의 체계적 분석을 가능하게 하여 히브리어 어학 교육 분야의 응용을 지원하기 위해.
  • 규칙 커버리지와 언어학적 복잡성의 변화에 따라 규칙 기반 분해의 성능을 평가하기 위해.
  • 인도아리아어 언어에서 형태소 분석 도구의 향후 개발을 위한 기반을 마련하기 위해.

제안 방법

  • 알고리즘은 수동으로 정의된 음소 및 철자 규칙의 집합을 적용하여 복합 히브리어 어절 내의 샌디 경계 패턴을 식별하고 분리한다.
  • 규칙는 주로 히브리어 복합어에서 나타나는 संस्कृत(산스크리트) 유래 샌디 패턴의 구조에 기반하며, 특히 장음과 자음 조합에 중점을 둔다.
  • 시스템은 입력 어절을 스캔하여 알려진 샌디 패턴을 식별하고, 변환 규칙을 적용하여 어절을 두 개의 구성 어절로 분리한다.
  • 알고리즘은 그래프음과 음소에 대한 패턴 매칭을 사용하여 유효한 샌디 접합부를 탐지하며, 특히 विसर्ग(비사르가) 및 स्वरित(스바리타) 기호에 특별한 주의를 기울인다.
  • 성능 평가는 알고리즘 출력 결과를 수작업으로 주석 처리된 분리 결과와 비교하여 다수의 테스트 케이스에서 정확도를 측정함으로써 평가된다.
  • 구현은 확장 가능하도록 설계되어, 커버리지와 정확도 향상을 위해 새로운 규칙를 점진적으로 추가할 수 있도록 한다.

실험 결과

연구 질문

  • RQ1규칙 기반 접근법이 복합 히브리어 어절의 샌디-비체다를 정확하게 수행하는 데 얼마나 효과적인가?
  • RQ2규칙 커버리지가 알고리즘의 총 정확도에 어떤 영향을 미치는가?
  • RQ3정규화된 규칙 기반 시스템이 수용 가능한 정밀도로 히브리어 복합어의 형태학적 복잡성을 처리할 수 있는가?
  • RQ4이 규칙 기반 시스템의 성능이 동일 분야의 통계적 또는 기계학습 대안과 비교해 어떻게 되는가?
  • RQ5이 방법이 자동 히브리어 어학 학습 및 언어학적 분석 도구의 지원에 얼마나 기여할 수 있는가?

주요 결과

  • 규칙 기반 알고리즘이 적용된 수준과 복잡성에 따라 샌디-비체다의 정확도 범위는 60%에서 80%에 이르며, 성능이 다양하게 나타난다.
  • 더 포괄적이고 맥락 민감도가 높은 규칙이 포함될수록 더 높은 정확도가 관찰된다.
  • 이 방법은 특히 तत्सम(타탐바) 및 तद्भव(타드바바) 복합어에서 흔히 나타나는 일반적인 샌디 패턴을 성공적으로 처리한다.
  • 비사르가 및 스바리타 기호가 포함된 다양한 종류의 복합어에 대해서도 알고리즘이 일관된 성능을 보인다.
  • 결과적으로, 규칙 기반 시스템은 히브리어와 같은 자원이 제한된 언어 환경에서 형태소 분석에 여전히 타당한 솔루션임을 시사한다.
  • 수작업으로 규칙를 설계하는 것이 대규모 주석 처리 코퍼스가 없더라도 신뢰할 수 있는 결과를 도출할 수 있음을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.