[논문 리뷰] Vartani Spellcheck -- Automatic Context-Sensitive Spelling Correction of OCR-generated Hindi Text Using BERT and Levenshtein Distance
Vartani Spellcheck는 BERT 임베딩과 Levenshtein 거리(편집 거리)를 사용하여 OCR에서 생성된 히ン두어 텍스트를 위한 맥락 민감한 철자 검사 시스템을 제안한다. 조회 사전, 명명된 실체 인식, 그리고 맥락 임베딩을 결합함으로써, Tesseract-OCR로 처리된 라마야나 텍스트에서 81%의 정확도를 달성하였으며, 이는 이전의 맥락 무관 방법보다 뚜렷이 뛰어나다.
Traditional Optical Character Recognition (OCR) systems that generate text of highly inflectional Indic languages like Hindi tend to suffer from poor accuracy due to a wide alphabet set, compound characters and difficulty in segmenting characters in a word. Automatic spelling error detection and context-sensitive error correction can be used to improve accuracy by post-processing the text generated by these OCR systems. A majority of previously developed language models for error correction of Hindi spelling have been context-free. In this paper, we present Vartani Spellcheck - a context-sensitive approach for spelling correction of Hindi text using a state-of-the-art transformer - BERT in conjunction with the Levenshtein distance algorithm, popularly known as Edit Distance. We use a lookup dictionary and context-based named entity recognition (NER) for detection of possible spelling errors in the text. Our proposed technique has been tested on a large corpus of text generated by the widely used Tesseract OCR on the Hindi epic Ramayana. With an accuracy of 81%, the results show a significant improvement over some of the previously established context-sensitive error correction mechanisms for Hindi. We also explain how Vartani Spellcheck may be used for on-the-fly autocorrect suggestion during continuous typing in a text editor environment.
연구 동기 및 목표
- 복잡한 스크립트와 문자 분할 문제로 인해 히ン두어와 같은 고도로 변화형 인도어 언어의 OCR 출력 정확도가 낮은 문제를 해결하기 위해.
- 기존의 맥락 무관 모델을 넘어서 후처리 OCR 텍스트 품질을 향상시키는 맥락 민감한 철자 검사 시스템을 개발하기 위해.
- 특히 BERT와 Levenshtein 거리를 포함한 최신 NLP 기법들을 히ン두어를 위한 실용적인 보정 파이프라인에 통합하기 위해.
- 제안된 보정 프레임워크를 활용하여 텍스트 에디터에서 실시간 자동 보정 제안을 가능하게 하기 위해.
- Tesseract OCR로 처리된 실제 대규모 히ン두어 텍스트 코퍼스(라마야나)를 대상으로 시스템을 검증하기 위해.
제안 방법
- 시스템은 OCR에서 생성된 히ン두어 텍스트의 잠재적 철자 오류를 식별하기 위해 조회 사전을 사용한다.
- 명명된 실체 인식(NER)은 맥락적으로 관련된 용어 중 오류로 인식될 수 있는 항목을 탐지하기 위해 적용된다.
- BERT 임베딩은 단어의 맥락 표현을 캡처하여 맥락 민감한 보정 결정을 가능하게 한다.
- 후보 보정 사항과 원본 단어 사이의 Levenshtein 거리(편집 거리)를 계산하여 타당한 보정 사항을 순위 매긴다.
- 최종 보정은 사전 또는 NER로 식별된 용어와 일치하는 BERT 임bedded 후보 중에서 가장 낮은 편집 거리를 가진 것에 기반하여 선택된다.
- 파이프라인은 실시간 텍스트 편집 환경에서의 즉각적인 자동 보정을 지원하도록 설계되었다.
실험 결과
연구 질문
- RQ1맥락 민감한 철자 검사 시스템은 맥락 무관 방법에 비해 OCR에서 생성된 히ン두어 텍스트의 정확도를 뚜렷이 향상시킬 수 있는가?
- RQ2BERT 임베딩과 Levenshtein 거리의 통합은 OCR 출력에서 히ン두어 철자 오류를 탐지하고 수정하는 데 얼마나 효과적인가?
- RQ3명명된 실체 인식과 사전 조회는 히ン두어와 같은 저자원, 형태학적으로 복잡한 언어에서 오류 탐지에 얼마나 기여하는가?
- RQ4제안된 시스템은 텍스트 에디터에서 실시간 상호작용 자동 보정에 적합하게 변형될 수 있는가?
- RQ5라마야나와 같은 대규모 실제 텍스트 코퍼스에서 시스템의 성능은 어떠한가?
주요 결과
- 제안된 Vartani Spellcheck 시스템은 Tesseract-OCR로 처리된 라마야나 텍스트에서 대규모 코퍼스에서 81%의 정확도를 달성하였다.
- BERT와 Levenshtein 거리를 사용한 맥락 민감한 접근 방식은 히ン두어에 대해 이전에 확립된 맥락 무관 오류 보정 메커니즘을 뛰어넘었다.
- 명명된 실체 인식과 사전 조회의 통합은 형태학적으로 복잡한 텍스트에서 잠재적 철자 오류 탐지에 뚜렷한 향상을 이끌었다.
- 시스템은 실시간 적용 가능성을 입증하여 연속 타이핑 중 즉각적인 자동 보정 제안을 가능하게 하였다.
- 맥락 임베딩과 편집 거리의 조합은 저자원, 고도로 변화형 언어 환경에서 각각의 방법보다 더 높은 보정 품질을 제공하는 것으로 확인되었다.
- 시스템은 대규모 도메인 특화 코퍼스에서 뛰어난 안정성을 보였으며, 인도어 언어 NLP 분야에 광범위한 적용 가능성을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.