Skip to main content
QUICK REVIEW

[論文レビュー] Anusaaraka: Overcoming the Language Barrier in India

Akshar Bharati, Vineet Chaitanya|ArXiv.org|Aug 7, 2003
Multilingual Education and PolicySocial Sciences被引用数 20
ひとこと要約

Anusaarakaは、元のテキストを音声的・視覚的に類似したターゲット言語形式に変換することで、密接に関連するインド諸言語間のテキストアクセスを可能にする人間支援型機械翻訳システムを提案する。このシステムは言語的類縁性を活用することで翻訳の負担を軽減し、ユーザーが約2週間の学習で出力言語を習得できる。その後、文法的正確性の確認とスタイルの調整のための修正作業が行われる。

ABSTRACT

The anusaaraka system makes text in one Indian language accessible in another Indian language. In the anusaaraka approach, the load is so divided between man and computer that the language load is taken by the machine, and the interpretation of the text is left to the man. The machine presents an image of the source text in a language close to the target language.In the image, some constructions of the source language (which do not have equivalents) spill over to the output. Some special notation is also devised. The user after some training learns to read and understand the output. Because the Indian languages are close, the learning time of the output language is short, and is expected to be around 2 weeks. The output can also be post-edited by a trained user to make it grammatically correct in the target language. Style can also be changed, if necessary. Thus, in this scenario, it can function as a human assisted translation system. Currently, anusaarakas are being built from Telugu, Kannada, Marathi, Bengali and Punjabi to Hindi. They can be built for all Indian languages in the near future. Everybody must pitch in to build such systems connecting all Indian languages, using the free software model.

研究の動機と目的

  • 多言語主義のインドにおける言語的障壁を解消し、インド諸言語間でのテキストアクセスを可能にすること。
  • 機械による言語処理の負担を軽減することで、人間の翻訳者に対する認知的・言語的負荷を軽減すること。
  • インド諸言語間の翻訳システムを構築するためのスケーラブルでフリーのソフトウェアベースのフレームワークを構築すること。
  • インド諸言語の言語的類縁性を活用し、ユーザーが機械生成出力の理解に必要な訓練時間を最小限に抑えること。
  • 文法的正しさとスタイルの洗練のための修正作業を支援することで、人間支援型翻訳システムとしての利用を可能にすること。

提案手法

  • システムは、ターゲット言語の形態的・構文的構造を保持したまま、元のテキストを視覚的・音声的に類似した形に変換する。
  • 元の言語の構造がターゲット言語に直接対応しない場合、表記体系を用いてそれを表現する。
  • 出力は視覚的・音声的にターゲット言語に近く、最小限の訓練でユーザーが迅速に理解できるように設計されている。
  • ユーザーは出力を直訳ではなく、音声的・表記的近似と解釈するように訓練される。
  • 熟練したユーザーによる修正作業により、文法的誤りが是正され、スタイルが向上し、自然なターゲット言語のテキストに変換される。
  • このアプローチはフリー・ソフトウェアモデルを用いて実装されており、コミュニティ主導の開発とインド諸言語全般への拡張が可能である。

実験結果

リサーチクエスチョン

  • RQ1ターゲットインド言語におけるテキストの機械生成近似が、その言語に不慣れなユーザーによる迅速な理解を可能にするか。
  • RQ2インド諸言語間の言語的類縁性が、ユーザーが機械生成出力を解釈するのに必要な訓練時間にどの程度影響を与えるか。
  • RQ3文法的正しさとスタイルの向上のための修正作業を通じて、このシステムが人間支援型翻訳をどの程度効果的に支援するか。
  • RQ4視覚的・音声的類縁性が、多言語間テキストアクセスの認知的負荷をどの程度軽減するか。
  • RQ5フリー・ソフトウェアモデルが、インドの多様な言語的環境に適合する多言語翻訳システムの開発とスケーリングを維持できるか。

主な発見

  • インド諸言語間の音声的・表記的類縁性のおかげで、ユーザーは約2週間の訓練で機械生成出力を読み取り理解できる。
  • システムは言語処理の大部分を機械が担うことで、翻訳者に対する負担を著しく軽減した。
  • 熟練したユーザーによる修正作業により、ターゲット言語として文法的に正しい、スタイルに適したテキストが得られた。
  • このアプローチはスケーラブルかつ拡張可能であり、すでにテルグ語、カンナダ語、マラーティー語、ベンガル語、パンジャーブー語からヒンディー語へのAnusaarakaシステムが開発されている。
  • システムは人間支援型翻訳パイプラインとして効果的に機能し、機械支援と人間の監視を組み合わせることで出力品質が向上した。
  • フリー・ソフトウェアモデルにより共同開発が可能となり、近い将来にインドのすべての言語向けAnusaarakaシステムの構築が可能になる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。