APP下载

藏文字频统计软件的设计与实现

2016-04-11李苗苗高定国普次仁扎西仓觉

电脑知识与技术 2016年4期

李苗苗+高定国+普次仁+扎西仓觉

摘要:藏字的频度统计是藏文信息处理技术领域的一项基础研究,对藏文拼写检查、字典建立等应用有着重要的意义。该文根据藏文音节的特性,结合Unicode藏文基本集的编码特征,提出了计算机统计藏文字频的方法,设计实现了藏文字频统计软件,并在藏文样本语料中进行测试,证明了方法的正确性。

关键词:藏文;字频;统计

中图分类号:TP391 文献标识码:A 文章编号:1009-3044(2016)04-0179-03

The Design and Implementation of Tibetan Word Frequency Statistics Software

LI Miao-miao, GAO Ding-guo, PU Tsering, TRASHI CangJue

(Tibetan Information Technology Engineering Research Center, Tibetan University, Lhasa 850000, China)

Abstract: Word frequency statistics,which has important significance to the Tibetan spell checking, Tibetan dictionary building and other suchlike applications , is a basic research in the field of Tibetan information processing technology . According to the characteristics of Tibetan syllables, combined with the features of encoding of Unicode Tibetan basic set, we proposed a method to statistic Tibetan word with computer ,and implemented the software ,which has been tested in a sample corpus, and achieved satisfactory result.

Key words: Tibetan; word frequency; statistics

1 背景

藏文字符是一种拼音性文种,由辅音和元音构成藏文的一个音节。藏文音节以一个辅音字母为核心,此辅音字母为基础在其前后或上下叠加其他辅音或元音构成一个完整的藏文音节(简称为藏字)[1]。

藏文字频的统计对研究藏文信息处理技术有着重要的意义,据统计,符合现代藏文书写文法规则的藏字共有19380个[1] ,这是静态统计的结果,包含了所有符合藏文文法书写规则的藏字,但实际上并不都具有实际的意义,在藏文文本中也不会用到没有意义的藏字。为了更好的统计实际应用的现代藏字的数量,就要借助于大规模语料进行动态统计。

本文在研究藏文文本结构的基础上,整理出藏文音节的分割符号,以这些符号为统计藏文音节的分割点,提出了统计藏文音节的方法,并用软件实现了该方法,在藏文样本语料中进行测试,证明了方法的正确性。

2 藏字字频统计的方法

藏文是一种拼音型文字,一般一个音节表示一个字。在文本中……

登录APP查看全文