藏语机读音标SAMPA_ST的设计
2012-06-29于洪志李永宏郑文思
于洪志,高 璐,李永宏,郑文思
(西北民族大学 中国民族语言文字信息技术教育部—国家民委重点实验室,甘肃 兰州 730030)
1 引言
语料库建设在语音分析、合成以及识别等语音工程中,起着举足轻重的作用。高质量的语料库,除需要根据不同研究目标优化语料选取算法外,还要进行语音的标注,其中计算机可读音标符号系统的标注与设计占据较为重要的地位,是文音转换的基础[1-2]。SAMPA(Speech Assessment Methods Phonetic Alphabet)是J.Wells在欧共体支持的研究项目(Speech Assessment Methods)于20世纪90年代设计完成的。在多种语言研究基础上,设计出机器可以直接输入输出的音标系统,目的在于克服国际音标符号复杂、计算机键盘输入困难。
国内,汉语普通话机读音标的自动标注系统比较完善,多家单位语料库建设中音段标注采用了SAMPA_C的标注方案[2-3]。《汉语普通话机读音标SAMPA-SC》[4]阐述了汉语普通话机读音标方案,列出了声韵母以及声调的SAMPA_SC。中国少数民族语言的机读音标系统尚不完善,《三个少数民族语音声学参数数据库(光盘版)介绍》[5]介绍了蒙语、哈萨克语、藏语的国际音标与SAMPA码系统转换的原则。本文的SAMPA_ST(Standard Tibetan)标注系统是建立在SAMPA基础上的一套可机读的藏语音段标注系统,参考了中国社会科学院民族学与人类学研究所的相关研究成果,归纳藏语三大方言(拉萨、夏河、德格)的音系,针对声母、韵母以及声调的特点,设计了藏语三大方言的SAMPA_ST规则,阐述了SAMPA_ST的自动标注系统。
2 藏语音节结构
藏语属于汉藏语系藏缅语族藏语支,国内主要分卫藏方言、安多方言和康方言三大方言。……
