哈萨克语IT领域术语识别研究与实现
2016-05-04木合亚提尼亚孜别克古力沙吾利塔里甫
中文信息学报 2016年3期
木合亚提·尼亚孜别克,古力沙吾利·塔里甫
(1. 新疆大学 信息科学与工程学院,新疆多语种信息技术实验室,新疆 乌鲁木齐 830046;2. 新疆医科大学 中医学院,新疆 乌鲁木齐 830011)
哈萨克语IT领域术语识别研究与实现
木合亚提·尼亚孜别克1,古力沙吾利·塔里甫2
(1. 新疆大学 信息科学与工程学院,新疆多语种信息技术实验室,新疆 乌鲁木齐 830046;2. 新疆医科大学 中医学院,新疆 乌鲁木齐 830011)
该文阐述了基于统计方法进行哈萨克语IT领域术语识别的研究,并在已有的训练语料基础之上,采用最大熵模型进行标注识别和结合人工方式对错误识别结果进行后处理的分析实验,阐述了该平台的研究和设计思路,系统的总体框架、基本结构、功能模块以及实现方法等相关的问题。实验结果显示该方法识别哈萨克语IT领域术语是有效的,封闭测试结果达到了82.6%。
哈萨克语;IT术语;术语管理平台;最大熵模型
Research on Automatic Identification of IT Terms in Kazakh
引言
哈萨克语的术语像其他语言中的术语一样是一种结构紧密的固定或半固定的词语或词组,也是一种具有很强领域特征的词语。随着科技的发展和社会的进步,在科技、日常事物、社会现象、 生活概念等领域都出现了新的术语,扩大了语言资源。中文各语言信息处理应用领域的不断扩展,对于不同语言不同领域专业术语的检索需求也越来越迫切。研究以计算机作为工具的哈萨克语信息技术领域术语资源管理系统的构建,一方面是哈萨克语自然语言信息处理、哈萨克语语言学的研究、机器翻译、语料库建设等民族语言信息化建设研究的基础性前提[1]。……
登录APP查看全文
