维吾尔语广播新闻敏感词检索系统的研究
2011-06-28木合塔尔沙地克布合力齐姑丽瓦斯力
中文信息学报 2011年4期
木合塔尔·沙地克,李 晓,布合力齐姑丽·瓦斯力
(1. 中国科学院 新疆理化技术研究所,新疆 乌鲁木齐 830011;2. 中国科学院 研究生院,北京 100084;3. 新疆教育学院 数学与信息技术分院,新疆 乌鲁木齐 830043)
1 引言
截止到2004年,我国广播节目为1 789套,平均每日播出广播节目21 378小时,全天候地为我国13亿人口提供资讯信息和文化娱乐服务[1]。随着广播节目的增多,采用现代化的手段,对大量的广播节目进行快速高效的内容检索已经成为一项重要任务。维吾尔语广播新闻敏感词检索系统的基本原理是根据需要为系统设定若干敏感词,当广播新闻节目语音中出现所设定的敏感词的语音时,系统将把对应的语音段保存在存储设备中,以便进一步处理。不包含敏感词内容的语音段则不予处理。语音关键词识别(Speech Keyword Spotting)是实现维吾尔语敏感词检索的技术核心。
作为语音识别领域的一个重要研究方向,语音关键词识别技术是指从连续语音中检出和识别一组预先定义好的特定词和特定短语。它无需像连续语音识别(Continuous Speech Recognition,CSR)那样对连续语音的整体进行识别,而只需提取出语音段中的关键词信息。跟语音关键词识别相比,目前连续语音识别有资源耗费大,速度慢,抗噪能力不强等缺点,这是连续语音识别短期内难以突破的问题所在。因此在当前技术水平下,许多应用领域不适合连续语音识别,而要求语音关键词识别,这一系统的研究如能取得突破性进展,则将大大有助于拓宽维吾尔语语音识别系统的应用领域,而维吾尔语语音信息检索是一个有很好应用前景的领域。……
登录APP查看全文
