APP下载

面向大数据短文本的高并发语种识别系统的设计与实现

2020-08-21伊克拉木伊力哈木艾山吾买尔王路路麦麦提依明巴吾顿

现代计算机 2020年20期
关键词:文本系统

伊克拉木·伊力哈木,艾山·吾买尔,王路路,麦麦提依明·巴吾顿

(1.新疆大学信息科学与工程学院,乌鲁木齐830046;2.新疆大学新疆多语种信息技术实验室,乌鲁木齐830046;3.中科软科技股份有限公司信息工程八部,天津300384)

0 引言

随着网络社交媒体的发展、经济全球化进程的推进以及国际安全局势的变化,我国的网络舆情分析显得尤为重要,各类社交媒体和网络论坛等载体是用户发表观点、表达情绪的主要平台。而这些网络文本大部分都是短文本,其语言种类又呈现了多样化的趋势且文本的语种判别也易混淆。除了作为国家通用语言的中文文本数据之外,还存在少数民族语言或者周边国家语言的文本数据,如此大量混杂的多语种文本信息给传统的自然语言处理带来了挑战。

语种识别的研究经历了长期的演变,1994 年Cavnar 等人提出了基于N-Gram 的词频排序算法[1],此方法的准确率在针对400 字以上的长文本语种识别任务中可达到99.8%,但对于大部分社交媒体限制的140字以内的短文本识别上的效果差强人意。2003 年Frank基于此方法设计实现了名为Textcat 的语种识别工具[2]。2007 年Hammarstrom 使用词缀表扩充词典[3]。2009 年Ceylan 等人使用决策树对文本语言种类进行分类[4]。2010 年Vantanen 等结合N-Gram 语言模型和朴素贝叶斯分类器设计识别语言种类[5],该方法主要针对5-21 个字符的文本。2013 年Carter 等人针对推特上的交互信息提出了基于用户历史消息和消息中内嵌连接的内容识别语种[6]。2011 年Tromp 等人提出了基于NGram 的图结构的方法进行语种识别[7],该方法有效利用词本身的信息以及词与词之间的信息,提升了短文本上语种识别的效率。……

登录APP查看全文

猜你喜欢

文本系统
Smartflower POP 一体式光伏系统
WJ-700无人机系统
ZC系列无人机遥感系统
初中群文阅读的文本选择及组织
基于PowerPC+FPGA显示系统
在808DA上文本显示的改善
半沸制皂系统(下)
基于doc2vec和TF-IDF的相似文本识别
连通与提升系统的最后一块拼图 Audiolab 傲立 M-DAC mini
文本之中·文本之外·文本之上——童话故事《坐井观天》的教学隐喻