APP下载

基于应用技术实现语言处理研究

2018-05-13郭建伟燕娜陈佳宇

中阿科技论坛(中英文) 2018年4期
关键词:分类文本信息

郭建伟,燕娜,陈佳宇

(北京市科学技术情报研究所信息资源部,北京 100044)

互联网搜索的查询被划分成少数几个关键词而不是以自然语言表述的实际的问题。人们可以用基于社区的问答系统通上下文获得更为明确的理解而给出更好的回答。相比而言,一个互联网搜索引擎对于一段很长的查询只能给出很差的返回结果或不返回任何有价值的东西。人们只能将他们的问题转化成一个或几个贴切的关键词去尝试相对贴切的回复。信息检索研究的长期目标是开发检索模型来为更长、更专门的查询提供精确的结果。因此需要更好的理解文本信息。严格来说,自然语言处理[1][2](Natural Language Processing),包括自然语言理解和自然语言生成两部分。

一、语言处理

自然语言就是人交流用的语言。自然语言处理的研究方向包括以下几种[2]:

规则方法:可以用规则的方法预先准备好一些先验知识。然后用统计的方法来处理未知的情况。把些人工经验放入规则库。很多时候,人讲话并不是按概率来的,除非是随便说说。比如说,怎么减肥,只能说吃那么几样减肥的食品。

统计方法:语料库就是一个文档的样本库。需要有很大的规模,オ有概率统计的意义,可以假设很多词和句子都会在其中出现多次。

计算框架:算法设计是一件非常困难的工作,需要有很好的数据结构基础,采用的算法设计技术主要有迭代法、分治法、动态规划法等,互联网搜索经常面临海量数据,需要分布式的计算框架来执行对网页重要度打分等计算。……

登录APP查看全文

猜你喜欢

分类文本信息
分类算一算
在808DA上文本显示的改善
基于doc2vec和TF-IDF的相似文本识别
教你一招:数的分类
订阅信息
文本之中·文本之外·文本之上——童话故事《坐井观天》的教学隐喻
展会信息
如何快速走进文本
健康信息
健康信息(九则)