NLP在文献知识检索与处理中的应用*
2021-09-24李一琳
李一琳,徐 瑞
(1.南京森林警察学院 刑事科学技术学院,江苏 南京 210023;2.南京大学 信息管理学院,江苏 南京 210023)
自然语言处理(Natural Language Processing,NLP)又称自然语言理解,发源于美国IBM沃森研究中心,是一种对自然语言信息进行处理的技术,包括自然语言理解(Natural Language Understanding,NLU)和自然语言生成(Natural Language Generation,NLG)两部分[1]。它是计算机语言技术的一个分支,通常是指利用计算机对人类的自然语言进行有意义的分析与操作,作为人工智能的一部分,是目前信息技术最重要的研究方向之一。
为了从整体上把握该领域的研究现状与发展趋势,本文通过梳理相关文献,对自然语言与文献知识处理的发展关系以及在信息检索、文本处理等方面的研究进展进行归纳总结,探究未来发展趋势,以期能对自然语言处理的发展应用提供一定的参考。
1 自然语言的发展历程
1854年,美国波士顿梅堪特图书馆编印的字典式目录和1876年美国克特发表的《字典式目录条例》,把主题标识、著者标识、书名标识三者的字顺结合起来,应视为人工语言与自然语言兼容化的初步尝试。
国外学者于20世纪40年代末至50年代初开始涉及该领域,我国在20世纪50年代末和60年代初,开始自然语言检索的研究工作。从20世纪60年代以关键词匹配为主流,到70年代以句法-语义分析为主导,再到80年代开始实用化和工程化[2],自然语言检索已经成为国内外情报检索和自然语言处理领域的共同研究热点。到20世纪90年代,随着机器学习算法的引入,研究者开始注重语料库的建设,目前自然语言处理已经拓展到语音识别、句法分析、机器翻译、机器学习和信息检索等多个方面[3]。……
